Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
Modal é uma nuvem serverless que executa código Python em GPUs e CPUs com cobrança por segundo; a empresa a descreve como infraestrutura de nuvem para equipes que desenvolvem, treinam e servem aplicações de IA em escala.
O Modal coloca seu código em um contêiner, executa-o na nuvem e adiciona contêineres automaticamente quando o tráfego cresce, reunindo capacidade das principais nuvens para escolher onde cada tarefa roda. Imagens de contêiner e solicitações de GPU são escritas em Python, então um app do Modal não tem arquivos de implantação YAML.
A Modal Labs opera o modal.com. Segundo a imprensa de tecnologia independente, o Modal foi fundado em 2021 pelo CEO Erik Bernhardsson e pelo CTO Akshat Bubna; a empresa diz ter captado mais de 466 milhões de dólares de investidores como General Catalyst e Redpoint Ventures. Em 28 de setembro de 2026, uma reportagem de tecnologia que citava uma fonte anônima disse que a Modal Labs, que ela chamou de provedora de infraestrutura de inferência de IA, estava perto de fechar uma rodada de 750 milhões de dólares liderada pela Accel, com avaliação de 15,75 bilhões de dólares; a Modal Labs não quis comentar.
O Modal cobre inferência com o que chama de partidas a frio abaixo de um segundo, jobs em lote paralelos, treinamento e ajuste fino, Sandboxes isoladas para código gerado por IA e Notebooks colaborativos com GPU.
O argumento gpu aceita T4, L4, A10, L40S, A100 (genérica, 40 GB ou 80 GB), RTX PRO 6000, H100 (ou H100!), H200, B200 (ou B200+) e B300. B300, B200, H200, H100, A100, L4, T4 e L40S permitem até 8 GPUs por contêiner (até 2.304 GB de RAM de GPU); a A10 para em 4 GPUs e 96 GB.
Dois upgrades automáticos importam para benchmarks: uma solicitação de H100 pode rodar em uma H200 e uma de A100 em uma A100 de 80 GB, pelo preço original, enquanto solicitar H100! exclui o upgrade para H200. Uma função também pode listar tipos de GPU em ordem de preferência, e o Modal desce pela lista.
Modal Sandboxes são contêineres seguros, definidos em tempo de execução, para executar código não confiável de usuários ou agentes. O Modal diz que é possível criar milhões programaticamente em menos de um minuto, com snapshot e restauração para inicializar rápido.
Notebooks Jupyter hospedados com preços serverless, desligamento automático por ociosidade, GPUs do Modal e edição colaborativa em tempo real.
O Modal anunciou em 1º de outubro de 2026 que o Modal Clusters está disponível para todos pelo decorador @modal.clustered: grupos de GPUs multinó com RDMA, agendados em bloco de um pool de capacidade compartilhado e cobrados por segundo.
pip install modal e depois modal setup para se autenticar (ou python -m modal setup se a primeira forma falhar).@app.function(...), indicando a imagem de contêiner e a GPU, e execute o arquivo com modal run path/to/file.py.O Modal diz que os contêineres inicializam em cerca de um segundo, mas só ficam aquecidos depois de executadas as importações e outras configurações de escopo global, então ficar pronto pode levar de segundos a minutos. Três configurações equilibram latência e gasto ocioso:
scaledown_window: mantém contêineres ociosos ativos de 2 segundos a 20 minutos; janelas mais longas dão menos partidas a frio, mas os recursos ociosos são cobrados.min_containers e buffer_containers: o primeiro mantém um piso de contêineres aquecidos para que a função nunca escale a zero; o segundo adiciona contêineres de reserva enquanto ela está ativa.us oferece um pool de recursos maior que uma estreita, melhorando o tempo de partida a frio e a disponibilidade.O Modal pode implantar qualquer aplicação Python conteinerizável e mira computação intensiva com escala horizontal: inferência de ML em escala, treinamento e ajuste fino de modelos, pipelines de dados, computação científica e filas de jobs.
As três citações de clientes são depoimentos da página inicial, não estudos de caso independentes.
Os sinais de avaliações independentes desta rodada são limitados: em uma plataforma de avaliações ligada a uma comunidade de lançamentos, o Modal tinha nota 5,0 com 61 avaliações em 5 de outubro de 2026, e seu resumo por IA diz que os avaliadores são sobretudo fundadores e que quase não há críticas.
routing_region também aceita us-west (Oregon), eu-west (Dublin) e ap-south (Mumbai).O Modal combina um plano mensal com preços de GPU por segundo e CPU e memória medidas por uso; os preços de tabela abaixo foram registrados em 5 de outubro de 2026.
| Plano | Taxa de plataforma | Computação incluída | Assentos | Contêineres / concorrência de GPU | Retenção de logs | Tráfego de saída incluído |
|---|---|---|---|---|---|---|
| Starter | $0 + computação / mês | $30 / mês | 3 | 100 / 10 | 1 dia | 1 TiB / mês |
| Team | $250 + computação / mês | $100 / mês | Ilimitados | 5.000 / 50 | 30 dias | 10 TiB / mês |
| Enterprise | Personalizado | Personalizado | Ilimitados | Maior concorrência de GPU | Personalizada | 100 TiB / mês |
O Enterprise adiciona descontos por volume, serviços de engenharia de ML incorporados, suporte privado no Slack, logs de auditoria, SSO com Okta e HIPAA. O Starter permite 200 apps implantados e 5 jobs cron implantados e exclui domínios personalizados, reversões de implantação, orçamentos por ambiente, o proxy de IP estático e RBAC; o Team mantém 3 versões para reversão.
| Recurso | Preço por segundo |
|---|---|
| Nvidia B300 | $0.001972 |
| Nvidia B200 | $0.001736 |
| Nvidia H200 SXM | $0.001261 |
| Nvidia H100 SXM5 | $0.001097 |
| Nvidia RTX PRO 6000 | $0.000842 |
| Nvidia A100, 80 GB | $0.000694 |
| Nvidia A100, 40 GB | $0.000583 |
| Nvidia L40S | $0.000542 |
| Nvidia A10 | $0.000306 |
| Nvidia L4 | $0.000222 |
| Nvidia T4 | $0.000164 |
| CPU, por núcleo físico (2 vCPU) | $0.0000131 |
| Memória, por GiB | $0.00000222 |
A CPU tem mínimo de 0,125 núcleo por contêiner. Sandboxes e Notebooks usam tarifas de CPU e memória mais altas, $0.00003942 por núcleo e $0.00000667 por GiB por segundo, com GPUs a preço padrão. Os Volumes custam $0.09 por GiB por mês após 1 TiB grátis, e o tráfego de saída além da franquia do plano custa $0.04 por GiB. O exemplo de cálculo do Modal coloca o Stable Diffusion em uma A10G em cerca de $0.491 por 1.000 imagens.
nonpreemptible=True triplica os preços de tabela de CPU e memória e não está disponível para funções com GPU.Cada plataforma de GPU serverless abaixo difere do Modal principalmente em como o tempo ocioso é cobrado e na amplitude do cardápio de GPUs.
| Opção | Escolha de GPU | Escala a zero | Regra de ociosidade e cobrança |
|---|---|---|---|
| Google Cloud Run (GPU) | RTX PRO 6000 Blackwell (96 GB) ou L4 (24 GB) | Sim | Cobrança por instância; instâncias mínimas cobradas integralmente mesmo ociosas |
| RunPod Serverless | Não tratado aqui | Workers flex sim; workers ativos rodam 24/7 | Cobrado por segundo do início do worker até ele parar por completo, arredondado para cima |
| Replicate | Não tratado aqui | Modelos públicos sim | A maioria dos modelos privados roda em hardware dedicado e é cobrada pelo tempo de configuração, ociosidade e atividade |
A divisão entre workers flex e ativos do RunPod espelha a escolha de min_containers no Modal. O Replicate cobra a maioria dos modelos públicos por tempo de execução e alguns por entrada e saída. Os diferenciais do Modal são a infraestrutura definida em Python e as Sandboxes na mesma conta, além de uma lista de GPUs mais longa que a do Cloud Run.
routing_region só pode ser definido na primeira implantação de uma função, e entradas e saídas maiores que 2 MiB ainda vão para o armazenamento de objetos em us-east.O contrato do Modal proíbe mineração de criptomoedas ou atividades de blockchain relacionadas, ataques de negação de serviço, compartilhamento de arquivos ponto a ponto e plataformas genéricas de hospedagem de arquivos ou de distribuição de mídia.
O Starter não tem taxa de plataforma e inclui $30 de computação por mês, mas o guia de faturamento exige uma forma de pagamento cadastrada, e os tokens dos endpoints compartilhados são cobrados desde a primeira solicitação.
Não depois que ele escala a zero. O keep-alive padrão de 60 segundos e o tempo ocioso dentro de um scaledown_window mais longo são cobrados, e min_containers impede que a função chegue a zero.
Funções e Sandboxes podem ser fixadas em regiões da UE com multiplicador de 1,15 ou 1,75, com roteamento por eu-west, mas os logs de aplicação ficam nos EUA, entradas e saídas grandes passam por us-east e os endpoints compartilhados não podem ser fixados.