Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
A Runpod é uma nuvem de GPU para desenvolvedores que precisam de computação acelerada sem comprar hardware nem assinar contratos corporativos. Ela se descreve como a nuvem para desenvolvedores de IA, e na prática isso assume a forma de três linhas de produto que compartilham o mesmo catálogo de GPU sob uma única conta: Pods, instâncias de GPU para computação persistente e desenvolvimento; Serverless, que oferece endpoints de GPU com escalonamento automático que caem a zero quando ociosos; e Clusters, computação distribuída multi-GPU para treino e inferência em grandes lotes. Os três estão disponíveis sob demanda, sem contratos nem compromissos mínimos, e o objetivo de projeto declarado é ir do experimento à produção sem trocar de plataforma entre as etapas.
A origem da empresa explica muito sobre quem ela atende. Dois ex-desenvolvedores da Comcast, Zhen Lu e Pardeep Singh, converteram no fim de 2021 equipamentos de mineração de criptomoedas guardados em porões de Nova Jersey em servidores de IA, motivados — nas palavras de Lu — pela constatação de que "a experiência real de desenvolver software sobre GPU era simplesmente lixo". No início de 2022 eles publicaram em subreddits dedicados a IA uma oferta de acesso gratuito a GPU em troca de retorno; nove meses após o lançamento haviam largado seus empregos e chegado a um milhão de dólares de receita. Essa origem comunitária e voltada a desenvolvedores ainda se nota no produto, inclusive em como parte da sua capacidade é fornecida.
A escala alcançada desde então é considerável e convém datá-la, porque os números mudam depressa. A TechCrunch noticiou em janeiro de 2026 que a Runpod havia chegado a 120 milhões de dólares de receita recorrente anual com 500 mil clientes desenvolvedores em 31 regiões, depois de ultrapassar 24 milhões de dólares de receita por conta própria antes de qualquer capital institucional. No anúncio da série A em junho de 2026 — 100 milhões liderados pela Summit Partners a uma avaliação de um bilhão, elevando o financiamento total a 122 milhões após uma rodada semente de 20 milhões colíderada por Intel Capital e Dell Technologies Capital em maio de 2024 — o número de desenvolvedores era declarado acima de um milhão, com mais de 20 bilhões de requisições de inferência atendidas desde o lançamento. Entre os clientes citados estão Replit, Cursor, OpenAI, Perplexity, Wix e Zillow.
A Runpod é usada por um painel web, uma interface de linha de comando e APIs REST, com documentação cobrindo as APIs v1 e v2 ao lado das referências de modelos e CLI. A unidade de implantação é um contêiner Docker, o que significa que seu framework, suas dependências e seu código vão junto — a posição declarada é "seus contêineres, seu framework, seu código" em vez de um ambiente de execução imposto.
A infraestrutura abrange 31 regiões e mais de 30 modelos de GPU, e roda em duas classes bem distintas. A Community Cloud obtém capacidade de hospedeiros terceiros verificados num arranjo ponto a ponto, em que os pods compartilham máquina com isolamento por contêiner em nível de software. A Secure Cloud roda em data centers de nível 3 e 4 com máquinas e GPUs dedicadas, melhores SLAs e volumes de rede persistentes sobre NVMe. As duas aparecem lado a lado na tabela de preços para os mesmos modelos, e escolher entre elas é tanto uma decisão de confiabilidade e isolamento quanto de custo.
Quanto à integração, os endpoints Serverless são APIs HTTP: você envia tarefas, consulta o estado e recupera resultados, ou usa chamadas síncronas para trabalhos curtos. Os endpoints com balanceamento permitem trazer seu próprio framework HTTP e definir rotas próprias. Registros, monitoramento e métricas em tempo real vêm sem instrumentação adicional, e o pacote Runpod skills estende implantação e gestão de recursos a agentes de código, incluindo Claude Code e Cursor.
A Runpod cobra por hora ou por segundo, sem faixas de assinatura: você paga pela computação usada, e a página de preços trazia como última atualização 27 de julho de 2026.
Os Pods são precificados por modelo de GPU. No topo, a B300 custa 7,89 dólares a hora, a B200 6,79, a H200 4,59, a H100 SXM 3,29, a H100 PCIe 2,89 e a H100 NVL 3,19. No meio, a A100 SXM fica em 1,59, a A100 PCIe em 1,39, a RTX Pro 6000 em 2,09, a L40S em 0,99 e a RTX 6000 Ada em 0,84. Na entrada, a RTX 4090 fica em 0,74, a RTX 3090 em 0,50, a L4 em 0,49, a A40 em 0,44 e a RTX A5000 em 0,27 dólar a hora. A mesma tabela apresenta as duas classes de infraestrutura em colunas separadas, de modo que o preço efetivo depende de qual você escolher.
O Serverless é precificado à parte e sai consistentemente mais caro por hora que o Pod equivalente, o fato de precificação mais importante a assimilar: a H100 custa 4,79 dólares a hora no Serverless contra 3,29 como Pod, a A100 2,72 contra 1,59 e a RTX 4090 1,10 contra 0,74. A faixa de 16 GB fica em 0,58 a hora e a faixa compartilhada de 24 GB em 0,69. A Runpod afirma que isso representa 25% de economia em workers flex frente a outros provedores serverless. O adicional compra escalonamento automático e custo zero em repouso: justificado com tráfego irregular e desperdiçado com carga estável.
Os Clusters publicam apenas dois preços sob demanda — H200 SXM a 4,31 dólares a hora e A100 SXM a 1,79 — enquanto L40S, H100 SXM e B200 remetem ao time comercial. Os Reserved Clusters não publicam preço para nenhuma duração: todas as células de 1, 3, 6, 12 meses e mais indicam contatar vendas.
O armazenamento é cobrado de forma independente: disco de contêiner a 0,10 dólar por GB ao mês; disco de volume a 0,10 em operação e 0,20 ocioso; armazenamento de rede a 0,07 abaixo de 1 TB, 0,05 acima e 0,14 para a faixa de alto desempenho. Os Public Endpoints são cobrados por chamada, com grande variação por modelo.
Uma ressalva sobre os preços publicados: a seção de linguagem dos Public Endpoints lista Deep Cogito v2 Llama 70B a 0,00001 dólar por milhão de tokens quando, na mesma seção, Qwen3 32B AWQ está a 10,00 e IBM Granite 4.0 H Small a 1,00. Uma diferença de um fator de um milhão dentro de uma mesma tabela sugere fortemente um erro de página em vez de um preço real, e o dado é relatado como encontrado. A Runpod ainda declara mover seus preços para manter GPUs disponíveis, então trate cada número como um retrato de um momento e verifique na página em produção.
A comparação depende de qual lado da Runpod você está pesando. Diante dos grandes provedores — AWS, Azure, GCP — a troca é atrito de compra e preço contra profundidade de ecossistema e contratos corporativos; a Runpod reivindica custos de computação até 90% menores e ausência de taxas de saída, enquanto aqueles oferecem serviços integrados que a Runpod sequer tenta cobrir. Diante das nuvens de GPU focadas em IA como CoreWeave e Lambda, a escala de capacidade e a contratação corporativa pendem para os provedores maiores, enquanto a Runpod compete em acesso autosserviço e amplitude de modelos de GPU. Diante dos especialistas em inferência serverless como Modal, Replicate, Baseten e Together, a comparação se decide no comportamento da partida a frio, na experiência de desenvolvimento e no formato da cobrança, e os testes independentes mostram que a ordem muda conforme o tamanho do modelo em vez de uma plataforma dominar. Diante do aluguel de GPU tipo marketplace como a Vast.ai, a Community Cloud ocupa terreno parecido, enquanto a Secure Cloud acrescenta uma opção de nível data center que marketplaces puros geralmente não têm. A avaliação prática é medir seu modelo real em duas ou três delas, porque os números publicados de partida a frio e vazão raramente sobrevivem ao contato com uma carga concreta.
A afirmação de partida a frio abaixo de 200 ms precisa das suas condições. A página inicial da Runpod a anuncia via FlashBoot. A documentação da própria empresa é mais precisa: uma partida a frio abrange iniciar o contêiner, carregar os modelos na memória da GPU e inicializar o ambiente, e observa explicitamente que modelos maiores demoram mais a carregar, alongando a partida. Testes independentes com o Qwen Image fp16, que exige 56 GB de memória de vídeo, mediram cerca de 120 a 160 segundos de partida a frio total contra 30 a 40 segundos de geração efetiva — um acréscimo de três a quatro vezes. Não são dados contraditórios: o número de marketing descreve um caminho quente com modelo em cache, e a medição descreve um modelo grande partindo do zero. Mas quem ler apenas a página inicial vai dimensionar mal seu orçamento de latência. Vale notar ainda que o autor desse teste revela que a própria plataforma dele estava entre as comparadas.
As avaliações independentes são medianas e muito polarizadas. A Runpod tem 3,7 de 5 no Trustpilot com 302 avaliações, 156 delas nos últimos doze meses. O que chama atenção é a distribuição: 65% de cinco estrelas e 19% de uma estrela, com muito pouco no meio. Essa forma bimodal sugere experiências que divergem nitidamente em vez de se agruparem em torno do razoável. O perfil está marcado como convidando clientes a avaliar, o que introduz um viés de seleção a considerar na leitura da nota agregada.
As queixas operacionais recorrentes são específicas e consistentes. Usuários relatam que esgotar o crédito da conta leva à exclusão dos pods em vez de sua simples parada, exigindo reconstrução completa. Outros descrevem períodos de forte escassez de GPU, cobrança que não correspondia às especificações entregues — uma avaliação cita pagar por 1 TB de memória e receber 300 GB — e o recebimento de máquinas com NVSwitch quebrado, GPUs travadas, memória faltando ou discos não montados, o que um avaliador chamou de roleta. Outras agregações registram pods que levam até 30 minutos para iniciar ou que falham na inicialização e ainda assim são cobrados, e um suporte que vai do ágil ao completamente silencioso.
Uma disputa de cobrança não resolvida vale ser conhecida. Um avaliador do Trustpilot afirma nunca ter sido cliente da Runpod, que seu meio de pagamento foi usado para abrir uma conta que gerou 810 dólares em cobranças não autorizadas em duas semanas, e que a Runpod baniu essa conta por acesso de terceiros ao mesmo tempo em que negou o reembolso alegando não ter encontrado evidência de acesso de terceiros. É o relato de um único usuário, apresentado como tal e não como fato estabelecido.
As duas classes de infraestrutura não são intercambiáveis. A Community Cloud obtém capacidade de hospedeiros terceiros verificados, com pods compartilhando máquina isolados apenas em nível de contêiner e confiabilidade que varia conforme o hospedeiro. A Secure Cloud fornece hardware dedicado em data centers de nível 3 e 4. A documentação da Runpod recomenda a Secure Cloud para cargas sensíveis. Boa parte da divergência na experiência dos usuários provavelmente remonta a essa escolha, e tabelas que mostram as duas colunas lado a lado facilitam escolher só pelo preço sem registrar do que se abre mão.
A conformidade é condicional, não abrangente. A Runpod concluiu o SOC 2 Type 2, e seu Trust Center lista SOC 2 Type 2, SOC 3, HIPAA, RGPD e uma carta de transição de 2026, com alguns documentos exigindo acesso aprovado. Mas a página de conformidade afirma sem rodeios que a cobertura pode variar conforme carga, região, fornecedor e modelo de implantação, e aconselha confirmar os requisitos específicos durante a revisão de segurança. Acrescenta ainda que relatórios, certificações e cobertura de parceiros podem mudar com o tempo. A certificação no nível da empresa é, portanto, ponto de partida da diligência, não sua conclusão.
O site apresenta dois números de disponibilidade diferentes. A seção corporativa da página inicial indica 99,9% de disponibilidade enquanto as perguntas frequentes da mesma página falam em garantia de 99,99%. A Runpod não publicou explicação alguma, e ambos são relatados como encontrados.
Ao menos um preço publicado parece equivocado. Deep Cogito v2 Llama 70B aparece a 0,00001 dólar por milhão de tokens numa seção em que modelos comparáveis custam 1,00 e 10,00 dólares por milhão. É quase certamente um erro de página, e aqui não se faz nenhuma suposição sobre qual seria o número correto.
O Serverless custa mais por hora de GPU que os Pods. É projeto e não defeito, mas pega de surpresa equipes que presumem que serverless é automaticamente mais barato. Para carga estável e previsível, um Pod sai bem mais em conta; o Serverless só justifica seu adicional quando o tempo ocioso é substancial.
Os endpoints com balanceamento trocam fila por flexibilidade. Eles permitem trazer seu próprio framework HTTP mas não oferecem fila para requisições acumuladas, ao contrário dos endpoints padrão. Sob carga repentina, essa diferença determina se as requisições excedentes esperam ou falham.
Os números divulgados vêm com ressalvas de data. A contagem de desenvolvedores era de 500 mil na cobertura de janeiro de 2026 e de mais de um milhão em junho de 2026; ambas são citadas com data em vez de reconciliadas. Números de escala, taxas de sucesso de implantação e retenção são declarados pela empresa e não passaram por auditoria independente, assim como economias relatadas por clientes, como uma redução de 90% na fatura de infraestrutura.
Pods são instâncias de GPU para computação persistente e desenvolvimento, disponíveis como Reserved garantido ou como Spot interrompível e mais barato. O Serverless oferece endpoints de GPU com escalonamento automático que caem a zero em repouso e nada cobram fora de operação. Os Clusters entregam computação distribuída multi-GPU para treino e inferência em grandes lotes, até 64 GPUs sob demanda e mais por reserva. Os três compartilham o mesmo catálogo sob uma única conta, e o percurso previsto é usá-los em etapas diferentes sem trocar de plataforma.
Ele descreve uma condição específica, não todos os casos. O FlashBoot, com modelo em cache num caminho quente, pode de fato ser tão rápido. A documentação da própria Runpod observa que a partida a frio inclui iniciar o contêiner, carregar o modelo na memória da GPU e inicializar o ambiente, e que modelos maiores demoram mais. Testes independentes com um modelo de imagem de 56 GB de memória de vídeo mediram de 120 a 160 segundos de partida contra 30 a 40 segundos de geração. Meça com seu próprio modelo em vez de planejar a latência em torno do número de manchete.
Três alavancas, segundo a documentação. Guarde o modelo em cache — grave os pesos na imagem do worker ou mantenha-os num volume de rede para não baixá-los no momento da requisição. Ative o FlashBoot. E defina um número de workers ativos acima de zero, o que elimina a partida a frio da primeira requisição mas abre mão da economia de cair a zero. Essa terceira é uma troca direta entre custo e latência, e resolvê-la depende inteiramente de o seu tráfego ser irregular ou constante.
A Community Cloud obtém GPUs de hospedeiros terceiros verificados num arranjo ponto a ponto; os pods compartilham máquina com isolamento por contêiner em nível de software, os preços são menores e a confiabilidade varia conforme o hospedeiro. A Secure Cloud roda em data centers de nível 3 e 4 com máquinas e GPUs dedicadas, melhores SLAs e volumes de rede persistentes sobre NVMe. A documentação da Runpod recomenda a Secure Cloud para cargas sensíveis, e ela também é a opção padrão adequada para confiabilidade em produção.
Os Pods são cobrados por hora conforme o modelo de GPU: por exemplo B300 a 7,89, H200 a 4,59, H100 SXM a 3,29, A100 SXM a 1,59, L40S a 0,99, RTX 4090 a 0,74 e RTX A5000 a 0,27 dólar a hora, com as duas classes de infraestrutura em colunas separadas. O Serverless é precificado à parte e mais alto: H100 a 4,79 e A100 a 2,72 dólares a hora. O armazenamento é cobrado separadamente a partir de 0,05 dólar por GB ao mês. Os Clusters publicam dois preços sob demanda e o restante remete a vendas, e os Reserved Clusters não publicam nenhum. Os preços são movidos de propósito, então consulte a página em produção.
Porque você compra coisas diferentes. Um Pod é capacidade dedicada que você mantém e paga continuamente. Um worker Serverless é capacidade que aparece sob demanda, escala sozinha e nada custa em repouso — e essa elasticidade carrega um adicional por hora. A economia pende para o Serverless quando seu endpoint fica ocioso a maior parte do tempo e para os Pods quando a carga é estável. Fazer a conta com seu ciclo real de uso é mais confiável do que qualquer uma das suposições padrão.
Pode servir, com condições. A Runpod concluiu o SOC 2 Type 2, seu Trust Center lista recursos de SOC 3, HIPAA e RGPD, a Secure Cloud acrescenta isolamento de rede, e as perguntas frequentes citam um SLA de 99,99% de disponibilidade — embora a mesma página inicial indique 99,9% em outro ponto. A ressalva essencial vem da própria página de conformidade da Runpod: a cobertura varia conforme carga, região, fornecedor e modelo de implantação, e deve ser confirmada na revisão de segurança. Trate a certificação como o início da diligência, não como sua conclusão.
Várias avaliações de usuários relatam que os pods são excluídos em vez de apenas parados quando o crédito se esgota, obrigando você a criar um novo pod e refazer todas as configurações do zero. Como é um comportamento relatado por usuários com consequências reais para trabalho não salvo, mantenha uma folga de crédito, guarde o que for valioso em armazenamento de rede e não no disco local do pod, e monitore o saldo se deixar pods rodando.
Os sinais independentes são mistos e polarizados. O Trustpilot mostra 3,7 de 5 em 302 avaliações, com 65% de cinco estrelas e 19% de uma estrela e pouco no meio, num perfil que convida à avaliação. As queixas recorrentes incluem escassez de GPU, máquinas com falhas de hardware, cobrança divergente do que foi entregue, pods lentos para iniciar ou que falham mas seguem sendo cobrados, e suporte irregular. A distribuição bimodal se explica melhor pela separação entre Community e Secure Cloud e pelas oscilações de oferta, de modo que sua experiência depende bastante de qual infraestrutura você escolher e de qual placa precisar.
Diante dos grandes provedores, a Runpod compete no preço — reivindicando custos de computação até 90% menores e ausência de taxas de saída — e no acesso autosserviço sem processos de compra, abrindo mão do ecossistema de serviços ao redor. Diante da CoreWeave e de nuvens de IA semelhantes, os provedores maiores costumam liderar em escala de capacidade e contratação corporativa, enquanto a Runpod lidera na amplitude de GPUs disponíveis em autosserviço. Diante do Modal, do Replicate e de outros especialistas em serverless, os fatores decisivos são o comportamento da partida a frio no seu modelo, a experiência de desenvolvimento e o formato da cobrança, e os testes independentes não apontam um vencedor em todos os tamanhos de modelo. Teste com sua própria carga.