Já usou esta ferramenta? Avalie-a
Já usou esta ferramenta? Avalie-a
Together AI é uma plataforma em nuvem para executar, personalizar e treinar modelos de IA de código aberto e de pesos abertos por APIs e infraestrutura de GPU alugada. A empresa a apresenta como a nuvem nativa de IA, uma plataforma de IA completa impulsionada por pesquisa de ponta. Para a maioria dos desenvolvedores, o ponto de entrada é uma API de LLM de código aberto.
O serviço é operado pela Together Computer, Inc., uma corporação de Delaware cujos termos abrangem APIs e interfaces web para hospedar, usar, ajustar e treinar grandes modelos de IA. A imprensa de tecnologia independente descreveu a Together AI como uma neocloud de IA que aluga clusters de GPUs Nvidia e noticiou uma Série C de $800 milhões com avaliação de $8,3 bilhões. Segundo a mesma reportagem, a empresa diz ter milhares de clientes pagantes, entre eles Cursor, Cognition e Decagon.
Três fatos orientam a maioria das decisões: não há teste gratuito e o acesso começa com uma compra de $5 em créditos; os prompts são armazenados por padrão, a menos que a retenção zero de dados esteja ativada; e a capacidade sem servidor compartilhada é de melhor esforço (best-effort).
A Together AI agrupa seus produtos em inferência, computação e personalização de modelos, todos cobrados do mesmo saldo de créditos pré-pagos.
A empresa afirma ter alcançado, para o gpt-oss-20B, uma inferência sem servidor quase 2 vezes mais rápida que o próximo provedor mais rápido. É um teste de desempenho do próprio fornecedor, e depois o modelo foi programado para sair da oferta sem servidor.
Assim, o resultado do ajuste fino de LLM roda em hardware dedicado ou sai da plataforma como pesos, em vez de entrar no catálogo sem servidor cobrado por token.
A primeira chamada de API exige uma conta com saldo, uma chave de API e o SDK oficial ou um cliente OpenAI existente:
O custo de um ajuste fino pode ser verificado antes de gastar algo: a CLI mostra o preço estimado e pede confirmação antes de enviar o trabalho.
Os números de clientes acima são publicados pela Together AI em suas próprias páginas e não foram verificados de forma independente para esta ficha.
A Together AI atende desenvolvedores e equipes de ML que lidam bem com APIs, SDKs e ferramentas de linha de comando e querem usar modelos de pesos abertos sem operar a própria pilha de inferência.
A escolha entre os dois modos de inferência depende da utilização. A inferência de modelos dedicada costuma sair mais barata se uma réplica ficaria ocupada a maior parte do dia; a sem servidor, se o tráfego é baixo ou irregular a ponto de uma réplica dedicada ficar ociosa a maior parte do tempo. A página de preços acrescenta que a maioria das equipes começa com inferência sem servidor e passa para pontos de extremidade dedicados ao ganhar escala.
É menos indicada para quem quer testar modelos antes de pagar, já que não há teste gratuito, e para apps criados sobre a Assistants API da OpenAI, que a camada de compatibilidade não implementa.
A Together AI é usada via console web, SDKs, CLI e API REST, não por um app de consumo.
Os preços da Together AI são baseados no uso e totalmente pré-pagos. A Together AI não oferece teste gratuito atualmente, e o acesso à plataforma exige uma compra mínima de $5 em créditos. É necessário ter saldo de créditos positivo para usar a plataforma. Os créditos de saldo pré-pago atualmente não têm data de validade. A recarga automática pode completar o saldo sozinha, mas só quando o método de pagamento padrão é um cartão de crédito ou débito. Pelos Termos de Serviço, as taxas pagas não são reembolsáveis, salvo se os termos ou um formulário de pedido disserem o contrário.
Os preços sem servidor são cotados por 1 milhão de tokens e mudam com frequência. Estas linhas representativas foram coletadas em 5 de outubro de 2026.
| Modelo | Entrada | Entrada em cache | Saída |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | Não informado | $0.60 |
| Llama 3.3 70B | $1.04 | Não informado | $1.04 |
A API de lote anuncia até 50 % de desconto sobre as tarifas sem servidor e um pool separado de limites de taxa. A tabela de modelos com desconto da documentação de lote, porém, lista apenas uma variante do Llama 3.3 70B Turbo e o Whisper Large v3 com 50 % de desconto, e os modelos fora da lista rodam a tarifas padrão.
Todos os preços de clusters de GPU são por GPU por hora.
| GPU | Preemptível | Sob demanda | Reservado 7–30 dias | 31–90 dias | 91–180 dias | A partir de 181 dias |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | Fale conosco |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | Fale conosco |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | Fale conosco |
As reservas são cobradas pela duração reservada completa assim que o cluster é provisionado, e o uso além da capacidade reservada é cobrado a tarifas sob demanda. Os créditos da aceleradora para startups não se aplicam a clusters de GPU reservados.
Uma réplica dedicada só é cobrada enquanto está pronta e apta a atender tráfego, por isso provisionamento e inicialização a frio não são cobrados. A tarifa da H100 difere entre páginas oficiais: a tabela de inferência dedicada da página de preços lista $5.49 por GPU-hora sob demanda. Já uma entrada do registro de alterações da documentação diz que o hardware de ponto de extremidade dedicado H100 80GB agora custa $3.99 por hora, reduzido de $5.49.
O ajuste fino é cobrado por tokens processados, ou seja, tamanho do conjunto de treinamento vezes épocas, mais eventuais tokens de avaliação, e cada trabalho tem cobrança mínima por modelo. A primeira tabela de ajuste fino da página de preços, sob abas rotuladas LoRA e ajuste fino completo, lista o Qwen3.5 0.8B a $0.34 por 1 milhão de tokens em ajuste fino supervisionado, $0.84 em DPO e mínimo de $4.00. Mais abaixo na mesma tabela, o GLM-5.2 aparece com $40.00 em ajuste fino supervisionado, $100.00 em DPO e mínimo de $60.00. Trabalhos cancelados ou interrompidos antecipadamente são cobrados apenas pelas etapas concluídas. Hospedar um modelo com ajuste fino em um ponto de extremidade dedicado é cobrado à parte, por minuto.
Provedores comparáveis de inferência de modelos abertos diferem sobretudo em como cobram modelos com ajuste fino e em se contas novas começam com créditos gratuitos.
Diante deles, a Together AI exige uma primeira compra de $5 sem teste gratuito e cobra por minuto a hospedagem de modelos com ajuste fino em hardware dedicado. Em troca, uma única conta cobre modelos sem servidor, trabalhos em lote, pontos de extremidade dedicados, clusters de GPU, ambientes isolados e armazenamento.
As fontes independentes de mídia e avaliações consultadas para esta página não mostraram interrupções nem relatos de segurança no nível do produto, e as amostras tinham menos de 20 avaliações, poucas demais para uma conclusão sobre qualidade.
Não. O acesso exige a compra de pelo menos $5 em créditos, e não há teste gratuito. Startups aceitas no programa de aceleração podem receber créditos de plataforma no lugar, mas esses créditos excluem clusters de GPU reservados.
Sim, para chat, conclusões, visão, geração de imagens, conversão de texto em fala e embeddings: aponte o cliente OpenAI para a URL base da Together e troque para os IDs de modelo com espaço de nomes da Together. Assistants, Threads e Runs não estão disponíveis, e os trabalhos em lote usam a própria API de lote da Together.
Não por padrão. O uso para treinamento é uma configuração de adesão opcional que fica desligada se não for ativada. Ainda assim, prompts e respostas são armazenados por padrão, a menos que a retenção zero de dados esteja ativada.
O acesso à API fica suspenso até você adicionar créditos. Clusters de GPU sob demanda são pausados e depois desativados se os créditos não forem restabelecidos, enquanto reservas de clusters de GPU existentes continuam ativas até a data de término programada.
Sim. Concluído o trabalho, o modelo pode ser servido em um ponto de extremidade dedicado da Together ou baixado como ponto de verificação para inferência local ou outro host.