Toolso.AI
Toolso.AI
FerramentasCategoriasTendênciaNovidadesPreçosBlog
Toolso.AI
Toolso.AI

💌Subscreva a Ferramentas de IA Semanal

Seleção semanal das últimas e mais populares ferramentas e tendências de IA, entregues na sua caixa de correio Subscrever

Toolso.AI
Toolso.AI

Descubra as melhores ferramentas de IA para impulsionar a sua produtividade

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorias Populares

  • Escrita com IA
  • Imagem IA
  • Vídeo IA
  • Programação IA
  • Mais Categorias

Explorar

  • Últimas Ferramentas
  • Ferramentas Populares
  • Mais Ferramentas
  • Submeter Ferramenta
  • Preços

Sobre

  • Sobre Nós
  • Contacto
  • Blog
  • Registo de Alterações

Legal

  • Política de Cookies
  • Política de Privacidade
  • Termos de Serviço
  • Política de Reembolso
© 2026 Toolso.AI Todos os Direitos Reservados
Oferta limitadaOferta por tempo limitadoDestaque promocionalRevisão em 24 h · Sem backlink · 30 dias em destaque$29.90depois $59.90Sobe para $59.90 após 31 de out.Termina em--:--:--Enviar agora
  1. Início
  2. Todas as Ferramentas
  3. Ferramentas de desenvolvimento
  4. Together AI
Prévia da interface do Together AI
Logotipo do Together AI

Together AI

A Together AI executa modelos de pesos abertos por meio de uma API sem servidor compatível com a OpenAI e oferece pontos de extremidade dedicados, ajuste fino, clusters de GPU e ambientes isolados, tudo pago com créditos pré-pagos.

Ferramentas de desenvolvimentoDesenvolvimento de IAPlataforma de Treinamento de IA#Processamento em lote#SDK#LLM
Experimentar Grátis
Salvos
Visitas
Visualizações
Preço
Freemium
Publicado
6 de out. de 2026
Domínio
together.ai
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Informação do Produto Together AI

Experimentar Grátis
Informações da Ferramenta
Salvos
Visitas
Visualizações
Preço
Freemium
Publicado
6 de out. de 2026
Domínio
together.ai
Avaliação dos utilizadores

Já usou esta ferramenta? Avalie-a

Avaliar esta ferramenta

Ferramentas em Destaque

Ferramentas Relacionadas

Experimentar Grátis

O que é Together AI?

Together AI é uma plataforma em nuvem para executar, personalizar e treinar modelos de IA de código aberto e de pesos abertos por APIs e infraestrutura de GPU alugada. A empresa a apresenta como a nuvem nativa de IA, uma plataforma de IA completa impulsionada por pesquisa de ponta. Para a maioria dos desenvolvedores, o ponto de entrada é uma API de LLM de código aberto.

O serviço é operado pela Together Computer, Inc., uma corporação de Delaware cujos termos abrangem APIs e interfaces web para hospedar, usar, ajustar e treinar grandes modelos de IA. A imprensa de tecnologia independente descreveu a Together AI como uma neocloud de IA que aluga clusters de GPUs Nvidia e noticiou uma Série C de $800 milhões com avaliação de $8,3 bilhões. Segundo a mesma reportagem, a empresa diz ter milhares de clientes pagantes, entre eles Cursor, Cognition e Decagon.

Três fatos orientam a maioria das decisões: não há teste gratuito e o acesso começa com uma compra de $5 em créditos; os prompts são armazenados por padrão, a menos que a retenção zero de dados esteja ativada; e a capacidade sem servidor compartilhada é de melhor esforço (best-effort).

Principais funcionalidades

A Together AI agrupa seus produtos em inferência, computação e personalização de modelos, todos cobrados do mesmo saldo de créditos pré-pagos.

Opções de inferência

  • Inferência sem servidor: os desenvolvedores chamam modelos de pesos abertos por uma única API, sem nada para implantar ou gerenciar, e pagam só pelos tokens que usam. O catálogo abrange modelos de texto, imagem, vídeo, código e voz.
  • Inferência em lote: grandes trabalhos assíncronos podem escalar até 30 bilhões de tokens por modelo, com qualquer modelo sem servidor ou uma implantação privada.
  • Taxa de transferência provisionada: capacidade de inferência contratada com preços por token, taxa de transferência reservada e um SLA de disponibilidade de 99 %.
  • Pontos de extremidade e contêineres dedicados: a inferência de modelos dedicada executa um modelo em hardware reservado e isolado, e a inferência de contêineres dedicada visa cargas de mídia generativa, como modelos de vídeo, áudio e imagem.

A empresa afirma ter alcançado, para o gpt-oss-20B, uma inferência sem servidor quase 2 vezes mais rápida que o próximo provedor mais rápido. É um teste de desempenho do próprio fornecedor, e depois o modelo foi programado para sair da oferta sem servidor.

Ajuste fino e personalização de modelos

  • Traga seu modelo: a Together AI afirma que qualquer modelo de código aberto do Hugging Face Hub pode passar por ajuste fino sem conversões de formato.
  • Dados de chamada de ferramentas: o treinamento de chamada de ferramentas aceita logs de agentes existentes como estão, com definições de funções e chamadas de ferramentas direto no conjunto de dados.
  • Ajuste fino de visão: modelos de visão treinam diretamente com imagens PNG, JPEG ou WEBP brutas, sem pré-processamento especial, com LoRA ou ajuste fino completo.
  • Resultados portáteis: um modelo finalizado pode ser hospedado em um ponto de extremidade dedicado da Together ou baixado como ponto de verificação independente.

Assim, o resultado do ajuste fino de LLM roda em hardware dedicado ou sai da plataforma como pesos, em vez de entrar no catálogo sem servidor cobrado por token.

Computação, ambientes isolados e armazenamento

  • Clusters de GPU: os clientes podem reservar de 8 a mais de 4.000 GPUs para treinar ou servir modelos.
  • Ambiente isolado de código: suas VMs vão de 2 a 64 vCPUs e de 1 a 128 GB de RAM para ambientes de desenvolvimento de IA.
  • Armazenamento gerenciado: oferece armazenamento de objetos e sistemas de arquivos paralelos sem taxas de saída de dados.

Guia

A primeira chamada de API exige uma conta com saldo, uma chave de API e o SDK oficial ou um cliente OpenAI existente:

  1. Cadastre-se no console da Together AI e adicione pelo menos $5 em créditos nas configurações de cobrança.
  2. Crie uma chave na página de chaves de API do projeto; chaves novas aparecem só uma vez, então guarde o valor na hora.
  3. Instale o SDK oficial de Python ou TypeScript, ou mantenha um cliente OpenAI existente e altere sua URL base; depois defina a chave como variável de ambiente.
  4. Execute o exemplo de início rápido, que envia uma solicitação de conclusão de chat ao MiniMax M3 e imprime a resposta.
  5. Para cargas offline, a API de lote executa de forma assíncrona muitas solicitações independentes de um único arquivo JSONL enviado.

O custo de um ajuste fino pode ser verificado antes de gastar algo: a CLI mostra o preço estimado e pede confirmação antes de enviar o trabalho.

Casos de uso e exemplos da Together AI

  • Trabalho em lote offline: trabalhos em lote se adequam a tarefas tolerantes à latência, como classificar um grande conjunto de dados, executar avaliações, gerar dados sintéticos e resumir offline.
  • Agentes de voz em tempo real: um caso de cliente da Together AI sobre a IA de voz da Decagon, com resposta em menos de um segundo, aponta uma redução de custo por turno de 6 vezes frente ao gpt-5 mini.
  • APIs de produção com menor latência: um depoimento de cliente da Salesforce AI Research cita redução de 2 vezes na latência e custos cortados em cerca de um terço.
  • Pesquisa e treinamento: os clusters de GPU são promovidos para subir um cluster em minutos, testar uma hipótese e desligá-lo ao fim do experimento.
  • Agentes de programação em modelos abertos: o Together Link executa seis agentes de programação em modelos hospedados pela Together, incluindo Claude Code, Codex, OpenCode e Pi Code no terminal, além de Claude Desktop e ChatGPT Desktop.

Os números de clientes acima são publicados pela Together AI em suas próprias páginas e não foram verificados de forma independente para esta ficha.

Para Quem É

A Together AI atende desenvolvedores e equipes de ML que lidam bem com APIs, SDKs e ferramentas de linha de comando e querem usar modelos de pesos abertos sem operar a própria pilha de inferência.

  • Prototipagem e tráfego variável: a inferência sem servidor é apresentada como a melhor opção para tráfego variável ou imprevisível, prototipagem rápida e cargas de produção sensíveis a custo ou em estágio inicial.
  • Produção estável e sensível à latência: a inferência de modelos dedicada visa tráfego previsível, aplicações sensíveis à latência e cargas de produção de alta taxa de transferência.
  • Startups com investimento: uma aceleradora com seleção oferece até $15.000 em créditos de plataforma para startups que captaram até $5 milhões, até $30.000 para quem captou de $5 milhões a $10 milhões e até $50.000 acima de $10 milhões.

A escolha entre os dois modos de inferência depende da utilização. A inferência de modelos dedicada costuma sair mais barata se uma réplica ficaria ocupada a maior parte do dia; a sem servidor, se o tráfego é baixo ou irregular a ponto de uma réplica dedicada ficar ociosa a maior parte do tempo. A página de preços acrescenta que a maioria das equipes começa com inferência sem servidor e passa para pontos de extremidade dedicados ao ganhar escala.

É menos indicada para quem quer testar modelos antes de pagar, já que não há teste gratuito, e para apps criados sobre a Assistants API da OpenAI, que a camada de compatibilidade não implementa.

Plataformas

A Together AI é usada via console web, SDKs, CLI e API REST, não por um app de consumo.

  • SDKs e APIs: a Together AI publica SDKs oficiais para Python e TypeScript, e o SDK da OpenAI ou chamadas REST simples de qualquer linguagem também funcionam.
  • Compatibilidade com a OpenAI: a API é compatível com a API REST e os SDKs da OpenAI em chat, conclusões, visão, geração de imagens, conversão de texto em fala e embeddings.
  • Ferramentas de lote: trabalhos em lote podem ser iniciados pelo console, pela API ou SDK, ou pela CLI.
  • Gerenciamento de clusters: o acesso aos clusters de GPU é gerenciado com RBAC por projeto pela CLI, SDK, API, Terraform ou console web.
  • Regiões: os pontos de extremidade sem servidor não oferecem seleção de região. Rede privada e implantações baseadas em VPC, incluindo regiões da UE, estão disponíveis em configurações dedicadas.

Preços

Os preços da Together AI são baseados no uso e totalmente pré-pagos. A Together AI não oferece teste gratuito atualmente, e o acesso à plataforma exige uma compra mínima de $5 em créditos. É necessário ter saldo de créditos positivo para usar a plataforma. Os créditos de saldo pré-pago atualmente não têm data de validade. A recarga automática pode completar o saldo sozinha, mas só quando o método de pagamento padrão é um cartão de crédito ou débito. Pelos Termos de Serviço, as taxas pagas não são reembolsáveis, salvo se os termos ou um formulário de pedido disserem o contrário.

Preços de tokens sem servidor

Os preços sem servidor são cotados por 1 milhão de tokens e mudam com frequência. Estas linhas representativas foram coletadas em 5 de outubro de 2026.

ModeloEntradaEntrada em cacheSaída
MiniMax M3$0.30$0.06$1.20
Kimi K3$3.00$0.30$15.00
gpt-oss-120B$0.15Não informado$0.60
Llama 3.3 70B$1.04Não informado$1.04

A API de lote anuncia até 50 % de desconto sobre as tarifas sem servidor e um pool separado de limites de taxa. A tabela de modelos com desconto da documentação de lote, porém, lista apenas uma variante do Llama 3.3 70B Turbo e o Whisper Large v3 com 50 % de desconto, e os modelos fora da lista rodam a tarifas padrão.

Clusters de GPU

Todos os preços de clusters de GPU são por GPU por hora.

GPUPreemptívelSob demandaReservado 7–30 dias31–90 dias91–180 diasA partir de 181 dias
NVIDIA HGX H100$1.99$3.99$3.69$3.45$3.19Fale conosco
NVIDIA HGX H200$2.99$5.99$4.99$4.15$3.99Fale conosco
NVIDIA HGX B200$4.09$8.19$7.99$7.79$6.79Fale conosco

As reservas são cobradas pela duração reservada completa assim que o cluster é provisionado, e o uso além da capacidade reservada é cobrado a tarifas sob demanda. Os créditos da aceleradora para startups não se aplicam a clusters de GPU reservados.

Inferência dedicada

Uma réplica dedicada só é cobrada enquanto está pronta e apta a atender tráfego, por isso provisionamento e inicialização a frio não são cobrados. A tarifa da H100 difere entre páginas oficiais: a tabela de inferência dedicada da página de preços lista $5.49 por GPU-hora sob demanda. Já uma entrada do registro de alterações da documentação diz que o hardware de ponto de extremidade dedicado H100 80GB agora custa $3.99 por hora, reduzido de $5.49.

Ajuste fino

O ajuste fino é cobrado por tokens processados, ou seja, tamanho do conjunto de treinamento vezes épocas, mais eventuais tokens de avaliação, e cada trabalho tem cobrança mínima por modelo. A primeira tabela de ajuste fino da página de preços, sob abas rotuladas LoRA e ajuste fino completo, lista o Qwen3.5 0.8B a $0.34 por 1 milhão de tokens em ajuste fino supervisionado, $0.84 em DPO e mínimo de $4.00. Mais abaixo na mesma tabela, o GLM-5.2 aparece com $40.00 em ajuste fino supervisionado, $100.00 em DPO e mínimo de $60.00. Trabalhos cancelados ou interrompidos antecipadamente são cobrados apenas pelas etapas concluídas. Hospedar um modelo com ajuste fino em um ponto de extremidade dedicado é cobrado à parte, por minuto.

Alternativas à Together AI

Provedores comparáveis de inferência de modelos abertos diferem sobretudo em como cobram modelos com ajuste fino e em se contas novas começam com créditos gratuitos.

  • Fireworks AI: a Fireworks AI afirma que modelos com ajuste fino são servidos pelo mesmo preço dos modelos base. Sua inferência sem servidor é cobrada por token, pré-paga e por uso.
  • Baseten: a Baseten diz que contas novas vêm com créditos para experimentar implantações gratuitamente. Suas implantações dedicadas cobram só a computação usada, por minuto.

Diante deles, a Together AI exige uma primeira compra de $5 sem teste gratuito e cobra por minuto a hospedagem de modelos com ajuste fino em hardware dedicado. Em troca, uma única conta cobre modelos sem servidor, trabalhos em lote, pontos de extremidade dedicados, clusters de GPU, ambientes isolados e armazenamento.

Limitações

Limites do serviço

  • Sem servidor no melhor esforço: o desempenho sem servidor é de melhor esforço, e uma taxa de transferência contratada exige a taxa de transferência provisionada.
  • Limitação de solicitações: com demanda alta, a Together pode limitar solicitações e os clientes podem receber respostas 429 Too Many Requests ou 503 Service Unavailable.
  • Rotatividade de modelos: uma entrada do registro de alterações programou a remoção do openai/gpt-oss-20b e de outros modelos da oferta sem servidor em 14 de setembro de 2026. Todos os modelos dessa entrada, exceto um, continuaram disponíveis por pontos de extremidade dedicados sob demanda, que cobram por tempo de hardware em vez de tokens.
  • Compatibilidade parcial com a OpenAI: Assistants, Threads e Runs da API da OpenAI não estão implementados. Nomes de modelos da OpenAI como gpt-4o ou text-embedding-3-large retornam 404 na Together.
  • Limites de lote: um único lote pode conter até 50.000 solicitações. Arquivos de entrada, saída e erro dos lotes são mantidos por 7 dias, então os resultados precisam ser baixados nesse prazo.

Limites de cobrança e suporte

  • Saldo zerado: se o saldo chegar a zero, o acesso à API fica suspenso até que se adicionem créditos.
  • Clusters sob demanda: em clusters de GPU totalmente sob demanda, ao ficar sem créditos, o cluster é primeiro pausado e depois desativado se os créditos não forem restabelecidos.
  • Níveis de suporte: a página de suporte ainda descreve o suporte por nível, com ajuda comunitária no Discord para usuários do nível Build. Uma entrada do registro de alterações, porém, diz que os rótulos de nível Build 1–5, Scale e Enterprise foram descontinuados.

Privacidade, uso de dados e propriedade

  • Armazenamento padrão: por padrão, a Together armazena prompts e respostas dos modelos e pode usá-los para melhorias de produto.
  • Treinamento: o uso de dados de clientes para treinar modelos é uma adesão opcional (opt-in) separada, desativada por padrão. A política de privacidade afirma que os dados coletados não serão usados para treinar os modelos da empresa sem consentimento explícito de adesão.
  • Retenção zero de dados: a retenção zero de dados não vem ativada por padrão. Com a ZDR ativada, prompts e saídas não são armazenados pela Together nem usados para qualquer finalidade secundária. A ZDR só vale a partir da ativação e não afeta dados processados antes. Arquivos enviados para ajuste fino ou a API de lote permanecem armazenados até serem excluídos pela API, CLI ou console web.
  • Modelos de repasse: modelos de repasse (passthrough), que encaminham solicitações a um provedor terceiro, são permitidos por padrão e seguem a política de dados desse provedor.
  • Modelos de terceiros hospedados: modelos de autores terceiros, como DeepSeek, Qwen ou Mistral, rodam na infraestrutura própria da Together e não chamam o autor do modelo.
  • Propriedade e conformidade: pelos Termos de Serviço, os clientes são donos exclusivos de seu conteúdo e de suas saídas. A Together AI lista SOC 2 Type II, opções alinhadas à HIPAA e criptografia em trânsito e em repouso.

As fontes independentes de mídia e avaliações consultadas para esta página não mostraram interrupções nem relatos de segurança no nível do produto, e as amostras tinham menos de 20 avaliações, poucas demais para uma conclusão sobre qualidade.

FAQ

Q1. A Together AI tem plano gratuito ou teste gratuito?

Não. O acesso exige a compra de pelo menos $5 em créditos, e não há teste gratuito. Startups aceitas no programa de aceleração podem receber créditos de plataforma no lugar, mas esses créditos excluem clusters de GPU reservados.

Q2. Posso usar o SDK da OpenAI com a Together AI?

Sim, para chat, conclusões, visão, geração de imagens, conversão de texto em fala e embeddings: aponte o cliente OpenAI para a URL base da Together e troque para os IDs de modelo com espaço de nomes da Together. Assistants, Threads e Runs não estão disponíveis, e os trabalhos em lote usam a própria API de lote da Together.

Q3. A Together AI treina com meus prompts?

Não por padrão. O uso para treinamento é uma configuração de adesão opcional que fica desligada se não for ativada. Ainda assim, prompts e respostas são armazenados por padrão, a menos que a retenção zero de dados esteja ativada.

Q4. O que acontece quando meus créditos acabam?

O acesso à API fica suspenso até você adicionar créditos. Clusters de GPU sob demanda são pausados e depois desativados se os créditos não forem restabelecidos, enquanto reservas de clusters de GPU existentes continuam ativas até a data de término programada.

Q5. Posso levar um modelo com ajuste fino para outro lugar?

Sim. Concluído o trabalho, o modelo pode ser servido em um ponto de extremidade dedicado da Together ou baixado como ponto de verificação para inferência local ou outro host.

Conhece uma Ferramenta Semelhante?
Se conhece outras ótimas ferramentas de IA, sinta-se à vontade para as submeter-nos