Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Herramientas de desarrollo
  4. Together AI
Vista previa de la interfaz de Together AI
Logotipo de Together AI

Together AI

Together AI ejecuta modelos de pesos abiertos mediante una API sin servidor compatible con OpenAI y suma puntos de conexión dedicados, ajuste fino, clústeres de GPU y entornos aislados, todo pagado con créditos prepago.

Herramientas de desarrolloDesarrollo de IAPlataforma de Entrenamiento de IA#Procesamiento por lotes#SDK#LLM
Probar gratis
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
6 oct 2026
Dominio
together.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Together AI

Probar gratis
Información de la herramienta
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
6 oct 2026
Dominio
together.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Probar gratis

¿Qué es Together AI?

Together AI es una plataforma en la nube para ejecutar, personalizar y entrenar modelos de IA de código abierto y de pesos abiertos con API e infraestructura de GPU de alquiler. La empresa la presenta como la nube nativa de IA, una plataforma de IA integral impulsada por investigación de vanguardia. Para la mayoría de los desarrolladores, el punto de entrada es una API de LLM de código abierto.

Lo opera Together Computer, Inc., una sociedad de Delaware cuyos términos cubren las API e interfaces web para alojar, usar, ajustar y entrenar grandes modelos de IA. La prensa tecnológica independiente describió Together AI como una neonube de IA que alquila clústeres de GPU de Nvidia e informó de una Serie C de 800 millones de dólares con una valoración de 8.300 millones. Según el mismo artículo, la empresa afirma tener miles de clientes de pago, entre ellos Cursor, Cognition y Decagon.

Tres hechos condicionan la mayoría de las decisiones: no hay prueba gratuita y el acceso empieza con una compra de créditos de $5; los prompts se almacenan por defecto salvo que se active la retención cero de datos; y la capacidad sin servidor compartida es de mejor esfuerzo (best-effort).

Funciones principales

Together AI agrupa sus productos en inferencia, cómputo y personalización de modelos, todo facturado desde el mismo saldo de créditos prepago.

Opciones de inferencia

  • Inferencia sin servidor: los desarrolladores llaman a modelos de pesos abiertos con una única API, sin nada que desplegar ni gestionar, y pagan solo por los tokens que usan. El catálogo abarca modelos de texto, imagen, vídeo, código y voz.
  • Inferencia por lotes: los grandes trabajos asíncronos pueden escalar hasta 30 mil millones de tokens por modelo, con cualquier modelo sin servidor o un despliegue privado.
  • Rendimiento aprovisionado: capacidad de inferencia comprometida con precios por token, rendimiento reservado y un SLA de disponibilidad del 99 %.
  • Puntos de conexión y contenedores dedicados: la inferencia de modelos dedicada ejecuta un modelo en hardware reservado y aislado, y la inferencia de contenedores dedicada se orienta a cargas de medios generativos, como modelos de vídeo, audio e imagen.

La empresa afirma haber logrado una inferencia sin servidor para gpt-oss-20B casi 2 veces más rápida que el siguiente proveedor más rápido. Es una prueba de rendimiento del propio proveedor, y después se programó la retirada del modelo de la oferta sin servidor.

Ajuste fino y personalización de modelos

  • Trae tu modelo: Together AI afirma que cualquier modelo de código abierto de Hugging Face Hub puede ajustarse sin conversiones de formato.
  • Datos de llamadas a herramientas: el entrenamiento de llamadas a herramientas acepta tal cual los registros de agentes existentes, con definiciones de funciones y llamadas a herramientas directamente en el conjunto de datos.
  • Ajuste fino de visión: los modelos de visión se entrenan directamente con imágenes PNG, JPEG o WEBP sin procesar, sin preprocesamiento especial, con LoRA o ajuste fino completo.
  • Resultados portables: un modelo terminado puede alojarse en un punto de conexión dedicado de Together o descargarse como punto de control independiente.

Por eso, el resultado del ajuste fino de LLM se ejecuta en hardware dedicado o sale de la plataforma como pesos, en vez de sumarse al catálogo sin servidor facturado por token.

Cómputo, entornos aislados y almacenamiento

  • Clústeres de GPU: los clientes pueden reservar de 8 a más de 4.000 GPU para entrenamiento o servicio de modelos.
  • Entorno aislado de código: sus VM van de 2 a 64 vCPU y de 1 a 128 GB de RAM para entornos de desarrollo de IA.
  • Almacenamiento gestionado: ofrece almacenamiento de objetos y sistemas de archivos paralelos sin tarifas de salida de datos.

Guía

Una primera llamada a la API requiere una cuenta con fondos, una clave de API y el SDK oficial o un cliente de OpenAI existente:

  1. Regístrate en la consola de Together AI y añade al menos $5 en créditos desde la configuración de facturación.
  2. Crea una clave en la página de claves de API del proyecto; las claves nuevas solo se muestran una vez, así que guarda el valor enseguida.
  3. Instala el SDK oficial de Python o TypeScript, o conserva un cliente de OpenAI existente y cambia su URL base; luego define la clave como variable de entorno.
  4. Ejecuta el ejemplo de inicio rápido, que envía una solicitud de completado de chat a MiniMax M3 e imprime la respuesta.
  5. Para cargas sin conexión, la API por lotes ejecuta asíncronamente muchas solicitudes independientes desde un único archivo JSONL subido.

El coste de un ajuste fino se puede comprobar antes de gastar nada: la CLI muestra el precio estimado y pide confirmación antes de enviar el trabajo.

Casos de uso y ejemplos de Together AI

  • Trabajo por lotes sin conexión: los trabajos por lotes encajan en tareas tolerantes a la latencia, como clasificar un gran conjunto de datos, ejecutar evaluaciones, generar datos sintéticos y resumir sin conexión.
  • Agentes de voz en tiempo real: un caso de cliente de Together AI sobre la IA de voz de Decagon, con respuesta en menos de un segundo, recoge una reducción de costes por turno de 6 veces frente a gpt-5 mini.
  • API de producción con menor latencia: un testimonio de cliente de Salesforce AI Research cita una reducción de latencia de 2 veces y costes recortados en cerca de un tercio.
  • Investigación y entrenamiento: los clústeres de GPU se promocionan para levantar un clúster en minutos, probar una hipótesis y apagarlo al terminar el experimento.
  • Agentes de programación con modelos abiertos: Together Link ejecuta seis agentes de programación sobre modelos alojados en Together, entre ellos Claude Code, Codex, OpenCode y Pi Code en la terminal, además de Claude Desktop y ChatGPT Desktop.

Together AI publica estas cifras de clientes en sus propias páginas y no se verificaron de forma independiente para esta ficha.

Para quién es

Together AI encaja con desarrolladores y equipos de ML que trabajan a gusto con API, SDK y herramientas de línea de comandos y quieren usar modelos de pesos abiertos sin operar su propia pila de inferencia.

  • Prototipado y tráfico variable: la inferencia sin servidor se presenta como la mejor opción para tráfico variable o impredecible, prototipado rápido y cargas de producción sensibles al coste o en fase inicial.
  • Producción estable y sensible a la latencia: la inferencia de modelos dedicada se dirige a tráfico predecible, aplicaciones sensibles a la latencia y cargas de producción de alto rendimiento.
  • Startups con financiación: una aceleradora con selección ofrece hasta 15.000 $ en créditos de plataforma a startups que captaron hasta 5 millones de dólares, hasta 30.000 $ con 5–10 millones y hasta 50.000 $ con más de 10 millones.

Elegir entre los dos modos de inferencia depende de la utilización. La inferencia de modelos dedicada suele ser más barata si una réplica estaría ocupada la mayor parte del día; la sin servidor suele serlo si el tráfico es bajo o tan irregular que una réplica dedicada estaría inactiva la mayor parte del tiempo. La página de precios añade que la mayoría de los equipos empiezan con inferencia sin servidor y pasan a puntos de conexión dedicados al ganar escala.

Encaja peor con quien quiera probar modelos antes de pagar, ya que no hay prueba gratuita, y con apps creadas sobre la Assistants API de OpenAI, que la capa de compatibilidad no implementa.

Plataformas

Together AI se usa con una consola web, SDK, una CLI y una API REST, no con una app de consumo.

  • SDK y API: Together AI publica SDK oficiales para Python y TypeScript, y también funcionan el SDK de OpenAI o llamadas REST simples desde cualquier lenguaje.
  • Compatibilidad con OpenAI: la API es compatible con la API REST y los SDK de OpenAI en chat, completados, visión, generación de imágenes, texto a voz y embeddings.
  • Herramientas por lotes: los trabajos por lotes pueden lanzarse desde la consola, la API o el SDK, o con la CLI.
  • Gestión de clústeres: el acceso a los clústeres de GPU se gestiona con RBAC por proyecto desde la CLI, el SDK, la API, Terraform o la consola web.
  • Regiones: los puntos de conexión sin servidor no permiten elegir región. Las redes privadas y los despliegues basados en VPC, incluidas regiones de la UE, se ofrecen con configuraciones dedicadas.

Precios

Los precios de Together AI se basan en el uso y son totalmente prepago. Together AI no ofrece actualmente prueba gratuita, y el acceso a la plataforma requiere una compra mínima de $5 en créditos. Para usar la plataforma se necesita un saldo de créditos positivo. Los créditos del saldo prepago no tienen actualmente fecha de caducidad. La recarga automática puede reponer el saldo sola, pero solo si el método de pago predeterminado es una tarjeta de crédito o débito. Según los Términos del servicio, las tarifas pagadas no son reembolsables, salvo que los términos o un formulario de pedido indiquen lo contrario.

Precios de tokens sin servidor

Los precios sin servidor se dan por 1 millón de tokens y cambian a menudo. Estas filas representativas se recopilaron el 5 de octubre de 2026.

ModeloEntradaEntrada en cachéSalida
MiniMax M3$0.30$0.06$1.20
Kimi K3$3.00$0.30$15.00
gpt-oss-120B$0.15No indicado$0.60
Llama 3.3 70B$1.04No indicado$1.04

La API por lotes anuncia hasta un 50 % de descuento sobre las tarifas sin servidor y un grupo de límites de solicitudes independiente. Sin embargo, la tabla de modelos con descuento de la documentación de lotes solo recoge con un 50 % de descuento una variante de Llama 3.3 70B Turbo y Whisper Large v3, y los modelos no incluidos van a tarifa estándar.

Clústeres de GPU

Todos los precios de los clústeres de GPU son por GPU y por hora.

GPUInterrumpibleBajo demandaReservado 7–30 días31–90 días91–180 díasDesde 181 días
NVIDIA HGX H100$1.99$3.99$3.69$3.45$3.19Contactar
NVIDIA HGX H200$2.99$5.99$4.99$4.15$3.99Contactar
NVIDIA HGX B200$4.09$8.19$7.99$7.79$6.79Contactar

Las reservas se cobran por toda la duración reservada una vez aprovisionado el clúster, y el uso por encima de la capacidad reservada se factura a tarifas bajo demanda. Los créditos de la aceleradora para startups no se aplican a los clústeres de GPU reservados.

Inferencia dedicada

Una réplica dedicada solo se factura mientras está lista y puede atender tráfico, así que el aprovisionamiento y el arranque en frío no se cobran. La tarifa de H100 difiere entre páginas oficiales: la tabla de inferencia dedicada de la página de precios indica $5.49 por GPU-hora bajo demanda. En cambio, una entrada del registro de cambios de la documentación dice que el hardware de punto de conexión dedicado H100 80GB cuesta ahora $3.99 por hora, rebajado desde $5.49.

Ajuste fino

El ajuste fino se factura por tokens procesados, es decir, tamaño del conjunto de entrenamiento por número de épocas más los tokens de evaluación que haya, y cada trabajo tiene un cargo mínimo según el modelo. La primera tabla de ajuste fino de la página de precios, bajo pestañas tituladas LoRA y ajuste fino completo, indica para Qwen3.5 0.8B $0.34 por 1 millón de tokens en ajuste fino supervisado, $0.84 en DPO y un mínimo de $4.00. Más abajo en la misma tabla, GLM-5.2 figura con $40.00 en ajuste fino supervisado, $100.00 en DPO y un mínimo de $60.00. Los trabajos cancelados o detenidos antes de tiempo solo se cobran por los pasos completados. Alojar un modelo ajustado en un punto de conexión dedicado se factura aparte, por minuto.

Alternativas a Together AI

Los proveedores comparables de inferencia de modelos abiertos se diferencian sobre todo en cómo facturan los modelos ajustados y en si las cuentas nuevas empiezan con créditos gratuitos.

  • Fireworks AI: Fireworks AI indica que los modelos ajustados se sirven al mismo precio que los base. Su inferencia sin servidor se factura por token, prepago y según el uso.
  • Baseten: Baseten afirma que las cuentas nuevas incluyen créditos para experimentar gratis con despliegues. Sus despliegues dedicados cobran solo el cómputo utilizado, al minuto.

Frente a ellos, Together AI exige una primera compra de $5 sin prueba gratuita y factura por minuto el alojamiento de modelos ajustados en hardware dedicado. A cambio, una sola cuenta cubre modelos sin servidor, trabajos por lotes, puntos de conexión dedicados, clústeres de GPU, entornos aislados y almacenamiento.

Limitaciones

Límites del servicio

  • Sin servidor de mejor esfuerzo: el desempeño sin servidor es de mejor esfuerzo, y un rendimiento comprometido requiere el rendimiento aprovisionado.
  • Limitación de solicitudes: con demanda alta, Together puede limitar las solicitudes y los clientes pueden recibir respuestas 429 Too Many Requests o 503 Service Unavailable.
  • Rotación de modelos: una entrada del registro de cambios programó la retirada de openai/gpt-oss-20b y otros modelos de la oferta sin servidor el 14 de septiembre de 2026. Todos los modelos de esa entrada salvo uno siguieron disponibles con puntos de conexión dedicados bajo demanda, que facturan por tiempo de hardware y no por tokens.
  • Compatibilidad parcial con OpenAI: Assistants, Threads y Runs de la API de OpenAI no están implementados. Los nombres de modelos de OpenAI como gpt-4o o text-embedding-3-large devuelven un 404 en Together.
  • Límites de lotes: un lote puede contener hasta 50.000 solicitudes. Los archivos de entrada, salida y error de los lotes se conservan 7 días, así que los resultados deben descargarse en ese plazo.

Límites de facturación y soporte

  • Saldo cero: si el saldo llega a cero, el acceso a la API se suspende hasta que se añadan créditos.
  • Clústeres bajo demanda: en los clústeres de GPU totalmente bajo demanda, al quedarse sin créditos el clúster primero se pausa y luego se da de baja si los créditos no se restauran.
  • Niveles de soporte: la página de soporte sigue describiendo el soporte por niveles, con ayuda comunitaria en Discord para usuarios del nivel Build. Sin embargo, una entrada del registro de cambios dice que las etiquetas de nivel Build 1–5, Scale y Enterprise se han retirado.

Privacidad, uso de datos y propiedad

  • Almacenamiento predeterminado: por defecto, Together almacena los prompts y las respuestas de los modelos y puede usarlos para mejorar sus productos.
  • Entrenamiento: el uso de datos de clientes para entrenar modelos es una opción de inclusión voluntaria (opt-in) aparte, desactivada por defecto. La política de privacidad declara que los datos recopilados no se usarán para entrenar los modelos de la empresa sin un consentimiento explícito de inclusión voluntaria.
  • Retención cero de datos: la retención cero de datos no está activada por defecto. Con ZDR activada, Together no almacena los prompts ni las salidas ni los usa para ningún fin secundario. ZDR solo se aplica desde que se activa y no afecta a los datos procesados antes. Los archivos subidos para ajuste fino o la API por lotes siguen almacenados hasta que se eliminan con la API, la CLI o la consola web.
  • Modelos de paso: los modelos de paso (passthrough), que reenvían las solicitudes a un proveedor externo, están permitidos por defecto y se rigen por la política de datos propia de ese proveedor.
  • Modelos de terceros alojados: los modelos de autores externos como DeepSeek, Qwen o Mistral se ejecutan en la infraestructura propia de Together y no llaman al autor del modelo.
  • Propiedad y cumplimiento: según los Términos del servicio, los clientes son propietarios exclusivos de su contenido y sus resultados. Together AI menciona SOC 2 Type II, opciones alineadas con HIPAA y cifrado en tránsito y en reposo.

Las fuentes independientes de medios y reseñas consultadas para esta página no mostraron caídas ni informes de seguridad a nivel de producto, y las muestras tenían menos de 20 reseñas, demasiado pocas para concluir sobre la calidad.

Preguntas frecuentes

Q1. ¿Together AI tiene plan gratuito o prueba gratuita?

No. El acceso requiere comprar al menos $5 en créditos y no se ofrece prueba gratuita. Las startups aceptadas en el programa de aceleración pueden recibir en su lugar créditos de plataforma, aunque esos créditos excluyen los clústeres de GPU reservados.

Q2. ¿Puedo usar el SDK de OpenAI con Together AI?

Sí, para chat, completados, visión, generación de imágenes, texto a voz y embeddings: apunta el cliente de OpenAI a la URL base de Together y cambia a los ID de modelo con espacio de nombres de Together. Assistants, Threads y Runs no están disponibles, y los trabajos por lotes usan la API por lotes propia de Together.

Q3. ¿Together AI entrena con mis prompts?

No por defecto. El uso para entrenamiento es una opción de inclusión voluntaria que permanece desactivada salvo que se active. Aun así, los prompts y las respuestas se almacenan por defecto salvo que se active la retención cero de datos.

Q4. ¿Qué pasa cuando se me acaban los créditos?

El acceso a la API se suspende hasta que añadas créditos. Los clústeres de GPU bajo demanda se pausan y después se dan de baja si no se restauran los créditos, mientras que las reservas de clústeres de GPU existentes siguen activas hasta su fecha de fin prevista.

Q5. ¿Puedo llevar un modelo ajustado a otro sitio?

Sí. Al terminar el trabajo, el modelo puede servirse en un punto de conexión dedicado de Together o descargarse como punto de control para inferencia local u otro alojamiento.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas