¿Has usado esta herramienta? Valórala
¿Has usado esta herramienta? Valórala
Together AI es una plataforma en la nube para ejecutar, personalizar y entrenar modelos de IA de código abierto y de pesos abiertos con API e infraestructura de GPU de alquiler. La empresa la presenta como la nube nativa de IA, una plataforma de IA integral impulsada por investigación de vanguardia. Para la mayoría de los desarrolladores, el punto de entrada es una API de LLM de código abierto.
Lo opera Together Computer, Inc., una sociedad de Delaware cuyos términos cubren las API e interfaces web para alojar, usar, ajustar y entrenar grandes modelos de IA. La prensa tecnológica independiente describió Together AI como una neonube de IA que alquila clústeres de GPU de Nvidia e informó de una Serie C de 800 millones de dólares con una valoración de 8.300 millones. Según el mismo artículo, la empresa afirma tener miles de clientes de pago, entre ellos Cursor, Cognition y Decagon.
Tres hechos condicionan la mayoría de las decisiones: no hay prueba gratuita y el acceso empieza con una compra de créditos de $5; los prompts se almacenan por defecto salvo que se active la retención cero de datos; y la capacidad sin servidor compartida es de mejor esfuerzo (best-effort).
Together AI agrupa sus productos en inferencia, cómputo y personalización de modelos, todo facturado desde el mismo saldo de créditos prepago.
La empresa afirma haber logrado una inferencia sin servidor para gpt-oss-20B casi 2 veces más rápida que el siguiente proveedor más rápido. Es una prueba de rendimiento del propio proveedor, y después se programó la retirada del modelo de la oferta sin servidor.
Por eso, el resultado del ajuste fino de LLM se ejecuta en hardware dedicado o sale de la plataforma como pesos, en vez de sumarse al catálogo sin servidor facturado por token.
Una primera llamada a la API requiere una cuenta con fondos, una clave de API y el SDK oficial o un cliente de OpenAI existente:
El coste de un ajuste fino se puede comprobar antes de gastar nada: la CLI muestra el precio estimado y pide confirmación antes de enviar el trabajo.
Together AI publica estas cifras de clientes en sus propias páginas y no se verificaron de forma independiente para esta ficha.
Together AI encaja con desarrolladores y equipos de ML que trabajan a gusto con API, SDK y herramientas de línea de comandos y quieren usar modelos de pesos abiertos sin operar su propia pila de inferencia.
Elegir entre los dos modos de inferencia depende de la utilización. La inferencia de modelos dedicada suele ser más barata si una réplica estaría ocupada la mayor parte del día; la sin servidor suele serlo si el tráfico es bajo o tan irregular que una réplica dedicada estaría inactiva la mayor parte del tiempo. La página de precios añade que la mayoría de los equipos empiezan con inferencia sin servidor y pasan a puntos de conexión dedicados al ganar escala.
Encaja peor con quien quiera probar modelos antes de pagar, ya que no hay prueba gratuita, y con apps creadas sobre la Assistants API de OpenAI, que la capa de compatibilidad no implementa.
Together AI se usa con una consola web, SDK, una CLI y una API REST, no con una app de consumo.
Los precios de Together AI se basan en el uso y son totalmente prepago. Together AI no ofrece actualmente prueba gratuita, y el acceso a la plataforma requiere una compra mínima de $5 en créditos. Para usar la plataforma se necesita un saldo de créditos positivo. Los créditos del saldo prepago no tienen actualmente fecha de caducidad. La recarga automática puede reponer el saldo sola, pero solo si el método de pago predeterminado es una tarjeta de crédito o débito. Según los Términos del servicio, las tarifas pagadas no son reembolsables, salvo que los términos o un formulario de pedido indiquen lo contrario.
Los precios sin servidor se dan por 1 millón de tokens y cambian a menudo. Estas filas representativas se recopilaron el 5 de octubre de 2026.
| Modelo | Entrada | Entrada en caché | Salida |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | No indicado | $0.60 |
| Llama 3.3 70B | $1.04 | No indicado | $1.04 |
La API por lotes anuncia hasta un 50 % de descuento sobre las tarifas sin servidor y un grupo de límites de solicitudes independiente. Sin embargo, la tabla de modelos con descuento de la documentación de lotes solo recoge con un 50 % de descuento una variante de Llama 3.3 70B Turbo y Whisper Large v3, y los modelos no incluidos van a tarifa estándar.
Todos los precios de los clústeres de GPU son por GPU y por hora.
| GPU | Interrumpible | Bajo demanda | Reservado 7–30 días | 31–90 días | 91–180 días | Desde 181 días |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | Contactar |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | Contactar |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | Contactar |
Las reservas se cobran por toda la duración reservada una vez aprovisionado el clúster, y el uso por encima de la capacidad reservada se factura a tarifas bajo demanda. Los créditos de la aceleradora para startups no se aplican a los clústeres de GPU reservados.
Una réplica dedicada solo se factura mientras está lista y puede atender tráfico, así que el aprovisionamiento y el arranque en frío no se cobran. La tarifa de H100 difiere entre páginas oficiales: la tabla de inferencia dedicada de la página de precios indica $5.49 por GPU-hora bajo demanda. En cambio, una entrada del registro de cambios de la documentación dice que el hardware de punto de conexión dedicado H100 80GB cuesta ahora $3.99 por hora, rebajado desde $5.49.
El ajuste fino se factura por tokens procesados, es decir, tamaño del conjunto de entrenamiento por número de épocas más los tokens de evaluación que haya, y cada trabajo tiene un cargo mínimo según el modelo. La primera tabla de ajuste fino de la página de precios, bajo pestañas tituladas LoRA y ajuste fino completo, indica para Qwen3.5 0.8B $0.34 por 1 millón de tokens en ajuste fino supervisado, $0.84 en DPO y un mínimo de $4.00. Más abajo en la misma tabla, GLM-5.2 figura con $40.00 en ajuste fino supervisado, $100.00 en DPO y un mínimo de $60.00. Los trabajos cancelados o detenidos antes de tiempo solo se cobran por los pasos completados. Alojar un modelo ajustado en un punto de conexión dedicado se factura aparte, por minuto.
Los proveedores comparables de inferencia de modelos abiertos se diferencian sobre todo en cómo facturan los modelos ajustados y en si las cuentas nuevas empiezan con créditos gratuitos.
Frente a ellos, Together AI exige una primera compra de $5 sin prueba gratuita y factura por minuto el alojamiento de modelos ajustados en hardware dedicado. A cambio, una sola cuenta cubre modelos sin servidor, trabajos por lotes, puntos de conexión dedicados, clústeres de GPU, entornos aislados y almacenamiento.
Las fuentes independientes de medios y reseñas consultadas para esta página no mostraron caídas ni informes de seguridad a nivel de producto, y las muestras tenían menos de 20 reseñas, demasiado pocas para concluir sobre la calidad.
No. El acceso requiere comprar al menos $5 en créditos y no se ofrece prueba gratuita. Las startups aceptadas en el programa de aceleración pueden recibir en su lugar créditos de plataforma, aunque esos créditos excluyen los clústeres de GPU reservados.
Sí, para chat, completados, visión, generación de imágenes, texto a voz y embeddings: apunta el cliente de OpenAI a la URL base de Together y cambia a los ID de modelo con espacio de nombres de Together. Assistants, Threads y Runs no están disponibles, y los trabajos por lotes usan la API por lotes propia de Together.
No por defecto. El uso para entrenamiento es una opción de inclusión voluntaria que permanece desactivada salvo que se active. Aun así, los prompts y las respuestas se almacenan por defecto salvo que se active la retención cero de datos.
El acceso a la API se suspende hasta que añadas créditos. Los clústeres de GPU bajo demanda se pausan y después se dan de baja si no se restauran los créditos, mientras que las reservas de clústeres de GPU existentes siguen activas hasta su fecha de fin prevista.
Sí. Al terminar el trabajo, el modelo puede servirse en un punto de conexión dedicado de Together o descargarse como punto de control para inferencia local u otro alojamiento.