Together AI 是一个云平台,通过 API 和可租用的 GPU 基础设施运行、定制和训练开源及开放权重 AI 模型。公司将其宣传为 AI 原生云,即由前沿研究驱动的全栈 AI 平台。对多数开发者而言,入口是开源大模型 API。
该服务由 Together Computer, Inc. 运营,这是一家特拉华州公司,其条款涵盖用于托管、使用、微调和训练大型 AI 模型的 API 与网页界面。独立科技媒体将 Together AI 描述为出租英伟达 GPU 集群的 AI 新型云厂商(neocloud),并报道其以 83 亿美元估值完成 8 亿美元 C 轮融资。同一报道称,公司自称拥有数千家付费客户,并点名其中包括 Cursor、Cognition 和 Decagon。
三个事实决定了大多数选择:没有免费试用,使用前须先购买 $5 额度;除非启用零数据留存,提示词默认会被存储;共享的无服务器容量为尽力而为(best-effort)。
Together AI 将产品分为推理、算力和模型定制三类,全部从同一个预付额度余额中扣费。
公司称,其 gpt-oss-20B 无服务器推理速度达到次快服务商的近 2 倍。这是厂商自测基准,且该模型之后已被安排从无服务器服务下架。
因此,大模型微调的产出要么运行在专用硬件上,要么以权重形式带离平台,而不会加入按 token 计费的无服务器模型目录。
首次调用 API 需要一个已充值的账户、一个 API 密钥,以及官方 SDK 或现有的 OpenAI 客户端:
微调费用可在花钱之前查看,因为 CLI 会在提交任务前打印预估价格并请求确认。
以上客户数据由 Together AI 在其自有页面上发布,本条目未经独立核实。
Together AI 适合熟练使用 API、SDK 和命令行工具、希望使用开放权重模型却不想自建推理栈的开发者和机器学习团队。
在两种推理模式之间选择,关键在利用率。若副本一天中大部分时间都处于忙碌状态,专用模型推理通常更便宜;若流量低或突发性强,以致专用副本大部分时间闲置,无服务器通常更便宜。定价页还指出,大多数团队从无服务器推理起步,规模扩大后再转向专用端点。
对想先试用模型再付费的人来说,它不太合适,因为没有免费试用;基于 OpenAI Assistants API 构建的应用也不太合适,因为兼容层没有实现该 API。
Together AI 通过网页控制台、SDK、CLI 和 REST API 使用,而不是消费级应用。
Together AI 价格按用量计费,且完全预付。Together AI 目前不提供免费试用,使用平台至少需购买 $5 额度。使用平台须保持额度余额为正。预付余额额度目前没有有效期。自动充值可自动补足余额,但仅限默认支付方式为信用卡或借记卡时。根据服务条款,已付费用不予退还,除非条款或订购单另有规定。
无服务器价格按每 100 万 token 报价,且经常变动。以下代表性数据采集于 2026 年 10 月 5 日。
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | 未列出 | $0.60 |
| Llama 3.3 70B | $1.04 | 未列出 | $1.04 |
批处理 API 宣传最多可比无服务器费率便宜 50%,并有独立的速率限制池。不过,批处理文档中的折扣模型表只列出一个 Llama 3.3 70B Turbo 变体和 Whisper Large v3 享受 50% 折扣,未列出的模型按标准费率计费。
所有 GPU 集群价格均按每 GPU 每小时计。
| GPU | 可抢占 | 按需 | 预留 7–30 天 | 31–90 天 | 91–180 天 | 181 天以上 |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | 联系我们 |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | 联系我们 |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | 联系我们 |
集群开通后,预留按完整预留期限收费,超出预留容量的用量按按需费率计费。初创公司加速器额度不适用于预留 GPU 集群。
专用副本仅在就绪并可处理流量时计费,因此开通和冷启动时间不收费。H100 费率在不同官方页面之间存在差异:定价页的专用推理表列出按需每 GPU 小时 $5.49。而一条文档更新日志则称,H100 80GB 专用端点硬件现为每小时 $3.99,由 $5.49 下调。
微调按处理的 token 计费,即训练数据集大小乘以轮数,再加上评估 token(如有),且每个任务都有按模型设定的最低收费。定价页上的第一张微调价格表(页签为 LoRA 与全量微调)列出 Qwen3.5 0.8B 的监督微调价格为每 100 万 token $0.34、DPO 为 $0.84,最低收费 $4.00。同一表格靠后的 GLM-5.2 列出监督微调 $40.00、DPO $100.00,最低收费 $60.00。已取消或提前停止的任务仅按已完成的步骤收费。在专用端点上托管微调模型另按分钟计费。
同类开放模型推理服务商的主要区别在于微调模型如何计费,以及新账户是否附带免费额度。
与这些选项相比,Together AI 要求首次购买 $5 且无免费试用,并在专用硬件上按分钟对微调模型托管计费。作为交换,一个账户即可覆盖无服务器模型、批处理任务、专用端点、GPU 集群、沙箱和存储。
本页核查的独立媒体和评测来源未发现产品层面的故障或安全报告,评测样本不足 20 条,数量太少,无法得出质量结论。
没有。使用须购买至少 $5 额度,且不提供免费试用。获准加入加速器计划的初创公司可改为获得平台额度,但这些额度不适用于预留 GPU 集群。
可以,适用于聊天、补全、视觉、图像生成、文本转语音和嵌入:将 OpenAI 客户端指向 Together 的基础 URL,并改用 Together 带命名空间的模型 ID。Assistants、Threads 和 Runs 不可用,批处理任务使用 Together 自己的批处理 API。
默认不会。训练用途是选择加入设置,除非启用,否则保持关闭。但除非开启零数据留存,提示词和响应仍会默认被存储。
API 访问会被暂停,直到你充值。按需 GPU 集群会被暂停,若额度未恢复则随后被撤除;现有 GPU 集群预留则保持有效,直到其预定结束日期。
可以。任务完成后,模型可在 Together 专用端点上提供服务,也可下载为检查点,用于本地推理或其他托管方。