Together AI 是一個雲端平台,透過 API 與可租用的 GPU 基礎設施執行、客製化及訓練開源與開放權重 AI 模型。公司將其宣傳為 AI 原生雲,也就是由前沿研究驅動的全端 AI 平台。對多數開發者來說,入口是開源 LLM API。
這項服務由 Together Computer, Inc. 營運,這是一家德拉瓦州公司,其條款涵蓋用於託管、使用、微調與訓練大型 AI 模型的 API 與網頁介面。獨立科技媒體將 Together AI 描述為出租輝達 GPU 叢集的 AI 新型雲端業者(neocloud),並報導其以 83 億美元估值完成 8 億美元 C 輪募資。同一篇報導指出,公司自稱擁有數千家付費客戶,並點名其中包括 Cursor、Cognition 與 Decagon。
三個事實左右了大多數決定:沒有免費試用,使用前須先購買 $5 額度;除非啟用零資料保留,提示詞預設會被儲存;共享的無伺服器容量為盡力而為(best-effort)。
Together AI 將產品分為推論、運算與模型調校三類,全部從同一個預付額度餘額扣款。
公司表示,其 gpt-oss-20B 無伺服器推論速度達到次快服務商的近 2 倍。這是廠商自測的基準,且該模型後來已被排定從無伺服器服務下架。
因此,LLM 微調的產出不是在專用硬體上執行,就是以權重形式帶離平台,而不會加入按 token 計費的無伺服器模型目錄。
第一次呼叫 API 需要一個已儲值的帳戶、一組 API 金鑰,以及官方 SDK 或既有的 OpenAI 用戶端:
微調費用可在花錢之前確認,因為 CLI 會在送出工作前印出預估價格並要求確認。
以上客戶數據由 Together AI 在自家頁面上發布,本條目未經獨立查證。
Together AI 適合熟悉 API、SDK 與命令列工具、想使用開放權重模型又不想自建推論架構的開發者與機器學習團隊。
在兩種推論模式之間選擇,關鍵在使用率。若副本一天中大部分時間都處於忙碌狀態,專用模型推論通常較便宜;若流量低或突發性高,以致專用副本大部分時間閒置,無伺服器通常較便宜。定價頁也指出,多數團隊先從無伺服器推論開始,規模擴大後再轉向專用端點。
對想先試用模型再付費的人來說,它不太合適,因為沒有免費試用;以 OpenAI Assistants API 建構的應用程式也不太合適,因為相容層並未實作該 API。
Together AI 透過網頁主控台、SDK、CLI 與 REST API 使用,而不是消費級 App。
Together AI 價格按用量計費,且完全預付。Together AI 目前不提供免費試用,使用平台至少需購買 $5 額度。使用平台須維持正的額度餘額。預付餘額額度目前沒有到期日。自動儲值可自動補足餘額,但僅限預設付款方式為信用卡或簽帳金融卡時。依服務條款,已付費用不予退還,除非條款或訂購單另有規定。
無伺服器價格以每 100 萬 token 報價,且經常變動。以下代表性資料擷取於 2026 年 10 月 5 日。
| 模型 | 輸入 | 快取輸入 | 輸出 |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | 未列出 | $0.60 |
| Llama 3.3 70B | $1.04 | 未列出 | $1.04 |
批次 API 宣傳最多可比無伺服器費率便宜 50%,並有獨立的速率限制池。不過,批次文件中的折扣模型表只列出一個 Llama 3.3 70B Turbo 變體與 Whisper Large v3 享有 50% 折扣,未列出的模型按標準費率計費。
所有 GPU 叢集價格皆以每 GPU 每小時計。
| GPU | 可搶占 | 隨選 | 保留 7–30 天 | 31–90 天 | 91–180 天 | 181 天以上 |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | 聯絡我們 |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | 聯絡我們 |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | 聯絡我們 |
叢集佈建完成後,保留方案按完整保留期間收費,超出保留容量的用量按隨選費率計費。新創加速器額度不適用於保留型 GPU 叢集。
專用副本僅在就緒並可處理流量時計費,因此佈建與冷啟動時間不收費。H100 費率在不同官方頁面之間有所出入:定價頁的專用推論表列出隨選每 GPU 小時 $5.49。而一則文件更新日誌則表示,H100 80GB 專用端點硬體現為每小時 $3.99,由 $5.49 調降。
微調按處理的 token 計費,也就是訓練資料集大小乘以訓練輪數,再加上評估 token(如有),且每項工作都有依模型設定的最低收費。定價頁上的第一張微調價格表(分頁標示為 LoRA 與完整微調)列出 Qwen3.5 0.8B 的監督式微調價格為每 100 萬 token $0.34、DPO 為 $0.84,最低收費 $4.00。同一張表較下方的 GLM-5.2 列出監督式微調 $40.00、DPO $100.00,最低收費 $60.00。已取消或提前停止的工作只按已完成的步驟收費。在專用端點上託管微調模型另按分鐘計費。
同類開放模型推論服務商的主要差異在於微調模型如何計費,以及新帳戶是否附帶免費額度。
與這些選項相比,Together AI 要求首次購買 $5 且無免費試用,並在專用硬體上按分鐘對微調模型託管計費。作為交換,一個帳戶即可涵蓋無伺服器模型、批次工作、專用端點、GPU 叢集、沙箱與儲存。
本頁查核的獨立媒體與評測來源未發現產品層面的故障或資安報告,評測樣本不到 20 則,數量過少,無法得出品質結論。
沒有。使用須購買至少 $5 額度,且不提供免費試用。獲准加入加速器計畫的新創公司可改為取得平台額度,但這些額度不適用於保留型 GPU 叢集。
可以,適用於聊天、補全、視覺、影像生成、文字轉語音與嵌入:將 OpenAI 用戶端指向 Together 的基礎 URL,並改用 Together 帶命名空間的模型 ID。Assistants、Threads 與 Runs 無法使用,批次工作則使用 Together 自己的批次 API。
預設不會。訓練用途是選擇加入的設定,除非啟用,否則維持關閉。但除非開啟零資料保留,提示詞與回應仍會預設被儲存。
API 存取會被暫停,直到你儲值為止。隨選 GPU 叢集會被暫停,若額度未恢復則隨後被撤除;既有的 GPU 叢集保留則維持有效,直到預定結束日期。
可以。工作完成後,模型可在 Together 專用端點上提供服務,也能下載為檢查點,用於本機推論或其他託管服務。