Together AIは、APIとレンタルGPUインフラで、オープンソースおよびオープンウェイトのAIモデルを実行・カスタマイズ・学習できるクラウド基盤です。同社はこれを、最先端の研究に支えられたフルスタックAI基盤「AIネイティブクラウド」として打ち出しています。大半の開発者の入口は、オープンソースLLM APIです。
運営元はデラウェア州法人のTogether Computer, Inc.で、規約は大規模AIモデルをホスト・利用・ファインチューニング・学習するためのAPIとWebインターフェースを対象とします。独立系テックメディアはTogether AIを、Nvidia GPUクラスターを貸し出すAIネオクラウドと評し、評価額83億ドルでの8億ドルのシリーズC調達を報じました。同じ報道によれば、同社は数千社の有料顧客を抱えると主張し、その中にCursor、Cognition、Decagonを挙げています。
判断の大半を左右する事実は3つです。無料トライアルがなく利用は$5のクレジット購入から始まる点、ゼロデータ保持を有効にしない限りプロンプトがデフォルトで保存される点、共有のサーバーレス容量がベストエフォートである点です。
Together AIは製品を推論、コンピュート、モデル調整に分け、いずれも同じ前払いクレジット残高から課金します。
同社はgpt-oss-20Bのサーバーレス推論で、次に速いプロバイダーの2倍近い速度を出したとしています。これはベンダー自身のベンチマークで、同モデルはその後サーバーレスからの削除が予定されました。
そのため、LLMファインチューニングの成果物はトークン課金のサーバーレスカタログには加わらず、専用ハードウェアで動かすか、重みとしてプラットフォーム外へ持ち出すことになります。
最初のAPI呼び出しには、入金済みアカウント、APIキー、公式SDKか既存のOpenAIクライアントが必要です。
ファインチューニングの費用は支払い前に確認できます。CLIがジョブ送信前に見積価格を表示し、確認を求めるからです。
上記の顧客数値はTogether AIが自社ページで公開したもので、本掲載では独立検証をしていません。
Together AIは、API、SDK、コマンドラインツールを使いこなし、自前の推論スタックを運用せずにオープンウェイトモデルを使いたい開発者やMLチーム向きです。
2つの推論モードの選択は稼働率次第です。レプリカが1日の大半稼働し続けるなら通常は専用モデル推論が、トラフィックが少ないか断続的で専用レプリカがほとんどの時間アイドルになるなら通常はサーバーレスが安くなります。料金ページは、大半のチームがサーバーレス推論から始め、規模拡大に伴い専用エンドポイントに移行するとも説明します。
無料トライアルがないため、支払い前にモデルを試したい人にはあまり向きません。互換レイヤーがOpenAIのAssistants APIを実装していないため、それで構築したアプリにもあまり向きません。
Together AIは消費者向けアプリではなく、Webコンソール、SDK、CLI、REST APIで利用します。
Together AI 料金は使用量ベースで、全額前払いです。Together AIは現在無料トライアルを提供しておらず、プラットフォームの利用には最低$5のクレジット購入が必要です。利用には、クレジット残高がプラスである必要があります。前払いの残高クレジットには現在有効期限がありません。オートチャージで残高を自動補充できますが、デフォルトの支払い方法がクレジットカードかデビットカードの場合のみです。利用規約では、規約または注文書に別段の定めがない限り、支払済みの料金は返金されません。
サーバーレス料金は100万トークンあたりで提示され、頻繁に変わります。以下の代表的な行は2026年10月5日に取得しました。
| モデル | 入力 | キャッシュ入力 | 出力 |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | 記載なし | $0.60 |
| Llama 3.3 70B | $1.04 | 記載なし | $1.04 |
バッチAPIは、サーバーレス料金から最大50%割引と、別枠のレート制限プールをうたっています。ただし、バッチドキュメントの割引対象モデル表には、Llama 3.3 70B TurboのバリアントとWhisper Large v3しか50%割引として載っておらず、記載のないモデルは通常料金で実行されます。
GPUクラスターの料金はすべて、GPU 1基・1時間あたりです。
| GPU | プリエンプティブル | オンデマンド | 予約 7–30日 | 31–90日 | 91–180日 | 181日以上 |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | 要問合せ |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | 要問合せ |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | 要問合せ |
予約は、クラスターのプロビジョニング時点で予約期間全体分が課金され、予約容量の超過分はオンデマンド料金で請求されます。スタートアップアクセラレーターのクレジットは、予約GPUクラスターには適用されません。
専用レプリカは、準備が整いトラフィックを処理できる間だけ課金されるため、プロビジョニングとコールドスタートの時間は請求されません。H100の料金は公式ページ間で異なります。料金ページの専用推論の表では、オンデマンドでGPU時間あたり$5.49です。一方、ドキュメントの変更履歴のエントリは、H100 80GBの専用エンドポイント用ハードウェアが$5.49から値下げされ、現在1時間あたり$3.99だとしています。
ファインチューニングは処理トークン数、つまり学習データセットのサイズ×エポック数に評価トークン(ある場合)を加えた量で課金され、各ジョブにはモデルごとの最低料金がかかります。料金ページ最初のファインチューニング表(タブはLoRAとフルファインチューニング)では、Qwen3.5 0.8Bが教師ありファインチューニングで100万トークンあたり$0.34、DPOで$0.84、最低料金$4.00です。同じ表のさらに下では、GLM-5.2が教師ありファインチューニング$40.00、DPO $100.00、最低料金$60.00です。キャンセルまたは早期停止したジョブは、完了したステップ分のみ課金されます。微調整済みモデルを専用エンドポイントでホストする費用は、分単位で別途請求されます。
同種のオープンモデル推論プロバイダーの主な違いは、微調整済みモデルの課金方法と、新規アカウントに無料クレジットが付くかどうかです。
これらと比べ、Together AIは無料トライアルなしで初回$5の購入を求め、微調整済みモデルのホスティングを専用ハードウェアで分単位で課金します。その代わり、1つのアカウントでサーバーレスモデル、バッチジョブ、専用エンドポイント、GPUクラスター、サンドボックス、ストレージを扱えます。
本ページで確認した独立系メディアやレビュー情報源では、製品レベルの障害やセキュリティ報告は見つからず、レビューのサンプルは20件未満で、品質を判断するには少なすぎました。
ありません。利用には最低$5のクレジット購入が必要で、無料トライアルもありません。アクセラレータープログラムに採択されたスタートアップは代わりにプラットフォームクレジットを受け取れますが、そのクレジットは予約GPUクラスターには使えません。
はい。チャット、補完、ビジョン、画像生成、音声合成、埋め込みでは使えます。OpenAIクライアントをTogetherのベースURLに向け、Togetherの名前空間付きモデルIDに切り替えてください。Assistants、Threads、Runsは利用できず、バッチジョブはTogether独自のバッチAPIを使います。
デフォルトではしません。学習への利用はオプトイン設定で、有効にしない限りオフのままです。ただし、ゼロデータ保持をオンにしない限り、プロンプトと応答はデフォルトで保存されます。
クレジットを追加するまでAPIアクセスが停止されます。オンデマンドのGPUクラスターは一時停止され、クレジットが回復しなければその後廃止されます。一方、既存のGPUクラスター予約は予定の終了日まで有効です。
はい。ジョブ完了後、モデルはTogetherの専用エンドポイントで提供するか、ローカル推論や他のホスティング先向けにチェックポイントとしてダウンロードできます。