Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Together AI ist eine Cloud-Plattform, auf der sich Open-Source- und Open-Weight-KI-Modelle über APIs und mietbare GPU-Infrastruktur ausführen, anpassen und trainieren lassen. Das Unternehmen vermarktet sie als KI-native Cloud, eine Full-Stack-KI-Plattform auf Basis modernster Forschung. Für die meisten Entwickler ist der Einstieg eine Open-Source-LLM-API.
Betrieben wird der Dienst von Together Computer, Inc., einer Kapitalgesellschaft aus Delaware, deren Bedingungen APIs und Weboberflächen zum Hosten, Nutzen, Feinabstimmen und Trainieren großer KI-Modelle abdecken. Unabhängige Tech-Medien beschrieben Together AI als KI-Neocloud, die Nvidia-GPU-Cluster vermietet, und berichteten über eine Series-C-Finanzierung von 800 Mio. $ bei einer Bewertung von 8,3 Mrd. $. Laut demselben Bericht gibt das Unternehmen an, Tausende zahlende Kunden zu haben, und nennt darunter Cursor, Cognition und Decagon.
Drei Fakten prägen die meisten Entscheidungen: Es gibt keine kostenlose Testphase, und der Zugang beginnt mit einem Guthabenkauf von $5; Prompts werden standardmäßig gespeichert, sofern die Null-Datenaufbewahrung nicht aktiviert ist; und die geteilte serverlose Kapazität wird nach dem Best-Effort-Prinzip bereitgestellt.
Together AI gliedert seine Produkte in Inferenz, Rechenleistung und Modellanpassung; abgerechnet wird alles über dasselbe vorausbezahlte Guthaben.
Das Unternehmen gibt an, bei gpt-oss-20B eine fast 2-mal so schnelle serverlose Inferenz erreicht zu haben wie der nächstschnellste Anbieter. Das ist ein Benchmark des Anbieters selbst, und das Modell wurde später zur Entfernung aus dem serverlosen Angebot eingeplant.
Die Ergebnisse des LLM-Fine-Tunings laufen daher auf dedizierter Hardware oder verlassen die Plattform als Gewichte, statt in den tokenbasiert abgerechneten serverlosen Katalog aufgenommen zu werden.
Für den ersten API-Aufruf braucht man ein aufgeladenes Konto, einen API-Schlüssel und entweder das offizielle SDK oder einen vorhandenen OpenAI-Client:
Die Kosten eines Fine-Tunings lassen sich prüfen, bevor Geld ausgegeben wird, denn die CLI zeigt den geschätzten Preis an und bittet vor dem Absenden des Jobs um Bestätigung.
Die obigen Kundenzahlen veröffentlicht Together AI auf seinen eigenen Seiten; für diesen Eintrag wurden sie nicht unabhängig überprüft.
Together AI passt zu Entwicklern und ML-Teams, die sicher mit APIs, SDKs und Kommandozeilentools umgehen und Open-Weight-Modelle nutzen wollen, ohne einen eigenen Inferenz-Stack zu betreiben.
Die Wahl zwischen den beiden Inferenzmodi hängt von der Auslastung ab. Dedizierte Modellinferenz ist meist günstiger, wenn ein Replikat den größten Teil des Tages ausgelastet wäre. Serverlos ist meist günstiger, wenn der Traffic gering oder so sprunghaft ist, dass ein dediziertes Replikat die meiste Zeit ungenutzt bliebe. Die Preisseite merkt zudem an, dass die meisten Teams mit serverloser Inferenz beginnen und bei wachsender Größe zu dedizierten Endpunkten wechseln.
Weniger geeignet ist es für alle, die Modelle vor dem Bezahlen ausprobieren möchten, da es keine kostenlose Testphase gibt, sowie für Apps, die auf der Assistants API von OpenAI aufbauen, da die Kompatibilitätsschicht sie nicht implementiert.
Together AI wird über eine Webkonsole, SDKs, eine CLI und eine REST-API genutzt, nicht über eine Consumer-App.
Die Preise von Together AI sind nutzungsbasiert und vollständig im Voraus zu zahlen. Together AI bietet derzeit keine kostenlose Testphase an, und der Plattformzugang erfordert einen Mindestkauf von $5 Guthaben. Für die Nutzung der Plattform ist ein positives Guthaben erforderlich. Vorausbezahltes Guthaben hat derzeit kein Ablaufdatum. Die automatische Aufladung kann das Guthaben selbsttätig auffüllen, allerdings nur, wenn die Standardzahlungsmethode eine Kredit- oder Debitkarte ist. Laut den Nutzungsbedingungen sind gezahlte Gebühren nicht erstattungsfähig, sofern die Bedingungen oder ein Bestellformular nichts anderes vorsehen.
Serverlose Preise werden pro 1 Mio. Token angegeben und ändern sich häufig. Die folgenden repräsentativen Zeilen wurden am 5. Oktober 2026 erfasst.
| Modell | Eingabe | Gecachte Eingabe | Ausgabe |
|---|---|---|---|
| MiniMax M3 | $0.30 | $0.06 | $1.20 |
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| gpt-oss-120B | $0.15 | Nicht angegeben | $0.60 |
| Llama 3.3 70B | $1.04 | Nicht angegeben | $1.04 |
Die Batch-API wirbt mit bis zu 50 % Rabatt auf serverlose Preise und einem separaten Pool für Ratenlimits. Die Tabelle der rabattierten Modelle in der Batch-Dokumentation listet jedoch nur eine Variante von Llama 3.3 70B Turbo und Whisper Large v3 mit 50 % Rabatt; nicht aufgeführte Modelle laufen zu Standardpreisen.
Alle GPU-Cluster-Preise gelten pro GPU und Stunde.
| GPU | Unterbrechbar | On-Demand | Reserviert 7–30 Tage | 31–90 Tage | 91–180 Tage | ab 181 Tagen |
|---|---|---|---|---|---|---|
| NVIDIA HGX H100 | $1.99 | $3.99 | $3.69 | $3.45 | $3.19 | Auf Anfrage |
| NVIDIA HGX H200 | $2.99 | $5.99 | $4.99 | $4.15 | $3.99 | Auf Anfrage |
| NVIDIA HGX B200 | $4.09 | $8.19 | $7.99 | $7.79 | $6.79 | Auf Anfrage |
Reservierungen werden nach der Bereitstellung des Clusters für die gesamte reservierte Laufzeit berechnet, und Nutzung über die reservierte Kapazität hinaus wird zu On-Demand-Preisen abgerechnet. Guthaben aus dem Startup-Accelerator gilt nicht für reservierte GPU-Cluster.
Ein dediziertes Replikat wird nur abgerechnet, solange es bereit ist und Traffic bedienen kann; Bereitstellungs- und Kaltstartzeit werden also nicht berechnet. Der H100-Preis unterscheidet sich zwischen offiziellen Seiten: Die Tabelle zur dedizierten Inferenz auf der Preisseite nennt $5.49 pro GPU-Stunde On-Demand. Ein Eintrag im Änderungsprotokoll der Dokumentation besagt dagegen, dass H100-80GB-Hardware für dedizierte Endpunkte jetzt $3.99 pro Stunde kostet, gesenkt von $5.49.
Fine-Tuning wird nach verarbeiteten Token abgerechnet, also Größe des Trainingsdatensatzes mal Epochen plus etwaige Evaluierungstoken, und für jeden Job gilt eine modellspezifische Mindestgebühr. Die erste Fine-Tuning-Tabelle auf der Preisseite, unter Tabs mit den Bezeichnungen LoRA und vollständiges Fine-Tuning, nennt für Qwen3.5 0.8B $0.34 pro 1 Mio. Token für überwachtes Fine-Tuning, $0.84 für DPO und eine Mindestgebühr von $4.00. Weiter unten in derselben Tabelle nennt GLM-5.2 $40.00 für überwachtes Fine-Tuning, $100.00 für DPO und ein Minimum von $60.00. Abgebrochene oder vorzeitig gestoppte Jobs werden nur für abgeschlossene Schritte berechnet. Das Hosting eines feinabgestimmten Modells auf einem dedizierten Endpunkt wird separat minutenweise abgerechnet.
Vergleichbare Inferenzanbieter für offene Modelle unterscheiden sich vor allem darin, wie sie feinabgestimmte Modelle abrechnen und ob neue Konten mit Gratisguthaben starten.
Im Vergleich dazu verlangt Together AI einen Erstkauf von $5 ohne kostenlose Testphase und rechnet das Hosting feinabgestimmter Modelle minutenweise auf dedizierter Hardware ab. Im Gegenzug deckt ein einziges Konto serverlose Modelle, Batch-Jobs, dedizierte Endpunkte, GPU-Cluster, Sandboxes und Speicher ab.
Die für diese Seite geprüften unabhängigen Medien- und Bewertungsquellen zeigten keine Ausfälle oder Sicherheitsberichte auf Produktebene, und die Bewertungsstichproben umfassten weniger als 20 Bewertungen, zu wenige für ein Qualitätsurteil.
Nein. Für den Zugang muss Guthaben von mindestens $5 gekauft werden, und eine kostenlose Testphase gibt es nicht. Start-ups, die in das Accelerator-Programm aufgenommen werden, können stattdessen Plattformguthaben erhalten; dieses gilt jedoch nicht für reservierte GPU-Cluster.
Ja, für Chat, Vervollständigungen, Bildverständnis, Bildgenerierung, Sprachsynthese und Embeddings: Den OpenAI-Client auf die Basis-URL von Together richten und zu den Modell-IDs mit Namespace von Together wechseln. Assistants, Threads und Runs sind nicht verfügbar, und Batch-Jobs nutzen Togethers eigene Batch-API.
Standardmäßig nicht. Die Nutzung fürs Training ist eine Opt-in-Einstellung, die ausgeschaltet bleibt, solange sie nicht aktiviert wird. Prompts und Antworten werden standardmäßig dennoch gespeichert, sofern keine Null-Datenaufbewahrung eingeschaltet ist.
Der API-Zugang wird ausgesetzt, bis Sie Guthaben aufladen. On-Demand-GPU-Cluster werden pausiert und später außer Betrieb genommen, wenn das Guthaben nicht wieder aufgefüllt wird, während bestehende GPU-Cluster-Reservierungen bis zu ihrem geplanten Enddatum aktiv bleiben.
Ja. Nach Abschluss eines Jobs kann das Modell auf einem dedizierten Together-Endpunkt bereitgestellt oder als Checkpoint für lokale Inferenz oder einen anderen Host heruntergeladen werden.