Toolso.AI
Toolso.AI
Alle ToolsKategorienIm TrendNeueste ToolsPreiseBlog
Toolso.AI
Toolso.AI

💌Abonnieren Sie AI Tools Weekly

Wöchentlich kuratierte Auswahl der neuesten und angesagtesten KI-Tools und Trends, direkt in Ihrem Posteingang Abonnieren

Toolso.AI
Toolso.AI

Entdecken Sie die besten KI-Tools, um Ihre Produktivität zu steigern

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Beliebte Kategorien

  • KI-Schreiben
  • KI-Bild
  • KI-Video
  • KI-Programmierung
  • Weitere Kategorien

Entdecken

  • Neueste Tools
  • Beliebte Tools
  • Mehr Tools
  • Tool einreichen
  • Preise

Über

  • Über uns
  • Kontakt
  • Blog
  • Änderungsprotokoll

Rechtliches

  • Cookie-Richtlinie
  • Datenschutzrichtlinie
  • Nutzungsbedingungen
  • Rückerstattungsrichtlinie
© 2026 Toolso.AI Alle Rechte vorbehalten
BefristetZeitlich begrenztHervorgehobener EintragPrüfung in 24 Std. · Kein Backlink · 30 Tage hervorgehoben$29.90danach $59.90Nach dem 31. Okt. steigt der Preis auf $59.90Endet in--:--:--Jetzt einreichen
  1. Startseite
  2. Alle Tools
  3. Entwicklertools
  4. Together AI
Oberflächenvorschau von Together AI
Logo von Together AI

Together AI

Together AI betreibt Open-Weight-Modelle über eine serverlose, OpenAI-kompatible API und bietet zusätzlich dedizierte Endpunkte, Fine-Tuning, GPU-Cluster und Sandboxes, bezahlt aus vorausbezahltem Guthaben.

EntwicklertoolsKI-EntwicklungKI-Trainingsplattform#Stapelverarbeitung#SDK#LLM
Kostenlos testen
Gespeichert
Besuche
Aufrufe
Preis
Freemium
Veröffentlicht
6. Okt. 2026
Domain
together.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Together AI Produktinformationen

Kostenlos testen
Tool-Informationen
Gespeichert
Besuche
Aufrufe
Preis
Freemium
Veröffentlicht
6. Okt. 2026
Domain
together.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Empfohlene Tools

Verwandte Tools

Kostenlos testen

Was ist Together AI?

Together AI ist eine Cloud-Plattform, auf der sich Open-Source- und Open-Weight-KI-Modelle über APIs und mietbare GPU-Infrastruktur ausführen, anpassen und trainieren lassen. Das Unternehmen vermarktet sie als KI-native Cloud, eine Full-Stack-KI-Plattform auf Basis modernster Forschung. Für die meisten Entwickler ist der Einstieg eine Open-Source-LLM-API.

Betrieben wird der Dienst von Together Computer, Inc., einer Kapitalgesellschaft aus Delaware, deren Bedingungen APIs und Weboberflächen zum Hosten, Nutzen, Feinabstimmen und Trainieren großer KI-Modelle abdecken. Unabhängige Tech-Medien beschrieben Together AI als KI-Neocloud, die Nvidia-GPU-Cluster vermietet, und berichteten über eine Series-C-Finanzierung von 800 Mio. $ bei einer Bewertung von 8,3 Mrd. $. Laut demselben Bericht gibt das Unternehmen an, Tausende zahlende Kunden zu haben, und nennt darunter Cursor, Cognition und Decagon.

Drei Fakten prägen die meisten Entscheidungen: Es gibt keine kostenlose Testphase, und der Zugang beginnt mit einem Guthabenkauf von $5; Prompts werden standardmäßig gespeichert, sofern die Null-Datenaufbewahrung nicht aktiviert ist; und die geteilte serverlose Kapazität wird nach dem Best-Effort-Prinzip bereitgestellt.

Kernfunktionen

Together AI gliedert seine Produkte in Inferenz, Rechenleistung und Modellanpassung; abgerechnet wird alles über dasselbe vorausbezahlte Guthaben.

Inferenzoptionen

  • Serverlose Inferenz: Entwickler rufen Open-Weight-Modelle über eine einzige API auf, ohne etwas bereitzustellen oder zu verwalten, und zahlen nur für die genutzten Token. Der Katalog umfasst Text-, Bild-, Video-, Code- und Sprachmodelle.
  • Batch-Inferenz: Große asynchrone Jobs lassen sich auf 30 Milliarden Token pro Modell skalieren, mit jedem serverlosen Modell oder einem privaten Deployment.
  • Provisionierter Durchsatz: Zugesagte Inferenzkapazität mit tokenbasierter Abrechnung, reserviertem Durchsatz und einem SLA mit 99 % Verfügbarkeit.
  • Dedizierte Endpunkte und Container: Die dedizierte Modellinferenz führt ein Modell auf reservierter, isolierter Hardware aus, während die dedizierte Container-Inferenz auf generative Medien-Workloads wie Video-, Audio- und Bildmodelle zielt.

Das Unternehmen gibt an, bei gpt-oss-20B eine fast 2-mal so schnelle serverlose Inferenz erreicht zu haben wie der nächstschnellste Anbieter. Das ist ein Benchmark des Anbieters selbst, und das Modell wurde später zur Entfernung aus dem serverlosen Angebot eingeplant.

Fine-Tuning und Modellanpassung

  • Eigenes Modell mitbringen: Laut Together AI lässt sich jedes Open-Source-Modell aus dem Hugging Face Hub ohne Formatkonvertierung feinabstimmen.
  • Daten für Tool-Aufrufe: Das Training für Tool-Aufrufe übernimmt vorhandene Agent-Logs unverändert, wobei Funktionsdefinitionen und Tool-Aufrufe direkt im Datensatz stehen.
  • Vision-Fine-Tuning: Vision-Modelle trainieren direkt mit rohen PNG-, JPEG- oder WEBP-Bildern ohne spezielle Vorverarbeitung, per LoRA oder vollständigem Fine-Tuning.
  • Portable Ergebnisse: Ein fertiges Modell kann auf einem dedizierten Together-Endpunkt gehostet oder als eigenständiger Checkpoint heruntergeladen werden.

Die Ergebnisse des LLM-Fine-Tunings laufen daher auf dedizierter Hardware oder verlassen die Plattform als Gewichte, statt in den tokenbasiert abgerechneten serverlosen Katalog aufgenommen zu werden.

Rechenleistung, Sandboxes und Speicher

  • GPU-Cluster: Kunden können 8 bis über 4.000 GPUs für Training oder Inferenzbetrieb reservieren.
  • Code-Sandbox: Sandbox-VMs reichen von 2 bis 64 vCPUs und 1 bis 128 GB RAM für KI-Entwicklungsumgebungen.
  • Verwalteter Speicher: Der verwaltete Speicher bietet Objektspeicher und parallele Dateisysteme ohne Gebühren für ausgehenden Datenverkehr.

Anleitung

Für den ersten API-Aufruf braucht man ein aufgeladenes Konto, einen API-Schlüssel und entweder das offizielle SDK oder einen vorhandenen OpenAI-Client:

  1. In der Konsole von Together AI registrieren und in den Abrechnungseinstellungen mindestens $5 Guthaben aufladen.
  2. Auf der Seite für API-Schlüssel des Projekts einen Schlüssel erstellen; neue API-Schlüssel werden nur einmal angezeigt, daher den Wert sofort speichern.
  3. Das offizielle Python- oder TypeScript-SDK installieren oder einen vorhandenen OpenAI-Client behalten und dessen Basis-URL ändern, dann den Schlüssel als Umgebungsvariable setzen.
  4. Das Schnellstart-Beispiel ausführen, das eine Chat-Completion-Anfrage an MiniMax M3 sendet und die Antwort ausgibt.
  5. Für Offline-Workloads führt die Batch-API viele unabhängige Anfragen asynchron aus einer einzigen hochgeladenen JSONL-Datei aus.

Die Kosten eines Fine-Tunings lassen sich prüfen, bevor Geld ausgegeben wird, denn die CLI zeigt den geschätzten Preis an und bittet vor dem Absenden des Jobs um Bestätigung.

Anwendungsfälle und Beispiele für Together AI

  • Offline-Batch-Arbeit: Batch-Jobs eignen sich für latenztolerante Aufgaben wie die Klassifizierung eines großen Datensatzes, Evaluierungen, die Erzeugung synthetischer Daten und Offline-Zusammenfassungen.
  • Echtzeit-Sprachagenten: Eine Kundenstory von Together AI über die Sprach-KI von Decagon mit Antwortzeiten unter einer Sekunde nennt eine 6-fache Kostensenkung pro Gesprächsrunde gegenüber gpt-5 mini.
  • Produktions-APIs mit geringerer Latenz: Ein Kundenstatement von Salesforce AI Research nennt eine um den Faktor 2 reduzierte Latenz und um etwa ein Drittel gesenkte Kosten.
  • Forschungs- und Trainingsläufe: GPU-Cluster werden dafür beworben, in wenigen Minuten einen Cluster hochzufahren, eine Hypothese zu testen und ihn nach Ende des Experiments wieder abzuschalten.
  • Coding-Agenten auf offenen Modellen: Together Link betreibt sechs Coding-Agenten auf von Together gehosteten Modellen, darunter Claude Code, Codex, OpenCode und Pi Code im Terminal sowie Claude Desktop und ChatGPT Desktop.

Die obigen Kundenzahlen veröffentlicht Together AI auf seinen eigenen Seiten; für diesen Eintrag wurden sie nicht unabhängig überprüft.

Für wen ist es

Together AI passt zu Entwicklern und ML-Teams, die sicher mit APIs, SDKs und Kommandozeilentools umgehen und Open-Weight-Modelle nutzen wollen, ohne einen eigenen Inferenz-Stack zu betreiben.

  • Prototyping und schwankender Traffic: Serverlose Inferenz wird als am besten geeignet beworben für variablen oder unvorhersehbaren Traffic, schnelles Prototyping sowie kostensensible oder frühe Produktions-Workloads.
  • Stabile, latenzkritische Produktion: Die dedizierte Modellinferenz zielt auf vorhersehbaren Traffic, latenzkritische Anwendungen und Produktions-Workloads mit hohem Durchsatz.
  • Finanzierte Start-ups: Ein Accelerator mit Auswahlverfahren bietet bis zu 15.000 $ Plattformguthaben für Start-ups mit einer Finanzierung bis 5 Mio. $, bis zu 30.000 $ bei 5–10 Mio. $ und bis zu 50.000 $ bei über 10 Mio. $.

Die Wahl zwischen den beiden Inferenzmodi hängt von der Auslastung ab. Dedizierte Modellinferenz ist meist günstiger, wenn ein Replikat den größten Teil des Tages ausgelastet wäre. Serverlos ist meist günstiger, wenn der Traffic gering oder so sprunghaft ist, dass ein dediziertes Replikat die meiste Zeit ungenutzt bliebe. Die Preisseite merkt zudem an, dass die meisten Teams mit serverloser Inferenz beginnen und bei wachsender Größe zu dedizierten Endpunkten wechseln.

Weniger geeignet ist es für alle, die Modelle vor dem Bezahlen ausprobieren möchten, da es keine kostenlose Testphase gibt, sowie für Apps, die auf der Assistants API von OpenAI aufbauen, da die Kompatibilitätsschicht sie nicht implementiert.

Plattformen

Together AI wird über eine Webkonsole, SDKs, eine CLI und eine REST-API genutzt, nicht über eine Consumer-App.

  • SDKs und APIs: Together AI veröffentlicht offizielle SDKs für Python und TypeScript; auch das OpenAI SDK oder einfache REST-Aufrufe aus jeder Programmiersprache funktionieren.
  • OpenAI-Kompatibilität: Die API ist für Chat, Vervollständigungen, Bildverständnis, Bildgenerierung, Sprachsynthese und Embeddings mit der REST-API und den SDKs von OpenAI kompatibel.
  • Batch-Werkzeuge: Batch-Jobs lassen sich über die Konsole, per API oder SDK oder mit der CLI starten.
  • Clusterverwaltung: Der Zugriff auf GPU-Cluster wird mit RBAC auf Projektebene über CLI, SDK, API, Terraform oder die Webkonsole verwaltet.
  • Regionen: Serverlose Endpunkte bieten keine Regionsauswahl. Private Netzwerke und VPC-basierte Deployments, auch in EU-Regionen, sind über dedizierte Setups verfügbar.

Preise

Die Preise von Together AI sind nutzungsbasiert und vollständig im Voraus zu zahlen. Together AI bietet derzeit keine kostenlose Testphase an, und der Plattformzugang erfordert einen Mindestkauf von $5 Guthaben. Für die Nutzung der Plattform ist ein positives Guthaben erforderlich. Vorausbezahltes Guthaben hat derzeit kein Ablaufdatum. Die automatische Aufladung kann das Guthaben selbsttätig auffüllen, allerdings nur, wenn die Standardzahlungsmethode eine Kredit- oder Debitkarte ist. Laut den Nutzungsbedingungen sind gezahlte Gebühren nicht erstattungsfähig, sofern die Bedingungen oder ein Bestellformular nichts anderes vorsehen.

Serverlose Tokenpreise

Serverlose Preise werden pro 1 Mio. Token angegeben und ändern sich häufig. Die folgenden repräsentativen Zeilen wurden am 5. Oktober 2026 erfasst.

ModellEingabeGecachte EingabeAusgabe
MiniMax M3$0.30$0.06$1.20
Kimi K3$3.00$0.30$15.00
gpt-oss-120B$0.15Nicht angegeben$0.60
Llama 3.3 70B$1.04Nicht angegeben$1.04

Die Batch-API wirbt mit bis zu 50 % Rabatt auf serverlose Preise und einem separaten Pool für Ratenlimits. Die Tabelle der rabattierten Modelle in der Batch-Dokumentation listet jedoch nur eine Variante von Llama 3.3 70B Turbo und Whisper Large v3 mit 50 % Rabatt; nicht aufgeführte Modelle laufen zu Standardpreisen.

GPU-Cluster

Alle GPU-Cluster-Preise gelten pro GPU und Stunde.

GPUUnterbrechbarOn-DemandReserviert 7–30 Tage31–90 Tage91–180 Tageab 181 Tagen
NVIDIA HGX H100$1.99$3.99$3.69$3.45$3.19Auf Anfrage
NVIDIA HGX H200$2.99$5.99$4.99$4.15$3.99Auf Anfrage
NVIDIA HGX B200$4.09$8.19$7.99$7.79$6.79Auf Anfrage

Reservierungen werden nach der Bereitstellung des Clusters für die gesamte reservierte Laufzeit berechnet, und Nutzung über die reservierte Kapazität hinaus wird zu On-Demand-Preisen abgerechnet. Guthaben aus dem Startup-Accelerator gilt nicht für reservierte GPU-Cluster.

Dedizierte Inferenz

Ein dediziertes Replikat wird nur abgerechnet, solange es bereit ist und Traffic bedienen kann; Bereitstellungs- und Kaltstartzeit werden also nicht berechnet. Der H100-Preis unterscheidet sich zwischen offiziellen Seiten: Die Tabelle zur dedizierten Inferenz auf der Preisseite nennt $5.49 pro GPU-Stunde On-Demand. Ein Eintrag im Änderungsprotokoll der Dokumentation besagt dagegen, dass H100-80GB-Hardware für dedizierte Endpunkte jetzt $3.99 pro Stunde kostet, gesenkt von $5.49.

Fine-Tuning

Fine-Tuning wird nach verarbeiteten Token abgerechnet, also Größe des Trainingsdatensatzes mal Epochen plus etwaige Evaluierungstoken, und für jeden Job gilt eine modellspezifische Mindestgebühr. Die erste Fine-Tuning-Tabelle auf der Preisseite, unter Tabs mit den Bezeichnungen LoRA und vollständiges Fine-Tuning, nennt für Qwen3.5 0.8B $0.34 pro 1 Mio. Token für überwachtes Fine-Tuning, $0.84 für DPO und eine Mindestgebühr von $4.00. Weiter unten in derselben Tabelle nennt GLM-5.2 $40.00 für überwachtes Fine-Tuning, $100.00 für DPO und ein Minimum von $60.00. Abgebrochene oder vorzeitig gestoppte Jobs werden nur für abgeschlossene Schritte berechnet. Das Hosting eines feinabgestimmten Modells auf einem dedizierten Endpunkt wird separat minutenweise abgerechnet.

Alternativen zu Together AI

Vergleichbare Inferenzanbieter für offene Modelle unterscheiden sich vor allem darin, wie sie feinabgestimmte Modelle abrechnen und ob neue Konten mit Gratisguthaben starten.

  • Fireworks AI: Fireworks AI gibt an, dass feinabgestimmte Modelle zum gleichen Preis wie Basismodelle bereitgestellt werden. Deren serverlose Inferenz wird pro Token abgerechnet, vorausbezahlt und nutzungsbasiert.
  • Baseten: Laut Baseten erhalten neue Konten Guthaben, um kostenlos mit Deployments zu experimentieren. Deren dedizierte Deployments berechnen nur die genutzte Rechenleistung, minutengenau.

Im Vergleich dazu verlangt Together AI einen Erstkauf von $5 ohne kostenlose Testphase und rechnet das Hosting feinabgestimmter Modelle minutenweise auf dedizierter Hardware ab. Im Gegenzug deckt ein einziges Konto serverlose Modelle, Batch-Jobs, dedizierte Endpunkte, GPU-Cluster, Sandboxes und Speicher ab.

Einschränkungen

Servicegrenzen

  • Serverlos nach Best-Effort-Prinzip: Die serverlose Leistung wird nach dem Best-Effort-Prinzip erbracht; zugesagter Durchsatz erfordert provisionierten Durchsatz.
  • Drosselung: Bei hoher Nachfrage kann Together Anfragen begrenzen, und Clients können Antworten mit 429 Too Many Requests oder 503 Service Unavailable erhalten.
  • Modellwechsel: Ein Eintrag im Änderungsprotokoll sah die Entfernung von openai/gpt-oss-20b und weiteren Modellen aus dem serverlosen Angebot zum 14. September 2026 vor. Alle Modelle dieses Eintrags bis auf eines blieben über dedizierte On-Demand-Endpunkte verfügbar, die nach Hardwarezeit statt nach Token abrechnen.
  • Teilweise OpenAI-Kompatibilität: Assistants, Threads und Runs aus der OpenAI API sind nicht implementiert. OpenAI-Modellnamen wie gpt-4o oder text-embedding-3-large liefern bei Together einen 404-Fehler.
  • Batch-Obergrenzen: Ein einzelner Batch kann bis zu 50.000 Anfragen enthalten. Eingabe-, Ausgabe- und Fehlerdateien von Batches werden 7 Tage aufbewahrt; Ergebnisse müssen daher innerhalb dieses Zeitraums heruntergeladen werden.

Grenzen bei Abrechnung und Support

  • Guthaben bei null: Erreicht das Guthaben null, wird der API-Zugang ausgesetzt, bis Guthaben aufgeladen wird.
  • On-Demand-Cluster: Bei vollständig auf Abruf betriebenen GPU-Clustern wird der Cluster bei aufgebrauchtem Guthaben zunächst pausiert und dann außer Betrieb genommen, wenn das Guthaben nicht wieder aufgefüllt wird.
  • Support-Stufen: Die Support-Seite beschreibt den Support weiterhin nach Stufen, mit Community-Hilfe auf Discord für Nutzer der Build-Stufe. Ein Eintrag im Änderungsprotokoll besagt jedoch, dass die Stufenbezeichnungen Build 1–5, Scale und Enterprise abgeschafft wurden.

Datenschutz, Datennutzung und Eigentum

  • Standardmäßige Speicherung: Standardmäßig speichert Together Prompts und Modellantworten und kann sie für Produktverbesserungen nutzen.
  • Training: Die Nutzung von Kundendaten zum Trainieren von Modellen ist ein separates Opt-in, das standardmäßig deaktiviert ist. Die Datenschutzerklärung besagt, dass erhobene Daten ohne ausdrückliche Opt-in-Einwilligung nicht zum Training der Modelle des Unternehmens verwendet werden.
  • Null-Datenaufbewahrung: Die Null-Datenaufbewahrung (ZDR) ist standardmäßig nicht aktiviert. Mit aktivierter ZDR werden Prompts und Ausgaben von Together weder gespeichert noch für sekundäre Zwecke verwendet. ZDR gilt erst ab dem Zeitpunkt der Aktivierung und betrifft keine zuvor verarbeiteten Daten. Für Fine-Tuning oder die Batch-API hochgeladene Dateien bleiben gespeichert, bis sie über API, CLI oder Webkonsole gelöscht werden.
  • Durchgeleitete Modelle: Passthrough-Modelle, die Anfragen an einen Drittanbieter weiterleiten, sind standardmäßig erlaubt und unterliegen der eigenen Datenrichtlinie dieses Anbieters.
  • Gehostete Drittanbietermodelle: Modelle externer Entwickler wie DeepSeek, Qwen oder Mistral laufen auf Togethers eigener Infrastruktur und senden keine Aufrufe an den Modellautor.
  • Eigentum und Compliance: Laut Nutzungsbedingungen besitzen Kunden ihre Inhalte und Ausgaben ausschließlich. Together AI nennt SOC 2 Type II, an HIPAA ausgerichtete Optionen sowie Verschlüsselung bei der Übertragung und im Ruhezustand.

Die für diese Seite geprüften unabhängigen Medien- und Bewertungsquellen zeigten keine Ausfälle oder Sicherheitsberichte auf Produktebene, und die Bewertungsstichproben umfassten weniger als 20 Bewertungen, zu wenige für ein Qualitätsurteil.

FAQ

Q1. Gibt es bei Together AI eine Gratisstufe oder eine kostenlose Testphase?

Nein. Für den Zugang muss Guthaben von mindestens $5 gekauft werden, und eine kostenlose Testphase gibt es nicht. Start-ups, die in das Accelerator-Programm aufgenommen werden, können stattdessen Plattformguthaben erhalten; dieses gilt jedoch nicht für reservierte GPU-Cluster.

Q2. Kann ich das OpenAI SDK mit Together AI verwenden?

Ja, für Chat, Vervollständigungen, Bildverständnis, Bildgenerierung, Sprachsynthese und Embeddings: Den OpenAI-Client auf die Basis-URL von Together richten und zu den Modell-IDs mit Namespace von Together wechseln. Assistants, Threads und Runs sind nicht verfügbar, und Batch-Jobs nutzen Togethers eigene Batch-API.

Q3. Trainiert Together AI mit meinen Prompts?

Standardmäßig nicht. Die Nutzung fürs Training ist eine Opt-in-Einstellung, die ausgeschaltet bleibt, solange sie nicht aktiviert wird. Prompts und Antworten werden standardmäßig dennoch gespeichert, sofern keine Null-Datenaufbewahrung eingeschaltet ist.

Q4. Was passiert, wenn mein Guthaben aufgebraucht ist?

Der API-Zugang wird ausgesetzt, bis Sie Guthaben aufladen. On-Demand-GPU-Cluster werden pausiert und später außer Betrieb genommen, wenn das Guthaben nicht wieder aufgefüllt wird, während bestehende GPU-Cluster-Reservierungen bis zu ihrem geplanten Enddatum aktiv bleiben.

Q5. Kann ich ein feinabgestimmtes Modell woanders nutzen?

Ja. Nach Abschluss eines Jobs kann das Modell auf einem dedizierten Together-Endpunkt bereitgestellt oder als Checkpoint für lokale Inferenz oder einen anderen Host heruntergeladen werden.

Kennen Sie ein ähnliches Tool?
Wenn Sie andere großartige KI-Tools kennen, können Sie sie uns gerne einreichen