Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Fireworks (in der Dokumentation als Fireworks AI bezeichnet) ist eine Cloud-Plattform zum Ausführen und Trainieren offener KI-Modelle. Entwickler rufen gehostete Modelle über eine LLM-Inferenz-API auf, mieten dedizierte GPUs für eigene Deployments oder passen offene Modelle per Fine-Tuning mit eigenen Daten an und stellen das Ergebnis auf derselben Infrastruktur bereit.
Der Anbieter bewirbt die Plattform als „grundlegende Infrastruktur für spezialisierte Intelligenz“: eine Lernschleife im Besitz des Kunden, die führende Open-Source-Modelle und die Daten eines Kunden in einen Vorsprung verwandelt, der mit jeder Iteration schärfer wird. Fireworks entwickelt keine Foundation-Modelle von Grund auf: Mitgründerin und CEO Lin Qiao hat das Geschäft so beschrieben, dass es Unternehmen hilft, bestehende Modelle per Fine-Tuning an ihre jeweiligen Anforderungen anzupassen. Qiao leitete zuvor das Entwicklungsteam der KI-Plattform bei Meta.
Zur Einordnung der Größe: Die unabhängige Technologiepresse berichtete im September 2026, Fireworks habe im Juli bekanntgegeben, dass sein annualisierter Umsatz 1 Milliarde Dollar erreicht habe – das Fünffache des Vorjahres.
Diese Optionen machen das Fine-Tuning offener Modelle zu einer Pipeline bis zur Bereitstellung statt zu einem separaten Produkt: Laut Startseite wird jeder Checkpoint in Sekunden in die Produktion übernommen.
Ein typisches erstes Projekt führt von Serverless-Tests zur Kostenkontrolle:
firectl quota list aus, um die aktuellen Ratenlimits, GPU-Kontingente, Ausgabenlimits und die Nutzung des Kontos zu prüfen, bevor Sie einen Launch planen.Die Kundenzitate auf der Fireworks-Startseite sind vom Anbieter ausgewählte Referenzen und keine unabhängigen Fallstudien, zeigen aber, auf welche Workloads die Plattform zielt:
In zwei Fällen passt die Plattform weniger gut. Teams, die eine feste Modellversion brauchen, haben weniger von Serverless, weil Serverless-Modelle vom Fireworks-Team verwaltet werden und aktualisiert oder abgekündigt werden können, sobald neue Modelle erscheinen. Die Nutzung durch Minderjährige ist laut den Bedingungen verboten, sofern sie nicht von einem Elternteil oder gesetzlichen Vormund beaufsichtigt wird.
Die Abrechnung erfolgt im Voraus: Die automatische Aufladung kann das Guthaben selbsttätig auffüllen, und ein monatliches Ausgabenlimit deckelt die Nutzung. Vertragskunden haben möglicherweise die Option, auf nachträgliche Abrechnung umzustellen.
Die Preise sind in USD pro 1 Million Token angegeben, als Eingabe / gecachte Eingabe / Ausgabe, Stand 5. Oktober 2026.
| Modell | Standard | Priority |
|---|---|---|
| Kimi K3 | $3.00 / $0.30 / $15.00 | $3.75 / $0.375 / $18.75 |
| DeepSeek V4.1 Flash | $0.30 / $0.006 / $1.20 | $0.375 / $0.0075 / $1.50 |
| GLM 5.3 | $1.40 / $0.26 / $4.40 | $1.75 / $0.325 / $5.50 |
| OpenAI GPT OSS 120B | $0.15 / $0.015 / $0.60 | $0.18 / $0.018 / $0.72 |
Nicht einzeln aufgeführte Text- und Vision-Modelle werden nach Größe bepreist: unter 4B Parametern kostet $0.10, 4B bis 16B $0.20 und über 16B $0.90 pro 1M Token, ohne separaten Cache-Preis. Batch-Inferenz wird bei Eingabe und Ausgabe mit 50 % der Serverless-Preise abgerechnet. Ab dem 1. September 2026 werden eingeführte reine US-Modelle zum 1,5-Fachen der Serverless-Preise des Basismodells berechnet.
On-Demand-Deployments werden pro GPU-Sekunde abgerechnet, ohne Zusatzkosten für Startzeiten.
| GPU | Pro Minute | Pro Stunde |
|---|---|---|
| H100 80 GB | $0.134 | $8.00 |
| H200 141 GB | $0.134 | $8.00 |
| B200 180 GB | $0.217 | $13.00 |
| B300 288 GB | $0.250 | $15.00 |
| GB300 288 GB | $0.334 | $20.00 |
Regionsbeschränkte Deployments werden mit einem 1,5-fachen Aufschlag bepreist und laufen über den Vertrieb.
Verwaltetes überwachtes Fine-Tuning und Präferenz-Fine-Tuning werden pro 1M Trainings-Token berechnet:
| Größe des Basismodells | LoRA SFT | LoRA DPO | SFT mit allen Parametern | DPO mit allen Parametern |
|---|---|---|---|---|
| Bis 16B | $0.50 | $1.00 | $1.00 | $2.00 |
| 16,1B bis 80B | $3.00 | $6.00 | $6.00 | $12.00 |
| 80B bis 300B | $6.00 | $12.00 | $12.00 | $24.00 |
| Über 300B | $10.00 | $20.00 | $20.00 | $40.00 |
Trainings-Token werden als Anzahl der Token im Trainingsdatensatz multipliziert mit der Anzahl der Epochen geschätzt. Jobs der Dedicated Training API werden pro GPU-Stunde zu den On-Demand-Tarifen berechnet.
Die Kosten für die Bereitstellung lesen sich je nach Seite unterschiedlich. Die Preisseite sagt, dass Sie feinabgestimmte Modelle zum gleichen Preis wie Basismodelle bereitstellen können, während die Abrechnungs-FAQ sagt, dass trainierte LoRA-Modelle zur Bereitstellung ein dediziertes Deployment benötigen, abgerechnet pro GPU-Sekunde.
Fireworks rechnet dedizierte GPUs pro Sekunde ab, Baseten dagegen minutengenau – ein Unterschied, der vor allem bei kurzen, stoßweisen Deployments ins Gewicht fällt.
Standardmäßig protokolliert oder speichert Fireworks bei keinem offenen Modell Prompt- oder Generierungsdaten, sofern der Nutzer nicht ausdrücklich zustimmt (Opt-in); Anfrage-Metadaten wie die Token-Anzahl werden jedoch protokolliert. Bei aktivem Prompt-Caching können einige Prompt-Daten mehrere Minuten im flüchtigen Speicher verbleiben.
Die Response API ist eine Ausnahme: Sie speichert Unterhaltungen standardmäßig, und gespeicherte Unterhaltungsdaten werden nach 30 Tagen automatisch gelöscht. Die Bedingungen beschränken die Zusage zur Null-Datenspeicherung außerdem auf die Inferenz; sie gilt nicht für Funktionen, die Daten bauartbedingt aufbewahren, etwa Training, Fine-Tuning oder Agentenfunktionen.
Zur Nutzung für Training sind die beiden Dokumente unterschiedlich formuliert. Die Nutzungsbedingungen besagen, dass Fireworks Ihre Inhalte nicht verwenden wird, um eigene Modelle zu trainieren oder den Dienst zu verbessern. Die Datenschutzerklärung besagt, dass Fireworks Prompts, Trainingsdaten oder API-Eingaben ohne Ihre ausdrückliche Zustimmung (Opt-in) nicht verwendet, um seine Modelle zu trainieren oder zu verbessern. Im Verhältnis zwischen den Parteien stehen Ihnen alle Rechte, Titel und Ansprüche an Ihren Inhalten zu, die die Bedingungen als Ihre Eingaben und Ausgaben definieren.
Enterprise-Administratoren können eine kontoweite Richtlinie zur Null-Datenspeicherung aktivieren, die alles ablehnt, was Kundeninhalte dauerhaft speichern würde, darunter Batch-Inferenz-Jobs, Fine-Tuning- und RL-Jobs, Uploads von Datensätzen und virtuelle FireRouter-Modelle. Wenn FireRouter eine Gesprächsrunde an Claude oder GPT sendet, läuft das geschlossene Modell über Ihr eigenes Anthropic- oder OpenAI-Konto.
Dies sind Angaben des Anbieters, keine unabhängigen Prüfungen:
Auf den geprüften Preisseiten ist kein kostenloser Plan zu sehen. Über das in der Abrechnungs-FAQ erwähnte Guthaben von $1 hinaus erfordert die weitere Nutzung eine Zahlungsmethode und vorausbezahltes Guthaben.
Nein. LoRA-Modelle benötigen ein On-Demand-Deployment, das nach GPU-Zeit abgerechnet wird; ein Deployment kann bis zu 100 LoRA-Adapter hosten, wodurch sich diese Kosten verteilen.
Die Preise für Serverless-Inferenz berechnen jedes Token, daher kostet Leerlaufzeit nichts. On-Demand-Deployments werden bei hoher Auslastung als günstiger beschrieben; sie werden pro GPU-Sekunde statt pro Token abgerechnet.