Toolso.AI
Toolso.AI
Alle ToolsKategorienIm TrendNeueste ToolsPreiseBlog
Toolso.AI
Toolso.AI

💌Abonnieren Sie AI Tools Weekly

Wöchentlich kuratierte Auswahl der neuesten und angesagtesten KI-Tools und Trends, direkt in Ihrem Posteingang Abonnieren

Toolso.AI
Toolso.AI

Entdecken Sie die besten KI-Tools, um Ihre Produktivität zu steigern

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Beliebte Kategorien

  • KI-Schreiben
  • KI-Bild
  • KI-Video
  • KI-Programmierung
  • Weitere Kategorien

Entdecken

  • Neueste Tools
  • Beliebte Tools
  • Mehr Tools
  • Tool einreichen
  • Preise

Über

  • Über uns
  • Kontakt
  • Blog
  • Änderungsprotokoll

Rechtliches

  • Cookie-Richtlinie
  • Datenschutzrichtlinie
  • Nutzungsbedingungen
  • Rückerstattungsrichtlinie
© 2026 Toolso.AI Alle Rechte vorbehalten
BefristetZeitlich begrenztHervorgehobener EintragPrüfung in 24 Std. · Kein Backlink · 30 Tage hervorgehoben$29.90danach $59.90Nach dem 31. Okt. steigt der Preis auf $59.90Endet in--:--:--Jetzt einreichen
  1. Startseite
  2. Alle Tools
  3. Entwicklertools
  4. Fireworks
Oberflächenvorschau von Fireworks
Logo von Fireworks

Fireworks

Fireworks stellt offene Modelle über pro Token abgerechnete Serverless-APIs und pro GPU-Sekunde abgerechnete dedizierte Deployments bereit und bietet verwaltetes Fine-Tuning, damit Entwicklerteams eigene Modellvarianten trainieren und hosten können.

EntwicklertoolsKI-EntwicklungKI-Trainingsplattform#Stapelverarbeitung#LLM#OpenAI kompatible API
Kostenlos testen
Gespeichert
Besuche
Aufrufe
Preis
Kostenlos
Veröffentlicht
5. Okt. 2026
Domain
fireworks.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Fireworks Produktinformationen

Kostenlos testen
Tool-Informationen
Gespeichert
Besuche
Aufrufe
Preis
Kostenlos
Veröffentlicht
5. Okt. 2026
Domain
fireworks.ai
Nutzerbewertung

Hast du dieses Tool genutzt? Bewerte es

Dieses Tool bewerten

Empfohlene Tools

Verwandte Tools

Kostenlos testen

Was ist Fireworks?

Fireworks (in der Dokumentation als Fireworks AI bezeichnet) ist eine Cloud-Plattform zum Ausführen und Trainieren offener KI-Modelle. Entwickler rufen gehostete Modelle über eine LLM-Inferenz-API auf, mieten dedizierte GPUs für eigene Deployments oder passen offene Modelle per Fine-Tuning mit eigenen Daten an und stellen das Ergebnis auf derselben Infrastruktur bereit.

Der Anbieter bewirbt die Plattform als „grundlegende Infrastruktur für spezialisierte Intelligenz“: eine Lernschleife im Besitz des Kunden, die führende Open-Source-Modelle und die Daten eines Kunden in einen Vorsprung verwandelt, der mit jeder Iteration schärfer wird. Fireworks entwickelt keine Foundation-Modelle von Grund auf: Mitgründerin und CEO Lin Qiao hat das Geschäft so beschrieben, dass es Unternehmen hilft, bestehende Modelle per Fine-Tuning an ihre jeweiligen Anforderungen anzupassen. Qiao leitete zuvor das Entwicklungsteam der KI-Plattform bei Meta.

Zur Einordnung der Größe: Die unabhängige Technologiepresse berichtete im September 2026, Fireworks habe im Juli bekanntgegeben, dass sein annualisierter Umsatz 1 Milliarde Dollar erreicht habe – das Fünffache des Vorjahres.

Kernfunktionen

Serverless-Inferenz

  • Abrechnung pro Token: Serverless wird pro Token abgerechnet, mit den Optionen Priority und Fast, und die API wird als kompatibel mit OpenAI und Anthropic beschrieben.
  • Priority-Modus: Die Priority-Stufe hat Vorrang vor Standard-Traffic und fällt seltener dem Lastabwurf zum Opfer (503 server overloaded).
  • Fast-Modus: Fast-Varianten zielen auf einen Generierungsdurchsatz von über 100 Token pro Sekunde; laut Dokumentation ist eine Fast-Variante kein anderes Modell, und die Modellqualität bleibt gleich.
  • Modellkatalog: Die Dokumentation listet über 100 unterstützte Modelle für Text, Vision, Audio, Bild und Embeddings.
  • Batch-Jobs: Die Batch API verarbeitet große Mengen an Anfragen asynchron; jeder Job läuft innerhalb eines gewählten Zeitlimits von 12, 24, 48 oder 72 Stunden, und abgeschlossene Anfragen werden gespeichert, wenn der Job abläuft.

Dedizierte Deployments

  • On-Demand-Deployments: dedizierte Deployments, die mehrere Regionen abdecken und nachtrainierte Modelle unterstützen.
  • Eigene Gewichte: Sie können eigene Modelle (für unterstützte Architekturen) von Hugging Face oder anderen Quellen hochladen.
  • Reservierte Kapazität: Enterprise-Konten können reservierte Kapazität kaufen, meist mit einer Bindung von 1 Jahr, für garantierte Kapazität, höhere Kontingente und niedrigere GPU-Stundenpreise.
  • Viele Adapter auf einem Deployment: Das Multi-LoRA-Deployment lädt bis zu 100 LoRA-Modelle als Add-ons auf ein einzelnes Basismodell-Deployment.

Training und Fine-Tuning

  • Drei Einstiegswege: ein geführter Weg (Aufgabe beschreiben, Plan und Kosten prüfen, Lauf freigeben), ein konfigurationsgesteuerter Weg, bei dem Fireworks Planung und Übergabe in die Produktion übernimmt, und ein Code-Weg, auf dem Sie eigene Verlustfunktion, eigenen Trainer und eigene RL-Schleife auf Fireworks-GPUs schreiben.
  • Größenordnung: Überwachtes und Reinforcement-Fine-Tuning wird für Modelle mit bis zu 1T+ Parametern angeboten.
  • Serverless Training API: ein gemeinsam genutzter, ständig verfügbarer Trainer-Pool für LoRA-Training auf Launch-Modellen, ohne Provisionierung und ohne Leerlaufkosten.

Diese Optionen machen das Fine-Tuning offener Modelle zu einer Pipeline bis zur Bereitstellung statt zu einem separaten Produkt: Laut Startseite wird jeder Checkpoint in Sekunden in die Produktion übernommen.

Nexus und FireRouter

  • Nexus: bringt offene Modelle und Modell-Router in Umgebungen für Coding-Agenten, in Agenten und LLM-Gateways, mit Nutzungstransparenz und Ausgabenobergrenzen pro Nutzer für unterstützte Serverless-Modelle.
  • FireRouter: stellt eine einzige Modell-ID bereit und wählt für jede neue Gesprächsrunde des Nutzers ein Modell, sodass einfache Runden an ein offenes Fireworks-Modell und schwierigere an ein geschlossenes Modell wie Claude Opus gehen können.
  • Einsparversprechen: Fireworks vermarktet Nexus als Drop-in-Ersatz für APIs geschlossener Modelle, der die Ausgaben für KI-Coding um 50 bis 75 % senken kann – eine Herstellerangabe.

Anleitung

Ein typisches erstes Projekt führt von Serverless-Tests zur Kostenkontrolle:

  1. Hinterlegen Sie eine gültige Zahlungsmethode und eine Rechnungsadresse und kaufen Sie dann Guthaben; die Nutzung von Serverless, On-Demand-Deployments und Training wird von diesem Guthaben abgezogen.
  2. Nutzen Sie die Python-Clientbibliothek von OpenAI, um mit Fireworks zu arbeiten, indem Sie Basis-URL und API-Schlüssel ändern.
  3. Für Traffic, der Spitzenzeiten überstehen muss, setzen Sie die Service-Stufe der Anfrage auf Priority; für latenzkritische Funktionen wechseln Sie die Modell-ID auf eine Fast-Variante, sofern es eine gibt.
  4. Legen Sie ein monatliches Ausgabenlimit fest. Standardmäßig sendet Fireworks eine Warn-E-Mail, wenn die Nutzung 80 % Ihres monatlichen Ausgabenlimits erreicht, und auf der Abrechnungsseite lassen sich weitere Warnschwellen hinzufügen.
  5. Führen Sie firectl quota list aus, um die aktuellen Ratenlimits, GPU-Kontingente, Ausgabenlimits und die Nutzung des Kontos zu prüfen, bevor Sie einen Launch planen.
  6. Wenn Sie ein trainiertes LoRA-Modell, ein eigenes Modell oder eine fixierte Version brauchen, erstellen Sie ein On-Demand-Deployment, statt sich auf Serverless zu verlassen.

Einsatzszenarien und Kundenbeispiele für Fireworks

Die Kundenzitate auf der Fireworks-Startseite sind vom Anbieter ausgewählte Referenzen und keine unabhängigen Fallstudien, zeigen aber, auf welche Workloads die Plattform zielt:

  • KI-Coding-Produkte: Der Produktchef von Cursor sagt, Fireworks sei ein wichtiger Partner dabei gewesen, die Modelle hinter Cursor in großem Maßstab zu trainieren und bereitzustellen, einschließlich RL-Workloads mit hohem Durchsatz und Produktionsinferenz für Composer.
  • Schnellere Verbraucher-Apps: Ein Produktverantwortlicher von Quora berichtet nach der Migration eines Modells von einer 3-mal schnelleren Antwortzeit, die laut Unternehmen die Engagement-Kennzahlen gesteigert habe.
  • Feinabgestimmte zusammengesetzte Modelle: Der CTO von Vercel sagt, dessen v0-Modell nutze ein mit Fireworks feinabgestimmtes Reinforcement-Learning-Modell und schneide deutlich besser ab als der SOTA.
  • Unternehmensagenten über Azure: UiPath betreibt Fireworks auf Azure Foundry, um Autopilot und Delegate mit offenen Modellen anzutreiben.
  • Geschlossenes gegen offenes Modell tauschen: Gumloop hat einen unternehmensweit genutzten internen Agenten von Opus 4.8 auf GLM-5.2 umgestellt und berichtet, dass niemand einen Unterschied im Erlebnis bemerkt habe.

Für wen ist es

  • Prototyping-Teams: Die Serverless-Nutzung beliebter Modelle mit Abrechnung pro Token wird als ideal für Qualitätstests nach Gefühl und Prototyping positioniert.
  • Teams mit eigenen oder trainierten Modellen: On-Demand eignet sich für eigene Basismodelle, trainierte LoRA-Modelle und Workloads mit eigenen Latenzanforderungen, die Kontrolle über Hardware und Replikate brauchen.
  • Regulierte Unternehmen: Die kontoweite Richtlinie zur Null-Datenspeicherung und regionsgebundene Inferenz sind Enterprise-Funktionen und keine Self-Service-Einstellungen.

In zwei Fällen passt die Plattform weniger gut. Teams, die eine feste Modellversion brauchen, haben weniger von Serverless, weil Serverless-Modelle vom Fireworks-Team verwaltet werden und aktualisiert oder abgekündigt werden können, sobald neue Modelle erscheinen. Die Nutzung durch Minderjährige ist laut den Bedingungen verboten, sofern sie nicht von einem Elternteil oder gesetzlichen Vormund beaufsichtigt wird.

Plattformen

  • API: OpenAI- und Anthropic-kompatible Endpunkte, sodass bestehender SDK-Code auf Fireworks umgeleitet werden kann.
  • CLI: firectl erstellt, deployt und verwaltet Ressourcen über das Terminal und lässt sich mit Homebrew installieren.
  • Microsoft Foundry: Fireworks AI ist ein First-Party-Inferenzanbieter in Microsoft Foundry; die Nutzung wird über Azure abgerechnet und auf eine Azure-Verbrauchszusage angerechnet.
  • Grenzen von Foundry PayGo: PayGo auf Foundry ist auf die US Data Zone beschränkt, und das Durchsatzlimit für PayGo-Deployments liegt bei 500.000 Token pro Minute.
  • Regionen: Dedizierte Deployments können die Multiregionen GLOBAL, US, CANADA, EUROPE und APAC ansteuern.
  • Serverless nur in den USA: Ein separater US-Endpunkt bedient Inferenz ausschließlich aus den USA für eine kurze Liste von Modellen; Serverless nur in der EU erfordert eine Anfrage beim Vertrieb.

Preise

Die Abrechnung erfolgt im Voraus: Die automatische Aufladung kann das Guthaben selbsttätig auffüllen, und ein monatliches Ausgabenlimit deckelt die Nutzung. Vertragskunden haben möglicherweise die Option, auf nachträgliche Abrechnung umzustellen.

Preise für Serverless-Inferenz

Die Preise sind in USD pro 1 Million Token angegeben, als Eingabe / gecachte Eingabe / Ausgabe, Stand 5. Oktober 2026.

ModellStandardPriority
Kimi K3$3.00 / $0.30 / $15.00$3.75 / $0.375 / $18.75
DeepSeek V4.1 Flash$0.30 / $0.006 / $1.20$0.375 / $0.0075 / $1.50
GLM 5.3$1.40 / $0.26 / $4.40$1.75 / $0.325 / $5.50
OpenAI GPT OSS 120B$0.15 / $0.015 / $0.60$0.18 / $0.018 / $0.72

Nicht einzeln aufgeführte Text- und Vision-Modelle werden nach Größe bepreist: unter 4B Parametern kostet $0.10, 4B bis 16B $0.20 und über 16B $0.90 pro 1M Token, ohne separaten Cache-Preis. Batch-Inferenz wird bei Eingabe und Ausgabe mit 50 % der Serverless-Preise abgerechnet. Ab dem 1. September 2026 werden eingeführte reine US-Modelle zum 1,5-Fachen der Serverless-Preise des Basismodells berechnet.

Preise für On-Demand-GPUs

On-Demand-Deployments werden pro GPU-Sekunde abgerechnet, ohne Zusatzkosten für Startzeiten.

GPUPro MinutePro Stunde
H100 80 GB$0.134$8.00
H200 141 GB$0.134$8.00
B200 180 GB$0.217$13.00
B300 288 GB$0.250$15.00
GB300 288 GB$0.334$20.00

Regionsbeschränkte Deployments werden mit einem 1,5-fachen Aufschlag bepreist und laufen über den Vertrieb.

Preise für Fine-Tuning

Verwaltetes überwachtes Fine-Tuning und Präferenz-Fine-Tuning werden pro 1M Trainings-Token berechnet:

Größe des BasismodellsLoRA SFTLoRA DPOSFT mit allen ParameternDPO mit allen Parametern
Bis 16B$0.50$1.00$1.00$2.00
16,1B bis 80B$3.00$6.00$6.00$12.00
80B bis 300B$6.00$12.00$12.00$24.00
Über 300B$10.00$20.00$20.00$40.00

Trainings-Token werden als Anzahl der Token im Trainingsdatensatz multipliziert mit der Anzahl der Epochen geschätzt. Jobs der Dedicated Training API werden pro GPU-Stunde zu den On-Demand-Tarifen berechnet.

Die Kosten für die Bereitstellung lesen sich je nach Seite unterschiedlich. Die Preisseite sagt, dass Sie feinabgestimmte Modelle zum gleichen Preis wie Basismodelle bereitstellen können, während die Abrechnungs-FAQ sagt, dass trainierte LoRA-Modelle zur Bereitstellung ein dediziertes Deployment benötigen, abgerechnet pro GPU-Sekunde.

Guthaben, Stufen und Erstattungen

  • Startguthaben: Die Abrechnungs-FAQ nennt ein Guthaben von $1; ist es aufgebraucht, wird ein Konto ohne Zahlungsmethode gesperrt, bis eine hinzugefügt wird.
  • Ausgabenstufen: Wer $50 an Guthaben einzahlt oder ausgibt, steigt in Tier 2 auf, bei $500 in Tier 3 und bei $5.000 in Tier 4; höhere Stufen heben die Obergrenzen der Serverless-Ratenlimits an.
  • Mengenrabatte: Fireworks bietet Rabatte für Großeinkäufe oder Vorauszahlungen.
  • Erstattungen: Laut den Nutzungsbedingungen sind gezahlte Gebühren nicht erstattungsfähig, sofern in den Bedingungen nichts anderes angegeben ist.

Alternativen zu Fireworks

  • Together AI: Die Preisgestaltung umfasst Serverless-Inferenz, provisionierten Durchsatz, dedizierte Inferenz auf Single-Tenant-GPUs sowie LoRA- oder vollständiges Fine-Tuning – dieselbe Produktaufteilung, die Fireworks verkauft.
  • Baseten: kombiniert Model APIs mit dedizierten Deployments, bei denen Sie nur für die tatsächlich genutzte Rechenleistung zahlen, minutengenau, und der Basic-Plan kostet $0 pro Monat bei nutzungsbasierter Abrechnung.

Fireworks rechnet dedizierte GPUs pro Sekunde ab, Baseten dagegen minutengenau – ein Unterschied, der vor allem bei kurzen, stoßweisen Deployments ins Gewicht fällt.

Einschränkungen

Ratenlimits und Kapazität

  • Neue Konten werden gedrosselt: Ein Konto ohne Zahlungsmethode oder ohne Guthaben ist auf 10 Anfragen pro Minute begrenzt, und die kontoweite Obergrenze liegt auch mit Zahlungsmethode und Guthaben bei 6.000 Anfragen pro Minute.
  • Adaptive Serverless-Limits: Die Limits wachsen und schrumpfen mit Ihrer Nutzung, und wenn Ihr Traffic zu schnell ansteigt, erhalten Sie 429-Fehler.
  • Keine Erfolgsgarantie: Bei Serverless können Antworten mit 429 Too Many Requests oder 503 Service Overloaded auftreten, und wer unter seinen Limits bleibt, ist dennoch nicht vor Lastabwurf geschützt.
  • Obergrenzen nach Modellgröße: Die Obergrenzen für generierte Token reichen von 1,08M Token pro Minute für Modelle unter 600B Parametern bis zu 216k für Modelle mit 1,6T Parametern oder mehr.
  • GPU-Kontingente: Das Standard-On-Demand-Kontingent in der Multiregion GLOBAL beträgt je 16 GPUs für H100, H200, B200 und B300, während GB300 und A100 bei 0 beginnen.
  • Trainingskontingent erfordert eine Karte: Ohne Zahlungsmethode beträgt das Trainings-GPU-Kontingent 0; mit hinterlegter Zahlungsmethode sind es 32 GPUs je Typ.

Betriebliche Grenzen

  • Entfernung von Modellen: Fireworks kündigt die Entfernung eines Serverless-Modells mindestens 2 Wochen im Voraus an, bei beliebten Modellen mit längerer Frist.
  • Ungenutzte Deployments: Standardmäßig skalieren Deployments auf null herunter, wenn sie 1 Stunde lang nicht genutzt werden, und Deployments mit auf 0 gesetzten Mindestreplikaten werden nach 7 Tagen ohne Traffic gelöscht.
  • Unterbrechbare Kapazität: Unterbrechbare Deployments leihen sich ungenutzte GPUs und können mitten in einer Anfrage ohne Vorwarnung verdrängt werden; sie sind daher nur für Evaluierung und Batch-Arbeit gedacht.
  • Harter Ausgabenstopp: Erreicht die Nutzung 100 % des monatlichen Ausgabenlimits, werden alle API-Anfragen über Serverless-Inferenz, Deployments und Training hinweg pausiert (Enterprise-Konten erhalten nur Warnungen).
  • Verzögerte Ausgabenmeldung: Die Gesamtausgaben können dem Live-Traffic um einen Tag oder mehr hinterherhinken, besonders bei neu eingeführten Modellen.
  • Keine PCI-Konformität: Die Bedingungen besagen, dass Fireworks nicht PCI-konform ist und nicht verpflichtet ist, PCI-Konformität zu erreichen.

Datenspeicherung und Nutzung für Training

Standardmäßig protokolliert oder speichert Fireworks bei keinem offenen Modell Prompt- oder Generierungsdaten, sofern der Nutzer nicht ausdrücklich zustimmt (Opt-in); Anfrage-Metadaten wie die Token-Anzahl werden jedoch protokolliert. Bei aktivem Prompt-Caching können einige Prompt-Daten mehrere Minuten im flüchtigen Speicher verbleiben.

Die Response API ist eine Ausnahme: Sie speichert Unterhaltungen standardmäßig, und gespeicherte Unterhaltungsdaten werden nach 30 Tagen automatisch gelöscht. Die Bedingungen beschränken die Zusage zur Null-Datenspeicherung außerdem auf die Inferenz; sie gilt nicht für Funktionen, die Daten bauartbedingt aufbewahren, etwa Training, Fine-Tuning oder Agentenfunktionen.

Zur Nutzung für Training sind die beiden Dokumente unterschiedlich formuliert. Die Nutzungsbedingungen besagen, dass Fireworks Ihre Inhalte nicht verwenden wird, um eigene Modelle zu trainieren oder den Dienst zu verbessern. Die Datenschutzerklärung besagt, dass Fireworks Prompts, Trainingsdaten oder API-Eingaben ohne Ihre ausdrückliche Zustimmung (Opt-in) nicht verwendet, um seine Modelle zu trainieren oder zu verbessern. Im Verhältnis zwischen den Parteien stehen Ihnen alle Rechte, Titel und Ansprüche an Ihren Inhalten zu, die die Bedingungen als Ihre Eingaben und Ausgaben definieren.

Enterprise-Administratoren können eine kontoweite Richtlinie zur Null-Datenspeicherung aktivieren, die alles ablehnt, was Kundeninhalte dauerhaft speichern würde, darunter Batch-Inferenz-Jobs, Fine-Tuning- und RL-Jobs, Uploads von Datensätzen und virtuelle FireRouter-Modelle. Wenn FireRouter eine Gesprächsrunde an Claude oder GPT sendet, läuft das geschlossene Modell über Ihr eigenes Anthropic- oder OpenAI-Konto.

Sicherheits- und Compliance-Angaben

Dies sind Angaben des Anbieters, keine unabhängigen Prüfungen:

  • Fireworks gibt an, die Zertifizierungen ISO 27001, ISO 27701 und ISO 42001 erhalten zu haben und SOC 2 Type II zu besitzen.
  • Fireworks bezeichnet sich selbst als HIPAA-konform.
  • Daten werden bei der Übertragung mit TLS 1.2+ und im Ruhezustand mit AES-256 verschlüsselt.
  • Datenresidenz, die die Inferenz auf eine Region beschränkt, ist eine Enterprise-Funktion; als Option ist US aufgeführt.

FAQ

Q1. Gibt es eine kostenlose Stufe?

Auf den geprüften Preisseiten ist kein kostenloser Plan zu sehen. Über das in der Abrechnungs-FAQ erwähnte Guthaben von $1 hinaus erfordert die weitere Nutzung eine Zahlungsmethode und vorausbezahltes Guthaben.

Q2. Kann ich ein feinabgestimmtes LoRA-Modell über Serverless bereitstellen?

Nein. LoRA-Modelle benötigen ein On-Demand-Deployment, das nach GPU-Zeit abgerechnet wird; ein Deployment kann bis zu 100 LoRA-Adapter hosten, wodurch sich diese Kosten verteilen.

Q3. Wann ist eine dedizierte GPU günstiger als Serverless?

Die Preise für Serverless-Inferenz berechnen jedes Token, daher kostet Leerlaufzeit nichts. On-Demand-Deployments werden bei hoher Auslastung als günstiger beschrieben; sie werden pro GPU-Sekunde statt pro Token abgerechnet.

Kennen Sie ein ähnliches Tool?
Wenn Sie andere großartige KI-Tools kennen, können Sie sie uns gerne einreichen