Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Runpod ist eine GPU-Cloud für Entwickler, die beschleunigte Rechenleistung brauchen, ohne Hardware zu kaufen oder Unternehmensverträge zu unterschreiben. Das Unternehmen bezeichnet sich als AI Developer Cloud, und praktisch bedeutet das drei Produktlinien, die sich unter einem Konto denselben GPU-Katalog teilen: Pods sind GPU-Instanzen für dauerhaftes Rechnen und Entwicklung, Serverless liefert automatisch skalierende GPU-Endpunkte, die im Leerlauf auf null zurückgehen, und Clusters bieten verteiltes Multi-GPU-Rechnen für Training und Inferenz in großen Stapeln. Alle drei sind auf Abruf verfügbar, ohne Verträge und ohne Mindestabnahme, und das erklärte Entwurfsziel lautet, vom Experiment bis in die Produktion zu kommen, ohne zwischen den Phasen die Plattform zu wechseln.
Die Herkunft des Unternehmens erklärt viel darüber, wem es dient. Zwei ehemalige Comcast-Entwickler, Zhen Lu und Pardeep Singh, bauten Ende 2021 Mining-Rigs aus Kellern in New Jersey zu KI-Servern um, motiviert — in Lus Worten — von der Beobachtung, dass „die tatsächliche Erfahrung, Software auf GPUs zu entwickeln, schlicht grottig war". Anfang 2022 boten sie in KI-Subreddits kostenlosen GPU-Zugang gegen Rückmeldungen an; binnen neun Monaten nach dem Start kündigten sie ihre Jobs und erreichten eine Million Dollar Umsatz. Dieser entwicklerorientierte, aus der Community gewachsene Ursprung ist dem Produkt bis heute anzumerken, auch daran, wie ein Teil seiner Kapazität bereitgestellt wird.
Die seither erreichte Größenordnung ist beträchtlich und sollte mit Datum genannt werden, denn die Zahlen bewegen sich schnell. TechCrunch berichtete im Januar 2026, Runpod habe 120 Millionen Dollar an jährlich wiederkehrendem Umsatz mit 500.000 Entwicklerkunden in 31 Regionen erreicht, nachdem das Unternehmen vor institutionellem Kapital mehr als 24 Millionen Dollar Umsatz aus eigener Kraft erwirtschaftet hatte. Zur Ankündigung der Series A im Juni 2026 — 100 Millionen Dollar unter Führung von Summit Partners bei einer Bewertung von einer Milliarde, womit die Gesamtfinanzierung nach einer von Intel Capital und Dell Technologies Capital im Mai 2024 gemeinsam geführten Seed-Runde über 20 Millionen auf 122 Millionen stieg — wurde die Entwicklerzahl mit über einer Million angegeben, bei mehr als 20 Milliarden seit dem Start verarbeiteten Inferenzanfragen. Zu den genannten Kunden zählen Replit, Cursor, OpenAI, Perplexity, Wix und Zillow.
Runpod wird über ein Web-Dashboard, eine Kommandozeile und REST-APIs genutzt; die Dokumentation deckt API v1 und v2 sowie Modell- und CLI-Referenzen ab. Die Bereitstellungseinheit ist ein Docker-Container, das heißt Framework, Abhängigkeiten und Code kommen mit — die erklärte Haltung lautet „deine Container, dein Framework, dein Code" statt einer vorgeschriebenen Laufzeitumgebung.
Die Infrastruktur umfasst 31 Regionen und mehr als 30 GPU-Modelle und läuft in zwei deutlich verschiedenen Klassen. Community Cloud bezieht Kapazität von geprüften Drittanbieter-Hosts in einer Peer-to-Peer-Anordnung, bei der Pods sich eine Wirtsmaschine mit Container-Isolation auf Softwareebene teilen. Secure Cloud läuft in Rechenzentren der Stufen 3 und 4 mit dedizierten Maschinen und GPUs, besseren SLAs und dauerhaften Netzwerkvolumes auf NVMe. Beide erscheinen für dieselben GPU-Modelle nebeneinander in der Preistabelle, und die Wahl zwischen ihnen ist ebenso eine Entscheidung über Zuverlässigkeit und Isolation wie über Kosten.
Zur Anbindung: Serverless-Endpunkte sind HTTP-APIs — Aufträge einreichen, Status abfragen, Ergebnisse abholen, oder synchrone Aufrufe für kurze Arbeit. Endpunkte mit Lastverteilung erlauben ein eigenes HTTP-Framework und eigene Routen. Echtzeitprotokolle, Überwachung und Metriken gibt es ohne zusätzliche Instrumentierung, und das Runpod-skills-Paket erweitert Bereitstellung und Ressourcenverwaltung auf Coding-Agenten einschließlich Claude Code und Cursor.
Runpod rechnet stunden- oder sekundengenau ab, ohne Abostufen — du zahlst die verbrauchte Rechenleistung, und die Preisseite trug als letzte Aktualisierung den 27. Juli 2026.
Pods werden je GPU-Modell bepreist. Am oberen Ende kostet die B300 7,89 $/h, die B200 6,79 $/h, die H200 4,59 $/h, die H100 SXM 3,29 $/h, die H100 PCIe 2,89 $/h und die H100 NVL 3,19 $/h. In der Mitte liegt die A100 SXM bei 1,59 $/h, die A100 PCIe bei 1,39 $/h, die RTX Pro 6000 bei 2,09 $/h, die L40S bei 0,99 $/h und die RTX 6000 Ada bei 0,84 $/h. Im Einstieg kostet die RTX 4090 0,74 $/h, die RTX 3090 0,50 $/h, die L4 0,49 $/h, die A40 0,44 $/h und die RTX A5000 0,27 $/h. Dieselbe Tabelle führt die beiden Infrastrukturklassen als getrennte Spalten, der effektive Preis hängt also davon ab, welche du wählst.
Serverless wird getrennt bepreist und ist je Stunde durchgehend teurer als der entsprechende Pod — die wichtigste Preisrealität, die man verinnerlichen sollte: Die H100 kostet 4,79 $/h serverless gegen 3,29 $/h als Pod, die A100 2,72 $ gegen 1,59 $, die RTX 4090 1,10 $ gegen 0,74 $. Die 16-GB-Stufe liegt bei 0,58 $/h, die geteilte 24-GB-Stufe bei 0,69 $/h. Runpod gibt an, damit bei Flex-Workern 25 % gegenüber anderen Serverless-Anbietern zu sparen. Der Aufschlag kauft automatische Skalierung und Kostenfreiheit im Leerlauf: bei stoßweisem Verkehr lohnend, bei stetiger Last verschwendet.
Clusters veröffentlichen nur zwei Abrufpreise — H200 SXM zu 4,31 $/h und A100 SXM zu 1,79 $/h — während L40S, H100 SXM und B200 als Vertriebsanfrage geführt werden. Reserved Clusters weisen für keine Laufzeit einen öffentlichen Preis aus; jede Zelle über 1, 3, 6, 12 und mehr Monate verweist auf den Vertrieb.
Speicher wird eigenständig abgerechnet: Container-Disk 0,10 $/GB/Monat; Volume-Disk 0,10 $/GB/Monat im Betrieb und 0,20 $/GB/Monat im Leerlauf; Netzwerkspeicher 0,07 $/GB/Monat unter 1 TB, 0,05 $/GB/Monat darüber und 0,14 $/GB/Monat für die Hochleistungsstufe. Public Endpoints rechnen je Aufruf ab, mit großen Unterschieden je Modell.
Ein Vorbehalt zu den veröffentlichten Preisen: Im Sprachbereich der Public Endpoints steht Deep Cogito v2 Llama 70B mit 0,00001 $ je Million Token, während im selben Abschnitt Qwen3 32B AWQ 10,00 $ und IBM Granite 4.0 H Small 1,00 $ kostet. Eine millionenfache Spanne in einer Tabelle spricht stark für einen Seitenfehler statt für einen echten Preis, und der Befund wird hier unverändert wiedergegeben. Runpod nennt zudem als Preisphilosophie, Preise zu bewegen, um GPUs verfügbar zu halten: Behandle jede Zahl als Momentaufnahme und prüfe die Live-Seite.
Der Vergleich hängt davon ab, welche Seite von Runpod du abwägst. Gegenüber Hyperscalern — AWS, Azure, GCP — steht Beschaffungsaufwand und Preis gegen Ökosystemtiefe und Unternehmensverträge; Runpod beansprucht bis zu 90 % geringere Rechenkosten und wirbt mit fehlenden Egress-Gebühren, während jene integrierte Dienste bieten, die Runpod gar nicht anstrebt. Gegenüber KI-fokussierten GPU-Clouds wie CoreWeave und Lambda sprechen Kapazitätsgröße und Vertragsfähigkeit eher für die größeren Anbieter, während Runpod mit Selbstbedienung und der Breite der GPU-Modelle konkurriert. Gegenüber Spezialisten für Serverless-Inferenz wie Modal, Replicate, Baseten und Together entscheidet sich der Vergleich an Kaltstartverhalten, Entwicklererfahrung und Preisform, und unabhängige Vergleiche zeigen, dass die Rangfolge je nach Modellgröße wechselt, statt dass eine Plattform durchgehend dominiert. Gegenüber marktplatzartiger GPU-Vermietung wie Vast.ai besetzt Runpods Community Cloud ähnliches Terrain, während Secure Cloud eine Option auf Rechenzentrumsniveau hinzufügt, die reine Marktplätze meist nicht haben. Praktisch bewertet man, indem man das eigene Modell auf zwei oder drei dieser Plattformen misst, denn veröffentlichte Kaltstart- und Durchsatzzahlen überstehen den Kontakt mit einer konkreten Last selten.
Die Angabe eines Kaltstarts unter 200 ms braucht ihre Bedingungen. Runpods Startseite wirbt damit über FlashBoot. Die eigene Dokumentation ist präziser: Ein Kaltstart umfasst das Starten des Containers, das Laden der Modelle in den GPU-Speicher und die Initialisierung der Laufzeit, und sie hält ausdrücklich fest, dass größere Modelle länger laden und den Kaltstart verlängern. Unabhängige Tests an Qwen Image fp16 mit 56 GB Grafikspeicherbedarf maßen rund 120 bis 160 Sekunden Kaltstart gegenüber 30 bis 40 Sekunden tatsächlicher Erzeugung — ein Aufschlag um das Drei- bis Vierfache. Das ist kein Widerspruch: Die Werbezahl beschreibt einen warmen Pfad mit zwischengespeichertem Modell, die Messung ein großes Modell, das bei null beginnt. Wer nur die Startseite liest, wird sein Latenzbudget jedoch falsch bemessen. Zu beachten ist außerdem, dass der Autor des Vergleichs offenlegt, dass seine eigene Plattform mit verglichen wurde.
Unabhängige Bewertungen sind mittelmäßig und stark polarisiert. Runpod erreicht auf Trustpilot 3,7 von 5 bei 302 Bewertungen, 156 davon aus den letzten zwölf Monaten. Auffällig ist die Verteilung: 65 % fünf Sterne und 19 % ein Stern, mit sehr wenig dazwischen. Diese zweigipflige Form legt nahe, dass die Erfahrungen deutlich auseinandergehen, statt sich um ein Mittelmaß zu scharen. Das Profil ist als kundeneinladend gekennzeichnet, woraus ein Auswahleffekt folgt, den man beim Lesen der Gesamtnote mitdenken sollte.
Wiederkehrende Betriebsbeschwerden sind konkret und konsistent. Nutzer berichten, dass ein aufgebrauchtes Kontoguthaben zur Löschung statt zum bloßen Stoppen von Pods führt, was vollständigen Neuaufbau erzwingt. Andere schildern Phasen erheblicher GPU-Knappheit, eine Abrechnung, die nicht zur gelieferten Ausstattung passte — eine Bewertung nennt bezahlte 1 TB Arbeitsspeicher bei erhaltenen 300 GB — und Maschinen mit defektem NVSwitch, gesperrten GPUs, fehlendem Speicher oder nicht eingehängten Datenträgern, was ein Rezensent als Roulette bezeichnete. Weitere Aggregationen nennen Pods, die bis zu 30 Minuten zum Starten brauchen oder gar nicht initialisieren und dennoch abrechnen, sowie eine Unterstützung, die von reaktionsschnell bis vollständig stumm reicht.
Ein ungelöster Abrechnungsstreit ist erwähnenswert. Ein Trustpilot-Rezensent gibt an, nie Kunde gewesen zu sein, sein Zahlungsmittel sei zur Kontoeröffnung genutzt worden und habe binnen zwei Wochen 810 Dollar unautorisierte Belastungen erzeugt, und Runpod habe das Konto wegen Fremdzugriffs gesperrt, eine Erstattung aber mit der Begründung verweigert, es sei kein Beleg für Fremdzugriff gefunden worden. Das ist die Darstellung eines einzelnen Nutzers und wird als solche wiedergegeben, nicht als feststehende Tatsache.
Die beiden Infrastrukturklassen sind nicht austauschbar. Community Cloud bezieht Kapazität von geprüften Drittanbieter-Hosts, wobei Pods eine Maschine mit Isolation nur auf Containerebene teilen und die Zuverlässigkeit je Host schwankt. Secure Cloud liefert dedizierte Hardware in Rechenzentren der Stufen 3 und 4. Runpods Dokumentation empfiehlt Secure Cloud für sensible Lasten. Ein Großteil der auseinanderlaufenden Nutzererfahrungen dürfte auf diese Wahl zurückgehen, und Preistabellen, die beide Spalten nebeneinander zeigen, machen es leicht, allein nach Preis zu wählen, ohne zu registrieren, was man aufgibt.
Konformität ist bedingt statt pauschal. Runpod hat SOC 2 Type 2 abgeschlossen, und das Trust Center führt SOC 2 Type 2, SOC 3, HIPAA, DSGVO und ein Übergangsschreiben 2026, wobei manche Dokumente eine Freigabe erfordern. Doch die Compliance-Seite hält klar fest, dass die Abdeckung nach Last, Region, Anbieter und Bereitstellungsmodell variieren kann, und rät, konkrete Anforderungen bei der Sicherheitsprüfung zu bestätigen. Sie merkt zudem an, dass Berichte, Zertifizierungen und Partnerabdeckung sich über die Zeit ändern können. Eine Zertifizierung auf Unternehmensebene ist damit Ausgangspunkt der Prüfung, nicht ihr Ergebnis.
Die Website nennt zwei verschiedene Verfügbarkeitszahlen. Der Unternehmensbereich der Startseite nennt 99,9 % Verfügbarkeit, die FAQ derselben Seite eine Garantie von 99,99 %. Runpod hat dazu keine Erklärung veröffentlicht, und beide werden hier unverändert wiedergegeben.
Mindestens ein veröffentlichter Preis wirkt fehlerhaft. Deep Cogito v2 Llama 70B steht mit 0,00001 $ je Million Token in einem Abschnitt, in dem vergleichbare Modelle 1,00 $ und 10,00 $ je Million Token kosten. Das ist mit hoher Wahrscheinlichkeit ein Seitenfehler, und es wird hier keine Annahme darüber getroffen, wie die richtige Zahl lauten müsste.
Serverless kostet je GPU-Stunde mehr als Pods. Das ist Absicht und kein Mangel, erwischt aber Teams, die serverless automatisch für günstiger halten. Bei stetiger, planbarer Last ist ein Pod deutlich billiger; Serverless verdient seinen Aufschlag nur, wenn die Leerlaufzeit erheblich ist.
Endpunkte mit Lastverteilung tauschen Warteschlange gegen Flexibilität. Sie erlauben ein eigenes HTTP-Framework, bieten aber anders als Standardendpunkte keine Warteschlange für auflaufende Anfragen. Unter plötzlicher Last entscheidet dieser Unterschied, ob überzählige Anfragen warten oder scheitern.
Berichtete Zahlen tragen Datumsvorbehalte. Die Entwicklerzahl lag in der Berichterstattung vom Januar 2026 bei 500.000 und im Juni 2026 bei über einer Million; beide werden mit Datum zitiert statt angeglichen. Größenangaben, Bereitstellungserfolgsquoten und Bindungsraten sind Unternehmensangaben ohne unabhängige Prüfung, ebenso kundenberichtete Ersparnisse wie eine um 90 % gesenkte Infrastrukturrechnung.
Pods sind GPU-Instanzen für dauerhaftes Rechnen und Entwicklung, erhältlich als garantiertes Reserved oder als unterbrechbares, günstigeres Spot. Serverless bietet automatisch skalierende GPU-Endpunkte, die im Leerlauf auf null gehen und außer Betrieb nichts kosten. Clusters bieten verteiltes Multi-GPU-Rechnen für Training und Inferenz in großen Stapeln, auf Abruf bis 64 GPUs und darüber hinaus reserviert. Alle drei teilen sich unter einem Konto denselben GPU-Katalog, und der vorgesehene Weg ist, sie in verschiedenen Phasen zu nutzen, ohne die Plattform zu wechseln.
Sie beschreibt eine bestimmte Bedingung, nicht jeden Fall. FlashBoot kann mit zwischengespeichertem Modell auf einem warmen Pfad so schnell sein. Runpods eigene Dokumentation hält fest, dass der Kaltstart Containerstart, Laden des Modells in den GPU-Speicher und Laufzeitinitialisierung umfasst und größere Modelle länger brauchen. Unabhängige Tests an einem Bildmodell mit 56 GB Grafikspeicherbedarf maßen 120 bis 160 Sekunden Kaltstart gegen 30 bis 40 Sekunden Erzeugung. Miss mit deinem eigenen Modell, statt dein Latenzbudget um die Schlagzeilenzahl zu planen.
Laut Dokumentation gibt es drei Hebel. Modell zwischenspeichern — Gewichte ins Worker-Image backen oder auf einem Netzwerkvolume halten, damit sie nicht zur Anfragezeit geladen werden. FlashBoot aktivieren. Und aktive Worker über null setzen, was den Kaltstart der ersten Anfrage beseitigt, aber die Ersparnis des Rückgangs auf null aufgibt. Der dritte Punkt ist ein direkter Handel zwischen Kosten und Latenz, dessen Ausgang allein davon abhängt, ob dein Verkehr stoßweise oder stetig ist.
Community Cloud bezieht GPUs von geprüften Drittanbieter-Hosts in einer Peer-to-Peer-Anordnung; Pods teilen sich eine Maschine mit Container-Isolation auf Softwareebene, die Preise sind niedriger und die Zuverlässigkeit schwankt je Host. Secure Cloud läuft in Rechenzentren der Stufen 3 und 4 mit dedizierten Maschinen und GPUs, besseren SLAs und dauerhaften Netzwerkvolumes auf NVMe. Runpods Dokumentation empfiehlt Secure Cloud für sensible Lasten, und für Produktionszuverlässigkeit ist es ebenfalls die passende Grundeinstellung.
Pods werden je GPU-Modell stündlich abgerechnet: etwa B300 zu 7,89 $, H200 zu 4,59 $, H100 SXM zu 3,29 $, A100 SXM zu 1,59 $, L40S zu 0,99 $, RTX 4090 zu 0,74 $ und RTX A5000 zu 0,27 $ je Stunde, wobei beide Infrastrukturklassen als getrennte Spalten erscheinen. Serverless wird getrennt und höher bepreist — H100 zu 4,79 $/h, A100 zu 2,72 $/h. Speicher wird ab 0,05 $/GB/Monat separat berechnet. Clusters veröffentlichen zwei Abrufpreise, der Rest verweist auf den Vertrieb, Reserved Clusters gar keine. Preise werden bewusst bewegt, prüfe daher die Live-Seite.
Weil du Verschiedenes kaufst. Ein Pod ist dedizierte Kapazität, die du hältst und fortlaufend bezahlst. Ein Serverless-Worker ist Kapazität, die auf Abruf erscheint, automatisch skaliert und im Leerlauf nichts kostet — und diese Elastizität trägt einen Stundenaufschlag. Die Rechnung fällt für Serverless aus, wenn dein Endpunkt die meiste Zeit ruht, und für Pods, wenn die Last stetig ist. Mit dem eigenen tatsächlichen Auslastungsgrad zu rechnen ist verlässlicher als beide Standardannahmen.
Bedingt ja. Runpod hat SOC 2 Type 2 abgeschlossen, das Trust Center führt SOC 3, HIPAA und DSGVO, Secure Cloud ergänzt Netzwerkisolation, und die FAQ nennt ein SLA von 99,99 % — während dieselbe Startseite an anderer Stelle 99,9 % nennt. Der entscheidende Vorbehalt stammt von Runpods eigener Compliance-Seite: Die Abdeckung variiert nach Last, Region, Anbieter und Bereitstellungsmodell und sollte bei der Sicherheitsprüfung bestätigt werden. Behandle die Zertifizierung als Beginn der Prüfung, nicht als deren Schluss.
Mehrere Nutzerbewertungen berichten, dass Pods bei aufgebrauchtem Guthaben gelöscht statt nur gestoppt werden, sodass du einen neuen Pod anlegen und deine Einstellungen von Grund auf neu setzen musst. Da dies ein von Nutzern berichtetes Verhalten mit realen Folgen für ungesicherte Arbeit ist, halte einen Guthabenpuffer, lege Wertvolles auf Netzwerkspeicher statt auf die lokale Platte des Pods und überwache das Guthaben, wenn Pods laufen bleiben.
Die unabhängigen Signale sind gemischt und polarisiert. Trustpilot zeigt 3,7 von 5 über 302 Bewertungen, mit 65 % fünf Sternen und 19 % einem Stern und wenig dazwischen, auf einem Profil, das zu Bewertungen einlädt. Wiederkehrende Beschwerden betreffen GPU-Knappheit, Maschinen mit Hardwarefehlern, Abrechnung abweichend von der gelieferten Ausstattung, langsam startende oder scheiternde und dennoch berechnete Pods sowie ungleichmäßige Unterstützung. Die zweigipflige Verteilung erklärt sich am besten aus der Trennung zwischen Community und Secure Cloud und aus schwankendem GPU-Angebot; deine Erfahrung hängt also wesentlich davon ab, welche Infrastruktur du wählst und welche Karte du brauchst.
Gegenüber Hyperscalern konkurriert Runpod über den Preis — beansprucht bis zu 90 % geringere Rechenkosten und keine Egress-Gebühren — und über Selbstbedienung ohne Beschaffung, verzichtet dafür aber auf das umgebende Dienste-Ökosystem. Gegenüber CoreWeave und ähnlichen KI-Clouds führen die größeren Anbieter bei Kapazitätsgröße und Unternehmensverträgen, während Runpod bei der Breite selbst wählbarer GPUs führt. Gegenüber Modal, Replicate und anderen Serverless-Spezialisten entscheiden Kaltstartverhalten bei deinem Modell, Entwicklererfahrung und Preisform, und unabhängige Vergleiche zeigen keinen Anbieter, der über alle Modellgrößen gewinnt. Teste mit deiner eigenen Last.