Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Modal ist eine Serverless-Cloud, die Python-Code auf GPUs und CPUs ausführt und sekundengenau abrechnet; das Unternehmen beschreibt sie als Cloud-Infrastruktur für Teams, die KI-Anwendungen in großem Maßstab entwickeln, trainieren und bereitstellen.
Modal packt Ihren Code in einen Container, führt ihn in der Cloud aus und fügt bei steigendem Traffic automatisch Container hinzu; dabei bündelt es Kapazität über große Clouds hinweg und wählt, wo jeder Job läuft. Container-Images und GPU-Anforderungen werden als Python-Code geschrieben, daher hat eine Modal-App keine YAML-Deployment-Dateien.
Modal Labs betreibt modal.com. Laut unabhängigen Berichten der Tech-Presse wurde Modal 2021 von CEO Erik Bernhardsson und CTO Akshat Bubna gegründet; nach eigenen Angaben hat das Unternehmen über 466 Mio. US-Dollar von Investoren wie General Catalyst und Redpoint Ventures eingesammelt. Am 28. September 2026 berichtete ein Tech-Nachrichtenartikel unter Berufung auf eine ungenannte Quelle, Modal Labs, das er als Anbieter von KI-Inferenz-Infrastruktur bezeichnete, stehe kurz vor einer von Accel angeführten Finanzierungsrunde über 750 Mio. US-Dollar bei einer Bewertung von 15,75 Mrd. US-Dollar; Modal Labs lehnte eine Stellungnahme ab.
Modal deckt Inferenz mit nach eigener Aussage Kaltstarts unter einer Sekunde ab, außerdem parallele Batch-Jobs, Training und Fine-Tuning, isolierte Sandboxes für KI-generierten Code sowie kollaborative Notebooks mit GPU.
Das Argument gpu akzeptiert T4, L4, A10, L40S, A100 (generisch, 40 GB oder 80 GB), RTX PRO 6000, H100 (oder H100!), H200, B200 (oder B200+) und B300. B300, B200, H200, H100, A100, L4, T4 und L40S erlauben bis zu 8 GPUs pro Container (bis zu 2.304 GB GPU-RAM); bei A10 ist bei 4 GPUs und 96 GB Schluss.
Zwei automatische Upgrades sind für Benchmarks wichtig: Eine H100-Anforderung kann auf einer H200 laufen und eine A100-Anforderung auf einer A100 mit 80 GB, jeweils zum ursprünglichen Preis; wer H100! anfordert, verzichtet auf das H200-Upgrade. Eine Funktion kann außerdem GPU-Typen nach Präferenz geordnet auflisten, und Modal weicht dann die Liste hinab aus.
Modal Sandboxes sind sichere, zur Laufzeit definierte Container zum Ausführen von nicht vertrauenswürdigem Code von Nutzern oder Agenten. Laut Modal lassen sich Millionen davon in weniger als einer Minute programmatisch erstellen, mit Snapshot und Wiederherstellung für einen schnellen Start.
Gehostete Jupyter-Notebooks mit Serverless-Preisen, automatischem Herunterfahren bei Inaktivität, Modal-GPUs und kollaborativer Bearbeitung in Echtzeit.
Modal gab am 1. Oktober 2026 bekannt, dass Modal Clusters über den Decorator @modal.clustered allgemein verfügbar sind: Multi-Node-GPU-Gruppen mit RDMA, die per Gang-Scheduling aus einem gemeinsamen Kapazitätspool zugeteilt und sekundengenau abgerechnet werden.
pip install modal aus und danach modal setup zur Authentifizierung (oder python -m modal setup, falls die erste Variante fehlschlägt).@app.function(...) dekorierte Python-Funktion, die Container-Image und GPU benennt, und starten Sie die Datei mit modal run path/to/file.py.Modal gibt an, dass Container in etwa einer Sekunde booten, doch warm ist ein Container erst, wenn Importe und sonstige Einrichtung im globalen Gültigkeitsbereich gelaufen sind; bis zur Bereitschaft können daher Sekunden bis Minuten vergehen. Drei Einstellungen wägen Latenz gegen Leerlaufkosten ab:
scaledown_window: hält inaktive Container zwei Sekunden bis zwanzig Minuten am Leben; längere Fenster bedeuten weniger Kaltstarts, aber inaktive Ressourcen werden abgerechnet.min_containers und buffer_containers: Ersteres hält eine Untergrenze warmer Container, sodass die Funktion nie auf null skaliert, Letzteres fügt Reservecontainer hinzu, solange sie aktiv ist.us bietet einen größeren Ressourcenpool als eine enge und verbessert Kaltstartzeit und Verfügbarkeit.Modal kann jede containerisierbare Python-Anwendung bereitstellen und zielt auf rechenintensive, horizontal skalierende Arbeit: ML-Inferenz in großem Maßstab, Modelltraining und Fine-Tuning, Datenpipelines, wissenschaftliches Rechnen und Job-Warteschlangen.
Die drei Kundenaussagen sind Testimonials von der Startseite, keine unabhängigen Fallstudien.
Die in dieser Runde gefundenen unabhängigen Bewertungssignale sind begrenzt: Auf einer Bewertungsplattform aus einer Launch-Community zeigte Modal laut Erfassung vom 5. Oktober 2026 eine 5,0 auf Basis von 61 Bewertungen, und die KI-Zusammenfassung dieser Plattform sagt, die Bewertenden seien überwiegend Gründer und die Bewertungen enthielten fast keine Kritik.
routing_region akzeptiert außerdem us-west (Oregon), eu-west (Dublin) und ap-south (Mumbai).Modal kombiniert einen Monatsplan mit GPU-Preisen pro Sekunde sowie verbrauchsabhängig gemessener CPU und Arbeitsspeicher; die folgenden Listenpreise wurden am 5. Oktober 2026 erfasst.
| Plan | Plattformgebühr | Inklusive Rechenleistung | Plätze | Container / GPU-Parallelität | Log-Aufbewahrung | Inklusive ausgehender Datenverkehr |
|---|---|---|---|---|---|---|
| Starter | $0 + Rechenleistung / Monat | $30 / Monat | 3 | 100 / 10 | 1 Tag | 1 TiB / Monat |
| Team | $250 + Rechenleistung / Monat | $100 / Monat | Unbegrenzt | 5.000 / 50 | 30 Tage | 10 TiB / Monat |
| Enterprise | Individuell | Individuell | Unbegrenzt | Höhere GPU-Parallelität | Individuell | 100 TiB / Monat |
Enterprise ergänzt Mengenrabatte, eingebettete ML-Engineering-Services, privaten Slack-Support, Audit-Logs, Okta-SSO und HIPAA. Starter erlaubt 200 bereitgestellte Apps und 5 bereitgestellte Cron-Jobs und schließt benutzerdefinierte Domains, Deployment-Rollbacks, Budgets auf Umgebungsebene, den Proxy mit statischer IP und RBAC aus; Team behält 3 Rollback-Versionen.
| Ressource | Preis pro Sekunde |
|---|---|
| Nvidia B300 | $0.001972 |
| Nvidia B200 | $0.001736 |
| Nvidia H200 SXM | $0.001261 |
| Nvidia H100 SXM5 | $0.001097 |
| Nvidia RTX PRO 6000 | $0.000842 |
| Nvidia A100, 80 GB | $0.000694 |
| Nvidia A100, 40 GB | $0.000583 |
| Nvidia L40S | $0.000542 |
| Nvidia A10 | $0.000306 |
| Nvidia L4 | $0.000222 |
| Nvidia T4 | $0.000164 |
| CPU, pro physischem Kern (2 vCPU) | $0.0000131 |
| Arbeitsspeicher, pro GiB | $0.00000222 |
Für CPU gilt ein Minimum von 0,125 Kernen pro Container. Sandboxes und Notebooks nutzen höhere CPU- und Speichertarife, $0.00003942 pro Kern und $0.00000667 pro GiB und Sekunde, GPUs zu Standardpreisen. Volumes kosten nach 1 TiB frei $0.09 pro GiB und Monat, ausgehender Datenverkehr über das Planvolumen hinaus $0.04 pro GiB. Modals Rechenbeispiel beziffert Stable Diffusion auf einer A10G auf etwa $0.491 pro 1.000 Bilder.
nonpreemptible=True verdreifacht die Listenpreise für CPU und Arbeitsspeicher und ist für GPU-Funktionen nicht verfügbar.Jede der folgenden Serverless-GPU-Plattformen unterscheidet sich von Modal vor allem darin, wie Leerlaufzeit abgerechnet wird und wie breit die GPU-Auswahl ist.
| Option | GPU-Auswahl | Skalierung auf null | Leerlauf- und Abrechnungsregel |
|---|---|---|---|
| Google Cloud Run (GPU) | RTX PRO 6000 Blackwell (96 GB) oder L4 (24 GB) | Ja | Instanzbasierte Abrechnung; Mindestinstanzen werden auch im Leerlauf voll berechnet |
| RunPod Serverless | In diesem Vergleich nicht behandelt | Flex-Worker ja; aktive Worker laufen rund um die Uhr | Sekundengenaue Abrechnung vom Start des Workers bis zum vollständigen Stopp, aufgerundet |
| Replicate | In diesem Vergleich nicht behandelt | Öffentliche Modelle ja | Die meisten privaten Modelle laufen auf dedizierter Hardware und werden für Setup-, Leerlauf- und Aktivzeit berechnet |
Die Aufteilung in Flex und aktiv bei RunPod entspricht der min_containers-Wahl bei Modal. Replicate rechnet die meisten öffentlichen Modelle nach Laufzeit ab, manche nach Ein- und Ausgabe. Modals Unterscheidungsmerkmale sind in Python definierte Infrastruktur und Sandboxes im selben Konto sowie eine längere GPU-Liste als bei Cloud Run.
routing_region lässt sich nur beim ersten Deployment einer Funktion festlegen, und Ein- und Ausgaben über 2 MiB gehen weiterhin in den Objektspeicher in us-east.Modals Vertrag verbietet Kryptowährungs-Mining oder verwandte Blockchain-Aktivitäten, Denial-of-Service-Angriffe, Peer-to-Peer-Filesharing sowie allgemeine Plattformen für Datei-Hosting oder Medienauslieferung.
Starter hat keine Plattformgebühr und enthält $30 Rechenleistung pro Monat, aber der Abrechnungsleitfaden verlangt eine hinterlegte Zahlungsmethode, und Tokens für gemeinsame Endpunkte werden ab der ersten Anfrage berechnet.
Nicht, nachdem sie auf null skaliert ist. Das standardmäßige Keep-alive von 60 Sekunden und Leerlaufzeit innerhalb eines längeren scaledown_window werden berechnet, und min_containers verhindert, dass die Funktion je null erreicht.
Funktionen und Sandboxes lassen sich mit einem Multiplikator von 1,15 oder 1,75 an EU-Regionen binden, mit Routing über eu-west, doch Anwendungslogs bleiben in den USA, große Ein- und Ausgaben laufen über us-east, und gemeinsame Endpunkte lassen sich nicht binden.