
MiniMax H3 erzeugt 2K-Video mit nativem Stereoton, nennt Preise pro Sekunde und stellt H3-Base-Gewichte unter einer Community License bereit.
| Du bist… | Urteil |
|---|---|
| Jemand, der Short-Form-Inhalte mit Dialog produziert | Starte mit einer Abnahme-Batch. MiniMax dokumentiert gemeinsame Audio-Video-Ausgabe, aber Dialog und Tonvorgaben müssen mit deinem Material getestet werden |
| Betreiber eines selbst gehosteten KI-Stacks | Prüfe Lizenz und Architektur. H3-Base-Gewichte sind verfügbar, doch der vollständige 2K-Workflow enthält weiter gehostete Stufen |
| Auf Einstellungen länger als 15 Sekunden angewiesen | Vergleiche mit Seedance 2.5. Seedance dokumentiert bis zu 30 Sekunden gemeinsame Audio-Video-Generierung; prüfe den Zugang für Konto und Region |
| Jemand, der exakt budgetiert | Ja; der Sekundenpreis ist veröffentlicht, und das ist seltener, als es sein sollte |
Die Zusammenfassung in einem Satz: Dieser MiniMax-H3-Test prüft die von MiniMax dokumentierte gemeinsame Audio-Video-Generierung, die veröffentlichte API-Preisliste und H3-Base-Gewichte unter Community License. Das sind Fähigkeiten, die du mit deinem Briefing validieren musst, keine Garantie für ein fertiges Video.
MiniMax hat H3 am July 31, 2026 gestartet, und das Unterscheidungsmerkmal ist nicht die Auflösung. Dialog, Soundeffekte und Umgebungston entstehen im selben Inferenzdurchlauf wie das Bild. Die übliche Pipeline erzeugt stummes Video, beschafft dann Musik, Foley und Stimme getrennt und synchronisiert sie anschließend von Hand.
Für H3 bedeutet „nativ“, dass MiniMax Audio und Video als eine Generierung statt als Nachbearbeitungsschicht entwirft. Ob Schritte, Dialog, Atmosphäre und Schnitte kohärent bleiben, ist ein Akzeptanzkriterium für deine eigenen Prompts, keine aus der Produktbeschreibung abzuleitende Eigenschaft.
Für Short-Form-Inhalte, Produktdemos und Dialogszenen fällt damit die längste manuelle Stufe eines KI-Video-Workflows weg. Für Teams, die ohnehin in einer vollen Schnittsuite zu Hause sind, schrumpft der Vorteil deutlich.
Die aktuellen H3-Unterlagen von MiniMax nennen 4 bis 15 Sekunden bei 24 fps. Die gehostete API bietet 768P und 2K; der veröffentlichte H3-Base-Workflow nutzt standardmäßig eine kurze Seite von 768 Pixeln, während der vollständige 2K-Pfad H3-Regenerate-2K einbezieht. Die Bildrate ist nicht konfigurierbar.
MiniMax beschreibt H3 als Unterstützung für natives Multi-Shot-Modelling. Teste mit deinem Briefing, ob eine Titelsequenz oder ein Schuss-Gegenschuss-Dialog kohärent genug ist, um getrennte Generierungen und Montage zu ersetzen.
H3 nimmt Text, Bilder, Video und Audio gemeinsam entgegen. Laut der veröffentlichten Spec-Seite von MiniMax verarbeitet ein Lauf bis zu 9 images, 3 video clips, and 3 audio files, sodass eine einzelne Einstellung Gesicht, Bewegung und Stimme gleichzeitig erben kann. Auch das Bearbeiten vorhandener Aufnahmen und das Übertragen von Bewegung zwischen Videos wird unterstützt.
Am 3. August 2026 kündigte MiniMax die H3-Veröffentlichung an und stellte seine H3-Base-Checkpoints bereit. Die offizielle Modellkarte ist über die Hugging-Face-Organisation von MiniMax unter der MiniMax H3 Community License verfügbar.
Die Veröffentlichung ist keine bedingungslose, weltweit geltende Open-Source-Lizenz. Die Community License schließt die USA, die EU, das Vereinigte Königreich und Südkorea aus. Kommerzielle Produkte oder Dienste mit mehr als $20M Jahresumsatz benötigen eine vorherige schriftliche Genehmigung; kommerzielle Oberflächen müssen „MiniMax H3“ prominent anzeigen.
MiniMax beschreibt den vollständigen H3-Workflow als H3-Context-IR, H3-Base und H3-Regenerate-2K. Das veröffentlichte Basismodell kann lokal 768P ausgeben, während der vollständige 2K-Workflow offizielle API-Stufen kombiniert.
Stand 10. September 2026 nennt die offizielle Preisseite von MiniMax $0.13 pro Ausgabesekunde für 2K und $0.08 pro Ausgabesekunde für 768P. Audioeingaben sind kostenlos; die ersten fünf Bilder sind kostenlos, weitere Bilder kosten $0.04 je Bild, und Videoeingaben werden nach Dauer und gewählter Ausgabeauflösung berechnet. Eine 768P-zu-2K-Regenerierung ist mit $0.05 pro regenerierter Ausgabesekunde angegeben, zuzüglich separater Eingabekosten.
Bei den genannten $0.13 pro Ausgabesekunde kostet ein 15-sekündiger 2K-Clip etwa $1.95 und eine Minute generierter 2K-Ausgabe rund $7.80. Das sind reine Ausgabeberechnungen, keine Festpreise für fertige Videos: zusätzliche Referenzen, Videoeingaben, Regenerierung und verworfene Takes ändern die Rechnung.
Führe eine kleine, repräsentative Batch mit deinem echten Prompt, freigegebenen Referenzen, Zielseitenverhältnis, Dauer und Lieferformat aus. Notiere erzeugte Sekunden, Eingabematerial, Wiederholungen, akzeptierte Takes und die Gesamtrechnung. So bleibt die H3-versus-Seedance-Entscheidung in deinem Workflow reproduzierbar.
MiniMax dokumentiert eine V2-API, gemeinsame Audio-Video-Generierung, Referenzeingaben und H3-Base-Gewichte. Das definiert, was zu testen ist. Ohne reproduzierbare Batch belegt es weder Latenz, Moderationsergebnis, Dialogqualität, Akzeptanzrate noch die Kosten eines fertigen Projekts.
| Dimension | MiniMax H3 | Seedance 2.5 |
|---|---|---|
| Länge | 4–15s; MiniMax beschreibt natives Multi-Shot-Modelling | Bis zu 30s Einzeleinstellung |
| Auflösung | 768P oder 2K bei 24fps | 480P oder 720P in der aktuellen BytePlus-LAS-Dokumentation |
| Ton | Natives Stereo, gleiche Generierung | Gemeinsame Audio-Video-Generierung |
| Zugang | API + veröffentlichte Preisliste | Dokumentierte BytePlus-LAS-API + dynamische Preise |
Beide Modelle erzeugen Ton und haben einen dokumentierten API-Weg; vergleiche daher den Workflow statt eines von beiden als Platzhalter zu behandeln. Wähle H3, wenn 2K-Ausgabe, H3-Base-Gewichte innerhalb ihrer Lizenzgrenze oder die aktuelle API-Preisliste zentral sind. Wähle Seedance 2.5, wenn eine einzelne Szene bis zu 30 Sekunden, ein größeres gemischtes Referenzpaket oder Timeline-Bearbeitung wichtiger sind. Die breitere KI-Video-Landschaft hat mehr Optionen als dieses Paar.
Multi-Shot-Generierung innerhalb eines Clips hilft, aber 15 Sekunden begrenzen, was du in einem Lauf erzählen kannst. Narrative Arbeit verlangt weiterhin Montage, und Montage kostet weiterhin Anschluss.
Die Community License stellt H3-Werke und -Ausgaben „as is“, ohne Gewährleistungen einschließlich Nichtverletzung, bereit und überträgt dem Nutzer die Beurteilung der Angemessenheit einer Nutzung. Prüfe für kommerzielle oder stark sichtbare Ausgaben Lizenz, Rechte an jedem Input und den Ausgabe-Reviewprozess mit geeigneter Beratung.
H3-Base ist verfügbar, aber das macht nicht jeden H3-Workflow lokal oder weltweit lizenziert. Berücksichtige die Gebietsbeschränkungen der Community License und dass der vollständige 2K-Workflow weiter offizielle H3-Context-IR- und H3-Regenerate-2K-Stufen verwendet.
Ziehe H3 in Betracht, wenn deine Abnahme-Batch von dem dokumentierten Audio-Video-Workflow, der 768P/2K-V2-API und der aktuellen Preisliste profitiert. Die offizielle V2-Dokumentation nennt Endpoint und Pay-as-you-go-Anforderung, ersetzt aber nicht die Tests für Konto, Region, Moderationspfad und fertige Ausgabe.
Teams mit Bedarf an Langform-Kontinuität oder einem vollständig lokalen 2K-Workflow sollten zuerst testen. Prüfe das Gebiet der Community License und die gehosteten Stufen, die deine Pipeline weiter benötigt, statt davon auszugehen, dass ein veröffentlichtes Checkpoint die Bereitstellung löst.
H3-Base-Gewichte sind unter der MiniMax H3 Community License veröffentlicht, aber die Freigabe ist nicht weltweit bedingungslos. Die Lizenz schließt die USA, die EU, das Vereinigte Königreich und Südkorea aus; kommerzielle Produkte oder Dienste über $20M Jahresumsatz benötigen schriftliche Genehmigung. Der vollständige 2K-Workflow enthält zudem offizielle gehostete Stufen.
Stand 10. September 2026 nennt MiniMax $0.13 pro Ausgabesekunde für 2K und $0.08 für 768P. Eine 15-sekündige 2K-Ausgabe kostet damit etwa $1.95, vor Videoeingaben, zusätzlichen Bildern, Regenerierung oder verworfenen Takes.
MiniMax beschreibt H3 als Modell, das nativen Stereoton mit dem Video in derselben Generierung erstellt. Teste Dialog, Soundeffekte und Umgebungston mit deinem Briefing, bevor du einen Audio- oder Postproduktionsschritt streichst.
Die aktuelle MiniMax-H3-V2-Dokumentation nennt 4 bis 15 Sekunden bei 24 fps mit 768P- oder 2K-Ausgabe. MiniMax beschreibt auch natives Multi-Shot-Modelling, doch bewerte die Kontinuität in deiner Szene, bevor du Montage ersetzt.
Keines ist allgemein besser. H3 kombiniert nativen Stereoton, 768P/2K-API-Ausgabe, eine aktuelle Preisliste und H3-Base-Gewichte unter eingeschränkter Lizenz. Seedance 2.5 dokumentiert gemeinsame Audio-Video-Generierung, Szenen bis 30 Sekunden, breitere gemischte Referenzen und gezielte Bearbeitung. Vergleiche denselben Brief, dieselben Referenzen, Kontozugang und Abnahmestandard.
Sources: MiniMax — H3 launch · MiniMax — H3 open-weights release · MiniMax API Platform — H3 V2 API · MiniMax API Platform — current H3 pricing · MiniMax official H3 model card and license · ByteDance Seed — Seedance 2.5 launch · BytePlus LAS — Seedance 2.5 API and pricing
Zuletzt aktualisiert: 10. September 2026
Seedance 2.5 bietet 30 Sekunden Audio-Video, 50 Referenzen und zeitgesteuerte Bearbeitung. Was offiziell ist, was es kostet und was Sie testen sollten.
Hermes Agent verbindet persistentes Memory mit selbstverbessernden Skills; Sicherheit und Ergebnisse hängen von Backend, Genehmigungen und Ihrer Prüfung ab.
OpenClaw ist eine leistungsfähige Agent-Runtime, deren Nutzen von bewusst geplanter Gateway-Sicherheit, Skill-Prüfung und Betriebsdisziplin abhängt.
KI-Musik 2026: Können und Prozesse von Suno und Udio, AIVAs volles Urheberrecht und wie der Warner-Vergleich deine kommerziellen Rechte umschreibt.
Der KI-Videomarkt nach Soras Abgang, mit echten Preisen: 0,50 bis 2,50 Dollar pro 10-Sekunden-Clip, wer jetzt führt und wie man pro Einstellung wählt.
Der ehrliche Vergleich der Gratis-Tarife 2026: Geminis großzügiges Paket, Claudes Qualität, ChatGPTs begrenzte Breite und wann Gratis nicht reicht.
Was GPT-5 im August 2025 lieferte, warum der erste Monat holperte und wie sich die Architektur vom Standpunkt der drei GPT-5.6-Stufen aus liest.
Eine ehrliche Bilanz für 2026: was GPT-5.5, Dreaming-V3-Speicher und Agenten wirklich leisten, wo Claude und Gemini gewinnen und für wen sich Plus lohnt.