Im Quellenvergleich
Worin die Quellen übereinstimmen
Der chinesische KI-Anbieter MiniMax hat die Gewichte seines neuen Videomodells H3 freigegeben. Laut der Benchmark-Plattform Artificial Analysis ist H3 das weltweit stärkste KI-Modell für Videobearbeitung. Bei Text-zu-Video-Aufgaben liegt es hinter Googles Gemini Omni Flash, bei Bild-zu-Video-Fähigkeiten hinter ByteDances Seedance 2.0 und Gemini Omni Flash. Die Lizenz erlaubt kostenlose nicht-kommerzielle Nutzung sowie kommerzielle Nutzung für Organisationen mit weniger als 20 Millionen US-Dollar Jahresumsatz. Das Modell verarbeitet Text, Bilder, Videos und Audio gemeinsam und erzeugt einen vier bis 15 Sekunden langen Clip mit Stereo-Ton. Zwei Bausteine bleiben geschlossen: das Modul für 2K-Auflösung und H3-Context-IR, das Prompts in eine strukturierte Zwischenform übersetzt. Lokal in ComfyUI erhält man daher 768p. Die Kontextaufbereitung lässt sich anhand veröffentlichter Leitfäden selbst nachbauen. Feintuning ist möglich. Zeitgleich veröffentlichte ByteDance das geschlossene Seedance 2.5, das 30-Sekunden-Clips mit Audio liefert. Das Modell erschien am 31. Juli 2026 als API-Produkt. Die offenen Gewichte wurden laut Ankündigung Anfang August auf Hugging Face veröffentlicht. Das Modell mit 33 Milliarden Parametern verarbeitet Text, Bilder, Videos und Audio gemeinsam und erzeugt einen vier bis 15 Sekunden langen Clip mit Stereo-Ton. Laut Modellkarte sind bis zu neun Referenzbilder, drei Videoclips und drei Audioclips pro Prompt möglich.
Aktualisierungen
06.08.2026
09:07Das Modell erschien am 31. Juli 2026 als API-Produkt.
Die offenen Gewichte wurden laut Ankündigung Anfang August auf Hugging Face veröffentlicht.
Worin sie sich unterscheidenZeitpunkt der Veröffentlichung der vollständigen Modellgewichte·Begründung für die Öffnung der Gewichte·Leistungsfähigkeit bei Text-zu-Video und Bild-zu-Video+2 weitere
Zeitpunkt der Veröffentlichung der vollständigen Modellgewichte- Die vollständigen Modellgewichte sollen laut MiniMax „in den kommenden Tagen“ veröffentlicht werden.1
- Die offenen Gewichte wurden laut Ankündigung Anfang August auf Hugging Face veröffentlicht.2
Begründung für die Öffnung der Gewichte- MiniMax öffnet die Gewichte, um die Open-Source-Community zu unterstützen und Nutzern Anpassungen auf verschiedener Hardware zu ermöglichen. Die Hardware-Kompatibilität sei eine „Schlüsselüberlegung“ im Design.1
- Der Hersteller bezeichnet H3 als „Schritt zu einem allgemeineren multimodalen Intellekt“ und hält spezialisierte Modelle für „überflüssige Komplexität“. Die Architektur wurde laut Hersteller neu geschrieben.2
Leistungsfähigkeit bei Text-zu-Video und Bild-zu-Video- Bei Text-zu-Video-Aufgaben liegt H3 hinter Googles Gemini Omni Flash, bei Bild-zu-Video-Fähigkeiten hinter ByteDances Seedance 2.0 und Gemini Omni Flash.1
- Bei Artificial Analysis belegt H3 Platz eins im Video Editing, Platz zwei bei Text-zu-Video und Platz drei bei Bild-zu-Video.3
Anzahl der Referenzbilder pro Prompt- Laut Modellkarte sind bis zu neun Referenzbilder, drei Videoclips und drei Audioclips pro Prompt möglich.3
- H3 kann aus sechs Referenzbildern, einem Beispielvideo und einem Textsatz einen 15-sekündigen Clip im Stil des Beispiels erstellen.2
Schwächen bei der Darstellung von Schriften und Details- Kleine Schriften und Details im Bild bleiben unscharf. Das sei eine allgemeine Schwäche aller Videomodelle, H3 halte große Schriften aber besser als Konkurrenten.2