Geschwindigkeit verändert den Workflow
Teste Komposition und Bewegung, ändere nur eine Anweisung und vergleiche mehrere Takes ohne lange Wartezeit.
Eigener H3-Max-Bereich, klar vom bestehenden MiniMax-H3-Arbeitsbereich getrennt.
Erzeuge ein Video aus einem detaillierten Prompt mit Timing, Kamera, Handlung und Ton.
Wähle einen Modus, füge die erforderlichen Medien hinzu, formuliere die Regie und generiere dein MiniMax-H3-Max-Video.
MiniMax H3 Max ist ein geschwindigkeitsorientierter KI-Video-Generator auf Basis von MiniMax H3 für 5–15 Sekunden lange Text-, Bild- und Referenzvideos mit synchronem nativem Audio.
H3 Max ist eine nachtrainierte MiniMax-H3-Variante. Dieser Arbeitsbereich sendet ausschließlich H3-Max-Anfragen und bietet derzeit 768P- und 1080P-Ausgabe.

MiniMax H3 Max ist eine nachtrainierte MiniMax-H3-Videovariante für stärkere Prompt-Treue, verfeinerte Ästhetik und schnellere Iterationen von Bild und Ton.
Starte mit einem Shot-Brief, einem Anfangsbild plus optionalem Endbild oder mit Bild-, Video- und Audioreferenzen. Kamera, Handlung, Dialog, Atmosphäre und Musik gehören in eine gemeinsame Produktionsanweisung.
Teste Komposition und Bewegung, ändere nur eine Anweisung und vergleiche mehrere Takes ohne lange Wartezeit.
H3 Max nutzt 5–15 Sekunden und 480P, 768P oder 1080P. MiniMax H3 bleibt die separate Wahl für 4–15 Sekunden und 2K.
Ein kompakter Satz von Entscheidungen verbindet Briefing, Ausgangsmaterial, Bild und Ton.
Beschreibe Motiv, Ort, Handlung, Kamera, Licht, Dialog und Klang in einem Prompt. Sechs Seitenverhältnisse decken Kino-, Standard-, Quadrat- und Hochformat ab.
Nutze ein Anfangsbild und optional ein Endbild. Das Bild bestimmt die Leinwand, der Prompt die Bewegung und den audiovisuellen Übergang.
Wähle fünf bis fünfzehn Sekunden. Kurze Takes eignen sich für einen Beat, längere für Enthüllung, Reaktion oder mehrstufige Bewegung.
480P dient schnellen Entwürfen, 768P der ausgewogenen Iteration und 1080P der größeren Ausgabe des gewählten Takes.
Plane Dialog, Raumton, Geräusche, Musik und Stille zusammen mit dem Bild.
Bilder definieren Motiv und Stil, Clips zeigen Bewegung und Audio lenkt die Klangwelt. Weise jeder Referenz eine klare Rolle zu.
Standbilder sichern Identität und Design, Video demonstriert Bewegung, Audio steuert Performance und Rhythmus, und der Prompt verbindet alles auf der Zeitachse.

Produktbilder halten Silhouette und Material, Bewegungsvideo führt die Enthüllung und getaktete Sounds betonen Details und Schlussmoment.

Verankere Gesicht, Kleidung und Umgebung, definiere Text und Raumton und führe Blickrichtung, Reaktion, Kameraabstand und Schlussbild.

Referenzvideo führt den Körperrhythmus, Bilder definieren Person und Styling, Musikrichtung und 9:16 bestimmen die Plattformwirkung.
Definiere das Ausgabeformat, wähle die richtige H3-Eingabelogik, gib jeder Referenz eine Aufgabe und führe Bild und Ton auf derselben Zeitachse.
Wähle 5–15 Sekunden und das echte Veröffentlichungsformat. Beschreibe Anfang, Wendepunkt und was im letzten Moment zu sehen und zu hören ist.
Nutze Text und Start-/Endbilder für kompositionsgetriebene Shots; multimodale Referenzen für Identität, gezeigte Bewegung, Sprechweise oder Tonrichtung.
Kennzeichne Bilder für Identität oder Umgebung, Video nur für Bewegung und Audio für Stimme oder Tempo. Entferne Widersprüche.
Prüfe Identität, Physik, Kameralogik, Lippentiming, Dialog, Atmosphäre, Musikbalance und Schlussbild, bevor du das 768P- oder 1080P-Ergebnis für den Schnitt herunterlädst.
Beide gehören zur H3-Familie, unterscheiden sich aber bei Dauer, Auflösung und Iterationsstil.
| Workflow | MiniMax H3 Max | Hailuo 2.3 | Kreativer Nutzen |
|---|---|---|---|
| Schwerpunkt | Geschwindigkeitsorientierte Variante | Offenes Basismodell | Max für schnelle Varianten, Basis-H3 für dessen eigenen Produktionsvertrag. |
| Eingabestruktur | 5–15 Sekunden | 4–15 Sekunden | Vier Sekunden gehören nur zum bestehenden H3-Workflow. |
| Audioausgabe | 480P / 768P / 1080P | 768P / 2K | Max übernimmt die 2K-Steuerung von H3 nicht. |
| Auflösung | Text, Frames, Referenzen | Text, Frames, Referenzen | Die Modi wirken vertraut, Parameter und Preise bleiben modellspezifisch. |
Wähle H3 für multimodale audiovisuelle Regie; Hailuo 2.3 für etablierte Text-zu-Video- und Bild-zu-Video-Konfigurationen.
Beschreibe sichtbaren Ablauf, Referenzrollen, Kamera, Dialog, Atmosphäre, Effekte, Musik und Schlussbild.
Nenne Dauer, Seitenverhältnis, Plattform, Zielgruppe und Shot-Zweck vor Stilbegriffen.
Lege fest, welches Bild Identität, welches Video Bewegung und welches Audio Stimme oder Rhythmus führt.
Teile 5–15 Sekunden in Anfang, Entwicklung und Schluss mit beobachtbaren Handlungen.
Beschreibe Ausschnitt, Objektivgefühl, Bewegung, Tempo und den Grund der Enthüllung.
Trenne Dialog, Raumton, Effekte und Musik und definiere Start, Intensität und Bildbezug.
Fixiere Identität, Produktgeometrie, Kleidung, Lichtrichtung, Text und Schlussbild.
Jede Anweisung ist in Bild oder Ton prüfbar und gezielt überarbeitbar.
AUSGABE 12 Sekunden, 16:9, hochwertiger Produktfilm mit nativem Stereo-Audio. REFERENZROLLEN @Bild 1 steuert Flaschengeometrie und sichere Etikettansicht. @Video 1 steuert nur die langsame Handbewegung. @Audio 1 steuert nur den Sprechton. ZEITACHSE 0–4 s — 85-mm-Makrofahrt über Kondenswasser; leiser Raumton und ein Glasdetail. 4–9 s — zurückziehen, eine Hand dreht die Flasche um 30 Grad; ruhige Stimme spricht einen kurzen Satz. 9–12 s — festes Hero-Bild, bernsteinfarbiges Kantenlicht, kurzer musikalischer Abschluss. KONSTANTEN Proportionen, Verschlusshöhe, Etikettfläche, Kameraachse und Lichtrichtung bleiben unverändert. Keine Untertitel oder zusätzlichen Objekte.
H3 passt zu kurzen Videos mit stabiler Identität, demonstrierter Bewegung, hörbarer Performance oder bewusstem Weg vom Start- zum Endbild.
Verbinde Hook, Demo, Voice-Line, taktilen Sound und Produkt-Schlussbild in 5–15 Sekunden.
Erhalte Form und Material über Makrodetail, Handhabung, Anwendung und Schlussbild.
Koordiniere Identität, Blick, Reaktion, Sprache, Lippenbewegung, Atmosphäre und Kamera.
Plane direkt in 9:16, führe Performance per Video und ende mit mobil lesbarer Komposition.
Richte Bewegungsakzente, Kamerarhythmus und Atmosphäre an Audio- und Musikreferenzen aus.
Wechsle die Dialogsprache und bewahre Produkt, Charakter, Struktur und Timing.
Klare Antworten zu Identität, Modi, Dauer, Auflösung, Audio, Prompts und dem Unterschied zu MiniMax H3.
Lege Dauer, Start- und Endbilder, Referenzrollen, Kamerabewegung, Dialog, Atmosphäre und Ton fest und generiere den Shot im MiniMax-H3-Workspace.
