VideoGeschlossen⚠▸▾
Wan3.0-Video
Alibaba (Wan-Team)
Auf QwenCloud als Alleskönner-Videomodell gelistet: Erzeugung, referenzgestützte Erzeugung, Bearbeitung, Nachbildung und Bewegungssteuerung in einem Modell statt in einer Familie spezialisierter Endpunkte.
Wan3.0-Video
Bis 30 Sekunden Länge mit omnimodaler Referenz; als Eingabekontext nimmt das Modell laut Beschreibung Dateien, Webseiten und komplexe Bilder an, Eingabemodalitäten sind Audio, Bild, Text und Video. Ausgabe in 480P, 720P oder 1080P, abgerechnet pro Sekunde mit $0,05, $0,10 und $0,20. Grenzen: 30 Anfragen pro Minute, zwei gleichzeitige Läufe, asynchrone Warteschlange bis 50 Aufträge; angesprochen wird es über den DashScope-Endpunkt zur Videosynthese mit `"model": "wan3.0-video"`. Als Eigenwerbung nennt die Seite „produktionsreife Figurenkonsistenz“ sowie lebensechtes Bild und Ton.
Dreißig Sekunden in einem Durchlauf, mit Ton und gleichbleibenden Figuren, wären ein Sprung — die geschlossene Spitze rechnet bislang in einstelligen Sekunden pro Einstellung. Und die Bündelung geht in dieselbe Richtung wie MiniMax H3 fünf Tage zuvor: Referenz, Schnitt, Bewegungsübertragung und Erzeugung wandern in ein Modell, statt sich auf mehrere Endpunkte zu verteilen. Der Eintrag ist aber vor allem ein Befund über die Veröffentlichungspraxis selbst: Ein Videomodell steht mit vollständiger Preisliste, Ratenbegrenzung und API-Aufruf auf der eigenen Cloud des Anbieters, bevor es irgendeine Ankündigung, einen Modellbericht oder eine einzige Messung dazu gibt. Wer den Stand der Technik verfolgen will, liest inzwischen Preistabellen.
ⓘ Geschlossene Beta — der Zugang muss über „Join Beta“ beantragt und freigegeben werden; ohne Freigabe ist das Modell nicht aufrufbar. Kein Ankündigungsbeitrag, kein Modellbericht, keine Benchmarks, keine Angabe zu Architektur oder Größe.