Generative KI · Ende 2022 → heute

Die Beschleunigung, die wir alle unterschätzen.

2022 brachte KI kaum einen Satz zu Ende. Heute schreibt sie Software, malt Fotos, dreht Filme und spricht wie ein Mensch — alles in dreieinhalb Jahren.

Text

2022: Autovervollständigung

heute: schreibt Software & besteht Examen

Bild

2022: verschmierte Gesichter

heute: Fotorealismus mit lesbarem Text

Video

2022: gab es praktisch nicht

heute: filmreife Clips — mit Ton

Audio

2022: Roboter-Vorlesestimme

heute: Echtzeit-Gespräch & ganze Songs

snipKI für dein TeamStand: 6. August 2026247 Meilensteine · jedes Datum primärgeprüft
Scrollen

Damals → Heute

Wie viel besser? Sieh selbst.

Vier Dimensionen, dreieinhalb Jahre. Links der Stand 2022, rechts heute.

TextTokens Kontext4.0001 Mio.+
2022

Stichwortsuche und Autovervollständigung. Verlor nach ein paar Sätzen den Faden.

Heute

Schreibt Software, besteht Examen, arbeitet stundenlang eigenständig als Agent.

BildBildqualität512 px2K + Text
2022

Verschmierte Gesichter, sechs Finger, unlesbare Buchstaben.

Heute

Fotorealismus mit korrekter Typografie — in wenigen Sekunden.

VideoBewegtbild4 Sek.Minuten + Ton
2022

Vier Sekunden stummes Flackern (das „Will Smith isst Spaghetti“-Meme).

Heute

Filmreife Clips mit lippensynchronem Dialog und Geräuschen.

AudioStimme & KlangVorlese-RoboterEchtzeit < 1 Sek.
2022

Roboterhaftes Vorlesen mit hörbarer Verzögerung.

Heute

Natürliches Gespräch in Echtzeit — und ganze Songs aus einem Satz.

Das Wichtigste in Zahlen

0
verfolgte Meilensteine
74 offen · 173 geschlossen
104Text
45Bild
44Video
54Audio
0
Tage seit ChatGPT
≈ 3,6 Jahre
0 %
laufen auf Open-Weights
74 von 247 Modellen

Release-Takt

Bemerkenswerte Releases pro Quartal

Jeder Balken ist ein Quartal, gestapelt nach Modalität. Die Form ist die Geschichte: Was früher ein paar Mal im Jahr kam, kommt heute alle paar Wochen.

TextBildVideoAudio
2022
2023
2024
2025
2026

Jeder Balken = ein Quartal · gestapelt nach Modalität · 2026 läuft noch

Tempo im Vergleich

Frühere Umbrüche brauchten ein Jahrzehnt.

Grobe Maßstäbe zum Einordnen, kein exakter Vergleich — aber die Größenordnung stimmt.

Das Web
ca. 1993 – 2000

Vom ersten Browser bis zur alltäglichen Massennutzung vergingen rund sieben Jahre.

Das Smartphone
ca. 2007 – 2012

Vom ersten iPhone bis zur App-Wirtschaft, die den Alltag umbaute: etwa fünf Jahre.

Generative KI
2022 – 2026

Dieselben dreieinhalb Jahre: von Stichwortsuche zu autonomen Agenten, Video mit Ton und Songs auf Zuruf.

Dieses Tempo hält niemand allein. Dein Team muss nicht alles wissen — nur mithalten.

snipKI zeigt wie

Im Herbst 2022 wirkte eine Maschine, die ein Gespräch führen konnte, wie Science-Fiction. Bildmodelle verschmierten Gesichter zu Albträumen. Video war eine flackernde Kuriosität. Synthetische Stimmen klangen synthetisch.

Dann geriet der Boden in Bewegung. Was folgt, ist das Protokoll — Release für Release, über vier Modalitäten hinweg — davon, wie schnell aus „unmöglich“ „alltäglich“ wurde. Lies es langsam. Die Liste beginnt bei heute — und je weiter du nach unten scrollst, desto dünner wird sie, bis am Anfang Monate zwischen den Meilensteinen liegen. Wer die Beschleunigung von vorn erleben will, stellt die Sortierung auf „Älteste“.

Die Zeitachse

Alles, Monat für Monat.

Jedes Modell, jedes Datum — Ende 2022 bis heute, das Neueste zuerst. Filtere nach Disziplin, such ein Modell, klapp die Details auf.

Zuletzt aktualisiert: 6. August 2026247 Releases · jedes Datum primärgeprüft
Filter

Fortsetzung folgt

Hier fehlt noch der nächste Durchbruch.

Das Tempo lässt nicht nach — oben landet, was als Nächstes kommt. Scroll nach unten und reise zurück bis Ende 2022.

lädt …

August 2026

#6 Releases
6
Aug. 2026
VideoGeschlossen

Wan3.0-Video

Alibaba (Wan-Team)

Auf QwenCloud als Alleskönner-Videomodell gelistet: Erzeugung, referenzgestützte Erzeugung, Bearbeitung, Nachbildung und Bewegungssteuerung in einem Modell statt in einer Familie spezialisierter Endpunkte.

Bis 30 Sekunden Länge mit omnimodaler Referenz; als Eingabekontext nimmt das Modell laut Beschreibung Dateien, Webseiten und komplexe Bilder an, Eingabemodalitäten sind Audio, Bild, Text und Video. Ausgabe in 480P, 720P oder 1080P, abgerechnet pro Sekunde mit $0,05, $0,10 und $0,20. Grenzen: 30 Anfragen pro Minute, zwei gleichzeitige Läufe, asynchrone Warteschlange bis 50 Aufträge; angesprochen wird es über den DashScope-Endpunkt zur Videosynthese mit `"model": "wan3.0-video"`. Als Eigenwerbung nennt die Seite „produktionsreife Figurenkonsistenz“ sowie lebensechtes Bild und Ton.

Dreißig Sekunden in einem Durchlauf, mit Ton und gleichbleibenden Figuren, wären ein Sprung — die geschlossene Spitze rechnet bislang in einstelligen Sekunden pro Einstellung. Und die Bündelung geht in dieselbe Richtung wie MiniMax H3 fünf Tage zuvor: Referenz, Schnitt, Bewegungsübertragung und Erzeugung wandern in ein Modell, statt sich auf mehrere Endpunkte zu verteilen. Der Eintrag ist aber vor allem ein Befund über die Veröffentlichungspraxis selbst: Ein Videomodell steht mit vollständiger Preisliste, Ratenbegrenzung und API-Aufruf auf der eigenen Cloud des Anbieters, bevor es irgendeine Ankündigung, einen Modellbericht oder eine einzige Messung dazu gibt. Wer den Stand der Technik verfolgen will, liest inzwischen Preistabellen.

Geschlossene Beta — der Zugang muss über „Join Beta“ beantragt und freigegeben werden; ohne Freigabe ist das Modell nicht aufrufbar. Kein Ankündigungsbeitrag, kein Modellbericht, keine Benchmarks, keine Angabe zu Architektur oder Größe.

5
Aug. 2026
VideoOffen

MiniMax H3 (Open Weights)

MiniMax

MiniMax löst die Ankündigung vom 31.07.2026 ein und legt die Gewichte von H3 auf Hugging Face offen (MiniMaxAI/MiniMax-H3, ohne Zugangsschranke).

Erst damit werden die Kennzahlen prüfbar: 33 Mrd. Parameter dicht besetzt in einem einzigen Strom — die modalitätsspezifischen Teile sitzen nur in den Ein- und Ausgabeschichten und in den AdaLN-Zweigen, nicht in getrennten Expertentürmen. Ausgabe 4 bis 15 Sekunden, bis 2K (voreingestellt 768 px kürzere Kante), 24 Bilder/s, Stereo-Ton mit 32 kHz, Seitenverhältnisse von 21:9 bis 9:16; als Text- und Bildencoder dient Qwen3-VL-32B unter Apache 2.0. Die Lizenz ist keine Open-Source-Lizenz, sondern ein „MiniMax H3 Community License Agreement“ mit einer entscheidenden Klausel: Als „Excluded Territories“ ausgenommen sind die Europäische Union, das Vereinigte Königreich, Südkorea und die USA. Untersagt ist dort nicht nur der Betrieb des Modells, sondern ausdrücklich auch Vervielfältigung, Bearbeitung, Weitergabe und Vorführung — und dasselbe gilt für die erzeugten Videos. Ab 20 Mio. US-Dollar Jahresumsatz braucht es zusätzlich eine schriftliche Genehmigung, kommerzielle Oberflächen müssen „MiniMax H3“ sichtbar nennen; Gerichtsstand ist Hongkong, Lizenzgeberin die Nanonoble Pte. Ltd. in Singapur.

Die letzte große Lücke zwischen offenen und geschlossenen Videomodellen fällt — für europäische Nutzende aber nicht. Die Gewichte sind herunterladbar, die Lizenz schließt genau jene vier Räume aus, in denen der westliche Markt liegt, und sie erstreckt das Verbot auf die fertigen Videos. Das erste offene Modell mit 2K und nativem Ton ist damit in Deutschland ohne Antrag nicht rechtssicher nutzbar; die API bleibt weltweit offen. MiniMax begründet das im Repository selbst und ungewöhnlich offen: die Durchsetzung der EU-KI-Verordnung, unklare Rechtslage in Großbritannien und Südkorea, laufende US-Urheberrechtsverfahren speziell zu generativer Video-KI. „Noch nicht“ heiße nicht „nie“, schreibt MiniMax dazu. Bemerkenswert ist der zweite Befund: 33 Mrd. Parameter dicht besetzt — ein Videomodell dieser Klasse läuft auf gewöhnlicher Hardware. Was den Zugang begrenzt, ist nicht mehr die Grafikkarte, sondern der Vertrag.

Trotz offener Gewichte in der EU, im Vereinigten Königreich, in Südkorea und in den USA nicht lizenziert — auch nicht für die erzeugten Videos. Zugang für diese Räume nur auf Antrag über platform.minimax.io/h3-license. Die gehostete API ist davon nicht betroffen und bleibt global verfügbar.

5
Aug. 2026
AudioGeschlossen

SeedRealtime

ByteDance Seed

Ein Modell für Echtzeitgespräche, das Audio, Video und Text in einer einzigen Architektur verarbeitet statt in der üblichen Kette aus Spracherkennung, Sprachmodell und Sprachsynthese.

Drei Dinge nennt ByteDance als Kern. Erstens gemeinsames Hören und Sehen: Homophone werden über das Kamerabild aufgelöst, Verweise wie „das hier“ und zeitliche Bezüge im Bild verstanden. Zweitens Eigeninitiative — das Modell meldet sich unaufgefordert, wenn im Bild auftaucht, worauf es warten sollte, und webt Werkzeugaufrufe in die laufende Antwort ein. Drittens entscheidet es den Gesprächstakt selbst, wann es also einsetzt, wartet oder unterbricht, statt sich auf eine vorgeschaltete Sprachaktivitätserkennung zu verlassen; laut ByteDance bleibt es dadurch auch bei Nebengesprächen und Hintergrundlärm stabil. Gezeigt wird das an sieben Alltagsszenen — Namen zu Gesichtern am Abendessenstisch, eine Sichuan-Speisekarte auf Englisch erklärt, eine Erinnerung im Museum, eine Korrektur an der Espressomaschine („die Extraktion um zwei bis drei Sekunden verkürzen“), das Auffinden von Abschnitt „3.4 Implementation“ in einem Paper, Lärmfestigkeit am Flughafen Peking-Daxing und eine Englischstunde zwischen Mutter und Tochter. Das Modell ist laut ByteDance vollständig ausgerollt.

Bei Sprachassistenten fällt gerade die Verarbeitungskette — und hier kommt die Kamera dazu. GPT-Live hatte am 08.07.2026 das vollduplexe Sprechen in ein Modell geholt; bei SeedRealtime liegt der Bildkanal im selben Modell, sodass der Assistent sieht, worauf man zeigt. Der eigentliche Bruch ist aber die Eigeninitiative: Ein Modell, das selbst entscheidet, wann es zu sprechen anfängt, verlässt das Frage-Antwort-Muster, auf dem die gesamte Assistenzsoftware der letzten Jahre gebaut ist. Nachprüfbar ist davon fast nichts — ByteDance veröffentlicht keine Benchmarks, keine Latenzwerte und keine API, sondern eine einzige menschliche Bewertung, nach der sich Taktprobleme gegenüber Kettensystemen halbieren. Der Eintrag steht für die Richtung, nicht für gemessene Leistung.

Keine API, keine Preisangabe, keine Gewichte und keine Benchmarktabelle. ByteDance nennt auch nicht, in welchem Produkt das Modell ausgerollt ist.

5
Aug. 2026
TextGeschlossen

Muse Code (Beta) & Muse Spark 1.2

Meta

Meta bringt erstmals einen eigenen Terminal-Coding-Agenten: Muse Code läuft auf macOS und Linux, wird über ein Installationsskript von dev.meta.ai eingerichtet und arbeitet an Aufgaben über große Repositorys hinweg — Planen, Schreiben, Prüfen.

Technisch zwei Besonderheiten. Erstens laufen neben der Hauptschleife dauerhafte Hintergrundagenten mit, die über die ganze Sitzung aktiv bleiben statt pro Aufgabe neu gestartet zu werden; sie arbeiten eigenständig weiter und entscheiden selbst, wann sie sich zurückmelden. Zweitens schreibt Muse Code jeden Modellaufruf, Werkzeuglauf, jede Freigabe und Änderung in ein lokales Ereignisprotokoll — die Laufzeit ist damit exakt wiederholbar und absturzsicher, nach einem Abbruch setzt der Agent genau an der Abbruchstelle fort. Mitgeliefert sind Fertigkeiten wie /plan (Aufgabe zu einem freigabepflichtigen Plan), /grill (der Plan wird unter Druck gesetzt, bis er hält) und /goal. Das zugehörige Modell Muse Spark 1.2 ist eine coding-fokussierte Fortschreibung von 1.1, gemeinsam mit dem Agenten trainiert (Harness-Trajektorien per Rejection Sampling, Rezepte für Goals, Kontextverdichtung und Subagenten) und ausgiebig auf Aufgaben mit langem Horizont: Generierung ganzer Repositorys, große Ende-zu-Ende-Projekte, automatisierte Recherche. Metas eigene Zahlen: Terminal-Bench 2.1 82,9 % (Claude Opus 5 max 86,7, GPT 5.6 Terra 81,8, Grok 4.5 81,6, Gemini 3.6 Flash 78,9, Muse Spark 1.1 76,2), DeepSWE 1.1 59,3 % (Opus 5 65,0, GPT 5.6 Terra 64,8), Meta Internal Coding Bench 70,6 % (Opus 5 79,4), MCP Atlas 90,3 % (Bestwert, vor 1.1 mit 88,1 und Opus 5 mit 85,8) und GDPVal-AA v2 mit 1.631 Elo (Opus 5 1.852). Verfügbar ist 1.2 ab dem Ankündigungstag in Muse Code und in der Meta Model API mit erweitertem globalem Zugang.

Meta steigt dort ein, wo der Wettbewerb um Coding inzwischen entschieden wird — nicht am Modell, sondern am Agenten im Terminal. Nach Claude Code, Codex, Antigravity und Grok Build ist Muse Code der nächste Fall desselben Musters: Das Labor liefert Modell und Harness als ein Produkt und trainiert beide gegeneinander. Genau das macht Meta hier explizit, und es ist die eigentliche Nachricht: Muse Spark 1.2 wurde mit Muse Code ko-trainiert, die Werkzeugoberfläche des Agenten steckt im Training. Bemerkenswert ist zudem, was Meta selbst zeigt: In allen drei Coding-Suiten liegt 1.2 hinter Claude Opus 5, teils deutlich (Meta Internal Coding Bench 70,6 gegen 79,4) — vorn liegt Meta nur bei MCP-Werkzeugnutzung. Ein Labor, das seine eigene Zweitplatzierung publiziert und den Release als „nächsten Schritt zur Spitze" mit „größeren und deutlich fähigeren Modellen" in Aussicht stellt, kalkuliert sichtbar mit einer Zwischenstation. Und die Linie von Llama ist endgültig verlassen: Der Coding-Stack des Hauses, das Open Weights groß gemacht hat, ist geschlossen und läuft über die eigene API.

Erster eigener Terminal-Coding-Agent von Meta.

Muse Code ist Beta und nur für macOS und Linux; installiert wird über ein per curl bezogenes Shell-Skript. Preise nennt Meta weder für Muse Code noch für Muse Spark 1.2 in der API, ebenso keine Kontextfenster- oder Parameterangabe; Gewichte sind nicht verfügbar.

4
Aug. 2026
TextOffen

Shieldstral 1.0 3B

Mistral AI

Ein Klassifikator für Inhaltsmoderation mit 3 Mrd. Parametern, der keine feste Kategorienliste vorhersagt, sondern eine in natürlicher Sprache formulierte Richtlinie zur Laufzeit als Eingabe nimmt und einen kontinuierlichen Sicherheitswert zurückgibt.

Technisch ist die Aufgabe auf eine binäre Ja/Nein-Frage reduziert: feste Systemnachricht, ein einziger Vorwärtsdurchlauf, ein einziges Ausgabetoken, dessen Wahrscheinlichkeit als Schwellwert dient. Derselbe Checkpoint lässt sich damit auf neue Richtlinien umstellen, ohne ihn nachzutrainieren. Basis ist Ministral-3-3B-Base-2512 mit nativem Pixtral-Bildencoder; über dieselbe Schnittstelle moderiert werden reiner Text, reine Bilder und Text-Bild-Kombinationen, in zwölf Sprachen einschließlich Deutsch. Trainiert auf Sequenzen bis 32K Tokens (theoretisch 256K), lauffähig auf einer einzelnen 16-GB-GPU. Lizenz: Apache 2.0, Gewichte auf Hugging Face, dazu ein technischer Bericht.

Der Sprung liegt bei den Bildern: Auf VLGuard erreicht Shieldstral 97,7 statt 88,5 F1, auf UnsafeBench 81,8 statt 72,6 — jeweils gegen OmniGuard-7B als bisher bestes offenes Modell. Bei reiner Textmoderation reicht ein 3-Mrd.-Modell an GPT-OSS-Safeguard mit 20 Mrd. Parametern heran und schlägt es auf mehreren Suiten. Wichtiger als die Punkte ist aber die Bauform: Richtlinien kommen als freier Text zur Laufzeit hinein, nicht als trainiertes Kategorienschema. Genau daran hängen die laufenden Kosten von Moderation — jede Änderung an einer Plattformregel bedeutete bisher eine neue Trainingsrunde. Und mit Apache 2.0 auf einer 16-GB-Karte wird das Bauteil, das jeder Betreiber eines Sprachmodells braucht, ohne API-Abhängigkeit selbst hostbar. Nicht überall vorn: Beim Erkennen von Verweigerungen verliert Shieldstral in allen drei Suiten gegen GPT-OSS-Safeguard-20B, und auf mehrsprachigen RTP-LX-Prompts fällt es mit 70,3 klar hinter Nemotron-3.5-Content-Safety-4B (86,1) zurück.

3
Aug. 2026
TextGeschlossen

Qwen3.8-Max (Allgemeine Verfügbarkeit)

Alibaba

Alibaba löst die Preview vom 19.07.2026 ab: Qwen3.8-Max ist als reguläres Modell in Alibaba Clouds Model Studio und auf QwenCloud aufrufbar.

Erst mit der allgemeinen Verfügbarkeit nennt Alibaba die Konfiguration — 2,4 Billionen Parameter total, davon rund 95 Mrd. pro Token aktiv, aufgesetzt auf die Architektur von Qwen3.5. Kontextfenster 1 Mio. Tokens, bis zu 131.072 Ausgabe-Tokens, Denkaufwand in drei Stufen (low, medium, xhigh). Der Zugang läuft sowohl über ein OpenAI- als auch über ein Anthropic-kompatibles API-Format. Preise pro 1 Mio. Tokens: $2 Eingabe, $6 Ausgabe, $0,25 bei implizitem Cache-Treffer; explizites Caching kostet $2,50 beim Anlegen und $0,17 beim Lesen. Angekündigt, aber zum Prüfzeitpunkt nicht ausgeliefert: offene Gewichte „in der folgenden Woche“ auf Hugging Face und ModelScope, gemeinsam mit einem Qwen3.8-27B.

Alibaba schickt erstmals ein Modell der Max-Klasse auf den Weg zu offenen Gewichten — bisher blieb die Spitze der Qwen-Reihe geschlossen, offen war nur, was darunter lag. Werden 2,4 Billionen Parameter tatsächlich herunterladbar, verschiebt das die Obergrenze des offenen Feldes weit über Kimi K3 hinaus. Bemerkenswert ist zudem, worauf Alibaba die Werbung stützt: nicht auf Benchmarks, sondern auf Dauerläufe — ein Agent, der 16 Tage lang ein Kommandozeilenwerkzeug pflegt (265 Commits, 127 Pull Requests), Dokumente über 200 Seiten und Videos über 100 Stunden Länge, eine einjährige E-Commerce-Simulation mit 4,16-facher Rendite. Der Maßstab wandert von der Frage, was ein Modell in einer Antwort kann, zu der, was es über Wochen durchhält.

Die offenen Gewichte sind angekündigt, am 06.08.2026 aber nicht veröffentlicht; bis dahin ist das Modell nur über API und Chat nutzbar. Eine Benchmarktabelle veröffentlicht Alibaba weiterhin nicht.

Juli 2026

#32 Releases
31
Juli 2026
TextOffen

DeepSeek-V4-Flash-0731

DeepSeek

Ablösung der V4-Flash-Preview vom 24.04.2026 bei unveränderter Architektur und Größe (284 Mrd. Parameter total, rund 13 Mrd. aktiv, plus Modul für spekulatives Decoding): Laut DeepSeeks eigenem Changelog wurde das Modell nicht neu vortrainiert, sondern ausschließlich neu nachtrainiert („re-post-training").

Der Zugewinn liegt entsprechend bei agentischen Aufgaben — Terminal Bench 2.1 82,7, Cybergym 76,7, Toolathlon-Verified 70,3, DSBench-FullStack 68,7, DSBench-Hard 59,6, DeepSWE 54,4, NL2Repo 54,2, dazu 25,2 auf Agents' Last Exam und 25,1 auf AutomationBench Public. Der Denkaufwand ist in drei Stufen steuerbar (low, high, max), das Kontextfenster bleibt bei 1 Mio. Tokens mit bis zu 384K Ausgabe-Tokens. Neu sind das native Responses-API-Format (nur für Flash, nicht für Pro) und eine Anpassung für den Betrieb unter Codex. Preise: 0,14 USD Eingabe (Cache-Miss), 0,0028 USD bei Cache-Treffer und 0,28 USD Ausgabe pro Mio. Tokens — rund ein Drittel von V4-Pro (0,435/0,87 USD). Auf dem Artificial-Analysis-Intelligence-Index erreicht Flash-0731 in der Stufe max 50 Punkte, V4-Pro 44. Gewichte unter MIT-Lizenz auf Hugging Face.

Das kleine Modell überholt das große aus dem eigenen Haus: 284 Mrd. Parameter schlagen 1,6 Bio. — bei einem Drittel des Preises und ohne eine einzige neue Pre-Training-Runde. Was DeepSeek hier zeigt, ist keine Skalierung, sondern reines Post-Training auf agentische Arbeit: Terminal-Sitzungen, Tool-Aufrufe, Repository-Aufgaben. Für Anwender verschiebt das die Rechnung deutlich, denn genau diese Aufgaben verbrauchen die meisten Tokens, und mit 0,0028 USD pro Mio. Cache-Treffer-Tokens wird ein Agent, der immer wieder denselben Code-Kontext liest, fast kostenlos. Zur absoluten Spitze bleibt Abstand — Claude Opus 5 (max) liegt bei 61, Kimi K3 (max) bei 57 —, aber der Preis pro Punkt Intelligenz ist bemerkenswert. Und die Reihenfolge ist ungewohnt: Das offizielle V4-Pro-Release steht laut DeepSeek noch aus, die kleine Variante läuft vor.

Der API-Zugang läuft als öffentliche Beta. Die V4-Pro-API sowie die App- und Web-Modelle bleiben unverändert; ein offizielles V4-Pro-Release kündigt DeepSeek erst an. Auf der Preisseite ist zudem eine noch nicht aktive Spitzenlast-Tarifierung angekündigt (doppelter Preis während der Pekinger Kernzeiten).

31
Juli 2026
VideoOffen

MiniMax H3

MiniMax

Von MiniMax als „Open-Weights"-Videomodell angekündigt: H3 nimmt Text, Bild, Video und Audio in einer gemeinsamen Anfrage als Kontext (bis 7.000 Zeichen Prompt, bis 9 Referenzbilder, 3 Videoclips, 3 Audioclips — Audio nur zusammen mit Bild oder Video) und gibt natives 2K mit synchronem Stereo-Ton aus, 4 bis 15 Sekunden in ganzzahligen Schritten.

Neben reiner Generierung nennt MiniMax Bearbeitung vorhandener Aufnahmen und Bewegungsübertragung zwischen Videos. Architektonisch führt eine neue „H3-Omni"-Transformer-Struktur Text-zu-Bild, Text-zu-Video, Bild-zu-Video und Audio in einem Rahmen zusammen — laut MiniMax rund 30 % mehr Trainingsdurchsatz —, dazu kommt ein neu entworfener Tokenizer (H3-VAE) mit hoher Kompression. Zum Preis sagt MiniMax nur relativ: 2K koste pro Sekunde weniger als ein Drittel vergleichbarer marktüblicher Modelle. Live ist H3 als „MiniMax-H3" in der API und im MiniMax Hub; die Gewichte sollen „innerhalb weniger Tage" vollständig offengelegt werden.

Wenn die Gewichte tatsächlich kommen, fällt die letzte große Lücke zwischen offenen und geschlossenen Videomodellen: 2K mit nativem, synchronem Stereo-Ton in einem Modell, das man herunterladen kann — bisher das Merkmal der geschlossenen Spitze um Seedance und Veo. Der Zeitpunkt ist kein Zufall: H3 erscheint am Tag des öffentlichen Seedance-2.5-Starts und unterbietet dessen Sekundenpreis nach Herstellerangabe deutlich. Bemerkenswert ist zudem, worauf MiniMax die Architektur ausdrücklich auslegt — Betrieb auf chinesischen Beschleunigern. Offene Gewichte plus heimische Hardware ergeben einen Videostack, der ohne westliche Cloud und ohne Nvidia auskommt.

Gewichte am 31.07.2026 noch nicht veröffentlicht — MiniMax kündigt sie „innerhalb weniger Tage" an; in der MiniMaxAI-Organisation auf Hugging Face existierte zum Prüfzeitpunkt kein öffentlich sichtbares H3-Repository. Eingelöst am 05.08.2026, allerdings unter einer Lizenz, die die EU, das Vereinigte Königreich, Südkorea und die USA ausschließt — dazu der eigene Eintrag „MiniMax H3 (Open Weights)".

31
Juli 2026
VideoGeschlossen

Seedance 2.5 (Öffentlicher Start)

ByteDance

Das am 23.06.2026 vorgestellte Modell geht in den regulären Betrieb, mit eigener Modellseite bei ByteDance Seed. ByteDance beschreibt es dort als gemeinsames Audio-Video-Modell für 30-Sekunden-Erzählungen: bis zu 30 Sekunden in einem Durchgang, zweimal verlängerbar, dazu ruhigere und konsistentere Bewegung.

Referenzvideos werden nicht mehr nur in ihrer Bewegung übernommen, sondern in Absicht, Bildaufbau und filmischer Sprache gelesen; Bearbeitungsanweisungen greifen zuverlässiger und decken jetzt auch Audio ab. Für Produktionsarbeit kommen Weißmodell-Steuerung (Vorgabe von Kamera und Bildaufbau über eine 3D-Rohgeometrie), Green-Screen-Bearbeitung, professionelle Kamerafahrten und Performance-Blocking hinzu. Die Referenzobergrenze von 50 verteilt sich laut Modellkarte auf bis zu 30 Bilder, 10 Videoclips und 10 Audioclips. Preise auf BytePlus ModelArk liegen für einen Fünf-Sekunden-Clip im Format 16:9 bei rund $0,103 pro Sekunde in 480p und $0,231 pro Sekunde in 720p — etwa 47–54 % über Seedance 2.0; 4K steht auf der Preisliste nicht. Ausgeliefert wird gestuft: Jimeng und Doubao zuerst, danach BytePlus Global sowie CapCut/Dreamina.

Der Sprung von der Konferenzankündigung zur buchbaren Rechnung: 30 Sekunden in einem Durchgang mit synchronem Ton sind ab jetzt ein Produkt mit Preisschild, kein Enterprise-Beta-Versprechen. Der Preis ist dabei die eigentliche Nachricht — rund die Hälfte mehr pro Sekunde als Seedance 2.0, während ByteDance bei den Mini-Varianten bis auf $0,02 heruntergeht. Video spreizt sich damit sichtbar in ein Massensegment und ein Produktionssegment. Dorthin zielen auch die neuen Funktionen: Weißmodell-Vorgaben, Green Screen und Blocking sind keine Prompt-Spielereien, sondern Schritte aus einer echten Produktionspipeline — der Versuch, KI-Video vom Zufallstreffer zum planbaren Arbeitsmittel zu machen. Am selben Tag legt MiniMax mit H3 ein offenes Gegenmodell vor.

Gestufter Rollout: Am Starttag zeigten mehrere Plattformen (Dreamina, Runway, Pika) noch „coming soon" oder Warteliste; die BytePlus-API war laut Berichten ab ca. 16.07.2026 zugänglich.

30
Juli 2026
VideoGeschlossen

Gemini Robotics 2 (mit ER 2 und On-Device 2)

Google DeepMind

Drei Modelle in einem Release: Gemini Robotics 2 als Vision-Language-Action-Modell, das nicht mehr nur Arme, sondern den ganzen Körper eines Humanoiden steuert — laufen, sich bücken, strecken und dabei greifen, etwa eine Gießkanne aus dem Regal holen; Gemini Robotics ER 2 als übergeordnete Planungsschicht, die auf einem laufenden Videostream mitdenkt und die Motorik an ein beliebiges VLA-Modell abgibt; Gemini Robotics On-Device 2 als lokal laufende Variante ohne Netzverbindung.

Ein und derselbe Checkpoint steuert laut Google drei verschiedene Roboterkörper; neue Zwei-Arm-Plattformen sind in wenigen Stunden und typischerweise mit unter 200 Beispielen adaptierbar. Erfolgsquoten aus Googles eigenen Tabellen: Ganzkörper-Manipulation auf Apptronik Apollo (Inspire-Hände) 76,3 % aus dem Regal, 68,4 % vom Tisch, 45,7 % vom Boden; mehrfingrige Feinmotorik (SharpaWave-Hände) 92 % Glühbirne herausdrehen, aber nur 36 % hineindrehen und 44 % Mülltüte zuknoten; Greifer-Aufgaben auf Franka Duo 89,6 % bei Präzisionseinsteckvorgängen, 78,9 % beim Bestücken mit wechselnden Werkzeugen. ER 2 erkennt den Fortschritt einer Aufgabe in fünf Stufen mit 57,4 % Trefferquote, findet den Moment eines Ereignisses im Video mit 91,3 % (mittlere Abweichung 0,96 s) und liest zehn Instrumententypen ab. Neu ist der Sicherheits-Benchmark ASIMOV-Agentic, der prüft, ob ein Agent unsichere Tool-Calls verweigert. Verfügbar ist nur ER 2 (Gemini API mit Live-Streaming-Endpunkt, AI Studio, Enterprise-Preview); VLA und On-Device bleiben bei Early-Access-Partnern. Kein Preis veröffentlicht.

Gemini Robotics 1.5 konnte den Oberkörper am Tisch — Version 2 geht von den Füßen bis in die Fingerspitzen und lässt mehrere, auch unterschiedliche Roboter zusammenarbeiten. Interessanter als die Ganzkörpersteuerung ist der eine Checkpoint für mehrere Körper: Wenn dasselbe Modell einen Humanoiden und einen Zwei-Arm-Tischroboter steuert und neue Hardware mit unter 200 Demonstrationen dazukommt, hört Robotik auf, ein Ein-Roboter-ein-Modell-Geschäft zu sein. Genauso aussagekräftig ist, was Google offenlegt: 36 % beim Eindrehen einer Glühbirne und 44 % beim Zuknoten einer Mülltüte sind die Zahlen eines Feldes, das noch nicht funktioniert — Feinmotorik bleibt das ungelöste Problem, nicht das Verstehen der Aufgabe. Und die Arbeitsteilung wird zum Standard: ER 2 sitzt als Planer in der normalen Gemini-API, die Ausführung liegt bei einem beliebigen VLA darunter.

Erstes Gemini-Robotikmodell mit Ganzkörpersteuerung und Kollaboration mehrerer, auch unterschiedlicher Roboter

Nur ER 2 ist allgemein zugänglich (Gemini API / AI Studio, Enterprise-Preview); VLA und On-Device 2 laufen über eine Trusted-Tester-Anmeldung.

29
Juli 2026
AudioGeschlossen

Grok Voice Think Fast 2

xAI

Speech-to-Speech-Modell für Voice-Agenten, das parallel zum Sprechen denkt: Das Reasoning läuft nicht vor der Antwort, sondern während sie schon läuft.

Die Zeit bis zum ersten Ton fällt von 1,25 auf 0,70 Sekunden, der Median-Verbrauch an Reasoning-Tokens auf das 0,4-Fache von Version 1.0 — laut xAI werden Tool-Calls dadurch meist ausgeführt, bevor der Agent seinen ersten Satz beendet hat. Auf dem Speech-to-Speech-Index von Artificial Analysis steigt der Gesamtwert von 75,7 % auf 82,9 % und liegt damit über GPT-Realtime-2.1 (79,1 %) und Gemini 3.1 Flash (69,5 %); die Teilwerte: Agentik (τ-voice Bench) 56,5 % gegen 45,7 % bei GPT-Realtime und 37,7 % bei Gemini, Conversational Dynamics (Full Duplex Bench) 95,1 % — ein Sprung von 77,8 %, aber knapp hinter GPT-Realtime (95,7 %) —, Speech Reasoning (Big Bench Audio) 97,2 %. Bei der Transkription beansprucht xAI über 24 getestete Sprachen die 1,5- bis 2-fache Genauigkeit dedizierter STT-Modelle (Deepgram Nova 3, ElevenLabs Scribe v2) und bei starkem Hintergrundgeräusch etwa das Zehnfache. Per Reinforcement Learning auf Gesprächsdisziplin trainiert: kürzere Sätze, eine Frage auf einmal, weniger Füllwerk. Preis $0,08 pro Audiominute; der Alias „grok-voice-latest" springt am 05.08.2026 auf 2.0.

Sechs Tage nach Grok STT 1.0 dreht xAI die eigene Logik um: Das Speech-to-Speech-Modell transkribiert nach Herstellerangaben genauer als die Spezialmodelle, für die man bisher eine separate Stufe in die Pipeline gebaut hat — und unter Störgeräuschen um eine Größenordnung. Der eigentliche Hebel ist aber das Reasoning parallel zur Sprachausgabe. Bislang war Nachdenken bei Voice-Agenten ein hörbares Loch: Erst Stille, dann Antwort. Wenn Tool-Calls losgehen, während der erste Satz noch läuft, verschwindet der Kompromiss zwischen Latenz und Sorgfalt, der Sprachagenten seit dem Advanced Voice Mode von 2024 im Wesentlichen auf Smalltalk beschränkt hat. Der Vorsprung von 11 Punkten auf GPT-Realtime-2.1 im Agentik-Benchmark bei fast gleicher Gesprächsqualität markiert die Verschiebung: Voice ist nicht mehr die Chat-Oberfläche, sondern die Agenten-Oberfläche.

29
Juli 2026
AudioGeschlossen

Google Lyria 3.5

Google

Nächste Iteration von Googles Musikmodell, ausgeliefert in Flow Music — dem eigenen Musikprodukt, in das Google die Lyria-Generierung aus der Gemini-App herausgelöst hat.

Google nennt vier Verbesserungen: reichere und komplexere Melodiestrukturen, die natürlicher klingen; höhere Textqualität mit besserer Prompt-Treue und struktureller Bewusstheit, also einem Gespür für Strophe, Refrain und Bogen; ausdrucksstärkere und emotional nuanciertere Vocals mit sauberer Aussprache; sowie direktere Kontrolle über Tempo und Länge der Ausgabe. Alle vier Punkte sind qualitative Herstellerangaben — Google veröffentlicht zu diesem Release keine Benchmarks, keine Längenlimits, keine Preis- oder Tarifangaben und keine API-Verfügbarkeit in Gemini API oder Vertex AI.

Kein Fähigkeitssprung, sondern der Beleg für einen Reifeschritt: Nach Lyria 3 (Februar) und Lyria 3 Pro (März) geht es nicht mehr um längere Tracks oder neue Modalitäten, sondern um Musikalität, Textqualität und Steuerbarkeit — genau die Kriterien, an denen sich Suno und Udio messen lassen. Bemerkenswert ist die Verpackung: Musikgenerierung sitzt bei Google nicht mehr als Feature in der Gemini-App, sondern in einem eigenen Produkt mit eigener Domain. Damit tritt Google zum ersten Mal frontal als Musik-Plattform gegen die Suno/Udio-Achse an, statt Musik als Beigabe des Assistenten zu behandeln.

28
Juli 2026
AudioGeschlossen

GPT-Transcribe / GPT-Live-Transcribe

OpenAI

Zwei neue Transkriptionsmodelle in der OpenAI-API, die Whisper als empfohlenen Standard ablösen: GPT-Transcribe für fertige Aufnahmen und Batch-Workloads, GPT-Live-Transcribe für laufende Streams.

GPT-Transcribe liefert auch das Endtranskript einer abgeschlossenen Realtime-Runde; GPT-Live-Transcribe hat eine einstellbare Latenz in fünf Stufen, von „minimal" für Echtzeit-Interaktion bis „xhigh" für maximalen Kontext. Beide nehmen Kontext als Eingabe an: einen freien Prompt zum Thema der Aufnahme, eine Keyword-Liste für Fachbegriffe und Eigennamen sowie mehrere erwartete Sprachen statt einer einzigen. Laut OpenAI fällt die Transkriptionsfehlerrate von GPT-Transcribe gegenüber whisper-1 auf Common Voice (22 Sprachen) von 40,4 % auf 19,3 % und auf realweltlichem Audio (9 Sprachen) von 15,2 % auf 9,0 %; GPT-Live-Transcribe verbessert das Streaming-Vorgängermodell moderater (9,6 % statt 11,7 % auf realem Audio). Preis: $0,0045 pro Minute für Dateien — unter den $0,006 von gpt-4o-transcribe — und $0,017 pro Minute im Streaming. Kein Word-Timestamping, keine Sprechertrennung, keine SRT/VTT-Ausgabe, keine Übersetzung ins Englische: dafür bleiben die Spezialmodelle nötig.

Whisper war seit 2022 die Standardtranskription für Entwickler; hier wird sie zum Legacy-Pfad — bei rund der Hälfte der Fehler und einem niedrigeren Preis als das bisherige Spitzenmodell. Der eigentliche Bruch ist aber der Kontext als Parameter: Wer dem Modell vorab Fachbegriffe, Namen und mögliche Sprachen nennt, gewinnt laut OpenAI 3–6 Prozentpunkte. Transkription wird damit von einem starren Dienst zu einem steuerbaren Schritt in Sprach-Pipelines — und die Trennung in ein Latenz- und ein Genauigkeitsmodell macht die Abwägung, die Entwickler bisher selbst basteln mussten, zur Modellwahl. Fünf Tage nach Grok STT 1.0 ist damit klar: Speech-to-Text ist 2026 wieder ein umkämpftes eigenes Produktfeld, nicht nur ein Nebenprodukt der Voice-Assistenten.

27
Juli 2026
TextOffen

Kimi K3 (Open Weights)

Moonshot AI

Moonshot lädt die vollständigen Gewichte des K3-Flaggschiffs auf Hugging Face: 2,8 Billionen Parameter total, davon rund 104 Mrd. pro Token aktiv, 1.048.576 Token Kontext, ausgeliefert mit nativer MXFP4-Quantisierung und MXFP8-Aktivierungen.

Das Modell ist damit selbst hostbar — allerdings unter einer eigenen „Kimi K3 License", die für kommerzielle Nutzung eine separate Vereinbarung verlangt, nicht unter einer OSI-Lizenz.

Mit 57 Punkten im Intelligence Index von Artificial Analysis ist K3 das stärkste offene Modell, das man herunterladen kann: Platz 1 von 98 Open-Weights-Modellen, vor GLM-5.2 Max (51) und MiniMax-M3 (44). Zur geschlossenen Spitze — Claude Opus 5 mit Max Effort bei 61 — bleiben vier Punkte. Frontier-nahe Intelligenz läuft damit erstmals auf eigener Hardware; der Preis dafür sind hohe Inferenzkosten ($3 / $15 pro 1 Mio. Token in der gehosteten Variante) und mit 33 Token/s eine langsame Ausgabe.

24
Juli 2026
TextGeschlossen

Claude Opus 5

Anthropic

Neues Opus-Flaggschiff mit einstellbarem Effort-Level (niedrig/mittel/hoch), das Nutzende zwischen Intelligenz und Token-Sparsamkeit abwägen lässt; Fast-Modus mit 2,5-facher Geschwindigkeit.

State of the Art auf Frontier-Bench und GDPval-AA, dreifacher Wert des nächstbesten Modells auf ARC-AGI 3, rund 1,5-fache Pass-Rate auf Zapier AutomationBench und bessere Computer-Use-Werte als Claude Fable 5 auf OSWorld 2.0 bei gut einem Drittel der Kosten. Preis unverändert zu Opus 4.8: $5 pro 1 Mio. Input-, $25 pro 1 Mio. Output-Tokens.

Bringt nahezu Frontier-Intelligenz zum halben Preis von Claude Fable 5 — auf CursorBench 3.2 innerhalb von 0,5 % des Fable-5-Spitzenwerts bei halben Kosten pro Aufgabe. Wird zum Standardmodell in Claude Max und zum stärksten Modell in Claude Pro; verifiziert eigene Arbeit und erholt sich laut Anthropic ohne Eingriff von Fehlern, was den Abstimmungsaufwand in agentischen Workflows senkt.

23
Juli 2026
AudioGeschlossen

Grok STT 1.0

xAI

Eigenständiges Speech-to-Text-Modell von xAI: transkribiert Audio in 25 Sprachen — Sprachnotizen, Telefonmitschnitte, Podcasts — mit Wort-Zeitstempeln, optionaler Sprechertrennung (Diarization) und Mehrkanal-Audio.

Batch-Modus für vorliegende Dateien, Streaming-Modus für Echtzeit, über den REST-Endpunkt /v1/stt. Preis: $0,10 pro Stunde im Batch, $0,20 pro Stunde im Streaming.

Löst xAIs Sprachverarbeitung aus der Grok-App und macht sie zu einem versionierten API-Produkt für Entwickler — zu einem Stundenpreis, der Transkription als Vorstufe agentischer Pipelines praktisch zur Randnotiz in der Kostenrechnung macht.

23
Juli 2026
TextGeschlossen

Ling-3.0-flash

Ant Group

Hybrid-Reasoning-MoE von Ant Groups Lab inclusionAI, gebaut für Agenten im Produktionsmaßstab: 124 Mrd. Parameter total, davon nur rund 5,1 Mrd. pro Token aktiv (1/64 der Experten).

Architektur mischt Kimi Delta Attention (KDA) und Multi-head Latent Attention (MLA) im Verhältnis 5:1; Kontextfenster 256K Token, mit 1 Mio. als erklärtem Ziel. Laut Ant erreicht oder schlägt es mit 1/8 der Gesamt- und 1/12 der aktiven Parameter das eigene 1-Billion-Flaggschiff auf den meisten gezeigten Benchmarks. Bis 03.08.2026 kostenlos über OpenRouter und Vercels AI Gateway.

Der bislang deutlichste Effizienzbeleg der Sparse-MoE-Linie: Ein Modell, das ein achtmal größeres Flaggschiff desselben Hauses einholt, verschiebt die Kostenrechnung für hochvolumige Agenten-Workloads — und zeigt, dass chinesische Labs Techniken untereinander übernehmen (KDA stammt aus der Forschung von Moonshot AI, nicht von Ant).

Quelle:x.com
23
Juli 2026
VideoGeschlossen

FLUX 3

Black Forest Labs

Multimodales Frontier-Modell, das gemeinsam über Bild, Video, Audio und Action-Prediction trainiert wurde — nicht mehrere Einzelmodelle hinter einer gemeinsamen Schnittstelle.

Erzeugt laut Berichterstattung bis zu 20 Sekunden Video mitsamt synchronem Ton (Dialog, Soundeffekte, Musik) und hält Produkt- und Materialkonsistenz über Bewegung hinweg. Der Ansatz „Self-Flow“ soll multimodale Generierung und Verstehen innerhalb derselben Architektur ausrichten. Varianten: FLUX 3 Video und FLUX 3 Action (Roboter-Aktionen) im Early Access, FLUX 3 Image in den kommenden Wochen, das offene FLUX 3 Dev später im Jahr 2026.

Erstes Modell, das Video und Ton nicht nachträglich zusammenfügt, sondern gemeinsam aus einem Backbone erzeugt — und dasselbe Fundament über FLUX 3 Action bis in die Robotersteuerung verlängert. Damit verlässt Black Forest Labs die reine Bildgenerierung, mit der es über die FLUX-Reihe bekannt wurde, und stellt Bild, Video, Audio und physische Aktion auf ein einziges Modell.

Erstes Modell mit gemeinsam trainierter Video-, Audio- und Action-Generierung aus einem Backbone.

23
Juli 2026
AudioGeschlossen

MAI-Voice-2-Flash

Microsoft AI

Auf hohes Volumen und niedrige Latenz optimierte Variante von MAI-Voice-2: erzeugt ausdrucksstarke Sprache mit natürlicher Prosodie und hoher akustischer Qualität, dabei laut Microsoft 2× schneller und 32 % günstiger als MAI-Voice-2.

Als Public Preview verfügbar und in Dynamics 365 Contact Center sowie Azure Voice Live integriert; Preis $15 pro 1 Mio. Zeichen. Senkt GPU-Kosten in Contact-Center-Deployments laut Microsoft um bis zu 89 %.

Die bei Build 2026 nur als „coming soon“ angekündigte Flash-Variante von MAI-Voice-2 ist nun verfügbar — ausgelegt auf skalierbare, kostengünstige Echtzeit-Sprachanwendungen (Contact Center, Live-Voice) statt maximaler Qualität pro Einzelaufruf.

23
Juli 2026
BildGeschlossen

MAI-Image-2.5-Pro

Microsoft AI

Bisher fidelity-stärkstes Bildmodell von Microsoft AI: erzeugt hochdetaillierte Bilder aus Text- oder Foto-Prompts, mit Schwerpunkt auf präzisem Editing und akkuratem In-Image-Text-Rendering per natürlicher Sprache.

Als Public Preview über Azure Foundry und das MAI Playground verfügbar. Preise: $5 pro 1 Mio. Text-Input-, $8 pro 1 Mio. Bild-Input- und $106 pro 1 Mio. Bild-Output-Tokens.

Pro-Ausbau der bei Build 2026 vorgestellten MAI-Image-2.5-Linie — Microsofts bislang höchste Bild-Fidelity mit einem laut Ankündigung echten Durchbruch beim zuverlässigen Rendern von Text innerhalb generierter Bilder, ein bekanntes Schwachstellen-Feld der Text-zu-Bild-Modelle.

21
Juli 2026
TextGeschlossen

Fugu-Cyber

Sakana AI

Dritter Endpunkt des Fugu-Orchestrators, auf Security-Reasoning abgestimmt: kein Einzelmodell, sondern ein Multi-Agenten-System, das sich wie ein einzelnes Modell verhält und einen Pool spezialisierter Agenten dynamisch für mehrstufige Security-Aufgaben routet und koordiniert.

Sakana berichtet 86,9 % auf CyberGym (Berkeley-Benchmark mit 1.507 realen Schwachstellen aus 188 OSS-Fuzz-Projekten) und 72,1 % auf Microsofts CTI-REALM. Zugang nur nach Antrag und manueller Prüfung, im Token-Plan und unter aktualisierter Acceptable-Usage-Policy.

Setzt Orchestrierung statt Modellgröße als Hebel: Werte auf Höhe cyber-spezialisierter Frontier-Modelle wie GPT-5.5-Cyber und Mythos-Preview, erreicht durch Koordination vieler kleiner Agenten statt durch ein größeres Basismodell. Zusammen mit Gemini 3.5 Flash Cyber am selben Tag markiert es den Punkt, an dem Cybersecurity zur ersten Domäne mit eigenen, bewusst zugangsbeschränkten Spezialmodellen wird.

21
Juli 2026
TextOffen

Laguna S 2.1

poolside

Offenes MoE-Modell für agentisches Coding: 118 Mrd. Parameter total, davon nur 8 Mrd. pro Token aktiv, bis zu 1 Mio. Token Kontext und getrennte Thinking-/No-Thinking-Modi.

Laut poolside 70,2 % auf Terminal-Bench 2.1 (mit Thinking), 78,5 % auf SWE-Bench Multilingual, 40,4 % auf DeepSWE v1.1 und 46,2 % auf SWE Atlas (Codebase-QnA). Gewichte auf Hugging Face unter OpenMDW-1.1 (BF16 plus FP8- und NVFP4-Quantisierungen), lauffähig auf einer einzelnen NVIDIA DGX Spark.

Das stärkste offene Coding-Modell aus dem Westen und ein Gegenbeispiel zur Größenlogik: Es hält auf Long-Horizon-Coding-Benchmarks gegen Modelle mit einem Vielfachen seiner Parameterzahl mit und ging in unter neun Wochen vom Trainingsstart zum Release. poolside veröffentlicht zu jedem publizierten Benchmark-Wert die vollständigen Trajektorien aller Durchläufe (trajectories.poolside.ai) — ein in dieser Form seltener Transparenzschritt bei Agenten-Benchmarks.

21
Juli 2026
TextGeschlossen

Gemini 3.5 Flash Cyber

Google

Auf 3.5 Flash aufgesetztes, für Security feinjustiertes Modell, das Schwachstellen schnell findet, validiert und patcht — gekoppelt mit Googles CodeMender-Agent.

Da leichte, wiederholte Aufrufe über viele Ausführungspfade hier stärker sind als teure Einzelabfragen großer Modelle, fand es laut DeepMind 55 bestätigte Fehler in der V8-JavaScript-Engine (vs. 47 bei 3.5 Flash, 36 bei Claude Opus 4.6) und eine RCE-Lücke in Google-Cloud-APIs in unter zwei Stunden. Wegen der Dual-Use-Risiken zunächst nur für Regierungen und vertrauenswürdige Partner (Limited-Access-Pilot via CodeMender).

Googles erster öffentlich benannter, auf Cybersecurity spezialisierter Vertical-Finetune — ein Signal, dass die großen Labs beginnen, dedizierte Modelle für einzelne Hochrisiko-Domänen zu veröffentlichen, und diese wegen ihres Dual-Use-Charakters bewusst nur eingeschränkt freigeben.

Googles erster öffentlich benannter, auf Cybersecurity spezialisierter Vertical-Finetune.

21
Juli 2026
TextGeschlossen

Gemini 3.5 Flash-Lite

Google

Schnellstes und kostengünstigstes Modell der 3.5-Klasse, ausgelegt auf hohen Durchsatz und niedrige Latenz (rund 350 Output-Tokens/Sekunde) für agentische Workflows, Suche und Dokumentenverarbeitung.

Preis: $0,30 pro 1 Mio. Input-, $2,50 pro 1 Mio. Output-Tokens. Sofort verfügbar über Gemini API, AI Studio, Android Studio, Gemini Enterprise und die Gemini-App.

Deckt das untere Preis-/Latenz-Segment der neuen Flash-Generation ab und macht Gemini für hochvolumige, kostensensible Agenten- und Batch-Anwendungen attraktiv — bei laut Google deutlichem Sprung in Coding- und Agenten-Aufgaben gegenüber dem Vorgänger.

21
Juli 2026
TextGeschlossen

Gemini 3.6 Flash

Google

Googles neues Workhorse-Modell der Flash-Reihe: verbessert bei Coding, Knowledge Work und Multimodalität, verbraucht rund 17 % weniger Output-Tokens als Gemini 3.5 Flash (bis zu 65 % weniger in einzelnen Benchmarks) und ist günstiger im Preis ($1,50 pro 1 Mio. Input-, $7,50 pro 1 Mio. Output-Tokens, gesenkt von $9,00).

Wissens-Cutoff auf März 2026 vorgezogen; ausgeliefert über Gemini API, AI Studio, Android Studio, Gemini Enterprise und die Gemini-App.

Beerbt Gemini 3.5 Flash direkt als Standard-Arbeitspferd — höhere Token-Effizienz und niedrigere Preise bei besserer Coding-Leistung. Google kündigte parallel an, den „bislang ehrgeizigsten Pre-Training-Lauf“ für Gemini 4 gestartet zu haben, während Gemini 3.5 Pro weiter aussteht.

19
Juli 2026
TextGeschlossen

Qwen3.8-Max (Preview)

Alibaba

Alibabas neues Flaggschiff der Qwen-Reihe mit laut Ankündigung rund 2,4 Billionen Parametern (aktive Parameterzahl und MoE-Konfiguration nicht offengelegt).

Zunächst als Qwen3.8-Max-Preview über Alibaba Cloud (Token Plan), Qoder und QoderWork aufrufbar; das vollständige Modell und offene Gewichte sind laut Alibaba „in Kürze“ geplant.

Vierter Frontier-Launch in elf Tagen (nach Grok 4.5 und GPT-5.6) und Alibabas bislang größtes Modell. Alibaba positioniert es als „nur hinter Fable 5“ — allerdings eine reine Eigenangabe: zum Start lagen keine veröffentlichten oder unabhängigen Benchmarks vor.

18
Juli 2026
BildGeschlossen

Qwen-Image-3.0

Alibaba

Dritte Generation von Alibabas Bildmodell, ausgelegt auf praktisch nutzbare statt nur ästhetische Bilder: verarbeitet Anweisungen von bis zu 4.500 Tokens für informationsdichte Kompositionen in einem Durchgang.

„World Knowledge“-Fähigkeiten — natives Rendering von 12 Sprachen, Reproduktion von Oberflächen wie Webseiten und Livestreams sowie Einbindung aktueller Daten aus dem Netz (z. B. eine Wettergrafik für eine bestimmte Stadt und ein Datum). Zunächst nur über Qwen Chat testbar.

Verschiebt Text-zu-Bild von Deko zu funktionalen, informationsdichten Grafiken mit Weltwissen und Live-Daten. Zugleich ein Bruch mit Alibabas offener Linie: anders als Qwen-Image 1.0/2.0 erscheint 3.0 ohne offene Gewichte, Lizenz, Parameterzahl, Benchmarks oder Technical Report.

16
Juli 2026
TextOffen

Kimi K3

Moonshot AI

Neues MoE-Flaggschiff mit rund 2,8 Billionen Parametern, neuer „Kimi Delta Attention“-Architektur und 1-Mio.-Token-Kontext, ausgelegt auf langlaufendes Coding und Agenten-Workloads.

Zwei Varianten zum Start: K3 Max (Chat/Agent) und K3 Swarm Max (massiv-paralleles Processing). Zum Launch nur über Kimi Code und die Kimi-App (ab ¥199-Tarif) nutzbar; die herunterladbaren Gewichte folgten am 27.07.2026.

Hebt Open-Weights-Modelle auf Frontier-Niveau: laut Moonshot 93,5 % auf GPQA Diamond (stärkstes veröffentlichtes Open-Weight-Ergebnis zum Launch), 91,2 % auf BrowseComp und 88,3 % auf Terminal-Bench 2.1 — agentische Werte, die mit den geschlossenen Spitzenmodellen konkurrieren.

15
Juli 2026
TextOffen

Inkling

Thinking Machines Lab

Erstes Modell von Mira Muratis Thinking Machines Lab — ein quelloffenes „Interaktionsmodell“, das Anfragen über verschiedene Medien hinweg verarbeitet und dabei Kosten gegen Leistung ausbalanciert.

Frei verfügbar (Open-Weights zum Herunterladen und Anpassen); das Unternehmen monetarisiert nicht Inkling selbst, sondern das separate Fine-Tuning-Werkzeug Tinker.

Erster öffentlicher Release von Thinking Machines Lab — über ein Jahr nach der Gründung durch Ex-OpenAI-CTO Mira Murati. Positioniert als menschenzentriertes, anpassbares Open-Weights-Modell (laut Firma „nicht das stärkste“ verfügbare Modell, aber stark unter vergleichbaren Open-Weights). Ein weiterer prominenter Frontier-Lab-Player tritt damit öffentlich an.

Erstes öffentlich verfügbares Modell von Thinking Machines Lab (Mira Murati).

9
Juli 2026
TextGeschlossen

Muse Spark 1.1

Meta (Superintelligence Labs)

Agentisch ausgelegtes multimodales Modell: fortgeschrittenes Reasoning, starke Tool- und Computer-Use-Fähigkeiten, Top-Coding und multimodales Verständnis (Text, Bild, Video, Audio) bei 1-Mio.-Token-Kontext mit aktivem Kontext-Management.

Verfügbar als öffentliche Preview der neuen Meta Model API für Entwickler (OpenAI-kompatibel) sowie im „Thinking"-Modus der Meta-AI-App und auf meta.ai.

Meta positioniert Muse Spark 1.1 als „vollständige agentische Grundlage" — Millionen-Token-Kontext, volle Multimodalität, starkes Reasoning und Coding in einem OpenAI-kompatiblen Paket. Öffnet Metas Superintelligence-Modelle erstmals über eine eigene Entwickler-API.

9
Juli 2026
TextGeschlossen

GPT-5.6 (Sol / Terra / Luna)

OpenAI

Öffentlicher Launch der Modellfamilie mit drei Stufen: Sol (Flaggschiff, $5/$30 pro 1M Token), Terra (ausgewogen, $2,50/$15) und Luna (schnell und günstig, $1/$6).

Ab 09.07.2026 für ChatGPT-, Codex- und API-Nutzer verfügbar. Neu sind zwei Reasoning-Modi — „max" (maximale Denkzeit für Sol) und „ultra" (Subagenten teilen komplexe Aufgaben parallel auf) — sowie explizite Cache-Breakpoints (mind. 30 Min. TTL) und ein verstärkter Safety-Stack.

Sol ist laut OpenAI das bislang stärkste Modell des Hauses mit agentischen Fortschritten in Coding, Biologie und Cybersicherheit; Terra erreicht GPT-5.5-Niveau zum halben Preis. Bemerkenswert ist der Weg dorthin: erst ab 26.06. nur ~20 von der US-Regierung genehmigte Partner im Limited Preview, dann am 09.07. öffentlicher Launch — ein staatlich gesteuerter Zugang, der sich schrittweise öffnete.

Öffentlicher Launch am 09.07.2026 für ChatGPT, Codex und API. Zuvor ab 26.06.2026 nur im Limited Preview für ~20 von der US-Regierung genehmigte Partner; allgemeine Verfügbarkeit (GA) laut OpenAI in den Wochen danach.

8
Juli 2026
TextGeschlossen

Grok 4.5

xAI

Auf dem 1,5-Billionen-Foundation-Modell „V9" aufgebautes Reasoning-Modell mit zusätzlichen Cursor-Trainingsdaten, konfigurierbarem Reasoning-Aufwand sowie Fokus auf Geschwindigkeit und Token-Effizienz. Ab dem 08.07.2026 über die xAI-API verfügbar ($2/$6 pro 1M Token); öffentlicher Rollout ab 09.07.2026.

xAI positioniert Grok 4.5 als „Opus-Klasse" — schneller, token-effizienter und günstiger. Wichtig: Die Leistungsaussagen sind Eigenangaben von xAI/Musk; zum Launch lagen keine unabhängigen oder öffentlichen Benchmarks vor.

Quelle:x.ai
8
Juli 2026
BildGeschlossen

Seedream 5.0 Pro

ByteDance

Multimodales Bild-Erzeugungsmodell mit durchgängigen Verbesserungen bei Bild-Text-Ausrichtung, Struktur, Textrendering und Ästhetik.

Vier Kern-Neuerungen: komplexe Informations-Visualisierung (verwandelt Daten, Konzepte und dichten Text in professionelle Layouts), interaktives pixelgenaues Editieren mit räumlichem Verständnis (Grounding), intelligente Ebenen-Trennung (zerlegt ein Poster in 10+ Layer — Text, Motive, Hintergründe, Deko) und Multi-Image-Fusion. Nativ mehrsprachig (über 10 Sprachen).

Verschiebt Text-zu-Bild von reiner Generierung zu echtem Design-Verständnis: Layout, editierbare Ebenen und komponierbare Bildteile statt nur eines fertigen Bildes — direkt anschlussfähig an professionelle Design-Workflows.

8
Juli 2026
AudioGeschlossen

GPT-Live (GPT-Live-1 / mini)

OpenAI

Neue Generation von Sprachmodellen mit Full-Duplex-Architektur — hört und spricht gleichzeitig, signalisiert Aufmerksamkeit („mhmm", „yeah"), erlaubt schnelles Hin und Her und lässt Pausen zu. Treibt ab sofort ChatGPT Voice an; zwei Varianten (GPT-Live-1 und GPT-Live-1 mini), globaler Rollout für ChatGPT-Nutzer, API in Kürze.

Verschiebt Sprach-KI vom turn-basierten Wechsel zum echten, gleichzeitigen Gespräch — Zuhören und Sprechen parallel statt abwechselnd — und macht die Voice-Interaktion mit ChatGPT deutlich natürlicher.

Erste Full-Duplex-Sprachmodellfamilie von OpenAI (gleichzeitiges Hören und Sprechen) für ChatGPT Voice.

8
Juli 2026
TextGeschlossen

SWE-1.7 (Cognition)

Cognition

Coding- und Agenten-Modell auf Frontier-Niveau zu deutlich geringeren Kosten, speziell für langlaufende asynchrone Software-Aufgaben optimiert.

Ab sofort in Devin (Web, Desktop, CLI) über Cerebras mit 1000 Tokens/Sek. verfügbar. Benchmarks: FrontierCode 1.1 Main 42,3 %, Terminal-Bench 2.1 81,5 %, SWE-Bench Multilingual 77,8 %.

Cognition zeigt mit weiteren großen Zuwächsen aus eigenem Post-Training, dass ein vermeintliches „Post-Training-Ceiling" nicht existiert — Reinforcement Learning treibt agentische Coding-Fähigkeiten weiter als bislang angenommen, und das bei 1000 TPS im Devin-Agenten.

7
Juli 2026
BildGeschlossen

Muse Image

Meta (Superintelligence Labs)

Erstes Bildgenerierungsmodell aus den Meta Superintelligence Labs.

Fortgeschrittenes Prompt-Verständnis (Reasoning), Foto-Blending, verlässliches Textrendering, Bildbearbeitung mit Markup-Werkzeugen und @-Mention-Integration für Instagram-Profile. In Meta AI verfügbar, Rollout auf Facebook, Messenger, Instagram und WhatsApp; kostenlos für alltägliche Nutzung, erweiterte Nutzung über Meta-Abos, für Werbetreibende via Meta Advantage+ Creative angekündigt.

Bringt integrierte, reasoning-gestützte Bilderzeugung und -bearbeitung direkt in Metas Massen-Apps mit Milliarden Nutzern — und ist das erste Bildmodell aus Metas neuem Superintelligence-Labs-Stack.

Erstes Bildgenerierungsmodell der Meta Superintelligence Labs.

6
Juli 2026
TextOffen

Hy3 (Hunyuan)

Tencent (Hunyuan)

Offizielle Version des Hunyuan-Hy3: 295B-MoE-Modell mit 21B aktiven Parametern und 256K-Kontext, veröffentlicht unter Apache-2.0-Lizenz. Gegenüber der Preview (23.04.) weitere Fortschritte bei Code-Generierung und Agenten-Fähigkeiten sowie mehr Stabilität; API über Tencent Cloud TokenHub.

Erreicht laut Tencent flagship-nahe Intelligenz bei 2–5× kleinerem Parameter-Budget.

Kleines, effizientes Open-Weights-Modell (nur 21B aktiv), das an die Leistung deutlich größerer Flaggschiffe heranreicht — mit permissiver Apache-2.0-Lizenz und Fokus auf Agenten, Coding und Reasoning für den praktischen, kostengünstigen Einsatz.

1
Juli 2026
TextGeschlossen

Claude Fable 5 (Wiederveröffentlichung)

Anthropic

Nach 19 Tagen offline wieder global verfügbar: Anthropic bringt Fable 5 am 01.07.2026 auf Claude-Plattform, Claude.ai, Claude Code und Claude Cowork zurück — mit einem neuen Sicherheits-Klassifikator, der die zur Sperre führende Technik (Umgehung der Safeguards zur Schwachstellensuche) in über 99 % der Fälle blockiert.

Erster Fall, in dem ein Frontier-Modell per US-Exportkontrolle vom Netz genommen und später wieder freigegeben wurde: am 12.06.2026 nach einem Amazon-Sicherheitsbericht sofort gesperrt (Fable 5 und Mythos 5), am 30.06. Kontrollen aufgehoben, am 01.07. redeployed. Zeigt, wie unmittelbar Regulierung und Sicherheitsbefunde die Verfügbarkeit von Spitzenmodellen steuern können.

Erstes Frontier-Modell, das durch eine US-Exportkontrolle vorübergehend abgeschaltet und nach Aufhebung wieder in Betrieb genommen wurde.

Juni 2026

#21 Releases
30
Juni 2026
BildGeschlossen

Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)

Google DeepMind

Schnellste und günstigste Variante der Nano-Banana-2-Reihe für Bilderzeugung und -bearbeitung: rund 4 Sekunden Latenz, $0,034 pro 1.000 Bilder.

Verfügbar in Google AI Studio, der Gemini-API, der Gemini Enterprise Agent Platform und über Consumer-Flächen (Suche, Gemini-App, Google Photos, NotebookLM, Stitch, Google Flow, Google Ads).

Drückt hochwertige Text-zu-Bild-Generierung auf Bruchteile eines Cents pro Bild bei ~4 Sekunden Latenz und macht sie damit für Massen- und Echtzeit-Anwendungen quer durch Googles Produktpalette praktikabel.

30
Juni 2026
TextGeschlossen

Claude Sonnet 5

Anthropic

Bisher agentischstes Sonnet-Modell: plant eigenständig, nutzt Werkzeuge wie Browser und Terminals und arbeitet autonom auf einem Niveau, das vor wenigen Monaten noch größere, teurere Modelle erforderte.

Einführungspreis 2/10 USD pro Mio. Tokens (regulär 3/15, bis 31.08.2026) und neues Standardmodell für Free- und Pro-Nutzer.

Erreicht annähernd die Leistung von Opus 4.8 zu deutlich niedrigerem Preis — die Grenze zwischen mittlerer Sonnet- und Spitzen-Opus-Klasse verschwimmt weiter. Agentische Fähigkeiten (Coding, Tool-Use, Reasoning) werden damit für breite, kostensensible Einsätze praktikabel.

29
Juni 2026
TextOffen

LongCat-2.0

Meituan

Quelloffenes 1,6-Billionen-Parameter-MoE-Modell (aktiviert ~48B Parameter pro Token, 33–56B je nach Komplexität) mit nativem 1-Mio.-Token-Kontext, veröffentlicht unter MIT-Lizenz auf GitHub und Hugging Face.

Auf agentisches Coding ausgelegt: SWE-bench Pro 59,5, Terminal-Bench 70,8.

Bringt ein Open-Weights-Modell nahe an die Frontier-Coding-Leistung geschlossener Spitzenmodelle (SWE-bench Pro 59,5 vs. 58,6 bei GPT-5.5) — und ist laut Meituan das erste Billionen-Parameter-Modell, das vollständig auf einem inländischen chinesischen Chip-Cluster (~50.000 Karten) trainiert und betrieben wurde.

Erstes Billionen-Parameter-Modell, das komplett auf inländischen chinesischen KI-Chips trainiert und ausgeführt wird.

25
Juni 2026
TextOffen

Ornith-1.0

DeepReinforce

Selbst-verbessernde, quelloffene Modellfamilie für agentisches Programmieren — vom 9B-Dense-Modell für Edge-Geräte bis zum 397B-MoE-Spitzenmodell (zudem 31B Dense und 35B MoE), aufgebaut auf Gemma 4 und Qwen 3.5.

Neuartiger Trainingsansatz: Im RL erzeugt das Modell nicht nur die Lösung, sondern auch das aufgabenspezifische Scaffold (den Harness), das diese Lösung steuert, und optimiert beides gemeinsam. Das 397B-Modell erreicht 77,5 auf Terminal-Bench 2.1 und 82,4 auf SWE-Bench Verified.

Erste offene Modellfamilie, die ihren eigenen RL-Harness lernt statt eines von Hand gebauten — ein neuer Pfad zu selbst-verbesserndem Training. Setzt den Open-Source-Bestwert für agentisches Coding über mehrere Größen und erreicht das Niveau der vorigen Frontier-Generation (Claude Opus 4.7); das 9B-Edge-Modell schlägt deutlich größere Modelle wie Gemma 4-31B.

Erste offene Modellfamilie, die ihre eigenen RL-Scaffolds (Task-Harnesses) lernt

Offene Gewichte (MIT) auf Hugging Face verfügbar.

24
Juni 2026
TextGeschlossen

Seed 2.1 Turbo

ByteDance (Volcano Engine / Doubao)

Schnellere, günstigere Variante von Seed 2.1 Pro für hochfrequente Enterprise-Workloads — etwa halber Preis bei auf Durchsatz optimierter Latenz.

Bringt die Seed-2.1-Generation (Coding, Agent, multimodales Verständnis) in den Hochvolumen-Produktivbetrieb und senkt die Kosten pro Aufgabe für Agenten-Pipelines im großen Maßstab.

24
Juni 2026
TextGeschlossen

Seed 2.1 Pro

ByteDance (Volcano Engine / Doubao)

Für „Coding und Agent" ausgelegtes Flaggschiff-Modell mit Fortschritten bei Engineering-Lieferung, Agent-Aufgaben über lange Ketten und multimodalem Verständnis.

Verfügbar über Volcano Engine / Volcano Ark; Preis ca. 6 Yuan (~$0,85) pro Mio. Input- und 30 Yuan (~$4,15) pro Mio. Output-Tokens.

ByteDance positioniert Seed 2.1 Pro als auf mehreren Coding-, Agent- und Multimodal-Benchmarks mit Claude Opus 4.6 konkurrenzfähig — bei rund 80 % niedrigeren Gesamtkosten. Drückt den Preis für agentische Frontier-Coding-Leistung weiter nach unten.

23
Juni 2026
VideoGeschlossen

Seedance 2.5

ByteDance

Seedance 2.5 erzeugt in einem einzigen Durchgang einen nativen Clip von bis zu 30 Sekunden — ohne Stitching, ohne Schnittkanten — und verarbeitet dabei bis zu 50 multimodale Referenzen (Bilder, Video, Audio, 3D-Blockouts und Stil-Vorlagen) gleichzeitig.

Neu sind lokales Editieren (Hintergrund, Produkt oder Person in einer Bildregion tauschen, ohne den Rest des Frames neu zu generieren) und 3D-Blockout-Eingabe, um Kamera und Bildaufbau vorab festzulegen. Rund 20 % bessere Prompt-Treue gegenüber Seedance 2.0; native 4K-Ausgabe wird berichtet, aber nicht offiziell bestätigt.

Verdoppelt die native Clip-Länge auf 30 Sekunden in einem Durchgang und vervierfacht die Referenz-Eingaben (12 → 50) — der bislang längste nahtlose KI-Clip und ein neuer Standard für gesteuerte, mehrfach referenzierte Generierung mit regionalem Editieren. Vorgestellt auf der Volcano-Engine-FORCE-Konferenz neben Seedream 5.0, der Seed-2.1-Familie und einem 4K-Upgrade von Seedance 2.0. Seedance 2.0 führt weiter die Artificial-Analysis-Bestenliste an; 2.5 baut diesen Vorsprung aus.

Erster nativer 30-Sekunden-Clip in einem einzigen Durchgang

Damals globale Enterprise-Beta; der öffentliche Start erfolgte am 31.07.2026 — siehe eigener Eintrag.

22
Juni 2026
TextGeschlossen

GPT-5.5-Cyber

OpenAI

Auf Cybersicherheit spezialisiertes Modell, das Schwachstellen in großen Codebasen nicht nur findet, sondern in einer kontrollierten Sandbox validiert und anschließend Patches entwickelt und testet — ein durchgehender Erkennen-→-Beheben-Workflow.

Laut OpenAI das bislang stärkste Modell zum Auffinden und Patchen von Software-Schwachstellen. Voll freigeschaltet am 22.06.2026 zusammen mit der Initiative „Patch the Planet" und einem Cyber Partner Program.

Verschiebt den Schwerpunkt von reiner Erkennung zur automatisierten Behebung — KI patcht Sicherheitslücken, statt sie nur aufzuspüren. OpenAIs Antwort auf Anthropics Mythos im Wettlauf um defensive Cyber-KI. Der Zugang ist streng beschränkt über „Trusted Access for Cyber" (geprüfte Organisationen, verpflichtende Advanced Account Security), um Missbrauch für Angriffe zu begrenzen.

Kein offener Zugang — nur für verifizierte Verteidiger über „Trusted Access for Cyber" (Advanced Account Security verpflichtend).

17
Juni 2026
VideoGeschlossen

Qwen-Robot Suite

Alibaba (Qwen)

Alibabas erstes umfassendes Robotik-Paket: drei Foundation-Models für verkörperte KI — Qwen-RobotNav (Navigation per Sprachbefehl), Qwen-RobotManip (Greifarm-Steuerung) und Qwen-RobotWorld (Diffusions-Weltmodell für physikalische Simulation, trainiert auf 8,6 Mio. Video-Text-Paaren, 20+ Roboter-Typen).

Holt generative KI aus dem Bildschirm in die physische Welt: Sprachsteuerung, Greifen und ein Video-Weltmodell zur Simulation in einem Stack. Qwen-RobotManip führt laut Alibaba den RoboChallenge-Generalisten-Track (59,83 %). Derzeit Pilot mit ausgewählten Alibaba-Cloud-Kunden.

Erstes umfassendes Robotik-/Embodied-Modellpaket von Alibaba (Qwen)

16
Juni 2026
VideoGeschlossen

Seedance 2.0 Mini

ByteDance (Dreamina)

Leichtere, schnellere und günstigere Variante von Seedance 2.0 — rund 2× schneller als Seedance 2.0 Fast, 720p–1080p, 5–12 Sekunden, ab $0,02/Sek.

Drückt den Preis für hochwertige KI-Videogenerierung auf wenige Cent pro Sekunde und macht Kurzform-Video damit für die breite Masse zugänglich.

Quelle:x.com
13
Juni 2026
TextOffen

GLM-5.2

Zhipu AI (Z.ai)

Agentisch ausgerichtetes Coding-Modell auf Basis derselben 744B-MoE-Architektur wie GLM-5, mit einem nutzbaren Kontextfenster von 1M Tokens, bis zu 131.072 Output-Tokens und einem neuen System mit zwei Reasoning-Stufen (High und Max).

GLM-5.2 verschiebt die Grenze für Open-Weights-Modelle bei langlebigen Coding-Aufgaben auf Repository-Ebene und erlaubt durch das 1M-Kontextfenster vollständige Plan-then-Execute-Durchläufe. Es ist out of the box mit Claude Code, Cline, OpenCode, Goose und weiteren Agenten-Harnesses kompatibel und treibt Zhipus eigene Coding-Produkte an.

12
Juni 2026
TextOffen

Kimi K2.7 Code

Moonshot AI

Coding-fokussiertes agentisches MoE-Modell mit 1T Total-Parametern (32B aktiv, 384 Experts) und 256K-Kontextfenster, das mehrstufig plant, editiert, Tools ausführt und debuggt.

Reduziert die Zahl der Thinking-Tokens gegenüber K2.6 um rund 30 Prozent.

K2.7 Code ist Moonshots fünfte große Release in unter einem Jahr und meldet +21,8 % auf Kimi Code Bench v2 sowie deutliche Zuwächse bei der MCP-Tool-Nutzung gegenüber K2.6 - ein Open-Weights-Modell, das bei agentischem Coding mit proprietären Spitzenmodellen konkurriert, bei zugleich höherer Token-Effizienz.

10
Juni 2026
TextOffen

DiffusionGemma 26B-A4B

Google DeepMind

Experimentelles offenes Text-Diffusion-Modell auf Gemma-4-Basis mit 26B MoE-Parametern (rund 3,8B aktiv), das 256-Token-Blöcke parallel statt sequenziell generiert und so bis zu 4x schnellere Textgenerierung erreicht (über 1.000 Tokens/s auf einer einzelnen H100).

DiffusionGemma bringt das aus der Bildgenerierung bekannte Diffusionsprinzip in ein großes offenes Sprachmodell: Durch bidirektionale Attention kann das Modell unsichere Tokens neu 'verrauschen' und korrigieren. Google positioniert es bewusst als experimentell (geringere Qualität als das autoregressive Gemma 4), demonstriert aber einen alternativen Generierungspfad mit massivem Geschwindigkeitsvorteil.

Erstes großes Open-Weights-Text-Diffusionsmodell von Google, das Text in parallelen Blöcken statt autoregressiv Token für Token erzeugt.

9
Juni 2026
TextGeschlossen

Claude Fable 5

Anthropic

Anthropics bis dahin fähigstes öffentlich verfügbares Modell, das die neue Mythos-Klasse oberhalb der Opus-Klasse breit zugänglich macht.

State-of-the-Art in nahezu allen getesteten Benchmarks, mit besonderer Stärke bei Software-Engineering, Knowledge Work, Vision und autonomer Aufgabenausführung; auf manchen Benchmarks über 10 % besser als Opus 4.8.

Mit Fable 5 brachte Anthropic erstmals Mythos-Klasse-Fähigkeit in die allgemeine Nutzung – nur wenige Tage nach einer eigenen Warnung, dass KI zu gefährlich werde. Das Modell startete mit konservativen Schutzmechanismen (Anfragen zu Cyber, Chemie und Biologie werden teils an Opus 4.8 umgeleitet) und definierte ein neues oberes Leistungssegment.

Erstes öffentlich zugängliches Modell der Mythos-Klasse von Anthropic (oberhalb der Opus-Klasse).

Derzeit wegen US-Regulierung nicht verfügbar (Stand: 14. Juni 2026). Kann sich künftig ändern.

3
Juni 2026
BildOffen

Ideogram 4.0

Ideogram

Erstes Open-Weights-Foundation-Modell von Ideogram (9.3B, Single-Stream-Diffusion-Transformer mit 34 Layern und Qwen3-VL-8B-Instruct als Text-Encoder), spezialisiert auf Design-Arbeit: branchenfuehrendes Text-Rendering (0.97 X-Omni English OCR), Bounding-Box-Layout-Kontrolle, strukturiertes JSON-Prompting, native Transparenz und 2K-Aufloesung; laeuft mit Quantisierung auf einer einzelnen 24-GB-GPU.

Schloss die Qualitaetsluecke zwischen proprietaeren Frontier-Bildmodellen und dem offenen Oekosystem fuer typografie- und designlastige Aufgaben und belegte als bestes Open-Weights-Modell sofort die Spitze der DesignArena-Bestenliste in dieser Kategorie.

Erstes Open-Weights-Modell von Ideogram, das seine Spitzentechnologie fuer Design- und Text-Rendering oeffentlich freigab.

2
Juni 2026
TextGeschlossen

MAI-Code-1-Flash

Microsoft AI

Erstes hauseigenes Coding-Modell von Microsoft AI: ein inference-effizientes, agentisches Code-Modell mit 5 Mrd. aktiven Parametern, tief in GitHub Copilot und VS Code integriert.

Erreicht 51% auf SWE-Bench Pro bei deutlich geringeren Kosten (Größenordnung vergleichbar mit Haiku).

MAI-Code-1-Flash erweiterte die MAI-Familie erstmals um ein spezialisiertes Coding-Modell und bringt hauseigene Microsoft-Modelle direkt in die Entwickler-Workflows von GitHub Copilot und VS Code, ein weiterer Baustein der Lösung von OpenAI-Abhängigkeit.

Erstes hauseigenes, agentisches Coding-Modell von Microsoft AI.

2
Juni 2026
AudioGeschlossen

MAI-Voice-2

Microsoft AI

Bisher ausdrucksstärkstes, natürlich klingendes Text-to-Speech-Modell von Microsoft AI.

Unterstützt 15 Sprachen, granulare Emotionssteuerung über Emotion-Tags, Zero-Shot-Voice-Prompting per Referenzaudio sowie Code-Switching für ausgewählte Sprachpaare; niedrige Latenz auch über lange Generierungen.

MAI-Voice-2 hob Microsofts hauseigene Sprachsynthese auf ein neues Qualitäts- und Steuerbarkeitsniveau und war Teil der sieben bei Build 2026 vorgestellten MAI-Modelle, die Microsofts eigenständige Modellstrategie untermauerten.

2
Juni 2026
BildGeschlossen

MAI-Image-2.5

Microsoft AI

Hauseigenes Bildmodell für maximale Fidelity, das sowohl Text-to-Image als auch präzises, kontrollierbares Image-Editing beherrscht.

Versteht Szenenstruktur, Licht, Massstab und räumliche Beziehungen; erreichte #3 bei Text-to-Image und #2 auf Arenas Image-Edit-Bestenliste und übertraf Nano Banana Pro.

MAI-Image-2.5 war Teil der sieben bei Build 2026 vorgestellten MAI-Modelle und brachte erstmals echtes In-Context-Image-Editing in Microsofts hauseigene Bild-Pipeline, mit Spitzenwerten auf den Arena-Bestenlisten.

2
Juni 2026
TextGeschlossen

MAI-Thinking-1

Microsoft AI

Sparse-MoE-Reasoning-Modell mit rund 35B aktiven und etwa 1T Total-Parametern und 256K-Kontextfenster, ausgelegt auf mehrstufige agentische Aufgaben; vollständig auf kommerziell lizenzierten, nachvollziehbaren Daten trainiert, ohne Distillation aus Drittmodellen.

MAI-Thinking-1 ist Microsofts erstes vollwertiges, intern entwickeltes Reasoning-Modell und markiert die Loslösung von OpenAI-Abhängigkeit: Auf SWE-Bench Pro liegt es etwa auf dem Niveau von Claude Opus 4.6 und wird in Blindvergleichen gegenüber Sonnet 4.6 bevorzugt. Trainiert ohne Distillation aus Drittmodellen, betont es saubere Datenherkunft.

Erstes von Microsoft AI vollständig in-house entwickeltes Reasoning-/Thinking-Modell, trainiert ohne Distillation aus Drittanbieter-Modellen.

1
Juni 2026
VideoGeschlossen

Grok Imagine Video 1.5

xAI

Bild-zu-Video-Modell: animiert ein Standbild zu flüssigem Clip (1–15 Sek., 480p/720p) und erzeugt dabei in einem Durchgang synchronen Ton — Geräusche, Atmosphäre und lippensynchrone Sprache.

xAIs erster ernsthafter Vorstoß in die Liga der Video-Generatoren mit nativem Ton — Bewegtbild samt Soundtrack direkt aus einem Foto, integriert in Grok.

1
Juni 2026
TextOffen

MiniMax M3

MiniMax

Nativ multimodales Open-Weights-Modell mit der neuen MSA-Architektur (MiniMax Sparse Attention), 1M-Kontextfenster, Bild- und Video-Input sowie Computer-Use, das Frontier-Coding (SWE-Bench Pro 59,0 %) mit langlaufender autonomer Ausführung über 24+ Stunden verbindet.

MiniMax bezeichnet M3 als erstes und einziges Open-Weights-Modell, das Frontier-Coding, langes Kontextfenster und native Multimodalität in einer Architektur vereint. Der Per-Token-Rechenaufwand sinkt durch MSA auf etwa 1/20 der Vorgängergeneration, was extrem lange agentische Workflows wirtschaftlich macht.

Laut MiniMax erstes Open-Weights-Modell, das Frontier-Coding, 1M-Kontext und native Multimodalität in einer einzigen Architektur kombiniert.

Mai 2026

#10 Releases
29
Mai 2026
TextOffen

Step 3.7 Flash

StepFun

Vision-Language-MoE-Modell mit 198B Total-Parametern (rund 11B aktiv), das einen 1,8B-Vision-Encoder mit einem 196B-Sprach-Backbone koppelt und Charts, PDFs, UI-Wireframes und App-GUIs ohne separate Vision-API verarbeitet.

Ausgelegt auf Coding-Agenten und Such-Workflows.

Step 3.7 Flash zeigt, dass ein vergleichsweise kompaktes chinesisches MoE-Modell größere Rivalen schlagen kann: Es meldet eine 100-prozentige Tool-Call-Erfolgsrate und SWE-Bench-Pro-Werte oberhalb von DeepSeek V4 Flash und Gemini 3.5 Flash - bei Auslieferung unter Apache 2.0.

28
Mai 2026
TextGeschlossen

Claude Opus 4.8

Anthropic

Modell der Opus-Klasse mit Schwerpunkt auf Ehrlichkeit und Zuverlässigkeit: laut Anthropic rund viermal seltener als Opus 4.7 dabei, selbst geschriebene Code-Fehler unkommentiert durchgehen zu lassen.

Dazu kommen bessere Reasoning-Werte, ein Fast-Modus mit 2,5-facher Geschwindigkeit und 84 % auf dem Browser-Agenten-Benchmark Online-Mind2Web.

Opus 4.8 verschob den Fokus von reiner Benchmark-Leistung hin zu verlässlicher, ehrlicher Code-Generierung und reduzierte fehlerhaftes (deceptive) Verhalten deutlich, was für den produktiven Einsatz in agentischen Coding-Workflows entscheidend ist.

26
Mai 2026
AudioGeschlossen

ElevenLabs Music v2

ElevenLabs

Neues Musikgenerierungsmodell, das innerhalb eines einzelnen Songs das Genre wechseln kann (etwa von Oper zu Heavy Metal und zurueck), schnellen Rap und dichte Textlieferung beherrscht und nicht-musikalische Soundeffekte direkt in den Track einbettet, ohne die musikalische Kohaerenz zu verlieren.

Verbessertes Inpainting erlaubt das gezielte Neugenerieren einzelner Abschnitte (z. B. nur der Bridge), und Songs lassen sich Abschnitt fuer Abschnitt aufbauen. Trainiert auf lizenzierten, kommerziell freigegebenen Daten.

Music v2 hob KI-Musik von kurzen Clips auf vollstaendige, strukturierte Songs mit dynamischen Genrewechseln und kommerzieller Rechtsfreigabe ohne Sync-Gebuehren und positionierte ElevenLabs als direkten Wettbewerber zu Suno und Udio.

20
Mai 2026
TextGeschlossen

Grok Build 0.1

xAI

Agentisches Coding-Modell, von Grund auf für End-to-End-Softwareentwicklung trainiert: plant Aufgaben, führt sie schrittweise aus, debuggt selbst und bindet Entwickler-Tools über MCP ein.

Treibt die Grok-Build-CLI an, ab Anfang Juni 2026 öffentlich per API.

xAIs erstes eigenständiges Coding-Modell für autonome Software-Agenten — Eintritt ins Rennen um agentische Programmierung gegen Claude Code, Codex & Co.

20
Mai 2026
AudioOffen

Stable Audio 3.0

Stability AI

Modellfamilie zur Audiogenerierung aus vier Modellen: Small SFX, Small, Medium und Large.

Erzeugt vollstaendige Kompositionen von bis zu rund sechs Minuten mit erhaltener musikalischer Struktur, mit Variable-Length-Generierung, Audio-Inpainting (Segment-Editing und Fortsetzung) sowie LoRA-Fine-Tuning. Trainiert ausschliesslich auf lizenzierten und Creative-Commons-Daten.

Mit dem Sprung von zuvor 47-sekuendigen Clips (Stable Audio Open) auf strukturierte Sechsminueter und der Freigabe von Open Weights fuer Small und Medium, die auf Consumer-Hardware laufen, wurde leistungsfaehige, kommerziell nutzbare Musikgenerierung lokal und rechtssicher verfuegbar.

19
Mai 2026
TextGeschlossen

Gemini Spark

Google

Immer aktiver persönlicher Agent auf Google-Cloud-VMs, der Langzeit-Aufgaben über Gmail/Docs/Slides und Dritt-Apps via MCP ausführt.

Der Consumer-„agentische Ära"-Launch der I/O 2026.

19
Mai 2026
VideoGeschlossen

Gemini Omni Flash

Google DeepMind

Gemini Omni Flash ist das erste Modell der Gemini-Omni-Familie und erzeugt aus beliebiger Kombination von Bild, Audio, Video und Text hochwertige Videos von rund 10 Sekunden mit synchronem Audio.

Es ermöglicht konversationelles Editieren der Clips, hält Charakter- und Szenenkonsistenz, ist in Gemins Weltwissen verankert und bettet ein SynthID-Wasserzeichen ein.

Google verschob die Videogenerierung von der separaten Veo-Linie in die Gemini-Familie und verband generative Medien direkt mit dem Weltwissen und der konversationellen Bearbeitung des Sprachmodells. Mit sofortiger Verfügbarkeit in Gemini-App, Google Flow und YouTube Shorts brachte es multimodale Video-Erzeugung und chatbasiertes Editieren in Massendistribution.

Erstes Modell der Gemini-Omni-Familie, das generative Medien mit Gemins Weltwissen vereint und Video aus jeder Eingabemodalität per Konversation erzeugt und editiert.

Öffentliche Preview (gemini-omni-flash-preview) mit Preis $0,10 pro Sekunde Video am 30.06.2026 gestartet.

19
Mai 2026
TextGeschlossen

Qwen3.7-Max

Alibaba (Qwen)

Alibabas proprietäres Flaggschiff-Modell für die Agenten-Ära mit 1-Mio.-Token-Kontextfenster, ausgelegt auf Coding-Agenten, Büro-Automatisierung und Langzeit-Autonomie.

Demonstriert wurde ein 35-stündiger, vollständig autonomer Kernel-Optimierungslauf mit über 1.000 Tool-Calls; starke Werte auf SWE-Pro (60,6) und SWE-Multilingual (78,3).

Qwen3.7-Max brachte Alibaba als ersten chinesischen Anbieter an die Spitze einer großen Intelligenz-Rangliste und zeigte, dass lange autonome Aufgabenausführung über Stunden hinweg praktikabel wird. Es untermauerte die rasche Aufholjagd chinesischer Labore bei agentischen Frontier-Modellen.

19
Mai 2026
TextGeschlossen

Gemini 3.5 Flash

Google

Schnelles, kostengünstiges Modell der neuen Gemini-3.5-Generation, das auf agentischen und Coding-Benchmarks (Terminal-Bench 2.1 mit 76,2 %, MCP Atlas mit 83,6 %) das vorherige Gemini 3.1 Pro übertrifft und dabei rund viermal schneller läuft als andere Frontier-Modelle derselben Stufe.

Kontextfenster ~1 Mio. Tokens, multimodal (Text, Bild, Audio, Video).

Auf der Google I/O 2026 vorgestellt und am selben Tag allgemein verfügbar, zeigte Gemini 3.5 Flash, dass ein Modell der schnellen, günstigen Stufe das Pro-Modell der Vorgängergeneration schlagen kann, und verschärfte den Wettbewerb um effiziente agentische Modelle.

7
Mai 2026
AudioGeschlossen

OpenAI gpt-realtime-2 (mit gpt-realtime-translate und gpt-realtime-whisper)

OpenAI

Drei neue Audiomodelle in der API.

gpt-realtime-2 ist OpenAIs erstes Sprachmodell mit GPT-5-Klasse-Reasoning, einem 128.000-Token-Kontextfenster und einstellbarem Reasoning-Aufwand fuer Live-Sprachdialoge. gpt-realtime-translate uebersetzt gesprochene Sprache aus ueber 70 Eingabesprachen in 13 Ausgabesprachen nahezu in Echtzeit. gpt-realtime-whisper liefert latenzarme Streaming-Transkription, die Sprache live waehrend des Sprechens verschriftlicht.

Damit kam erstmals echtes GPT-5-Klasse-Reasoning in gesprochene Live-Konversationen, die das Gespraech aufrechterhalten, Tools aufrufen und Korrekturen oder Unterbrechungen verarbeiten koennen. Zusammen mit dedizierten Echtzeit-Modellen fuer Uebersetzung und Transkription erschloss das eine neue Klasse reaktionsschneller Sprachanwendungen.

Erstes OpenAI-Sprachmodell mit GPT-5-Klasse-Reasoning fuer Live-Sprachdialoge.

April 2026 · erst jetzt möglich

Agenten, die stundenlang eigenständig Aufgaben lösen.

2022: ein Chatbot, der auf einzelne Fragen antwortet.

April 2026

#12 Releases
30
Apr. 2026
TextGeschlossen

ERNIE 5.1 Preview

Baidu

Effizienzoptimiertes MoE-Modell, das gegenüber ERNIE 5.0 die Total-Parameter auf etwa ein Drittel und die aktiven Parameter auf etwa die Hälfte reduziert, dabei mit decoupled fully-asynchronous Reinforcement Learning und skaliertem agentischem Post-Training trainiert wurde.

ERNIE 5.1 Preview wurde mit nur rund 6 % der Pre-Training-Kosten vergleichbarer Frontier-Modelle trainiert und erreichte Platz 1 unter den chinesischen Modellen auf dem LMArena-Text-Leaderboard (Platz 13 global) - die höchste Position, die ein chinesisches Lab dort je gehalten hat. Zudem stieg es als erstes chinesisches LLM in die globale Top 5 der Search Arena auf.

Erstes chinesisches LLM in den globalen Top 5 der LMArena Search Arena.

28
Apr. 2026
TextOffen

Mistral Medium 3.5

Mistral AI

Frontier-multimodales Modell mit einstellbarem reasoning_effort und 256k Kontext; neuer Standard für Le Chat.

Europas wichtigstes Open-Weights-Frontier-Release des Zeitraums.

24
Apr. 2026
TextOffen

DeepSeek V4 (Preview)

DeepSeek

Open-Weights-Flaggschiff in zwei Varianten: V4-Pro (1,6 Bio. Parameter total, 49 Mrd. aktiv) und V4-Flash (284 Mrd. total, 13 Mrd. aktiv), beide standardmäßig mit 1-Mio.-Token-Kontext und neuartigen Attention-Mechanismen.

V4-Pro bietet verbesserte agentische Fähigkeiten und Reasoning der Spitzenklasse in Mathematik, STEM und Coding.

DeepSeek V4 brachte Frontier-nahe Leistung als Open-Weights-Modell zu drastisch niedrigeren Preisen (rund 0,435/0,87 USD pro Mio. Tokens) und reihte sich auf agentischen Benchmarks neben GPT-5.5 und Claude Opus 4.7 ein. Es verschob die Erwartung, dass Spitzenleistung an geschlossene Modelle gebunden ist.

23
Apr. 2026
TextGeschlossen

GPT-5.5

OpenAI

OpenAIs zu diesem Zeitpunkt fähigstes Modell, mit besonders starken Zuwächsen bei agentischem Coding, Computer-Use, Knowledge Work und früher wissenschaftlicher Forschung.

Auffällig ist der Sprung bei Long-Context-Reasoning (MRCR v2 bei 1 Mio. Tokens von 36,6 % auf 74,0 %) sowie 82,7 % auf Terminal-Bench 2.0.

GPT-5.5 setzte OpenAIs Führungsanspruch bei agentischen und Long-Context-Aufgaben neu und übertraf bei Terminal-Bench konkurrierende Frontier-Modelle wie Claude Opus 4.7 und Gemini 3.1 Pro deutlich. Es definierte den Wettbewerbsmaßstab für das Frühjahr 2026.

21
Apr. 2026
BildGeschlossen

gpt-image-2 (ChatGPT Images 2.0)

OpenAI

Bildmodell mit integriertem Reasoning (O-Series-Mechanismus / Thinking-Mode), das vor der Generierung Komposition plant, Objektanzahl verifiziert und Prompt-Constraints prueft; nahezu perfektes mehrsprachiges Text-Rendering (ca. 99% ueber Latein, Japanisch, Koreanisch, Hindi, Arabisch u.a.), hohe Aufloesung und konsistente Generierung mehrerer Bilder aus einem Prompt.

Uebernahm laut Image-Arena-Leaderboard sofort die Spitze in allen Kategorien mit dem groessten je gemessenen Vorsprung und etablierte Reasoning als zentralen Hebel fuer praezise Instruction-Following und Text-Rendering bei der Bildgenerierung. Loeste die gesamte DALL-E-Generation als Produktionsstandard ab.

Erstes weit verbreitetes Bildgenerierungsmodell mit explizitem, der Generierung vorgeschaltetem Reasoning-/Thinking-Schritt.

20
Apr. 2026
TextOffen

Kimi K2.6

Moonshot AI

Open-Weights-Modell auf 1-Billion-Parameter-MoE-Basis (32 Mrd. aktive Parameter), spezialisiert auf agentisches Coding und Langzeit-Aufgaben.

Es kann laut Moonshot bis zu rund 13 Stunden durchgehend coden und bringt ein Agent-Swarm-System mit bis zu 300 spezialisierten Sub-Agents und bis zu 4.000 koordinierten Schritten pro Lauf.

K2.6 verkleinerte den Abstand zwischen Open-Weights und geschlossenen Frontier-Modellen weiter: Es erreichte laut Berichten Gleichstand mit GPT-5.5 auf SWE-Bench Pro bei rund 80 % geringeren Kosten pro Token und untermauerte die Stärke chinesischer Open-Weights-Modelle bei agentischer Software-Entwicklung.

16
Apr. 2026
TextGeschlossen

Claude Opus 4.7

Anthropic

Frontier-Modell der Opus-Klasse mit State-of-the-Art-Performance bei langlaufenden, komplexen Coding- und Agenten-Aufgaben.

Es bringt verbesserte Vision (Bilder bis ~3,75 Megapixel), deutlich bessere Instruction-Following-Fähigkeiten und Selbstverifikation der eigenen Ausgaben.

Opus 4.7 wurde als Modell positioniert, an das man die schwierigste Coding-Arbeit übergeben kann, und setzte zum Releasezeitpunkt Maßstäbe bei nachhaltiger mehrstufiger Agenten-Arbeit, während der Preis (5/25 USD pro Mio. Tokens) unverändert blieb.

13
Apr. 2026
AudioOffen

MOSS-Audio

OpenMOSS / MOSI.AI / Shanghai Innovation Institute

Open-Source-Foundation-Modell fuer einheitliches Audio-Verstehen ueber komplexe reale Audioszenen hinweg: Sprachverstehen, Umgebungsgeraeusche, Musikverstehen, Audio-Captioning, zeitbewusstes Question-Answering und mehrstufiges Reasoning.

Veroeffentlicht in vier Varianten (4B und 8B, jeweils als Instruct und Thinking) mit Audio-Encoder plus Qwen3-Backbone; Weights auf Hugging Face und Code auf GitHub.

MOSS-Audio brachte ein offenes, frei verfuegbares Audio-Reasoning-Modell mit Chain-of-Thought-Faehigkeiten in ein Feld, das bislang von geschlossenen Systemen dominiert wurde, und machte zeitbewusstes Verstehen und komplexes Schlussfolgern ueber gemischtes Audio fuer Forschung und Entwicklung zugaenglich.

Eines der ersten Open-Weights-Foundation-Modelle, das Verstehen von Sprache, Umgebungsklang und Musik samt zeitbewusstem Reasoning in einem Modell vereint.

8
Apr. 2026
TextGeschlossen

Muse Spark

Meta (Superintelligence Labs)

Nativ multimodales Reasoning-Modell mit Tool-Use, visuellem Chain-of-Thought und Multi-Agent-Orchestrierung (Contemplating-Modus).

Es nutzt Thought Compression zur Token-effizienten Inferenz und erreicht laut Meta rund 58 % auf Humanity's Last Exam im Contemplating-Modus.

Muse Spark war das erste Modell der neuen Meta Superintelligence Labs unter Alexandr Wang und markierte Metas Abkehr von der bisherigen Open-Source-Strategie hin zu einem geschlossenen Modell. Es wurde sofort über Facebook, Instagram, WhatsApp, Messenger und die Ray-Ban-Brillen an über drei Milliarden Nutzer ausgerollt.

Erstes Modell von Meta Superintelligence Labs und Metas erster strategischer Wechsel von Open-Weights zu einem geschlossenen Frontier-Modell.

7
Apr. 2026
TextOffen

GLM-5.1

Zhipu / Z.ai

754B-Parameter-MoE; erstes Open-Source-Modell auf Platz 1 von SWE-Bench Pro (58,4%), vor Claude Opus 4.6.

Der Moment, in dem Open-Weights ein reales Coding-Benchmark gegen alle geschlossenen Modelle anführte.

Erstes Open-Weights-Modell an der Spitze von SWE-Bench Pro

7
Apr. 2026
VideoGeschlossen

Wan2.7-Video

Alibaba

Wan2.7-Video ist eine Suite aus vier Modellen (Text-to-Video, Image-to-Video, Reference-to-Video und Video-Editing).

Sie erzeugt Clips von 2 bis 15 Sekunden in 720p und 1080p, hält Mehr-Shot-Konsistenz für bis zu fünf verschiedene Charaktere über Videos hinweg und bietet dynamische Dialog-Bearbeitung mit automatischem Lip-Sync und Erhalt der Stimmsignatur.

Wan2.7 hob die Wan-Linie von einzelnen Clips zu durchgängigen, mehrteiligen Erzählungen mit konsistenten Figuren und führte in unabhängigen Bestenlisten als bestplatziertes Modell, das von einem chinesischen Anbieter stammt. Es verschob die Erwartung von 'Director-Level'-Steuerung (Mehr-Shot, Charakterkonsistenz, Auto-Dubbing) in den Mainstream.

2
Apr. 2026
AudioGeschlossen

MAI-Transcribe-1

Microsoft AI

Erstes hauseigenes Speech-to-Text-(Transkriptions-)Modell von Microsoft AI.

State-of-the-Art-Genauigkeit über die 25 meistgenutzten Sprachen (FLEURS-Benchmark) mit niedrigster Word Error Rate, robust in lauten Umgebungen; Batch-Transkription 2,5x schneller als das bestehende Azure-Fast-Angebot.

MAI-Transcribe-1 erweiterte die hauseigene MAI-Familie um die Spracherkennung und wurde gemeinsam mit MAI-Voice-1 und MAI-Image-2 erstmals für Entwickler in Microsoft Foundry verfügbar gemacht, ein weiterer Schritt der Lösung von externer Modellabhängigkeit.

Erstes hauseigenes Speech-to-Text-/Transkriptions-Modell von Microsoft AI.

März 2026

#6 Releases
26
März 2026
AudioGeschlossen

Suno v5.5 (voice capture + custom models)

Suno AI

Musikgenerierung mit persönlicher Voice Capture (eine 30-sekündige bis 4-minütige Gesangsprobe überträgt deine stimmliche Identität auf jeden generierten Track), Fine-Tuning eigener, vom Nutzer trainierter Modelle sowie eine personalisierte Geschmacks-Engine

Verlagerte KI-Musik von generischer Generierung hin zur personalisierten Erstellung: Nutzer können ihre eigene Singstimme und ihren musikalischen Katalog direkt in das generative Modell einbetten und verbinden so Selbstausdruck mit Automatisierung im Consumer-Maßstab

Erster KI-Musikgenerator für Endnutzer, der es ermöglicht, die eigene Singstimme und den persönlichen Katalog als Generierungs-Priors einzubetten

25
März 2026
AudioGeschlossen

Google Lyria 3 Pro

Google DeepMind

Erweiterte Variante von Lyria 3, die Tracks von bis zu 3 Minuten Laenge mit struktureller Bewusstheit erzeugt.

Nutzer koennen Songbestandteile wie Intros, Strophen, Refrains, Bridges und Uebergaenge direkt im Prompt festlegen und so den musikalischen Bogen einer Komposition definieren.

Mit dem Sprung von 30-Sekunden-Clips auf strukturierte Dreiminueter nur einen Monat nach Lyria 3 ruekte Google in den Bereich vollstaendiger, arrangierbarer Songs vor und verkuerzte einen typischen Jahres-Produktzyklus auf wenige Wochen.

19
März 2026
BildGeschlossen

MAI-Image-2

Microsoft AI

Hauseigenes Text-to-Image-Modell der zweiten Generation.

Stärken bei Photorealismus (natürliches Licht, akkurate Hauttöne), zuverlässiger In-Image-Textgenerierung für Infografiken/Slides und komplexen, kinematografischen Szenen; rangierte als #3-Modellfamilie auf der Arena.ai-Bestenliste.

MAI-Image-2 brachte Microsofts eigene Bildgenerierung in die globale Top-3 der Text-to-Image-Labore und festigte die Strategie, Copilot und Bing zunehmend mit hauseigenen statt OpenAI-Modellen zu betreiben.

17
März 2026
BildGeschlossen

Midjourney V8 (Alpha)

Midjourney

Neue Modellgeneration mit ca. 5x schnellerer Generierung, nativer 2K-Aufloesung (--hd-Modus), deutlich verbessertem Text-Rendering (bei Angabe in Anfuehrungszeichen), besserer Instruction-Following, Kohaerenz und Detailtreue sowie staerkerer Personalisierung ueber Style-References und Moodboards.

Erste grosse Modellgeneration von Midjourney seit V7 mit komplett ueberarbeiteter Codebasis; brachte native hohe Aufloesung und endlich brauchbares Text-Rendering in eine der fuehrenden kreativen Bildplattformen. V8.1 wurde am 10.06.2026 zur Standardversion.

9
März 2026
AudioOffen

Fish Audio S2

Fish Audio

Open-Weights-TTS-Modell mit Dual-AR-Architektur (rund 4B Parameter auf der Zeitachse, 400M auf der Tiefenachse), trainiert auf ueber 10 Millionen Stunden Audio in etwa 50 Sprachen.

Erlaubt feinkoernige Inline-Steuerung von Prosodie und Emotion ueber natuerlichsprachliche Tags wie [laugh], [whispers] oder [super happy]. Veroeffentlicht mit Model-Weights, Fine-Tuning-Code und einer SGLang-basierten Streaming-Inferenz-Engine.

S2 zaehlte zu den ausdrucksstaerksten Open-Weights-Sprachmodellen des Jahres und gewann laut Berichten die hoechste EmergentTTS-Eval-Win-Rate aller getesteten Modelle, womit es mehrere kommerzielle Angebote uebertraf und damit die Luecke zwischen offenen und geschlossenen TTS-Systemen weiter schloss.

5
März 2026
TextGeschlossen

GPT-5.4

OpenAI

Erstes Mainline-Reasoning-Modell mit integriertem Frontier-Coding und Computer-Use; 33% weniger Faktenfehler als 5.2.

Der „Reasoning + Coding + Computer-Use vereint"-Meilenstein; breit genutztes Flaggschiff vor 5.5.

Februar 2026

#9 Releases
26
Feb. 2026
BildGeschlossen

Nano Banana 2 (Gemini 3.1 Flash Image)

Google DeepMind

Schnelles, hochfideles Bildgenerierungs- und Editing-Modell, das das Weltwissen, die Qualitaet und das Reasoning von Nano Banana Pro mit Flash-Geschwindigkeit kombiniert; Aufloesungen von 512px bis 4K, Charakterkonsistenz fuer bis zu fuenf Charaktere und Fidelitaet von bis zu 14 Objekten in einem Workflow.

Wurde sofort zum Standardmodell fuer Bildgenerierung in der gesamten Gemini-App sowie in Google Suche (AI Mode), Google Lens, Google Ads und Flow und brachte damit Frontier-Bildqualitaet in grossem Massstab in Googles Endprodukte. Nutzt Echtzeit-Informationen aus der Websuche fuer akkuratere Darstellung konkreter Motive.

18
Feb. 2026
AudioGeschlossen

Google Lyria 3

Google DeepMind

Musikgenerierungsmodell, das aus Text-Prompts 30-sekuendige Tracks mit automatisch erzeugten Lyrics und passendem Cover-Artwork erstellt.

Unterstuetzt multimodale Eingaben (Text, Bild, Video) sowie Steuerung von Genre, Tempo und Sprache und versieht alle Ausgaben mit SynthID-Wasserzeichen.

Lyria 3 brachte hochwertige KI-Musikgenerierung direkt in die Gemini-App und YouTube Dream Track und machte sie damit fuer ein Massenpublikum zugaenglich. Es markierte den Start eines extrem schnellen Release-Zyklus von Google DeepMind im Audiobereich.

17
Feb. 2026
TextGeschlossen

Claude Sonnet 4.6

Anthropic

Mittelgroßes Claude-Modell mit deutlichen Fortschritten bei Coding und Computer-Use sowie einem 1-Mio.-Token-Kontextfenster in der Beta. Es erreicht laut Anthropic Opus-nahe Intelligenz zu einem Preis (3/15 USD pro Mio. Tokens), der den Einsatz für deutlich mehr Aufgaben praktikabel macht.

Entwickler bevorzugten Sonnet 4.6 mit großem Abstand gegenüber dem Vorgänger und oft sogar gegenüber Claude Opus 4.5. Leistung, die zuvor ein Modell der Opus-Klasse erforderte, wurde damit in der günstigeren Sonnet-Klasse verfügbar und verschob das Preis-Leistungs-Verhältnis im mittleren Segment.

12
Feb. 2026
VideoGeschlossen

Seedance 2.0

ByteDance

Seedance 2.0 ist ein einheitliches multimodales Audio-Video-Modell, das Text, Bild, Audio und Video in derselben Anfrage als Eingabe akzeptiert (bis zu 9 Bilder, 3 Videoclips, 3 Audioclips plus Anweisungen) und in einem Durchgang bis zu 15 Sekunden synchrones Mehr-Shot-Video mit Stereo-Audio in mehreren Tonspuren (Musik, Effekte, Sprache) ausgibt.

Es bietet starke physikalische Genauigkeit und visuellen Realismus.

Seedance 2.0 setzte sich nach dem Launch an die Spitze der Artificial-Analysis-Text-to-Video-Bestenliste (mit Audio) und löste in China viral eine Debatte aus; eine Unterlassungsaufforderung von Disney unterstrich, wie nah die Ausgabequalität an Hollywood-Material heranreichte. Der einheitliche Mehr-Modalitäten-Ansatz mit paralleler Audio-Erzeugung hob den Standard für gesteuerte, vertonte Generierung an.

11
Feb. 2026
TextOffen

GLM-5

Zhipu AI (Z.ai)

Open-Weights-MoE-Frontier-Modell mit 744B Total-Parametern (rund 40-44B aktiv), 200K-Kontextfenster und DeepSeek-Sparse-Attention, ausgelegt auf agentische Engineering- und langlaufende Coding-Workflows.

Erreichte 77,8 % auf SWE-bench Verified und 92,7 % auf AIME 2026.

GLM-5 war zum Launch das neue Nr.-1-Open-Weights-Modell auf Artificial Analysis und in der LMArena Text Arena und übertraf in Teilen Gemini 3 Pro. Es kam zudem von der weltweit ersten börsennotierten Foundation-Model-Firma (Zhipu-IPO in Hongkong) und wurde auf heimischen Huawei-Ascend-Chips trainiert - ein Signal für Chinas KI-Eigenständigkeit.

Erstes Frontier-Open-Weights-Modell einer börsennotierten Foundation-Model-Firma (Zhipu/Z.ai).

10
Feb. 2026
BildGeschlossen

Qwen-Image-2.0

Alibaba (Qwen)

Bildgrundlagenmodell der naechsten Generation, das Text-to-Image-Generierung und Image-Editing in einer einzigen, leichteren Architektur vereint (ca. 7B statt zuvor 20B), mit nativer 2K-Aufloesung, staerkerer Prompt-Treue und professionellem Typografie-Rendering (Instruktionen bis 1k Token fuer Infografiken).

Demonstrierte, dass deutlich kleinere Modelle bei vereinheitlichter Generierung und Editing umfassende Leistungssteigerungen erzielen koennen, und setzte neue Massstaebe beim Text-Rendering in Bildern.

5
Feb. 2026
TextGeschlossen

Claude Opus 4.6

Anthropic

1-Mio.-Token-Kontext (Beta), Spitzenwerte auf Humanity's Last Exam und Terminal-Bench; anhaltendes agentisches Coding in großen Codebases.

Das erste 2026er Claude-Flaggschiff und Referenzpunkt, gegen den Opus 4.7/4.8 gemessen wurden.

5
Feb. 2026
VideoGeschlossen

Kling 3.0 (Video 3.0 / Video 3.0 Omni)

Kuaishou

Die Kling-3.0-Reihe (Video 3.0, Video 3.0 Omni, Image 3.0, Image 3.0 Omni) basiert auf einem einheitlichen multimodalen Framework, das Video und Audio in einem Durchgang erzeugt.

Sie liefert bis zu 15 Sekunden lange Clips, native Audio-Generierung mit Sprache in mehreren Sprachen, Dialekten und Akzenten sowie verbesserte Konsistenz und photorealistische Ausgabe; die Omni-Variante repliziert Charakter- und Stimmmerkmale aus Referenzvideos.

Kling 3.0 übernahm wenige Tage nach dem Launch die Spitze der ELO-Bestenliste für Videogeneratoren und positionierte ein chinesisches Modell vor westlichen Spitzenmodellen. Die synchrone Audio-Video-Erzeugung und das mehrsprachige Lip-Sync machten es zu einem ernsthaften Werkzeug für professionelle, vertonte Mehr-Shot-Produktionen.

2
Feb. 2026
AudioGeschlossen

ElevenLabs Eleven v3 (GA)

ElevenLabs

Allgemeine Verfügbarkeit des bislang ausdrucksstärksten TTS-Modells von ElevenLabs mit über 70 Sprachen und Audio Tags zur direkten Steuerung von Emotion und Sprechweise im Text.

Gegenüber der Alpha-Version sank die Fehlerquote bei Zahlen, Symbolen und Fachnotation um 68 Prozent (von 15,3 auf 4,9 Prozent), und Nutzer bevorzugten die GA-Version in 72 Prozent der Faelle.

Eleven v3 setzte einen neuen Qualitaetsmassstab fuer expressives, gesteuertes TTS und festigte die Position von ElevenLabs als Full-Stack-Audio-Anbieter. Die Audio Tags machten feinkoernige Emotionskontrolle ohne separate Modelle oder Nachbearbeitung zugaenglich.

Januar 2026

#5 Releases
27
Jan. 2026
TextOffen

Kimi K2.5

Moonshot AI

Nativ multimodales, agentisches Open-Weights-Modell mit einer 1-Billion-Parameter-Mixture-of-Experts-Architektur (etwa 32 Mrd. aktive Parameter), das auf rund 15 Billionen gemischten Bild- und Text-Tokens trainiert wurde.

Es versteht Text, Bilder und Video und bringt einen Agent-Swarm mit, der komplexe Aufgaben auf bis zu 100 parallele Sub-Agents aufteilt.

Moonshot positionierte Kimi K2.5 als Open-Weights-Modell, das laut eigenen Angaben in mehreren Benchmarks mit GPT-5.2 und Gemini 3 Pro mithalten oder sie übertreffen konnte (etwa SWE-Bench Verified und VideoMMMU). Begleitet von einem Coding-Agenten markierte es den Auftakt einer Welle starker chinesischer Open-Weights-Modelle im Jahr 2026.

26
Jan. 2026
BildOffen

HunyuanImage 3.0-Instruct

Tencent

Natives multimodales Open-Weights-Modell (80B MoE, ca. 13B aktive Parameter) mit Fokus auf praezisem, instruktionsgesteuertem Image-Editing: Reasoning-gestuetztes Prompt-Enhancement, Image-to-Image, Multi-Image-Fusion (bis zu 3 Eingabebilder) und Chain-of-Thought.

Erweiterte das groesste offene Text-to-Image-Modell um gezieltes Editing und Reasoning und staerkte damit die Position chinesischer Open-Weights-Modelle. Eine distillierte Variante (Instruct-Distil) ermoeglicht schnellere Inferenz mit nur 8 Sampling-Schritten.

22
Jan. 2026
TextGeschlossen

ERNIE 5.0

Baidu

Nativ voll-modales Modell mit rund 2,4T Parametern in MoE-Architektur (weniger als 3 % der Parameter je Inferenz aktiv), das Text, Bild, Audio und Video gemeinsam versteht und generiert.

Die offizielle Version von ERNIE 5.0 (nach Preview im November 2025) rangierte als Ernie-5.0-0110 als bestes chinesisches Modell und global auf Platz 8 des LMArena-Text-Leaderboards und übertraf Modelle wie GPT-5.1-High und Gemini-2.5-Pro - ein Beleg für die Schlagkraft chinesischer voll-modaler Foundation-Modelle.

15
Jan. 2026
BildOffen

FLUX.2 [klein]

Black Forest Labs

Kompakte Open-Weights-Modellfamilie (4B und 9B), die Bildgenerierung und -Editing in einer Architektur vereint und Text-to-Image, Single-Reference-Editing sowie Multi-Reference-Generierung in unter einer Sekunde auf Consumer-Hardware (ab ca. 13 GB VRAM) liefert.

Brachte nahezu Frontier-Qualität auf lokale GPUs und verschob damit die Pareto-Grenze zwischen Qualität und Latenz im Open-Weights-Bereich erheblich. Die 4B-Variante steht unter Apache 2.0 und ist damit auch kommerziell frei nutzbar.

6
Jan. 2026
VideoOffen

LTX-2

Lightricks

LTX-2 erzeugt synchronisiertes Video und Audio in einem einzigen Durchgang mit nativer 4K-Auflösung bei 50 Bildern pro Sekunde und bis zu 20 Sekunden Länge, inklusive ausdrucksstarkem Ton, akkuratem Lip-Sync und Umgebungsgeräuschen.

Das Modell (14B Video- plus 5B Audio-Parameter) läuft auf Consumer-GPUs.

Erstmals stellte ein produktionsreifes Audio-Video-Modell vollständig offene Gewichte sowie Inferenz- und Trainingscode bereit. Damit konnten Entwickler hochwertige, vertonte Clips lokal und kommerziell ohne Cloud-Abhängigkeit erzeugen und feintunen, was die Lücke zu geschlossenen Spitzenmodellen deutlich verkleinerte.

Erstes produktionsreifes Open-Weights-Modell, das Video und Audio synchron in einem Durchgang mit nativem 4K und offenem Trainingscode generiert.

November 2025

#1 Release
18
Nov. 2025
TextGeschlossen

Gemini 3

Google DeepMind

Flaggschiff-Modell mit dem Reasoning-Modus Deep Think, der 41 % auf Humanity's Last Exam erreicht; das Standardmodell Gemini 3 Pro erzielte 37,5 %.

1501 Elo auf LMArena, vom ersten Tag an in Search, der Gemini-App und über Entwickler-APIs ausgerollt

Erreichte zum Start den höchsten Wert nach menschlicher Präferenz auf LMArena (erstes Modell, das die Marke von 1500 Elo überschritt) und durchbrach mit Deep Think die 40-%-Schwelle auf Humanity's Last Exam; der gleichzeitige Rollout über die Google-Suche machte es zur umfangreichsten Einführung eines hochmodernen Modells in der Geschichte

Oktober 2025

#1 Release
13
Okt. 2025
BildGeschlossen

MAI-Image-1

Microsoft AI

Erstes hauseigenes Text-to-Image-Modell von Microsoft AI.

Stark bei photorealistischen Bildern, Lichteffekten (Bounce Light, Reflexionen) und Landschaften, mit Fokus auf visuelle Diversität und schnelle Iteration; Debüt in den Top 10 der Text-to-Image-Modelle auf LMArena.

Mit MAI-Image-1 trat Microsoft erstmals mit einem eigenen Bildmodell direkt gegen OpenAI an, statt nur deren Modelle zu integrieren, und erweiterte die hauseigene MAI-Familie über Text und Sprache hinaus auf die Bildgenerierung.

Erstes hauseigenes Bildgenerierungs-Modell von Microsoft AI.

September 2025

#5 Releases
30
Sept. 2025
VideoGeschlossen

OpenAI Sora 2

OpenAI

Sora der zweiten Generation mit synchronisierten Dialogen und Soundeffekten, verbesserter Physikgenauigkeit, Konsistenz über mehrere Einstellungen hinweg sowie einer App zum sozialen Teilen im TikTok-Stil

Ergänzte natives Audio und Sprachsynchronisierung, schärfere physikalische Plausibilität sowie die Cameo-Funktion (Einfügen eines Selfie-Videos des Nutzers in KI-Szenen); startete als Consumer-iOS-App mit beachtlichen Downloads und schlug eine Brücke zwischen KI-Video als Forschungsvorschau und der massentauglichen Erstellung sozialer Inhalte

29
Sept. 2025
TextGeschlossen

Claude Sonnet 4.5

Anthropic

Anthropics bestes Coding-/Agenten-Modell, ausgelegt auf stundenlange autonome Software-Aufgaben.

Der Coding-Agent-Meilenstein Ende 2025.

23
Sept. 2025
AudioGeschlossen

Suno v5 + Suno Studio

Suno AI

Musikmodell auf Profi-Niveau mit Mixing in Studioqualität und authentischem Gesang (v5, 23.

September), kombiniert mit Suno Studio – einer generativen DAW mit Mehrspur-Editor und MIDI-Export (25. September)

Verband hochmoderne Musikgenerierung mit professionellen Werkzeugen für die Postproduktion; der Mehrspur-Editor und der MIDI-Export schlugen eine Brücke zwischen KI-Generierung und traditionellen Workflows der Musikproduktion

Erster KI-Musikgenerator, der eine integrierte generative Digital Audio Workstation auslieferte (Mehrspur + MIDI-Export)

18
Sept. 2025
VideoGeschlossen

Luma Ray3

Luma AI

„Reasoning"-Videomodell, das eigene Ausgaben bewertet und nachbessert, und das erstmals echtes 10/12/16-Bit-HDR-Video (ACES2065-1) erzeugt.

Stärkster Luma-Meilenstein seit der hier gelisteten Dream Machine: bringt Selbstbewertung („Reasoning") und studiotaugliches HDR in die Videogenerierung.

Erstes „Reasoning"-Videomodell und erstes mit hochwertigem 16-Bit-HDR

9
Sept. 2025
BildGeschlossen

Seedream 4.0

ByteDance

Einheitliche Architektur für Text-zu-Bild und allgemeine Bildbearbeitung in einem Modell, nativ bis 4K, mit über 10× schnellerer Inferenz als Seedream 3.0.

ByteDances Flaggschiff-Bildmodell und führendes nicht-westliches Frontier-System — führte Bild-Arenen an und wurde zum wichtigsten Markt-Rivalen von Googles Nano Banana. Seedream-Bildmodelle fehlten hier bislang vollständig (nur die Seedance-Videoreihe war vertreten).

Erstes Modell eines chinesischen Labors an der Spitze globaler Bild-Arenen

August 2025

#6 Releases
28
Aug. 2025
TextGeschlossen

MAI-1-preview

Microsoft AI

Erstes End-to-End trainiertes Foundation-Modell (Text-LLM) von Microsoft AI.

Ein Mixture-of-Experts-(MoE)-Modell, pre- und post-trainiert auf rund 15.000 NVIDIA-H100-GPUs, ausgelegt auf Instruction-Following und Alltagsanfragen; öffentliches Testing auf LMArena.

MAI-1-preview war Microsofts erstes von Grund auf selbst trainiertes Sprach-Foundation-Modell und damit der strategische Wendepunkt weg von der reinen OpenAI-Abhängigkeit hin zu eigenen Modellen im Kern von Copilot.

Erstes vollständig hauseigenes, End-to-End trainiertes Foundation-LLM von Microsoft AI.

28
Aug. 2025
AudioGeschlossen

MAI-Voice-1

Microsoft AI

Erstes hauseigenes, hochgradig expressives Speech-Generation-Modell (TTS) von Microsoft AI.

Erzeugt laut Microsoft eine volle Minute Audio in unter einer Sekunde auf einer einzelnen GPU, unterstützt Single- und Multi-Speaker-Szenarien und treibt Copilot Daily sowie Podcasts an.

MAI-Voice-1 war eines der beiden ersten vollständig hauseigenen Foundation-Modelle, mit denen Microsofts Consumer-AI-Sparte unter Mustafa Suleyman ihre jahrelange ausschliessliche Abhängigkeit von OpenAI-Modellen durchbrach und begann, eigene Modelle in Copilot auszuliefern.

Erstes hauseigenes Speech-Generation-Modell der Microsoft-AI-(MAI)-Sparte.

28
Aug. 2025
AudioGeschlossen

OpenAI gpt-realtime (Realtime API GA)

OpenAI

Produktionsreife Speech-to-Speech-API mit verbesserter Befolgung von Anweisungen, präziserem Tool-Calling, SIP-Telefonie, Bildeingabe und Unterstützung für Remote-MCP-Server

Überführte die Realtime API von der Beta in die allgemeine Verfügbarkeit mit produktionsreifen Zuverlässigkeits-SLAs und ergänzte SIP-Telefonie-Unterstützung, was den direkten Einsatz in Unternehmens-Telefonsystemen ermöglichte

Erste hochmoderne Speech-to-Speech-API, die in der allgemeinen Verfügbarkeit eine SIP-Telefonie-Integration enthält

26
Aug. 2025
BildGeschlossen

Nano Banana (Gemini 2.5 Flash Image)

Google

Konversationelle Bildgenerierung und punktgenaue Bearbeitung per natürlicher Sprache mit starker Charakter- und Motivkonsistenz über mehrere Edits hinweg — viral als „Nano Banana" bekannt geworden.

Der Bildbearbeitungs-Durchbruch 2025: sofort Platz 1 in der LMArena-Bildbearbeitung, über 23 Mio. neue Gemini-Nutzer und 500 Mio. erzeugte Bilder in zwei Wochen. Machte mehrstufiges, weltwissen-gestütztes Editieren massentauglich. Bislang war hier nur der Nachfolger „Nano Banana 2" gelistet.

Erstes Bildmodell, das konversationelles Mehrfach-Editieren mit Konsistenz mainstreamfähig machte

7
Aug. 2025
TextGeschlossen

GPT-5

OpenAI

Einheitliches Modell, das die Sprachgewandtheit der GPT-Serie und das Reasoning der o-Serie hinter einem automatischen Router vereint und 74,9 % auf SWE-bench Verified sowie 94,6 % auf AIME 2025 erzielt

Erstes Produktivmodell, das schnelle dialogorientierte Inferenz und tiefgreifendes Chain-of-Thought-Reasoning in einem einzigen Endpunkt mit automatischem Routing vereint und so den Nutzern die Wahl zwischen verschiedenen Modellstufen abnimmt; begleitet von Open-Weights-Begleitmodellen (GPT-OSS 120B und 20B), die am 5. August 2025 veröffentlicht wurden

Erstes einheitliches Modell aus schnellem Modus und Reasoning mit automatischem Compute-Routing in einem einzigen API-Endpunkt

5
Aug. 2025
VideoGeschlossen

Google DeepMind Genie 3

Google DeepMind

Echtzeit-Weltmodell, das aus einem Prompt begehbare 720p/24fps-Umgebungen erzeugt, minutenlang konsistent.

Der „Weltmodell"-Durchbruch 2025 — eine neue Modalität jenseits von Text/Bild/Video.

Echtzeit-Weltmodell als neue Modalität

Juli 2025

#3 Releases
25
Juli 2025
VideoGeschlossen

Runway Aleph

Runway

In-Context-Videobearbeitung: Objekte hinzufügen, entfernen oder verändern, neue Kamerawinkel einer Szene erzeugen, Ausleuchtung und Stil bestehenden Materials ändern.

Anderes Paradigma als die hier gelisteten Gen-1 bis Gen-4 (Clip-Generierung): ein universelles Modell zum Bearbeiten vorhandener Videos. Eröffnete „Multi-Task-Videobearbeitung" als eigene Kategorie.

Erstes leistungsfähiges allgemeines In-Context-Videobearbeitungsmodell

17
Juli 2025
TextGeschlossen

OpenAI ChatGPT Agent

OpenAI

Vereint Operator (visueller Browser), Deep Research und eine Code-/Terminal-Toolbox mit eigenem virtuellem Computer.

Bündelte die agentischen Stränge 2025 in einem Produkt — „Agenten werden Mainstream".

9
Juli 2025
TextGeschlossen

xAI Grok 4

xAI

Frontier-Reasoning-Modell; laut xAI erstes mit rund 50 % auf „Humanity's Last Exam" und 100 % auf AIME 2025.

Schließt die Lücke zwischen dem hier gelisteten Grok 3 und Grok Build 0.1: bei Erscheinen das stärkste veröffentlichte Frontier-Benchmark-Profil von xAI.

Erstes Modell, das rund 50 % auf „Humanity's Last Exam" erreichte

Quelle:x.ai

Juni 2025

#4 Releases
26
Juni 2025
BildOffen

FLUX.1 Kontext [dev] (open weights)

Black Forest Labs

Open-Weights-Modell mit 12 Mrd. Parametern zur kontextbezogenen Bildbearbeitung mit Figurenbeibehaltung, lokalen und globalen Bearbeitungen, kompatibel mit ComfyUI und HuggingFace Diffusers

Bis zu dieser Veröffentlichung waren alle leistungsfähigen generativen Bildbearbeitungsmodelle proprietär – Kontext dev war das erste Open-Weights-Modell, das sowohl offene Vorgänger der Bildbearbeitung als auch geschlossene Modelle wie Gemini-Flash Image bei standardmäßigen Bearbeitungs-Benchmarks übertraf; demokratisierte die iterative Bildbearbeitung für die Open-Source-Community

Erstes Open-Weights-Modell, das die Leistung proprietärer Modelle bei der iterativen, kontextbewussten Bildbearbeitung erreichte

18
Juni 2025
VideoGeschlossen

MiniMax Hailuo 02

MiniMax

Natives 1080p-Video, 6–10 Sekunden, mit neuer NCR-Architektur (Noise-aware Compute Redistribution) — rund 3× mehr Parameter und 4× mehr Trainingsdaten als Hailuo-01 bei 2,5× besserer Effizienz.

Generationssprung gegenüber dem hier gelisteten Hailuo Video-01: erreichte Platz 2 der AA-Video-Arena und unterbot Veo 3 deutlich im Preis — ein Wendepunkt für „Frontier-Qualität zum kleinen Preis".

NCR-Architektur (Noise-aware Compute Redistribution)

11
Juni 2025
VideoGeschlossen

Seedance 1.0

ByteDance

Erstes Modell der Seedance-Reihe: natives Multi-Shot-Erzählvideo aus Text und Bild in 1080p, ein 5-Sekunden-Clip in rund 41 Sekunden, mit kohärenten Kamera- und Szenenwechseln innerhalb eines Prompts.

Übernahm bei Erscheinen gleichzeitig die Spitze der Artificial-Analysis-Ranglisten für Text-zu-Video und Bild-zu-Video und wurde zum dominierenden chinesischen Frontier-Videomodell 2025 — die Grundlage der später hier gelisteten Seedance 2.0/2.5.

Erstes Videomodell, das natives Multi-Shot-Storytelling als Standard zeigte

3
Juni 2025
AudioGeschlossen

ElevenLabs Eleven v3 (alpha)

ElevenLabs

Ausdrucksstärkstes TTS-Modell von ElevenLabs mit Audio Tags (inline emotionale Steuerung über in Klammern gesetzte Hinweise), einem Dialogue Mode für Mehrsprecher-JSON-Skripte und Unterstützung für über 70 Sprachen

Audio Tags gaben Produzenten eine fein abgestufte, skriptbare Kontrolle über Emotion und Vortrag innerhalb einer einzigen Textzeichenkette; der Dialogue Mode automatisierte die Produktion mit mehreren Figuren für Hörbücher und Videos

Erstes TTS-Modell mit inline skriptbaren Audio Tags zur Steuerung von Emotion und Vortrag innerhalb einer laufenden Synthese

Mai 2025

#4 Releases
29
Mai 2025
BildGeschlossen

FLUX.1 Kontext [pro] + [max]

Black Forest Labs

Kontextbewusste Bildbearbeitung: gemeinsames Prompting aus Text und Bild für lokale Bearbeitungen, Beibehaltung von Figuren über Szenen hinweg sowie iterative mehrstufige Bearbeitung ohne Qualitätsverlust

Führte ein neues Paradigma ein – 'erst generieren, dann dialogorientiert in einer Schleife bearbeiten' –, bei dem das Modell ein Referenzbild im Kontext behält und gezielte Änderungen anwendet; ermöglichte eine präzise, markenkonsistente Bildbearbeitung, die zuvor teures Fine-Tuning oder manuelle Photoshop-Arbeit erforderte

Erstes Flow-Matching-Modell mit gemeinsamer, kontextbezogener Text-und-Bild-Bearbeitung (Beibehaltung der Identität des Referenzbilds über iterative Bearbeitungen hinweg)

22
Mai 2025
TextGeschlossen

Claude Opus 4 / Sonnet 4

Anthropic

Claude-4-Familie, bei der Opus 4 einen Wert von 72,5 % auf SWE-bench Verified und Sonnet 4 einen Wert von 72,7 % erzielt, wobei beide komplexe, mehrstündige agentische Coding-Sitzungen durchhalten

Stellte einen neuen Rekord auf SWE-bench auf und demonstrierte durchgängiges, mehrstündiges autonomes Software-Engineering; Cursor, GitHub und Block berichteten von spürbaren Verbesserungen beim Coding in der Praxis, was KI-gestützte Softwareentwicklung im großen Maßstab praktikabel machte

20
Mai 2025
VideoGeschlossen

Google Veo 3

Google DeepMind

Videogenerierung mit nativ erzeugtem, synchronisiertem Audio: Dialoge, Soundeffekte und Hintergrundmusik werden gemeinsam mit den Videoframes generiert

Erstes hochmodernes Videomodell, das synchronisiertes Audio (Dialoge, SFX, Umgebungsgeräusche) in einem einzigen Modelldurchlauf nativ zusammen mit dem Video generiert – eine qualitative Kategorieerweiterung, die die KI-Videogenerierung vom 'Stummfilm' zum 'Tonfilm' brachte und grundlegend veränderte, was ein Text-zu-Video-Prompt vorgeben konnte

Erstes hochmodernes Videomodell mit nativer Generierung von synchronisiertem Audio, Sprache und Soundeffekten

20
Mai 2025
BildGeschlossen

Google Imagen 4

Google DeepMind

Ausgabe in bis zu 2K-Auflösung, feine Detailwiedergabe (Stoffe, Wassertropfen, Fell), verbesserte Typografie-Integration sowie eine bis zu 10× schnellere Generierung über eine eigene Fast-Variante

Zeigte, dass Googles Kadenz jährlicher umfangreicher Upgrades von Bildmodellen die Qualität zuverlässig kumuliert; die native 2K-Auflösung legte branchenweit eine höhere Messlatte für die Ausgabetreue an; die tiefe Integration in Google Workspace (Docs, Slides, Vids) brachte hochmoderne Bildgenerierung zu Hunderten Millionen von Wissensarbeitern

Mai 2025 · erst jetzt möglich

Video mit synchronem Ton — in einem einzigen Schritt.

Zwei Jahre zuvor: stumme Vier-Sekunden-Clips.

April 2025

#4 Releases
29
Apr. 2025
TextOffen

Alibaba Qwen3

Alibaba

Open-Weights-Familie (0,6B–235B MoE) mit umschaltbarem „Thinking/Non-Thinking"-Reasoning.

Eines der wichtigsten westlich zugänglichen Open-Weights-Releases 2025.

15
Apr. 2025
VideoGeschlossen

Kuaishou Kling 2.0

Kuaishou

Modernste Bewegungsqualität, semantische Reaktionsfähigkeit und multimodale Videobearbeitung aus komplexen Prompts bei branchenführender visueller Wiedergabetreue

Erreichte Spitzenplätze bei mehreren Benchmarks zur Videoqualität und führte die multimodale Videobearbeitung ein; bestätigte Klings Entwicklung von einer chinesischen Alternative zu einem globalen Qualitätsführer, wobei die Plattform innerhalb von 10 Monaten nach dem Start die Marke von 100 Mio. US-Dollar annualisiertem Umsatz überschritt

5
Apr. 2025
TextOffen

Llama 4 (Scout / Maverick)

Meta

Nativ multimodale offene MoE-Modelle; Scout bietet ein Kontextfenster von 10 Mio. Tokens (das mit INT4-Quantisierung auf eine einzige H100 passt), Maverick nutzt 128 Experten

Das Kontextfenster von 10 Mio. Tokens bei Scout war zum Erscheinungszeitpunkt das größte aller öffentlich verfügbaren Modelle und ermöglichte zuvor unmögliche Analysen ganzer Repositories und langer Videos

Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens

4
Apr. 2025
BildGeschlossen

Midjourney v7

Midjourney

Völlig neue Architektur mit Draft Mode (10× schneller, 0,5× Kosten), Omni Reference für motivübergreifende Konsistenz sowie deutlich verbesserter Textur, Kohärenz und anatomischer Genauigkeit

Der Draft Mode veränderte die Iterationsökonomie der KI-Bildgenerierung grundlegend – Nutzer konnten zu gleichen Kosten 10× mehr Konzepte erkunden, bevor sie sich auf vollständige Renderings festlegten; Omni Reference ersetzte das eingeschränkte System der Figurenreferenz und dehnte die Konsistenz auf jeden beliebigen Objekttyp aus

März 2025

#5 Releases
31
März 2025
VideoGeschlossen

Runway Gen-4

Runway

Konsistente Videogenerierung über mehrere Einstellungen hinweg: Beibehaltung derselben Figuren, Kostüme und Umgebungen in unterschiedlichen Szenen mithilfe von Referenzbild-Konditionierung

Löste die hartnäckigste Einschränkung von KI-Video – die Figurenkonsistenz über mehrere Einstellungen hinweg – ohne Fine-Tuning oder Neutraining; zum ersten Mal konnten Kreative eine zusammenhängende Erzählung über mehrere Einstellungen mit demselben Schauspieler in verschiedenen Szenen generieren, was KI-natives Filmemachen praktisch machbar machte

Erstes kommerzielles Videomodell, das aus Referenzbildern eine zuverlässige Figuren- und Szenenkonsistenz über mehrere Einstellungen hinweg liefert

26
März 2025
BildGeschlossen

Ideogram 3.0

Ideogram AI

Höchste ELO-Werte bei der menschlichen Präferenz über verschiedenste Prompt-Typen hinweg, Style References (bis zu 3 Referenzbilder), Style Codes, Batch-Generierung sowie verbesserter Fotorealismus und Textwiedergabe

Eroberte die Spitzenposition bei öffentlichen Benchmarks gegenüber der GPT-4o-Bildgenerierung und Midjourney v7 zurück; Style References machten die markenkonsistente Bildgenerierung ohne Fine-Tuning zugänglich – eine Fähigkeit, die den Workflow von Designern grundlegend veränderte

25
März 2025
BildGeschlossen

GPT-4o Native Image Generation (gpt-image-1)

OpenAI

Nativ multimodale Bildgenerierung, eingebettet in GPT-4o: dialogorientierte Bildbearbeitung, zuverlässige Texteinblendung im Bild, präzise Befolgung von Anweisungen und Transformation von Bildeingaben

Zum ersten Mal war die Bildgenerierung nativer Bestandteil eines hochmodernen multimodalen LLM und nicht ein angeflanschtes separates Modell; da das Weltwissen von GPT-4o inhärent ist, konnte der Generator über räumliche Beziehungen, Bildunterschriften und visuelle Logik auf eine Weise räsonieren, wie es DALL-E 3 nicht vermochte – löste eine virale Welle von Studio-Ghibli-Imitationen aus und dominierte die sozialen Medien

Erstes nativ multimodales LLM, bei dem Bildgenerierung und sprachliches Reasoning dieselben Modellgewichte teilen

25
März 2025
TextGeschlossen

Gemini 2.5 Pro

Google DeepMind

Thinking-Modell, das die Bestenlisten von LMArena und WebDev Arena anführt, bei den Mathematik-Benchmarks AIME 2025 und den Wissenschafts-Benchmarks GPQA führend ist und über ein Kontextfenster von 1 Mio. Tokens verfügt

Belegte mit großem Abstand Platz 1 beim Ranking nach menschlicher Präferenz auf LMArena und war zugleich bei anspruchsvollen Wissenschafts- und Mathematik-Benchmarks führend – das erste Mal, dass ein Google-Modell gleichzeitig sowohl bei menschlicher Präferenz als auch bei objektiven Reasoning-Evaluierungen führte

20
März 2025
AudioGeschlossen

OpenAI gpt-4o-transcribe / gpt-4o-mini-tts audio models

OpenAI

Neue STT-Modelle (gpt-4o-transcribe, gpt-4o-mini-transcribe) mit branchenführender WER sowie ein instruierbares TTS (gpt-4o-mini-tts), bei dem Entwickler Ton, Emotion und Vortragsstil vorgeben

Instruierbares TTS – dem Modell nicht nur zu sagen, was es sagen soll, sondern auch wie – war ein Paradigmenwechsel gegenüber der Auswahl aus voreingestellten Stimmen; in Kombination mit verbessertem STT ermöglichte es die erste vollständig auf GPT-4o-Niveau arbeitende Sprach-Pipeline für Entwickler

Erstes öffentlich verfügbares instruierbares TTS-Modell, bei dem sich der Vortragsstil per natürlichsprachlichen Anweisungen festlegen lässt

Februar 2025

#6 Releases
27
Feb. 2025
TextGeschlossen

GPT-4.5

OpenAI

OpenAIs größtes nicht-Reasoning-Modell („Orion") — Höhepunkt des reinen, unüberwachten Pretraining-Scalings: breiteres Wissen und natürlicheres Gespräch, aber kein spezialisiertes Reasoning.

Historischer Wendepunkt: der größte und letzte „Scale-up-Pretraining"-Versuch, bevor OpenAI vollständig auf Reasoning-Modelle umschwenkte. Wurde später wieder eingestellt.

Inzwischen eingestellt (deprecatet).

27
Feb. 2025
AudioOffen

Sesame CSM (conversational speech model) demo

Sesame AI

Modell zur dialogorientierten Sprachgenerierung, das kontextbewusste, emotional ausdrucksstarke Dialoge mit menschenähnlicher Prosodie und Mehrsprecher-Handhabung erzeugt

Zeigte, dass 'Voice Presence' – das Gefühl, dass eine KI-Stimme wirklich zuhört und reagiert – erreichbar ist; die virale Demo führte eine nahezu unheimliche Natürlichkeit im Gespräch vor, die kein vorheriges offenes oder geschlossenes System erreicht hatte

Erstes Open-Source-Modell, das explizit auf den psychologischen Benchmark der 'Voice Presence' für dialogorientierte KI abzielt

25
Feb. 2025
VideoOffen

Alibaba Wan 2.1

Alibaba (Wan Team)

Apache-2.0-Suite von Modellen zur Videogenerierung (bis zu 14 Mrd. Parameter) für Text-zu-Video, Bild-zu-Video sowie Interpolation des ersten/letzten Frames in 720p

Erreichte Platz 1 auf VBench (86,22 %) und übertraf damit Sora (84,28 %) sowie jedes andere Modell – in vollständig offener Form unter Apache 2.0; über 2,2 Mio. Downloads belegten die enorme Akzeptanz in der Community, und die 1,3-Mrd.-Variante lief auf Consumer-Hardware, was die hochmoderne Videogenerierung demokratisierte

Erstes Open-Source-Modell, das die VBench-Bestenliste für Videoqualität anführte und alle geschlossenen Modelle übertraf

24
Feb. 2025
TextGeschlossen

Claude 3.7 Sonnet

Anthropic

Erstes Hybrid-Modell, das sofortige Antworten und ein vom Nutzer konfigurierbares erweitertes Reasoning in einem einzigen Modell vereint und 70,3 % auf SWE-bench Verified erreicht (mit erweitertem Scaffolding)

Vereinte Standard- und Reasoning-Modus in einem Modell (gegenüber der getrennten Aufteilung von o1/GPT-4o) und gab Entwicklern einen einzigen API-Endpunkt, der zwischen schnellen und tiefgreifenden Denkmodi wechseln konnte; setzte zum Erscheinungszeitpunkt einen neuen Maßstab für Coding-Agenten

Erstes Hybrid-Modell für schnelles und erweitertes Reasoning in einem einzigen Deployment

21
Feb. 2025
Gegründet

snipKI

snipKI

snipKI startet als KI-Enablement-Company und macht Teams im Arbeitsalltag KI-fähig.

Gegründet mitten in der Beschleunigung dieser Zeitachse — mit der Mission, dass Menschen und Teams mit dem Tempo Schritt halten, statt hinterherzulaufen. (Macher dieser Seite.)

17
Feb. 2025
TextGeschlossen

xAI Grok 3 + DeepSearch

xAI

Frontier-Reasoning-Modell, trainiert auf dem 200k-GPU-Cluster Colossus, mit der DeepSearch-Suchmaschine.

Markierte xAIs Ankunft als echter Frontier-Konkurrent.

Quelle:x.ai

Januar 2025

#3 Releases
27
Jan. 2025
AudioOffen

Kokoro TTS v1.0

hexgrad (independent)

Erweiterte Version von Kokoro mit Unterstützung für 8 Sprachen (Englisch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Mandarin, Portugiesisch) und 54 Stimmen unter Apache 2.0

Verwandelte den vorherigen, ausschließlich englischsprachigen Machbarkeitsnachweis in eine mehrsprachige Open-Weights-TTS-Bibliothek für den Produktiveinsatz, die über 10 Mio. monatliche Downloads erreichte; zeigte, dass ein kleines offenes Modell mit geschlossenen mehrsprachigen TTS-Systemen mithalten kann

23
Jan. 2025
TextGeschlossen

OpenAI Operator

OpenAI

Erster Mainstream-Agent, der eigenständig einen Webbrowser bedient (klicken, tippen, Formulare ausfüllen).

Startschuss der „agentischen Computer-Nutzung" 2025.

Erster Mainstream-Agent, der den Browser selbst bedient

20
Jan. 2025
TextOffen

DeepSeek-R1

DeepSeek

Offenes, MIT-lizenziertes Reasoning-Modell, das mit Reinforcement Learning nahezu von Grund auf (mit minimalen überwachten Daten) trainiert wurde und OpenAI o1 bei Mathematik-, Coding- und Wissenschafts-Benchmarks erreicht

Erstes Open-Weights-Modell, das die Reasoning-Leistung der o1-Klasse erreicht; die MIT-Lizenz erlaubte uneingeschränkte kommerzielle Nutzung und Destillation; zeigte, dass das Entstehen von RL-basiertem Reasoning OpenAIs Skalierung der Rechenleistung zur Inferenzzeit ohne riesige überwachte Datensätze replizieren kann

Erstes Open-Weights-Reasoning-Modell, das die Leistung auf o1-Niveau erreicht, unter MIT-Lizenz

Januar 2025 · erst jetzt möglich

Ein frei herunterladbares Modell auf Augenhöhe mit der teuersten Spitze.

Davor galt Open-Weights als hoffnungslos abgehängt.

Dezember 2024

#7 Releases
26
Dez. 2024
TextOffen

DeepSeek-V3

DeepSeek

Open-Weights-Modell mit 671B Parametern als sparses MoE, das GPT-4o und Claude 3.5 Sonnet bei Benchmarks erreicht und für nur 5,6 Mio. US-Dollar an Rechenleistung trainiert wurde

Bewies, dass Leistung der Frontier-Klasse zu einem Bruchteil (~1/10) der Trainingskosten westlicher Labore erreichbar ist, und versetzte die KI-Branche in Aufruhr über die Kostenannahmen, die dem KI-Investitionsboom zugrunde liegen

Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht

25
Dez. 2024
AudioOffen

Kokoro-82M v0.19

hexgrad (independent)

Apache-lizenziertes TTS-Modell mit 82M Parametern, das bei seinem Start Platz 1 in der Hugging Face TTS Arena belegte und natürliche englische Sprache für unter 1 US-Dollar pro Million Zeichen erzeugt

Zeigte, dass ein drastisch kleineres Modell (82M statt typischer über 500M) Frontier-Qualität erreichen kann, und machte hochwertiges TTS auf Consumer-Hardware und in kostensensiblen Umgebungen einsetzbar; sein Platz 1 in der Arena zum Release blamierte weitaus größere geschlossene Modelle

Erstes Modell mit unter 100M Parametern, das Platz 1 auf einem öffentlichen TTS-Qualitäts-Leaderboard erreicht

20
Dez. 2024
TextGeschlossen

OpenAI o3 (preview/announcement)

OpenAI

Reasoning-Modell der zweiten Generation, das beim ARC-AGI 87,5 % (mit hoher Rechenleistung) und bei Humanity's Last Exam 25,2 % erreicht — weit über allen früheren Modellen

Erreichte beim ARC-AGI 87,5 % gegenüber den ~32 % von o1 und dem bisherigen menschlich entworfenen algorithmischen Bestwert von 53 %, ein überraschender Sprung, der die Debatte über die Nähe zur AGI neu entfachte; die vollständige allgemeine Verfügbarkeit folgte am 16. April 2025

Erstes Modell, das beim ARC-AGI 75 % überschreitet

16
Dez. 2024
VideoGeschlossen

Google Veo 2

Google DeepMind

Video-Generierung in bis zu 4K und über mehrere Minuten, mit verbesserter realistischer Physik, präziser menschlicher Bewegung und filmischen Objektivsteuerungen

Hob die Qualitätsobergrenze gegenüber Veo 1 deutlich an, mit besserer Physikmodellierung, drastisch weniger Halluzinationen (keine zusätzlichen Finger) und 4K-Ausgabe; direkte Evaluierungen durch Menschen zeigten, dass Veo 2 gegen Sora und andere führende Modelle gewann, und etablierten Google als glaubwürdige Nummer 1 oder 2 bei der Qualität der Video-Generierung

11
Dez. 2024
TextGeschlossen

Gemini 2.0 Flash

Google DeepMind

Agentisches multimodales Modell mit nativer Tool-Nutzung (Suche, Code-Ausführung), Echtzeit-Audio-/Video-Streaming sowie nativ erzeugten Bildern und Sprache

Übertraf Gemini 1.5 Pro bei doppelter Geschwindigkeit und führte native multimodale Ausgabegenerierung sowie Tool-Nutzung auf Agenten-Niveau ein; wurde zur Grundlage für Googles Project Astra und das Mariner-Agenten-Ökosystem

9
Dez. 2024
VideoGeschlossen

OpenAI Sora GA (Sora Turbo)

OpenAI

Öffentliche Veröffentlichung von Sora Turbo, das 5–20 Sekunden lange Videoclips in 720p–1080p für ChatGPT-Plus- und Pro-Abonnenten erzeugt

Nach einer Lücke von 10 Monaten seit der Vorschau erschien Sora schließlich — der meisterwartete KI-Produktstart des Jahres 2024; bestätigte, dass die Vorschau vom Februar real war, und ermöglichte den ersten öffentlichen Zugang zu fotorealistischer Text-zu-Video-Generierung im Minutenbereich in großem Maßstab

3
Dez. 2024
VideoOffen

Tencent HunyuanVideo

Tencent

Transformer mit 13B Parametern, der von Dual-Stream auf Single-Stream umschaltet, für detailgetreue Text-zu-Video-Generierung mit vollständig offenen Gewichten

Größtes Open-Source-Videomodell zum Zeitpunkt der Veröffentlichung (13B Parameter) und das erste, das kommerzielle geschlossene Modelle (Runway Gen-3, Sora) bei Standard-Benchmarks in Open-Weights-Form erreichte oder übertraf; setzte eine neue Open-Source-Obergrenze und beschleunigte Community-Forschung und Fine-Tuning

Größtes Open-Source-Videogenerierungsmodell zum Zeitpunkt der Veröffentlichung (13B Parameter), erstes offenes Modell, das die kommerzielle Frontier-Qualität erreicht

November 2024

#2 Releases
22
Nov. 2024
VideoOffen

Lightricks LTX-Video (LTXV)

Lightricks

DiT-basiertes Text-zu-Video-Modell mit 2B Parametern, das 5 Sekunden Video in 768×512 schneller als in Echtzeit erzeugt (4 s Generierung für einen 5-Sekunden-Clip)

Erstes Open-Source-Videomodell für Echtzeit-Generierung auf Basis von Diffusion-Transformern; indem es schneller als die Wiedergabegeschwindigkeit generiert, erschloss es interaktive und iterative Arbeitsabläufe, die mit offenen Modellen zuvor unmöglich waren, während die vollständig offenen Gewichte Community-Fine-Tuning ermöglichten

Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)

19
Nov. 2024
AudioGeschlossen

Suno v4

Suno

Saubereres Audio, schärfere Lyrics, dynamische Songstruktur, Covers und Personas.

Der prägende Consumer-KI-Musik-Meilenstein 2024.

Oktober 2024

#8 Releases
30
Okt. 2024
BildGeschlossen

Recraft V3

Recraft

Text-zu-Bild- und Vektor-Generierung mit präziser Textpositionierung, anatomisch korrekten Figuren und als einziges Modell in der Lage, Bilder mit langen, mehrwortigen Textpassagen zu erzeugen

Stieg auf Platz 1 des Text-zu-Bild-ELO-Leaderboards von Hugging Face Artificial Analysis ein (Wertung 1172) und hielt diese Spitzenposition fünf Monate in Folge vor Midjourney und OpenAI — das erste Mal, dass ein kleineres Start-up die etablierten Marktführer auf einem öffentlichen Benchmark nach menschlicher Präferenz verdrängte

Erstes Modell, das korrekte, mehrwortige Langtextpassagen innerhalb von Bildern erzeugt

28
Okt. 2024
TextGeschlossen

Apple Intelligence

Apple

On-Device- und Private-Cloud-KI direkt in iOS/iPadOS/macOS: Schreibwerkzeuge, Zusammenfassungen, Image Playground, ChatGPT-Siri.

Der Moment, in dem generative KI standardmäßig auf über eine Milliarde Geräte kam.

22
Okt. 2024
VideoOffen

Genmo Mochi 1

Genmo

Text-zu-Video-Modell mit 10B Parametern unter Apache 2.0, das 480p-Clips bei 30 fps mit hoher Bewegungsqualität und Prompt-Treue erzeugt

Damals das größte Open-Source-Videomodell; seine Architektur eines asymmetrischen Diffusion-Transformers (AsymmDiT) erreichte geschlossene Frontier-Modelle wie Gen-3 und Kling bei Benchmarks zur Bewegungsqualität, verkleinerte den Abstand zwischen offen und geschlossen drastisch und bot Forschenden eine frei modifizierbare, hochwertige Grundlage

Größtes Open-Source-Text-zu-Video-Modell zum Zeitpunkt der Veröffentlichung (10B Parameter, Apache 2.0)

22
Okt. 2024
BildOffen

Stable Diffusion 3.5 Large

Stability AI

MMDiT-X-Modell mit 8,1B Parametern und drei parallelen Text-Encodern (OpenCLIP, CLIP, T5-XXL), mit einer freizügigen kommerziellen Lizenz für bis zu 1 Mio. US-Dollar Jahresumsatz, lauffähig auf Consumer-Hardware

Reagierte direkt darauf, dass SD 3 Medium die Erwartungen der Community nicht erfüllt hatte; die uneingeschränkt kommerzielle, freizügige Lizenz für ein Modell mit über 8B Parametern war beispiellos — und machte SD 3.5 damals zum hochwertigsten offenen Modell für kommerzielles Fine-Tuning

Erstes Open-Weights-Bildgenerierungsmodell mit über 8B Parametern, das unter einer freizügigen kommerziellen Lizenz veröffentlicht wurde

22
Okt. 2024
TextGeschlossen

Claude 3.5 Sonnet (v2) with Computer Use

Anthropic

Überarbeitetes Sonnet mit einer öffentlichen Beta-API für Computer-Use, die es dem Modell erlaubt, einen echten Desktop zu steuern, indem es einen Bildschirm betrachtet und Maus und Tastatur bedient

Erstes Frontier-Modell mit einer öffentlichen API zur autonomen Computersteuerung, das Agenten ermöglichte, beliebige GUI-Software zu bedienen; der SWE-bench-Wert stieg auf 49 % (von 33 %) und setzte damals einen neuen öffentlichen Rekord für Coding-Agenten

Erstes Frontier-KI-Modell, das Computer-Use (GUI-Automatisierung) in einer öffentlichen Beta anbietet

9
Okt. 2024
AudioOffen

F5-TTS

Shanghai Jiao Tong University / Cambridge University

TTS auf Basis eines Diffusion-Transformers mit Flow Matching, das Zero-Shot-Voice-Cloning mit hoher Natürlichkeit aus kurzem Referenzaudio erreicht und Chinesisch sowie Englisch unterstützt

Kombinierte Flow Matching mit einem Diffusion-Transformer (DiT) für nicht-autoregressives TTS — und erzielte damit eine Natürlichkeit nahe dem Stand der Technik bei deutlich schnellerer Inferenz als frühere autoregressive Modelle, wobei die vollständigen Gewichte zur kommerziellen Nutzung freigegeben wurden

Erste Architektur aus Diffusion-Transformer mit Flow Matching, die auf Zero-Shot-TTS angewendet wird und autoregressive Qualität erreicht oder übertrifft

4
Okt. 2024
VideoGeschlossen

Meta Movie Gen

Meta

Bis zu 16 Sekunden Video in 1080p mit synchron erzeugtem nativem Audio, personalisiertes Video aus einem einzelnen Foto und instruktionsbasierte Videobearbeitung.

Setzte den Forschungsmaßstab für gemeinsame Video-und-Audio-Generierung rund acht Monate bevor Veo 3 dies produktisierte — breit als Referenz zitiert, obwohl nie öffentlich veröffentlicht.

Erstes Frontier-Labor-Modell mit gemeinsam erzeugtem synchronem Ton zum Video plus Ein-Foto-Personalisierung

Forschungsmodell — nie öffentlich veröffentlicht.

1
Okt. 2024
AudioGeschlossen

OpenAI Realtime API (public beta)

OpenAI

Entwickler-API zum Erstellen latenzarmer Speech-to-Speech-Sprachagenten auf GPT-4o-Basis, die in Anwendungen Unterbrechungen in Echtzeit, Function-Calling und natürliche Prosodie ermöglicht

Öffnete die nativen Sprachfähigkeiten von GPT-4o über eine stabile API für Drittentwickler und ermöglichte eine neue Generation produktiver Sprachagenten, ohne separate Pipelines aus ASR, LLM und TTS zusammenfügen zu müssen

Erste Entwickler-API, die ein durchgängiges Speech-to-Speech-Modell auf Frontier-Niveau für den Bau produktiver Sprachagenten bereitstellt

September 2024

#7 Releases
25
Sept. 2024
TextOffen

Llama 3.2 (Vision + Edge)

Meta

Metas erste offene multimodale Modelle (11B/90B Vision) plus 1B/3B-Textmodelle für Mobil/Edge.

Brachte offene Vision-Modelle und On-Device-LLMs in den Mainstream.

24
Sept. 2024
AudioGeschlossen

OpenAI ChatGPT Advanced Voice Mode (ChatGPT Plus rollout)

OpenAI

Echtzeit-Sprachassistent auf GPT-4o-Basis mit Erkennung des emotionalen Tonfalls, Unterbrechung mitten im Satz und einer Reaktionszeit unter 300 ms, ausgerollt an alle Plus- und Team-Abonnenten

Brachte das durchgängige, native Sprachmodell zu Hunderten Millionen ChatGPT-Plus-Nutzern und machte die konversationelle Sprachinteraktion mit KI massentauglich; emotionales Bewusstsein und der Umgang mit Unterbrechungen setzten neue Maßstäbe für Endkunden-Sprach-KI

19
Sept. 2024
TextOffen

Qwen2.5

Alibaba

Volle 0,5B–72B-Familie mit starkem Coding/Mathe; eines der größten Open-Source-Releases.

Definierte Ende 2024 die Open-Weights-Spitze und ebnete den Weg für die DeepSeek/Qwen-Welle.

19
Sept. 2024
VideoGeschlossen

Kuaishou Kling 1.5

Kuaishou

Video-Generierung in 1080p HD mit Motion Brush zur präzisen Bewegungssteuerung einzelner Elemente für bis zu sechs Szenenobjekte

Führte eine granulare Bewegungssteuerung pro Objekt (Motion Brush) ein, mit der Regisseure exakt choreografieren können, welche Teile einer Szene sich wie bewegen — ein qualitativer Sprung bei der professionellen Kontrollierbarkeit — und verbesserte zugleich die Ausgabequalität in internen Evaluierungen um 95 % gegenüber Kling 1.0

12
Sept. 2024
TextGeschlossen

OpenAI o1-preview

OpenAI

Reasoning-Modell, das vor der Antwort eine interne Gedankenkette aus 'Thinking-Tokens' nutzt und beim USA Math Olympiad das 83.

Perzentil sowie bei Codeforces das 89. Perzentil erreicht

Führte die Skalierung der Rechenleistung zur Inferenzzeit (Test-Time Compute) als neue Skalierungsachse ein, getrennt vom Vortraining; ermöglichte Durchbrüche bei Wettbewerbsmathematik und Wissenschaft auf Promotionsniveau (GPQA), die frühere Modelle der GPT-4-Klasse nicht erreichen konnten, und läutete damit die Ära der Reasoning-Modelle ein

Erstes öffentlich eingesetztes LLM, das interne Reasoning-Tokens (Skalierung der Rechenleistung zur Inferenzzeit) als Produktfunktion nutzt

11
Sept. 2024
AudioGeschlossen

NotebookLM Audio Overviews

Google

Verwandelt beliebige Dokumente in eine Podcast-artige Audiodiskussion zweier Hosts.

Der virale Consumer-KI-Moment Ende 2024 — definierte „KI-Audio" für die Öffentlichkeit neu.

11
Sept. 2024
AudioGeschlossen

Hume AI EVI 2

Hume AI

Voice-to-Voice-Foundation-Modell mit emotionaler Intelligenz, 500–800 ms Latenz, breiter Nachbildung von Persönlichkeit und Akzent sowie einer neuartigen API zur Stimmmodulation, die direktes Voice-Cloning vermeidet

Eigens entwickeltes Sprachmodell, das ausdrücklich auf emotionalen Ausdruck und tonale Anpassung trainiert wurde; stellte eine Entwickler-API für emotional bewusste Sprachagenten bereit, bevor OpenAIs Realtime API erschien, und leistete Pionierarbeit bei datenschutzfreundlicher Stimmmodulation ohne Cloning

Erste allgemein verfügbare Entwickler-API für emotional intelligente Voice-to-Voice-Konversation

August 2024

#5 Releases
31
Aug. 2024
VideoGeschlossen

MiniMax Hailuo Video-01

MiniMax

Text-zu-Video- und Bild-zu-Video-Generierung in 720p bei 25 fps mit filmischen Kameraeffekten in sechssekündigen Clips

Führte eine durchsatzstarke, komprimierte Video-Generierungspipeline ein, die filmische Qualität bei geringer Latenz liefert; entwickelte sich rasch zu einer der meistgenutzten Closed-Source-Video-APIs und etablierte MiniMax als wichtigen Frontier-Konkurrenten neben Runway und Kling

21
Aug. 2024
BildGeschlossen

Ideogram 2.0

Ideogram AI

Großer Sprung beim Fotorealismus, fünf Stilmodi (realistisch, Design, 3D, Anime, allgemein), verbesserte Darstellung von Händen, Gesichtern und Haut, iOS-App und öffentliche API

Verwandelte Ideogram von einem Spezialisten für Textdarstellung in ein vollwertiges Bildmodell, das in Evaluierungen nach menschlicher Präferenz mit DALL-E 3 und FLUX.1 Pro konkurriert; der gleichzeitige API-Start ermöglichte eine breite Adoption durch Entwickler

15
Aug. 2024
BildGeschlossen

Google Imagen 3

Google DeepMind

Fotorealistische Bilder mit feinen Details (Stoffe, Wassertropfen, Fell), weniger Artefakten, verbesserter Prompt-Treue und Integration in die Gemini-Apps für alle Nutzer in den USA

Googles erstes Bildmodell, das über Gemini allen Endnutzern (nicht nur dem Enterprise-Angebot Vertex AI) zur Verfügung stand; Benchmark-Evaluierungen zeigten, dass es Midjourney und DALL-E 3 im Fotorealismus erreichte oder übertraf — und schloss damit die Wahrnehmungslücke zwischen Googles Forschungsfähigkeit und seinem Endkundenprodukt

13
Aug. 2024
TextGeschlossen

Grok-2

xAI

Frontier-Chat mit Bildverständnis, Echtzeit-X-Suche und FLUX-gestützter Bildgenerierung.

Markierte xAIs Sprung in die Frontier-Liga (und die Debatte um ungefilterte Bildgenerierung).

Quelle:x.ai
1
Aug. 2024
BildOffen

FLUX.1 (pro / dev / schnell)

Black Forest Labs

Modellreihe mit 12B Parametern auf Basis von Flow Matching: FLUX.1[schnell] (Apache 2.0, 10× schneller dank Destillation), FLUX.1[dev] (Open Weights, nicht kommerziell), FLUX.1[pro] (geschlossene API), allesamt auf dem Qualitätsniveau von Midjourney v6

Die neue Architektur des ehemaligen Stable-Diffusion-Teams (Hybrid aus Flow Matching und Transformer) erreichte oder übertraf sofort alle bestehenden Open-Weights-Modelle und die meisten geschlossenen; die Apache-2.0-Lizenz von FLUX.1[schnell] machte es zum ersten vollständig kommerziell freien Bildmodell auf Frontier-Niveau und löste eine neue Welle an Open-Source-Werkzeugen aus

Erstes Apache-lizenziertes Modell, das Bildqualität auf Frontier-Niveau erreicht (FLUX.1[schnell])

Juli 2024

#3 Releases
24
Juli 2024
AudioGeschlossen

Udio v1.5

Udio

Überarbeitetes Musikmodell mit 48-kHz-Stereo-Ausgabe, Stem-Downloads (Vocals/Bass/Drums), Audio-zu-Audio-Remix aus eigenen Uploads sowie Tonart- und Modussteuerung

Führte Stem-Trennung und Audio-zu-Audio-Remixing in einen KI-Musikgenerator ein und schlug damit eine Brücke zwischen generativen Werkzeugen und klassischen Produktionsabläufen im Stil einer DAW

Erster KI-Musikgenerator, der integrierte Stem-Trennung und Upload-basiertes Audio-Remixing in einem Produkt ausliefert

23
Juli 2024
TextOffen

Llama 3.1 405B

Meta

Open-Weights-Modell mit 405B Parametern und 128K Kontext, das GPT-4o und Claude 3.5 Sonnet in zentralen Evaluierungen erreicht, mit einer destillationsfreundlichen Lizenz

Das erste frei verfügbare Modell, das in vollem Maßstab mit geschlossenen Frontier-Systemen konkurriert; seine Lizenz erlaubte ausdrücklich, die Ausgaben zum Training anderer Modelle zu verwenden, und ermöglichte damit Pipelines für synthetische Daten und Modelldestillation in beispiellosem Umfang

Erstes Open-Weights-Modell mit über 400B Parametern, das mit geschlossenen Frontier-Modellen konkurrenzfähig ist

3
Juli 2024
AudioOffen

Kyutai Moshi

Kyutai

Voll-duplexes Echtzeit-Sprache-zu-Sprache-Dialogmodell (rund 200 ms Latenz) mit dem Mimi-Neural-Codec — hört und spricht gleichzeitig, ohne starres Abwechseln.

Erstes offen testbares Echtzeit-Voll-Duplex-Sprach-LLM, noch vor der GA der OpenAI Realtime API — und mit offenen Gewichten, anders als GPT-4o-Sprache.

Erstes Echtzeit-Voll-Duplex-Sprachdialog-Foundation-Model

Offene Gewichte ab 18.09.2024.

Juni 2024

#7 Releases
21
Juni 2024
TextGeschlossen

Claude 3.5 Sonnet (v1)

Anthropic

Mittelklassemodell, das Claude 3 Opus in den meisten Benchmarks bei doppelter Geschwindigkeit und einem Fünftel der Kosten übertrifft

Kehrte die erwartete Kurve aus Leistungsfähigkeit und Kosten um: Ein Mittelklassemodell schlägt das Spitzenmodell der vorherigen Generation, macht erstklassiges Reasoning in großem Maßstab erschwinglich und zwingt zu einer Neubewertung, wie Modellfamilien strukturiert sein sollten

17
Juni 2024
VideoGeschlossen

Runway Gen-3 Alpha

Runway

Text- und Bild-zu-Video in hoher Detailtreue mit ausdrucksstarker Generierung menschlicher Figuren, feingranularer zeitlicher Steuerung und filmischen Übergängen

Deutlicher Sprung in der Detailtreue gegenüber Gen-2 — das erste Runway-Modell, das auf einer neuen, groß angelegten multimodalen Infrastruktur mit zeitlich dichten Bildbeschreibungen trainiert wurde. Das ermöglicht präzises Keyframing und ausdrucksstarke menschliche Bewegung, womit der Abstand zu Sora-Niveau erheblich verkleinert wurde

12
Juni 2024
VideoGeschlossen

Luma Dream Machine

Luma AI

Multimodaler Transformer, der aus Text- oder Bildeingaben flüssige, physikalisch plausible 5-Sekunden-Videoclips mit filmischer Kamerabewegung erzeugt

Erstes Videogenerierungsmodell, das durchgängig auf einem skalierbaren multimodalen Transformer aufgebaut ist (statt auf einem Latent-Diffusion-UNet) und merklich flüssigere Bewegung sowie eine bessere Einhaltung der Physik liefert; wuchs innerhalb von Monaten auf 25 Mio. Nutzer und zeigte damit eine Nachfrage im Massenmarkt

Erstes Verbraucher-Videomodell, das rein auf einem video-nativen multimodalen Transformer aufgebaut ist

12
Juni 2024
BildOffen

Stable Diffusion 3 Medium (open weights)

Stability AI

Architektur eines Multimodal Diffusion Transformer (MMDiT) mit 2 Mrd. Parametern, mit verbesserter Typografie, besserer Anatomie und Textkonditionierung über T5-XXL

Führte die transformerbasierte MMDiT-Architektur in die Open-Source-Community ein und ersetzte die UNet-basierte Diffusion; die neue Architektur ermöglichte eine bessere gemeinsame Attention von Text und Bild, legte das strukturelle Fundament für SD 3.5 und beeinflusste FLUX.1; die Aufnahme in der Community fiel jedoch wegen der restriktiven Lizenzierung gemischt aus

Erstes Open-Weights-Modell, das die Architektur eines Multimodal Diffusion Transformer (MMDiT) für die Text-to-Image-Generierung nutzt

10
Juni 2024
VideoGeschlossen

Kuaishou Kling 1.0

Kuaishou

Erzeugt bis zu 2 Minuten lange Videos in 1080p bei 30 fps aus Text oder Bildern mit komplexer Bewegung und Simulation der physischen Welt

Erstes Modell, das die 10-Sekunden-Clip-Grenze bei voller 1080p-Qualität durchbrach; seine Architektur aus 3D-VAE + vollständiger raumzeitlicher Attention erzeugte branchenführenden Bewegungsrealismus und bewies, dass chinesische Labore mit westlichen Spitzenmodellen mithalten können, was den globalen Wettbewerb verschärfte

Erstes kommerzielles Modell, das durchgehende Videogenerierung von 2 Minuten in 1080p unterstützt

8
Juni 2024
AudioGeschlossen

Microsoft VALL-E 2

Microsoft

Zero-Shot-TTS, das auf den VALL-E-Benchmarks menschliches Niveau erreicht – durch wiederholungsbewusstes Sampling und gruppierte Code-Modellierung

Erstes TTS-System, das auf den Standard-Benchmarks für Verständlichkeit (WER) und Natürlichkeit (CMOS) als auf menschlichem Niveau erklärt wurde, und markierte damit einen formalen Wendepunkt, an dem synthetische Sprache in kontrollierter Evaluierung statistisch nicht mehr von menschlicher Sprache zu unterscheiden war

Erstes TTS-Modell, das auf formalen Benchmarks für Verständlichkeit und Natürlichkeit Werte auf menschlichem Niveau erreicht

5
Juni 2024
AudioOffen

Stability Stable Audio Open

Stability AI

Open-Weights-Diffusionsmodell für Text-to-Audio zur Erzeugung von bis zu 47 Sekunden an Soundeffekten und Samples, verfügbar für die nichtkommerzielle Nutzung

Gab Forschern und Entwicklern eine freizügig veröffentlichbare Open-Weights-Baseline für die Text-to-Audio-Generierung aus einem kommerziellen Labor

Mai 2024

#3 Releases
14
Mai 2024
TextGeschlossen

Gemini 1.5 Flash

Google

Schnelles, günstiges Modell mit 1-Mio.-Token-Kontext für Hochvolumen-Aufgaben.

Machte günstige Long-Context-Inferenz zum Standard — Googles Arbeitspferd.

14
Mai 2024
VideoGeschlossen

Google Veo 1

Google DeepMind

Erzeugt filmische Videoclips in 1080p von über einer Minute Länge aus Text-Prompts, mit Verständnis für Kamerabewegungen und physikalische Dynamik

Googles erstes ernstzunehmendes Videogenerierungssystem in voller Auflösung; bündelte Jahre interner Forschung (Imagen-Video, Phenaki, Lumiere, VideoPoet) in einem einzigen Modell, das in direkten Vergleichen die Qualität der Sora-Klasse erreichte oder übertraf und damit glaubwürdige Konkurrenz von Google signalisierte

13
Mai 2024
AudioGeschlossen

GPT-4o native speech-to-speech (demo)

OpenAI

Durchgängiges multimodales Modell mit Sprache als Ein- und Ausgabe, mit einer Latenz unter 300 ms, Handhabung von Unterbrechungen, Erkennung des emotionalen Tonfalls und mehrsprachiger Echtzeitkonversation

Alle bisherigen Sprachassistenten (einschließlich des ChatGPT-eigenen) verketteten drei separate Modelle (STT → LLM → TTS), was 1–2 s Latenz verursachte und prosodische Feinheiten verlor; GPT-4o verarbeitete Audio nativ und ermöglichte so erstmals eine wirklich dialogfähige Interaktion im großen Maßstab

Erstes Spitzen-LLM, das Audio nativ und durchgängig verarbeitet und so die Latenz der STT→LLM→TTS-Kette beseitigt

Mai 2024 · erst jetzt möglich

Echtzeit-Sprachgespräch, mit Lachen und Unterbrechungen.

Davor: roboterhafte Vorlese-Stimmen mit spürbarer Verzögerung.

April 2024

#5 Releases
23
Apr. 2024
TextOffen

Microsoft Phi-3 (Phi-3-mini)

Microsoft

3,8-Mrd.-Parameter-Open-SLM, das die Leistung deutlich größerer Modelle erreicht und lokal auf einem Smartphone läuft.

Etablierte „Small Language Models" als ernsthafte Fähigkeitsstufe — leistungsfähige KI ohne Cloud, direkt auf dem Gerät. Bislang war kein Phi-Modell vertreten.

Wegweisendes SLM-auf-dem-Gerät

23
Apr. 2024
BildGeschlossen

Adobe Firefly Image 3

Adobe

Großer Qualitätssprung mit fotorealistischen Details, Stilisierung und Kompositionsabgleich anhand von Referenzbildern, verbessertem Verständnis komplexer Szenen und höherer Generierungsgeschwindigkeit

Erstes Firefly-Modell, das beim Fotorealismus direkt mit den Spitzenmodellen aus dem offenen Web konkurriert, und das zugleich den kommerziellen Schutzgraben aus lizenzierten Daten behält; integriert in die Workflows der generativen Fülltechnik von Photoshop, die von Millionen Profis genutzt werden

18
Apr. 2024
TextOffen

Llama 3 (8B / 70B)

Meta

Beste quelloffene 8B- und 70B-Modelle bei Erscheinen, mit 128K Kontext und verbessertem Reasoning, Coding und Befolgen von Anweisungen

Schloss bei der Größenordnung von 70B die Qualitätslücke zwischen Open-Weights- und geschlossenen Modellen, machte offen gehostete Fähigkeiten der GPT-3.5-Klasse breit verfügbar und ebnete den Weg für das 405B-Flaggschiff später im Jahr 2024

10
Apr. 2024
AudioGeschlossen

Udio public beta launch

Udio

KI-Musikgenerierung aus Text-Prompts, die hochauflösende vollständige Songs mit steuerbarem Genre, Stimmung und Instrumentierung erzeugt – entwickelt von ehemaligen Forschern von Google DeepMind

Brachte einen glaubwürdigen zweiten Spitzenkonkurrenten zu Suno hervor; seine Qualität bei komplexen Subgenres und seine Audiotreue hoben die Messlatte branchenweit an und schufen das erste echte Zweikampf-Rennen in der KI-Musikgenerierung

3
Apr. 2024
AudioGeschlossen

Stability AI Stable Audio 2.0

Stability AI

Text-to-Music-Modell, das vollständige Tracks von bis zu 3 Minuten in 44,1-kHz-Stereo mit kohärenter musikalischer Struktur erzeugt, plus Audio-to-Audio-Stilübertragung

Verlängerte die maximale Tracklänge auf 3 Minuten und ergänzte die Audio-to-Audio-Transformation – das heißt, Nutzer konnten bestehende Aufnahmen per Text-Prompt remixen – und erweiterte so den Produktionsnutzen deutlich über kurze Clips hinaus

März 2024

#1 Release
4
März 2024
TextGeschlossen

Claude 3 (Opus / Sonnet / Haiku)

Anthropic

Modellfamilie in drei Stufen mit Bildverständnis; Opus führt bei Erscheinen MMLU, GPQA und weitere führende Benchmarks an und übertrifft GPT-4 in den meisten Evaluierungen

Erste Modellfamilie, die GPT-4 in Standard-Benchmarks gemeinsam schlägt und dabei abgestufte Kompromisse zwischen Intelligenz und Geschwindigkeit einführt; Opus' nahezu perfekte Trefferquote bei der Nadel-im-Heuhaufen-Suche (99,4 %) bei 200K Tokens setzte einen neuen Zuverlässigkeitsstandard für lange Kontexte

Februar 2024

#4 Releases
28
Feb. 2024
BildGeschlossen

Ideogram 1.0

Ideogram AI

Spitzentechnologie bei der Textdarstellung mit einer rund halbierten Textfehlerrate gegenüber 0.1, deutlich verbessertem Fotorealismus und kommerziellem API-Zugang

Etablierte Ideogram als vollwertiges kommerzielles Modell und nicht nur als Kuriosität für Text im Bild; bewies, dass ein Start-up, das sich auf eine schwierige Nischenfähigkeit (Typografie) konzentriert, diesen Vorsprung in allgemeine Bildqualität ausweiten und etablierte Anbieter herausfordern kann

21
Feb. 2024
TextOffen

Google Gemma

Google

Googles erste offene LLM-Familie (2B/7B), abgeleitet aus der Gemini-Forschung, mit offenen Gewichten zur freien und kommerziellen Nutzung.

Markiert Googles Eintritt in das offene Modell-Rennen (als Antwort auf Meta und Mistral). Bis dahin war kein offenes Google-Modell vertreten.

Googles erstes offenes Sprachmodell

15
Feb. 2024
VideoGeschlossen

OpenAI Sora (preview announcement)

OpenAI

Diffusion-Transformer, der aus Text-Prompts fotorealistische Videos von bis zu 60 Sekunden Länge erzeugt – mit emergenter Objektpermanenz und kohärenten Szenen mit mehreren Charakteren

Ein so großer Qualitätssprung, dass er weithin als der „GPT-1-Moment“ für Video bezeichnet wurde; zeigte, dass die Skalierung von Rechenleistung und Daten in einem Diffusion-Transformer eine emergente physikalische Plausibilität hervorbringen kann – Objektpermanenz, realistische Bewegung –, die in dieser Detailtreue zuvor nicht zu sehen war, und setzte damit eine neue Obergrenze für das Feld

Erste Demonstration von minutenlangem, fotorealistischem KI-Video aus Text auf diesem Qualitätsniveau

15
Feb. 2024
TextGeschlossen

Gemini 1.5 Pro

Google DeepMind

Kontextfenster von 1 Million Tokens (später auf 2 Mio. erweitert), das In-Context-Learning über Text, Audio, Video und Code unterstützt

Erweiterte das effektive Kontextfenster um rund das Achtfache gegenüber dem damaligen Spitzenmodell (GPT-4 Turbo mit 128K) und ermöglichte so die Verarbeitung einer kompletten Codebasis oder einer Stunde Video in einem einzigen Prompt; führte das Erlernen von Fähigkeiten im Kontext ohne Fine-Tuning ein

Erstes Modell mit einem Kontextfenster von 1 Million Tokens

Februar 2024 · erst jetzt möglich

Ein Satz wird zu einer Minute kohärentem Video.

Ein Jahr zuvor: vier Sekunden Flackern — der „Will Smith isst Spaghetti“-Clip.

Dezember 2023

#5 Releases
20
Dez. 2023
AudioGeschlossen

Suno public launch (Chirp / v2 model)

Suno AI

Endkundenprodukt, das aus einem Text-Prompt in Sekunden vollständige Songs – Gesang, Instrumentierung, Songtext – erzeugt

Bisherige Musik-KI-Tools erzeugten kurze Instrumentalclips; Suno produzierte auf Abruf vollständige Songs mit kohärenter Struktur und Gesang und machte das Erstellen von KI-Musik für Nichtmusiker zugänglich

Erstes Massenmarktprodukt, das vollständige Gesangssongs (Songtext + Melodie + Arrangement) durchgängig aus einem Text-Prompt erzeugt

20
Dez. 2023
BildGeschlossen

Midjourney v6

Midjourney

Deutlicher Sprung beim Fotorealismus, lesbare Textdarstellung im Bild, doppelte Länge des Prompt-Tokens und überarbeitetes Prompting in natürlicher Sprache; drittes von Grund auf trainiertes Modell

Schloss den Rückstand bei der Textdarstellung gegenüber Ideogram/DALL-E 3 und baute zugleich Midjourneys Vorsprung beim künstlerischen Fotorealismus aus; das neunmonatige Training von Grund auf zeigte, dass Skalierung und architektonische Iteration die Qualität auf eine Weise steigern können, wie es Fine-Tuning nicht vermag

13
Dez. 2023
BildGeschlossen

Google Imagen 2

Google DeepMind

Fotorealistische Bildgenerierung mit Text- und Logo-Darstellung in mehreren Sprachen, unsichtbares Wasserzeichen per SynthID und unternehmensrechtliche IP-Freistellung auf Vertex AI

Erstes Google-Bildmodell mit allgemein verfügbarem Enterprise-API-Zugang; verband die Forschungsqualität von DeepMind mit Googles Infrastruktur und brachte den ersten großflächigen Einsatz von SynthID (Wasserzeichen zur Herkunftskennzeichnung von KI-Inhalten) – und ging damit branchenweit das Problem der Authentizität an

Erster Einsatz des unsichtbaren KI-Wasserzeichens SynthID im produktiven Maßstab

11
Dez. 2023
TextOffen

Mixtral 8x7B

Mistral AI

Sparse-Mixture-of-Experts-Modell mit 46,7 Mrd. Parametern insgesamt, aber nur 12,9 Mrd. aktiven pro Token, das GPT-3.5 in Benchmarks erreicht – bei sechsmal schnellerer Inferenz als Llama 2 70B

Bewies, dass eine Sparse-MoE-Architektur in einem offenen Apache-2.0-Modell mit Closed-Source vergleichbare Qualität zu einem Bruchteil der Inferenzkosten liefern kann, und machte Leistung der Spitzenklasse für das Self-Hosting erschwinglich

Erstes Open-Weights-Sparse-MoE-Modell dieser Größenordnung, das die Leistung von GPT-3.5 erreicht

6
Dez. 2023
TextGeschlossen

Gemini 1.0

Google DeepMind

Nativ multimodales Modell (Text, Bild, Audio, Video, Code) in drei Größen: Ultra, Pro, Nano; Ultra war das erste Modell, das mit 90,0 % den Durchschnitt menschlicher Experten im MMLU übertraf

Erstes Modell, das von Grund auf nativ multimodal gebaut wurde (statt einer nachträglich angeflanschten Bildverarbeitung), und das erste, das den Durchschnitt menschlicher Experten im MMLU übertraf – ein Signal für Googles Rückkehr in den Wettbewerb an der Spitze nach der Disruption durch ChatGPT

Erstes Modell, das den Durchschnitt menschlicher Experten im MMLU übertrifft (90,0 % gegenüber einer Baseline menschlicher Experten von etwa 89 %)

November 2023

#4 Releases
28
Nov. 2023
VideoGeschlossen

Pika 1.0

Pika Labs

Verbraucherfreundliche Text-to-Video-Plattform, die aus Text-Prompts über Web und Discord 3D-Animationen, Anime, Cartoons und filmische Clips erzeugt

Zeigte, dass ein kleines Start-up in sechs Monaten 500.000 Nutzer mit ausgereifter, vielseitiger Videogenerierung erreichen konnte; hob die Messlatte für die UX neben der Qualität an und etablierte die Produktkategorie der abonnementbasierten Videogenerierung für Endverbraucher

21
Nov. 2023
VideoOffen

Stable Video Diffusion (SVD)

Stability AI

Open-Weights-Modell für Image-to-Video, das aus einem einzelnen Referenzbild 14–25 Frames bei 3–30 fps erzeugt

Erstes grundlegendes Open-Weights-Modell für Image-to-Video mit öffentlich verfügbaren Gewichten; gab der Open-Source-Community einen hochwertigen Ausgangspunkt für die Bildanimation und das Fine-Tuning und übertraf bei Erscheinen führende geschlossene Modelle in Studien zur Nutzerpräferenz

Erstes breit veröffentlichtes Open-Weights-Diffusionsmodell für Image-to-Video

6
Nov. 2023
AudioGeschlossen

OpenAI TTS API (tts-1 / tts-1-hd) + Whisper large-v3

OpenAI

Entwickler-API für neuronale Text-to-Speech (6 Stimmen, Echtzeit- und HD-Varianten) plus Whisper large-v3 mit einer um 10–20 % niedrigeren WER als v2

Verschaffte jedem Entwickler über OpenAIs bestehende Plattform sofortigen Zugang zu einer ausgereiften neuronalen TTS-API; large-v3 aktualisierte zugleich den Stand der Technik bei der quelloffenen Spracherkennung (ASR)

6
Nov. 2023
TextGeschlossen

GPT-4 Turbo

OpenAI

Modell der GPT-4-Klasse mit einem Kontextfenster von 128K Tokens und einem Wissensstand bis April 2023, zu einem dreifach niedrigeren Preis pro Input-Token

Machte die Verarbeitung langer Kontexte (300+ Seiten in einem einzigen Prompt) bei drastisch reduzierten Kosten massentauglich und erweiterte zugleich den Wissensstand erheblich; demokratisierte Fähigkeiten auf GPT-4-Niveau für Entwickler

Oktober 2023

#1 Release
19
Okt. 2023
BildGeschlossen

DALL-E 3

OpenAI

Nativ in ChatGPT integriert für die dialogbasierte Iteration von Prompts; deutliche Verbesserung der Prompt-Treue und Detailgenauigkeit gegenüber DALL-E 2

Zeigte, dass die direkte Kopplung eines hochmodernen LLM an einen Bildgenerator (ChatGPT als „Prompt Engineer“) das richtige UX-Paradigma war; DALL-E 3 hörte auf, Wörter im Prompt zu ignorieren, und löste damit den langjährigen Fehlermodus des „ignorierten Prompts“; setzte den Maßstab für die Befolgung von Anweisungen in der Bildgenerierung

Erstes Bildgenerierungsmodell, das nativ in eine große LLM-Chat-Oberfläche (ChatGPT) eingebettet ist

September 2023

#4 Releases
27
Sept. 2023
TextOffen

Mistral 7B

Mistral AI

Modell mit 7,3 Mrd. Parametern, das Llama 2 13B in allen Benchmarks und Llama 1 34B in vielen übertrifft – mittels Sliding-Window-Attention

Zerschlug die Annahme, dass man 13 Mrd. oder mehr Parameter braucht, um ein 13B-Modell zu schlagen; zeigte, dass architektonische Effizienz rohe Skalierung ersetzen kann, und stellte einen neuen Rekord bei der Qualität pro Parameter für offene Modelle auf

Erstes Open-Weights-Modell mit 7B, das ein 13B-Modell auf ganzer Linie in Standard-Benchmarks schlägt

25
Sept. 2023
TextGeschlossen

GPT-4V (Vision) + Sprache

OpenAI

GPT-4 bekommt Bildverständnis (GPT-4V) und gesprochene Konversation — ChatGPT wird wirklich multimodal.

Der Moment, in dem ein Mainstream-Chatbot „sehen" und „sprechen" konnte.

13
Sept. 2023
AudioGeschlossen

Stability AI Stable Audio 1.0

Stability AI

Latent-Diffusion-Modell für Text-to-Audio, das 44,1-kHz-Stereotracks von bis zu 95 Sekunden Länge erzeugt – mit Timing-Konditionierung zur Steuerung der Länge

Erstes kommerziell verfügbares KI-Produkt zur Musikgenerierung, das hochauflösendes 44,1-kHz-Stereo-Audio liefert, und das die Timing-Konditionierung einführte, mit der Nutzer eine exakte Dauer vorgeben konnten – eine Funktion, die früheren öffentlich zugänglichen Text-to-Audio-Produkten fehlte

Erstes kommerzielles Text-to-Audio-Produkt mit expliziter Timing-Konditionierung für eine nutzergesteuerte Tracklänge in 44,1-kHz-Qualität

6
Sept. 2023
TextOffen

Falcon 180B

TII

180B-Parameter-Modell auf 3,5 Billionen Tokens; bei Veröffentlichung das größte offen verfügbare LLM.

Schob die Open-Weights-Grenze Richtung GPT-3.5-Niveau und brachte Nicht-US-Akteure ins Frontier-Rennen.

August 2023

#5 Releases
22
Aug. 2023
AudioOffen

Meta SeamlessM4T

Meta

Ein einziges multimodales Modell für Sprach- und Text-Übersetzung/Transkription über rund 100 Sprachen (ASR, Sprache-zu-Text, Sprache-zu-Sprache, Text-zu-Sprache, Text-zu-Text).

Erstes All-in-One-Modell für mehrsprachige, multimodale Übersetzung — ersetzte kaskadierte ASR→MT→TTS-Pipelines durch ein einziges Modell. Grundlage der späteren expressiven und streamenden „Seamless"-Modelle.

Erstes einheitliches multimodales und mehrsprachiges Sprachübersetzungsmodell

Offene Gewichte unter CC-BY-NC (nicht-kommerziell).

22
Aug. 2023
AudioGeschlossen

ElevenLabs Eleven Multilingual v2 (exit beta)

ElevenLabs

Foundational-Sprachmodell, das nahezu 30 Sprachen abdeckt, die Stimmidentität bewahrt und Professional Voice Cloning integriert

Erweiterte das ausdrucksstarke, identitätswahrende mehrsprachige TTS zum kommerziellen Start von 7 auf etwa 30 Sprachen; das Verlassen der Beta-Phase signalisierte Produktionsreife und förderte die breite Akzeptanz in Synchronisations- und Lokalisierungsworkflows

22
Aug. 2023
BildGeschlossen

Ideogram 0.1 (public launch)

Ideogram AI

Text-zu-Bild-Generierung mit branchenführender, gut lesbarer Typografie, die direkt in die erzeugten Bilder eingebettet ist

Erstes öffentlich zugängliches Modell, das in großem Umfang zuverlässig korrekten, lesbaren Text in Bildern darstellte; Typografie in KI-Bildern war im Grunde ein ungelöstes Problem — Ideogram erreichte rund 90 % Genauigkeit gegenüber etwa 30 % bei der Konkurrenz und erschloss damit einen völlig neuen Anwendungsfall im Design-Workflow

Erstes öffentlich verfügbares Modell, das auf die genaue Darstellung von Text in Bildern spezialisiert ist

3
Aug. 2023
TextOffen

Qwen-7B

Alibaba

Erstes offenes Modell der Qwen-Familie von Alibaba.

Startpunkt chinesischer Labore mit konkurrenzfähigen herunterladbaren Gewichten — Grundlage der Open-Model-Welle 2024/25.

2
Aug. 2023
AudioOffen

Meta AudioCraft (MusicGen + AudioGen + EnCodec)

Meta AI

Open-Source-Framework zur Audiogenerierung, das Text-zu-Musik (MusicGen), Text-zu-Soundeffekten (AudioGen) und einen verbesserten neuronalen Audio-Codec (EnCodec) in einer Bibliothek vereint

Bündelte den vollständigen Open-Source-Stack zur generativen Audioerzeugung — Musik, Soundeffekte und den zugrunde liegenden Codec — in einer veröffentlichten Bibliothek und ermöglichte der Community, durchgängige Pipelines zur Audiogenerierung ohne proprietäre Abhängigkeiten zu bauen

Juli 2023

#3 Releases
26
Juli 2023
BildOffen

Stable Diffusion XL 1.0 (SDXL)

Stability AI

Pipeline aus einem Basismodell mit 3,5 Mrd. Parametern und einem Refiner mit 6,6 Mrd. Parametern, die nativ 1024×1024 erzeugt, mit verbessertem semantischem Verständnis, besserer Beleuchtung und vereinfachtem Prompting

Größtes Open-Weights-Bildmodell zum Zeitpunkt des Starts; erreichte oder übertraf bei vielen Prompts die Qualität von Midjourney v5, blieb dabei aber vollständig herunterladbar; wurde zum neuen Standard-Basismodell der Community für das Fine-Tuning und brachte rasch SDXL-basierte LoRAs und ControlNets hervor

Erstes Open-Weights-Modell mit einer zweistufigen Pipeline aus Basismodell und Refiner bei nativer Auflösung von 1024 Pixeln

18
Juli 2023
TextOffen

Llama 2

Meta

Open-Weight-LLM (7B–70B), das über eine Partnerschaft von Meta und Microsoft kostenlos für Forschung und kommerzielle Nutzung veröffentlicht wurde

Das erste große Open-Weight-Modell eines bedeutenden Labors, das ausdrücklich für die kommerzielle Nutzung in großem Maßstab lizenziert war und es Start-ups und Unternehmen ermöglichte, Produkte ohne Abhängigkeit von proprietären Modellen zu entwickeln; trug dazu bei, Normen für verantwortungsvolle offene Veröffentlichungen zu etablieren

Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet

11
Juli 2023
TextGeschlossen

Claude 2

Anthropic

LLM mit einem Kontextfenster von 100.000 Tokens, verbessertem Coding (71,2 % HumanEval) und öffentlicher Chat-Oberfläche claude.ai

Machte das Kontextfenster von 100.000 Tokens erstmals über eine kostenlose öffentliche Chat-Oberfläche zugänglich und ermöglichte so die Verarbeitung ganzer Bücher und großer Codebasen in großem Umfang; Anthropic hatte API-Nutzern bereits ab Mai 2023 100.000 Tokens angeboten, doch Claude 2 und claude.ai machten dies breit zugänglich

Erste LLM-Familie mit einem Kontextfenster von 100.000 Tokens, die über eine kostenlose öffentliche Consumer-Chat-Oberfläche verfügbar war

Juni 2023

#1 Release
8
Juni 2023
AudioOffen

Meta MusicGen (open-source)

Meta AI

Open-Source-Musikgenerierung mit Steuerung über Text und optionale Melodie-Referenz, verfügbar als Code und Modellgewichte; Gewichte unter CC-BY-NC 4.0

Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie; Forschende und Entwickler konnten erstmals ein Backbone zur Musikgenerierung feinjustieren, prüfen und darauf aufbauen, ohne auf eine geschlossene API angewiesen zu sein

Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie

Juni 2023 · erst jetzt möglich

Fotorealistische Bilder auf Zuruf.

Wenige Monate zuvor: verschmierte Gesichter und sechs Finger.

Mai 2023

#2 Releases
10
Mai 2023
TextGeschlossen

PaLM 2

Google

Googles nächste LLM-Generation mit stärkerem Multilingual-/Reasoning-/Coding-Können; trieb Bard und 25+ Produkte an.

Googles wichtigste Frontier-Antwort 2023 auf GPT-4.

10
Mai 2023
AudioGeschlossen

Google MusicLM (public)

Google

Text-zu-Musik-Generierung, die aus frei formulierten natürlichsprachlichen Prompts hochauflösende Stereomusik erzeugt, trainiert auf 280.000 Stunden Musik

Erstes großes Labor, das ein hochwertiges Text-zu-Musik-System über ein Produkt öffentlich zugänglich machte und damit den Maßstab setzte, der MusicGen und AudioCraft auslöste

April 2023

#2 Releases
27
Apr. 2023
AudioGeschlossen

Eleven Multilingual v1

ElevenLabs

Sprachübergreifendes TTS, das die Merkmale einer geklonten Stimme in einem einzigen Prompt über 7 europäische und südasiatische Sprachen hinweg bewahrt

Bisheriges mehrsprachiges TTS erforderte separate Modelle je Sprache und konnte die Stimmidentität über Sprachen hinweg nicht erhalten; Eleven Multilingual v1 vereinte beides in einem Modell

·
Apr. 2023
AudioOffen

Bark

Suno AI

Open-Source-TTS auf Transformer-Basis mit Zero-Shot-Voice-Cloning, nonverbalen Lautäußerungen (Lachen, Seufzen), Hintergrundmusik und Unterstützung für über 100 Sprachen

Überführte qualitativ ausdrucksstarkes TTS — zuvor Closed Source — vollständig in den offenen Bereich; erstes OSS-Modell, das nonverbale Signale und Umgebungsgeräusche in einem einzigen Generierungsdurchgang nativ verarbeitet

Erstes Open-Source-Modell, das ausdrucksstarke Sprache mit eingebetteten nonverbalen Lauten und Hintergrundgeräuschen in einem einzigen Durchgang erzeugt

März 2023

#6 Releases
30
März 2023
TextOffen

AutoGPT

Significant Gravitas

Open-Source-Agent, der GPT-4-Aufrufe verkettet, um ein Ziel selbstständig mit Web- und Datei-Tools zu verfolgen.

Der prägende „autonome Agenten"-Moment 2023 — einer der am schnellsten wachsenden GitHub-Repos überhaupt.

Erster viraler autonomer KI-Agent

21
März 2023
BildGeschlossen

Adobe Firefly (beta)

Adobe

Erzeugung von Text-zu-Bild und Texteffekten, ausschließlich auf lizenzierten Adobe-Stock-Inhalten und gemeinfreiem Material trainiert, eingebettet in Photoshop und die Creative Cloud

Erster Bildgenerator auf Enterprise-Niveau mit einer klaren Herkunftsgeschichte hinsichtlich kommerzieller Rechtssicherheit (IP-Freistellung für Geschäftskunden); etablierte das Paradigma der „lizenzierten Trainingsdaten“ als Wettbewerbsvorteil und bewies, dass sich Bildgenerierung in professionelle kreative Workflows integrieren lässt

Erstes kommerziell freigestelltes Text-zu-Bild-Modell, das vollständig auf lizenzierten Inhalten trainiert wurde

20
März 2023
VideoOffen

ModelScope Text-to-Video

Alibaba DAMO Academy

Open-Weight-Diffusionsmodell mit 1,7 Mrd. Parametern für Text-zu-Video, das kurze Clips aus englischen Prompts erzeugt

Erstes breit heruntergeladenes Open-Source-Text-zu-Video-Modell auf Hugging Face; brachte den viralen Benchmark „Will Smith eating spaghetti“ hervor, der zur inoffiziellen Messlatte für jedes nachfolgende Modell wurde, und gab der Open-Source-Videoforschung damit Auftrieb

Erstes breit zugängliches Open-Source-Modell für Text-zu-Video

20
März 2023
VideoGeschlossen

Runway Gen-2

Runway

Reine Text-zu-Video-Generierung: Erstellung neuartiger Videoclips allein aus Text-Prompts, ohne jegliche Quellvideo-Eingabe

Erstes öffentlich verfügbares Text-zu-Video-Modell; bewies das Konzept, dass generative Modelle kohärente Videos von Grund auf synthetisieren können, statt nur bestehendes Material umzustilisieren — in 73 % der Nutzerstudien gegenüber Ansätzen auf Basis von Stable Diffusion bevorzugt

Erster öffentlich verfügbarer Text-zu-Video-Generator

15
März 2023
BildGeschlossen

Midjourney v5

Midjourney

Fotorealistische Bilder in doppelter Auflösung (1024×1024), Prompting in natürlicher Sprache, beliebige Seitenverhältnisse und verlässlich fünffingrige Hände

Erste Midjourney-Version, die einen Fotorealismus erreichte, der überzeugend genug war, um als gefälschte Fotos zu kursieren; die korrekte Handanatomie beseitigte ein langjähriges Erkennungsmerkmal für KI-Bilder und setzte Anfang 2023 branchenweit den Maßstab für Realismus

14
März 2023
TextGeschlossen

GPT-4

OpenAI

Großes multimodales Modell, das Bild- und Texteingaben verarbeitet, etwa das 90.

Perzentil im Anwaltsexamen erreicht und GPT-3.5 in fachlichen Benchmarks deutlich übertrifft

Stellte einen Sprung in Zuverlässigkeit, Reasoning und fachlicher Kompetenz gegenüber GPT-3.5 dar; die Leistungen im Anwaltsexamen und in medizinischen Prüfungen zeigten erstmals, dass LLMs die durchschnittliche Leistung menschlicher Fachkräfte übertreffen können

Erstes öffentlich ausgerolltes LLM, das in einer breiten Palette berufsqualifizierender Prüfungen über dem menschlichen Durchschnitt abschnitt

Februar 2023

#2 Releases
24
Feb. 2023
TextOffen

LLaMA 1

Meta

Hochwertiges, forschungstaugliches LLM (7B–65B), veröffentlicht mit offenen Gewichten unter einer nichtkommerziellen Lizenz

Gab der Open-Source-Forschungsgemeinschaft ihr erstes wirklich leistungsfähiges Foundation-Modell zum Fine-Tuning; löste das gesamte Ökosystem an Community-Fine-Tunes (Alpaca, Vicuna usw.) aus und bewies, dass offene Gewichte die Qualität proprietärer Modelle annähernd erreichen können

Erste offen verfügbare LLM-Familie, die mit den damaligen Modellen der GPT-3-Klasse konkurrenzfähig war

6
Feb. 2023
VideoGeschlossen

Runway Gen-1

Runway

Video-zu-Video-Stilübertragung: Anwendung eines beliebigen Bild- oder Textstils auf jedes Einzelbild eines bestehenden Videoclips

Erstes kommerziell zugängliches System zur Video-zu-Video-Synthese; es zeigte, dass neuronale Stilübertragung zeitlich konsistent auf reales Filmmaterial angewendet werden kann, und eröffnete damit erstmals KI-native Filmworkflows

Erstes kommerziell verfügbares KI-System zur Video-zu-Video-Generierung

Januar 2023

#3 Releases
23
Jan. 2023
AudioGeschlossen

ElevenLabs Beta Launch (instant voice cloning + TTS)

ElevenLabs

Für Verbraucher zugängliches sofortiges Voice-Cloning aus kurzen Audioproben, kombiniert mit emotionsbewusster Sprachsynthese, zunächst auf Englisch und Polnisch

Ein Webprodukt ermöglichte es jedem, eine Stimme in Sekunden aus minimalem Audiomaterial zu klonen und ausdrucksstarke Sprache in großem Umfang zu synthetisieren; bisherige kommerzielle TTS erforderte den Aufbau individueller Stimmen in Studioqualität; das Produkt erreichte innerhalb weniger Monate 1 Mio. Nutzer

Erstes breit zugängliches Consumer-Webprodukt, das sofortiges Voice-Cloning und emotionsbewusstes TTS in einer einzigen Oberfläche vereint

5
Jan. 2023
AudioGeschlossen

VALL-E

Microsoft

Zero-Shot-TTS als neuronales Codec-Sprachmodell, das die Stimme eines Sprechers aus einem 3-sekündigen Audio-Prompt synthetisiert und dabei die emotionale Färbung des Sprechers bewahrt

Zeigte, dass die Behandlung von TTS als Sprachmodellierungsproblem über Codec-Tokens — statt als Signalregression — zu einer dramatischen Zero-Shot-Generalisierung führte; ein Paradigmenwechsel, der praktisch jede nachfolgende TTS-Architektur beeinflusst hat

Erstes sprachmodellbasiertes Zero-Shot-TTS, das Sprecherähnlichkeit aus einer 3-sekündigen Referenzaufnahme erreicht

·
Jan. 2023
Newsletter

KI-Newsletter von Jens

jens.marketing

Ein deutschsprachiger Newsletter, der seit Anfang 2023 die KI-Entwicklung verfolgt und einordnet.

Gestartet, bevor der große Hype losging — und seitdem durchgehend zur KI-Entwicklung berichtet. (Vom Herausgeber dieser Seite.)

Dezember 2022

#1 Release
8
Dez. 2022
AudioOffen

Whisper large-v2

OpenAI

Verbessertes Whisper-Modell mit einer um etwa 10–15 % geringeren Wortfehlerrate, insbesondere bei verrauschten Aufnahmen, das 2,5-mal länger und mit Regularisierung trainiert wurde

Festigte den Status von Open-Source-ASR als produktionsreif, indem es den Abstand zu den besten kommerziellen Angeboten weiter verringerte; wurde über Jahre zur faktischen Referenz in der Community

November 2022 · erst jetzt möglich

Zum ersten Mal redet eine Maschine wie ein Mensch.

Davor: Stichwortsuche und holprige Autovervollständigung.

November 2022

#3 Releases
30
Nov. 2022
TextGeschlossen

ChatGPT (GPT-3.5-turbo)

OpenAI

Dialogorientierter, anweisungsbefolgender Chatbot, der über den Webbrowser für die breite Öffentlichkeit zugänglich ist

Zum ersten Mal wurde ein Frontier-LLM in eine kostenlose, reibungslose Consumer-Chat-Oberfläche eingebettet; erreichte 1 Mio. Nutzer in 5 Tagen und 100 Mio. in 2 Monaten, löste damit den KI-Massenmoment aus und zwang jedes große Technologieunternehmen zu einer Reaktion

Erste kostenlose Chat-Oberfläche für ein Frontier-LLM mit Reichweite im Massenmarkt

24
Nov. 2022
BildOffen

Stable Diffusion 2.0

Stability AI

Native Auflösung von 768×768, neuer OpenCLIP-Text-Encoder, Depth-to-Image-Pipeline und ein 4×-Upscaler-Modell

Erste SD-Version, die zu einem auf LAION trainierten offenen Text-Encoder (OpenCLIP) wechselte und nativ über 512 Pixel hinausging; die tiefengeführte Generierung war ein neues kreatives Grundelement, das es in SD 1.x noch nicht gab; die Akzeptanz in der Community stockte jedoch aufgrund der NSFW-Filterung und der Prompt-Inkompatibilität mit SD 1.5

5
Nov. 2022
BildGeschlossen

Midjourney v4

Midjourney

Völlig neue Architektur, trainiert auf Midjourneys eigenem KI-Supercluster, mit deutlich verbesserter Kohärenz, mehr Detailtreue und Unterstützung komplexer Prompts mit mehreren Motiven

Markierte den Punkt, an dem ein geschlossener Abodienst eine durchgängig hohe künstlerische Qualität erreichte, die das Open-Source-Modell SD 1.x in den meisten Ästhetik-Benchmarks übertraf; setzte für das folgende Jahr den Maßstab für kommerzielle Premium-Bilder

Oktober 2022

#1 Release
20
Okt. 2022
BildOffen

Stable Diffusion 1.5

RunwayML / Stability AI

Verbesserte Bildqualität, bessere Ästhetik und höhere Prompt-Treue gegenüber SD 1.4 auf derselben 512×512-Architektur

Wurde über Jahre zum dominierenden Open-Source-Basis-Checkpoint; SD 1.5 bildete die Grundlage für die überwiegende Mehrheit der Community-Fine-Tunes (LoRAs, DreamBooth-Modelle) und blieb bis weit in das Jahr 2024 hinein das meistgenutzte offene Modell

September 2022

#5 Releases
29
Sept. 2022
BildGeschlossen

DreamFusion

Google

Text-zu-3D ohne 3D-Trainingsdaten, durch Destillation eines 2D-Diffusionsmodells in ein NeRF (Score Distillation).

Der Text-zu-3D-Durchbruch 2022 und Basis der gesamten folgenden Text-zu-3D-Welle.

Durchbruch bei Text-zu-3D

29
Sept. 2022
VideoGeschlossen

Make-A-Video

Meta

Erstes prominentes Text-zu-Video-Modell; lernte Bewegung aus unbeschriftetem Video, Aussehen aus Text-Bild-Paaren.

Der „KI kann jetzt Video"-Moment, der das Text-zu-Video-Rennen auslöste.

Erstes prominentes Text-zu-Video-Modell

28
Sept. 2022
BildGeschlossen

DALL-E 2 (public launch, no waitlist)

OpenAI

Fotorealistische Bilderzeugung und -bearbeitung per Inpainting/Outpainting mit 1024×1024, ergänzt um CLIP-gestütztes semantisches Verständnis

Erstes kommerziell ausgerolltes geschlossenes Frontier-Modell, das vollständig öffentlich wurde; es zeigte, dass ein auf allgemeine LLMs spezialisiertes Unternehmen die Spitze der hochwertigen Bildgenerierung besetzen und den kommerziellen Maßstab setzen konnte, den DALL-E 3 später beerben sollte

Erstes geschlossenes Frontier-Modell für Text-zu-Bild, das ohne Warteliste vollständig der Öffentlichkeit zugänglich war

21
Sept. 2022
AudioOffen

Whisper (large-v1)

OpenAI

Mehrsprachige Open-Source-ASR, trainiert auf 680.000 Stunden Web-Audio, die über 99 Sprachen hinweg eine nahezu menschliche Transkriptionsqualität erreicht

Bisherige Open-Source-ASR lag deutlich hinter proprietären Systemen zurück; Whisper erreichte oder übertraf kommerzielle APIs zum Nulltarif unter MIT-Lizenz und demokratisierte damit die Transkription für alle Entwickler

Erstes Open-Source-ASR-Modell, das die Qualität mehrsprachiger Transkription auf kommerziellem Niveau weitgehend erreicht

7
Sept. 2022
AudioGeschlossen

AudioLM

Google

Erzeugt zusammenhängendes Audio (Sprache, Klavier) per Sprachmodellierung über Audio-Tokens.

Etablierte das „Audio als Sprachmodell"-Paradigma, das MusicLM und moderne Audiogenerierung trägt.

August 2022

#1 Release
22
Aug. 2022
BildOffen

Stable Diffusion 1.4 (public release)

Stability AI / CompVis / RunwayML

Erstes leistungsfähiges Open-Weights-Diffusionsmodell für Text-zu-Bild, das auf Consumer-GPUs läuft und 512×512-Bilder in Sekunden erzeugt

Das erste breit zugängliche, herunterladbare Text-zu-Bild-Modell mit konkurrenzfähiger Qualität — eine direkte Herausforderung für DALL-E 2 und Imagen, da sämtliche Zugangsschranken entfielen; brachte das Open-Source-Ökosystem für Bildgenerierung (LoRA, ControlNet, Fine-Tuning) praktisch über Nacht hervor

Erstes breit verteiltes Open-Weights-Modell für Text-zu-Bild, das auf einer Consumer-GPU lauffähig ist

Juli 2022

#1 Release
12
Juli 2022
BildGeschlossen

Midjourney (Open Beta, v3)

Midjourney

Öffnete die Discord-basierte Text-zu-Bild-Generierung für alle.

Brachte KI-Bildgenerierung Monate vor der Bild-Explosion im August einer Massenöffentlichkeit nahe.

April 2022

#1 Release
4
Apr. 2022
TextGeschlossen

PaLM (540B)

Google

540-Mrd.-Parameter-Sprachmodell, das GPT-3 auf fast allen Benchmarks schlug und emergentes Chain-of-Thought-Reasoning zeigte.

Der Skalierungs- und Emergenz-Meilenstein 2022 und Fundament für Googles Bard/Gemini-Linie.

Januar 2022

#1 Release
27
Jan. 2022
TextGeschlossen

InstructGPT

OpenAI

Erstes per RLHF an menschlichen Anweisungen ausgerichtetes Produktionsmodell, ausgeliefert als Standard in der OpenAI-API.

Die RLHF-Technik, die ChatGPT überhaupt erst möglich machte — der entscheidende Schritt vor dem Chatbot-Boom.

Erstes per RLHF instruktionsoptimiertes Produktionsmodell

Von Wissen zu Handlung

Wissen reicht nicht. Dein Team muss mithalten.

Die Tools ändern sich im Wochentakt — du hast es gerade gescrollt. Der Vorsprung liegt nicht im nächsten Modell, sondern in der Fähigkeit, diese Veränderung einzuordnen und KI im Arbeitsalltag produktiv zu nutzen.

Genau dafür gibt es snipKI.

Offen vs. geschlossen

Die Speerspitze ist kein geschlossener Club mehr

Geschlossene Labore bringen weiterhin die meisten Modelle heraus, daher laufen 30% dieser Meilensteine auf Open-Weights. Die Verschiebung dreht sich um Qualität, nicht um Anzahl: 2025 lieferten sich offene Releases wie DeepSeek-R1, Qwen und Llama einen Schlagabtausch mit den besten geschlossenen Systemen. Jeder Balken unten ist ein Jahr, seine Länge die Zahl der Meilensteine, aufgeteilt nach Lizenz.

2022
5/14 offen
2023
15/38 offen
2024
17/52 offen
2025
8/42 offen
2026
29/101 offen
Open-WeightsGeschlossen

Schon vergessen?

Das fühlte sich gerade noch wie Magie an.

  • Mit dem Computer reden — und verstanden werden.heute Alltag
  • Ein Foto live in jede Sprache übersetzen.heute Alltag
  • Aus einem Satz ein fertiges Lied mit Gesang.heute Alltag
  • Eine Idee in Sekunden als fotorealistisches Bild.heute Alltag
  • Software aus einer Beschreibung schreiben lassen.heute Alltag
  • Ein Video aus zwei Zeilen Text — mit Ton.heute Alltag
  • Hunderte Seiten zu einem Gespräch zusammenfassen.heute Alltag
  • Eine Stimme aus drei Sekunden Audio nachbilden.heute Alltag

Nichts davon ist älter als dreieinhalb Jahre.

gebaut von snipki.de