← Zurück zum Zeitstrahl

Erstmalig · Premieren

Erstmalig: 114 belegte Premieren

114 von 245 Releases tragen einen belegten „Erster, der …“-Anspruch: 40 in Text, 27 in Audio, 26 in Video, 21 in Bild. 41 davon kamen mit offenen Gewichten. Bei 8 ist der Anspruch oder das Datum strittig — mit Begründung, warum.

„Erster“ ist die am häufigsten behauptete und am seltensten geprüfte Aussage der KI-Branche. Jede Pressemitteilung enthält eine; fast keine nennt, gegen welchen Stand sie gemessen wurde. Diese Seite hält 114 solcher Ansprüche fest — mit Datum, Labor und Link, und mit einer offenen Kennzeichnung dort, wo der Anspruch nicht hält.

Alle 114 haben mindestens eine Primärquelle. 41 kamen mit offenen Gewichten, 8 sind als strittig markiert — inklusive Begründung, warum.

Definition

Was hier als „Erster“ zählt

Aufgenommen wird ein Anspruch nur, wenn eine Fähigkeit zum ersten Mal öffentlich verfügbar war — nicht, wenn eine Zahl auf einem Benchmark zum ersten Mal erreicht wurde. Ein Modell, das etwas besser kann, ist kein Erster. Ein Modell, das etwas kann, was vorher kein öffentlich zugängliches Modell konnte, ist einer.

„Öffentlich verfügbar“ ist dabei die härtere Hürde als „angekündigt“. Ein Forschungspapier ohne Zugang begründet keinen Ersten in diesem Datensatz; eine Wartelisten-Demo, die nachweislich Nutzer erreichte, schon. Deshalb steht bei Text nicht GPT-3, sondern InstructGPT am Anfang: die Fähigkeit, Anweisungen zuverlässig zu folgen, war die Neuerung, die alles Weitere trug.

Und: Ein Anspruch gilt nur so weit, wie er belegbar ist. Wo eine ursprüngliche Formulierung zu weit ging, wurde sie abgeschwächt statt gelöscht — und der Eintrag als strittig markiert. Diese Fälle stehen weiter unten, einzeln begründet.

Verteilung

Wo die Premieren liegen

ModalitätPremierenErsteJüngste
Text40InstructGPT 27.01.2022Muse Code (Beta) & Muse Spark 1.2 05.08.2026
Bild21Stable Diffusion 1.4 (public release) 22.08.2022Muse Image 07.07.2026
Video26Make-A-Video 29.09.2022Gemini Robotics 2 (mit ER 2 und On-Device 2) 30.07.2026
Audio27Whisper (large-v1) 21.09.2022GPT-Live (GPT-Live-1 / mini) 08.07.2026

Pro Jahr: 2022 → 7, 2023 → 24, 2024 → 27, 2025 → 27, 2026 → 29. Bemerkenswert ist, dass die Zahl der Premieren seit 2023 kaum steigt, während die Zahl der Releases sich vervielfacht hat. 2023 kamen 24 Premieren auf 37 Releases, 2026 sind es 29 auf 101. Es erscheint also nicht mehr Neues — es erscheint dasselbe Neue häufiger und von mehr Häusern.

Text · 40 Premieren

Erstmalig in Text & Reasoning

  1. InstructGPTOpenAIGeschlossen

    Erstes per RLHF instruktionsoptimiertes Produktionsmodell

    openai.com

  2. ChatGPT (GPT-3.5-turbo)OpenAIGeschlossen

    Erste kostenlose Chat-Oberfläche für ein Frontier-LLM mit Reichweite im Massenmarkt

    openai.comen.wikipedia.org

  3. LLaMA 1MetaOffen

    Erste offen verfügbare LLM-Familie, die mit den damaligen Modellen der GPT-3-Klasse konkurrenzfähig war

    ai.meta.com

  4. GPT-4OpenAIGeschlossen

    Erstes öffentlich ausgerolltes LLM, das in einer breiten Palette berufsqualifizierender Prüfungen über dem menschlichen Durchschnitt abschnitt

    openai.comtechcrunch.com

  5. AutoGPTSignificant GravitasOffen

    Erster viraler autonomer KI-Agent

    github.com

  6. Claude 2AnthropicGeschlossen⚠ strittig

    Erste LLM-Familie mit einem Kontextfenster von 100.000 Tokens, die über eine kostenlose öffentliche Consumer-Chat-Oberfläche verfügbar war

    anthropic.comanthropic.com

  7. Llama 2MetaOffen⚠ strittig

    Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet

    about.fb.comai.meta.com

  8. Mistral 7BMistral AIOffen

    Erstes Open-Weights-Modell mit 7B, das ein 13B-Modell auf ganzer Linie in Standard-Benchmarks schlägt

    mistral.ai

  9. Gemini 1.0Google DeepMindGeschlossen

    Erstes Modell, das den Durchschnitt menschlicher Experten im MMLU übertrifft (90,0 % gegenüber einer Baseline menschlicher Experten von etwa 89 %)

    blog.google

  10. Mixtral 8x7BMistral AIOffen

    Erstes Open-Weights-Sparse-MoE-Modell dieser Größenordnung, das die Leistung von GPT-3.5 erreicht

    mistral.ai

  11. Gemini 1.5 ProGoogle DeepMindGeschlossen

    Erstes Modell mit einem Kontextfenster von 1 Million Tokens

    blog.google9to5google.com

  12. Google GemmaGoogleOffen

    Googles erstes offenes Sprachmodell

    blog.google

  13. Microsoft Phi-3 (Phi-3-mini)MicrosoftOffen

    Wegweisendes SLM-auf-dem-Gerät

    azure.microsoft.com

  14. Llama 3.1 405BMetaOffen

    Erstes Open-Weights-Modell mit über 400B Parametern, das mit geschlossenen Frontier-Modellen konkurrenzfähig ist

    ai.meta.com

  15. OpenAI o1-previewOpenAIGeschlossen

    Erstes öffentlich eingesetztes LLM, das interne Reasoning-Tokens (Skalierung der Rechenleistung zur Inferenzzeit) als Produktfunktion nutzt

    openai.comen.wikipedia.org

  16. Claude 3.5 Sonnet (v2) with Computer UseAnthropicGeschlossen

    Erstes Frontier-KI-Modell, das Computer-Use (GUI-Automatisierung) in einer öffentlichen Beta anbietet

    anthropic.com

  17. OpenAI o3 (preview/announcement)OpenAIGeschlossen

    Erstes Modell, das beim ARC-AGI 75 % überschreitet

    arcprize.orgen.wikipedia.org

  18. DeepSeek-V3DeepSeekOffen⚠ strittig

    Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht

    arxiv.org

  19. DeepSeek-R1DeepSeekOffen

    Erstes Open-Weights-Reasoning-Modell, das die Leistung auf o1-Niveau erreicht, unter MIT-Lizenz

    github.comarxiv.org

  20. OpenAI OperatorOpenAIGeschlossen

    Erster Mainstream-Agent, der den Browser selbst bedient

    openai.com

  21. Claude 3.7 SonnetAnthropicGeschlossen⚠ strittig

    Erstes Hybrid-Modell für schnelles und erweitertes Reasoning in einem einzigen Deployment

    anthropic.com

  22. Llama 4 (Scout / Maverick)MetaOffen⚠ strittig

    Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens

    ai.meta.com

  23. xAI Grok 4xAIGeschlossen

    Erstes Modell, das rund 50 % auf „Humanity's Last Exam" erreichte

    x.ai

  24. GPT-5OpenAIGeschlossen

    Erstes einheitliches Modell aus schnellem Modus und Reasoning mit automatischem Compute-Routing in einem einzigen API-Endpunkt

    openai.comen.wikipedia.org

  25. MAI-1-previewMicrosoft AIGeschlossen

    Erstes vollständig hauseigenes, End-to-End trainiertes Foundation-LLM von Microsoft AI.

    microsoft.ai

  26. GLM-5Zhipu AI (Z.ai)Offen

    Erstes Frontier-Open-Weights-Modell einer börsennotierten Foundation-Model-Firma (Zhipu/Z.ai).

    huggingface.coscmp.com

  27. GLM-5.1Zhipu / Z.aiOffen

    Erstes Open-Weights-Modell an der Spitze von SWE-Bench Pro

    huggingface.co

  28. Muse SparkMeta (Superintelligence Labs)Geschlossen

    Erstes Modell von Meta Superintelligence Labs und Metas erster strategischer Wechsel von Open-Weights zu einem geschlossenen Frontier-Modell.

    ai.meta.comabout.fb.com

  29. ERNIE 5.1 PreviewBaiduGeschlossen

    Erstes chinesisches LLM in den globalen Top 5 der LMArena Search Arena.

    ernie.baidu.comremio.ai

  30. MiniMax M3MiniMaxOffen

    Laut MiniMax erstes Open-Weights-Modell, das Frontier-Coding, 1M-Kontext und native Multimodalität in einer einzigen Architektur kombiniert.

    minimax.iomarktechpost.com

  31. MAI-Thinking-1Microsoft AIGeschlossen

    Erstes von Microsoft AI vollständig in-house entwickeltes Reasoning-/Thinking-Modell, trainiert ohne Distillation aus Drittanbieter-Modellen.

    microsoft.aimicrosoft.ai

  32. MAI-Code-1-FlashMicrosoft AIGeschlossen

    Erstes hauseigenes, agentisches Coding-Modell von Microsoft AI.

    microsoft.aimicrosoft.ai

  33. Claude Fable 5AnthropicGeschlossen

    Erstes öffentlich zugängliches Modell der Mythos-Klasse von Anthropic (oberhalb der Opus-Klasse).

    anthropic.comtechcrunch.com

  34. DiffusionGemma 26B-A4BGoogle DeepMindOffen

    Erstes großes Open-Weights-Text-Diffusionsmodell von Google, das Text in parallelen Blöcken statt autoregressiv Token für Token erzeugt.

    blog.googlemarktechpost.com

  35. Ornith-1.0DeepReinforceOffen

    Erste offene Modellfamilie, die ihre eigenen RL-Scaffolds (Task-Harnesses) lernt

    deep-reinforce.commarktechpost.comhuggingface.co

  36. LongCat-2.0MeituanOffen

    Erstes Billionen-Parameter-Modell, das komplett auf inländischen chinesischen KI-Chips trainiert und ausgeführt wird.

    longcatai.orgventurebeat.com

  37. Claude Fable 5 (Wiederveröffentlichung)AnthropicGeschlossen

    Erstes Frontier-Modell, das durch eine US-Exportkontrolle vorübergehend abgeschaltet und nach Aufhebung wieder in Betrieb genommen wurde.

    anthropic.comcnbc.com

  38. InklingThinking Machines LabOffen

    Erstes öffentlich verfügbares Modell von Thinking Machines Lab (Mira Murati).

    thinkingmachines.aifortune.combloomberg.com

  39. Gemini 3.5 Flash CyberGoogleGeschlossen

    Googles erster öffentlich benannter, auf Cybersecurity spezialisierter Vertical-Finetune.

    blog.googledeepmind.google

  40. Muse Code (Beta) & Muse Spark 1.2MetaGeschlossen

    Erster eigener Terminal-Coding-Agent von Meta.

    research.meta.airesearch.meta.aideveloper.meta.com

Bild · 21 Premieren

Erstmalig in Bild

  1. Stable Diffusion 1.4 (public release)Stability AI / CompVis / RunwayMLOffen

    Erstes breit verteiltes Open-Weights-Modell für Text-zu-Bild, das auf einer Consumer-GPU lauffähig ist

    stability.aien.wikipedia.org

  2. DALL-E 2 (public launch, no waitlist)OpenAIGeschlossen

    Erstes geschlossenes Frontier-Modell für Text-zu-Bild, das ohne Warteliste vollständig der Öffentlichkeit zugänglich war

    openai.comsiliconangle.com

  3. DreamFusionGoogleGeschlossen

    Durchbruch bei Text-zu-3D

    arxiv.org

  4. Adobe Firefly (beta)AdobeGeschlossen

    Erstes kommerziell freigestelltes Text-zu-Bild-Modell, das vollständig auf lizenzierten Inhalten trainiert wurde

    news.adobe.comtechcrunch.com

  5. Stable Diffusion XL 1.0 (SDXL)Stability AIOffen

    Erstes Open-Weights-Modell mit einer zweistufigen Pipeline aus Basismodell und Refiner bei nativer Auflösung von 1024 Pixeln

    stability.aiprnewswire.com

  6. Ideogram 0.1 (public launch)Ideogram AIGeschlossen

    Erstes öffentlich verfügbares Modell, das auf die genaue Darstellung von Text in Bildern spezialisiert ist

    ideogram.aien.wikipedia.org

  7. DALL-E 3OpenAIGeschlossen

    Erstes Bildgenerierungsmodell, das nativ in eine große LLM-Chat-Oberfläche (ChatGPT) eingebettet ist

    openai.comopenai.com

  8. Google Imagen 2Google DeepMindGeschlossen

    Erster Einsatz des unsichtbaren KI-Wasserzeichens SynthID im produktiven Maßstab

    cloud.google.comtechcrunch.com

  9. Stable Diffusion 3 Medium (open weights)Stability AIOffen

    Erstes Open-Weights-Modell, das die Architektur eines Multimodal Diffusion Transformer (MMDiT) für die Text-to-Image-Generierung nutzt

    stability.aix.com

  10. FLUX.1 (pro / dev / schnell)Black Forest LabsOffen

    Erstes Apache-lizenziertes Modell, das Bildqualität auf Frontier-Niveau erreicht (FLUX.1[schnell])

    bfl.aiventurebeat.com

  11. Stable Diffusion 3.5 LargeStability AIOffen

    Erstes Open-Weights-Bildgenerierungsmodell mit über 8B Parametern, das unter einer freizügigen kommerziellen Lizenz veröffentlicht wurde

    stability.aisiliconangle.com

  12. Recraft V3RecraftGeschlossen

    Erstes Modell, das korrekte, mehrwortige Langtextpassagen innerhalb von Bildern erzeugt

    recraft.aien.wikipedia.org

  13. GPT-4o Native Image Generation (gpt-image-1)OpenAIGeschlossen

    Erstes nativ multimodales LLM, bei dem Bildgenerierung und sprachliches Reasoning dieselben Modellgewichte teilen

    openai.comopenai.com

  14. FLUX.1 Kontext [pro] + [max]Black Forest LabsGeschlossen

    Erstes Flow-Matching-Modell mit gemeinsamer, kontextbezogener Text-und-Bild-Bearbeitung (Beibehaltung der Identität des Referenzbilds über iterative Bearbeitungen hinweg)

    bfl.aibusinesswire.com

  15. FLUX.1 Kontext [dev] (open weights)Black Forest LabsOffen

    Erstes Open-Weights-Modell, das die Leistung proprietärer Modelle bei der iterativen, kontextbewussten Bildbearbeitung erreichte

    bfl.aihuggingface.co

  16. Nano Banana (Gemini 2.5 Flash Image)GoogleGeschlossen

    Erstes Bildmodell, das konversationelles Mehrfach-Editieren mit Konsistenz mainstreamfähig machte

    developers.googleblog.com

  17. Seedream 4.0ByteDanceGeschlossen

    Erstes Modell eines chinesischen Labors an der Spitze globaler Bild-Arenen

    seed.bytedance.com

  18. MAI-Image-1Microsoft AIGeschlossen

    Erstes hauseigenes Bildgenerierungs-Modell von Microsoft AI.

    microsoft.ai

  19. gpt-image-2 (ChatGPT Images 2.0)OpenAIGeschlossen

    Erstes weit verbreitetes Bildgenerierungsmodell mit explizitem, der Generierung vorgeschaltetem Reasoning-/Thinking-Schritt.

    openai.comtechcrunch.comen.wikipedia.org

  20. Ideogram 4.0IdeogramOffen

    Erstes Open-Weights-Modell von Ideogram, das seine Spitzentechnologie fuer Design- und Text-Rendering oeffentlich freigab.

    ideogram.aiideogram.ai

  21. Muse ImageMeta (Superintelligence Labs)Geschlossen

    Erstes Bildgenerierungsmodell der Meta Superintelligence Labs.

    about.fb.com

Video · 26 Premieren

Erstmalig in Video

  1. Make-A-VideoMetaGeschlossen

    Erstes prominentes Text-zu-Video-Modell

    ai.meta.com

  2. Runway Gen-1RunwayGeschlossen

    Erstes kommerziell verfügbares KI-System zur Video-zu-Video-Generierung

    runwayml.comarxiv.orgghacks.net

  3. Runway Gen-2RunwayGeschlossen

    Erster öffentlich verfügbarer Text-zu-Video-Generator

    runwayml.competapixel.comsiliconangle.com

  4. ModelScope Text-to-VideoAlibaba DAMO AcademyOffen⚠ strittig

    Erstes breit zugängliches Open-Source-Modell für Text-zu-Video

    huggingface.cohuggingface.co

  5. Stable Video Diffusion (SVD)Stability AIOffen

    Erstes breit veröffentlichtes Open-Weights-Diffusionsmodell für Image-to-Video

    stability.aiventurebeat.com

  6. OpenAI Sora (preview announcement)OpenAIGeschlossen

    Erste Demonstration von minutenlangem, fotorealistischem KI-Video aus Text auf diesem Qualitätsniveau

    en.wikipedia.orgtechnologyreview.com

  7. Kuaishou Kling 1.0KuaishouGeschlossen

    Erstes kommerzielles Modell, das durchgehende Videogenerierung von 2 Minuten in 1080p unterstützt

    prnewswire.comir.kuaishou.com

  8. Luma Dream MachineLuma AIGeschlossen

    Erstes Verbraucher-Videomodell, das rein auf einem video-nativen multimodalen Transformer aufgebaut ist

    en.wikipedia.orgradiancefields.com

  9. Meta Movie GenMetaGeschlossen

    Erstes Frontier-Labor-Modell mit gemeinsam erzeugtem synchronem Ton zum Video plus Ein-Foto-Personalisierung

    ai.meta.com

  10. Genmo Mochi 1GenmoOffen

    Größtes Open-Source-Text-zu-Video-Modell zum Zeitpunkt der Veröffentlichung (10B Parameter, Apache 2.0)

    siliconangle.comgithub.comgenmo.ai

  11. Lightricks LTX-Video (LTXV)LightricksOffen⚠ strittig

    Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)

    github.comcomfyui-wiki.comdataconomy.com

  12. Tencent HunyuanVideoTencentOffen

    Größtes Open-Source-Videogenerierungsmodell zum Zeitpunkt der Veröffentlichung (13B Parameter), erstes offenes Modell, das die kommerzielle Frontier-Qualität erreicht

    github.comtechnode.com

  13. Alibaba Wan 2.1Alibaba (Wan Team)Offen

    Erstes Open-Source-Modell, das die VBench-Bestenliste für Videoqualität anführte und alle geschlossenen Modelle übertraf

    alibabacloud.comgithub.comcomfyui-wiki.com

  14. Runway Gen-4RunwayGeschlossen

    Erstes kommerzielles Videomodell, das aus Referenzbildern eine zuverlässige Figuren- und Szenenkonsistenz über mehrere Einstellungen hinweg liefert

    runwayml.comtechcrunch.comsiliconangle.com

  15. Google Veo 3Google DeepMindGeschlossen

    Erstes hochmodernes Videomodell mit nativer Generierung von synchronisiertem Audio, Sprache und Soundeffekten

    cloud.google.com9to5google.com

  16. Seedance 1.0ByteDanceGeschlossen

    Erstes Videomodell, das natives Multi-Shot-Storytelling als Standard zeigte

    seed.bytedance.com

  17. MiniMax Hailuo 02MiniMaxGeschlossen

    NCR-Architektur (Noise-aware Compute Redistribution)

    minimax.io

  18. Runway AlephRunwayGeschlossen

    Erstes leistungsfähiges allgemeines In-Context-Videobearbeitungsmodell

    runwayml.com

  19. Google DeepMind Genie 3Google DeepMindGeschlossen

    Echtzeit-Weltmodell als neue Modalität

    deepmind.google

  20. Luma Ray3Luma AIGeschlossen

    Erstes „Reasoning"-Videomodell und erstes mit hochwertigem 16-Bit-HDR

    lumalabs.aibusinesswire.com

  21. LTX-2LightricksOffen

    Erstes produktionsreifes Open-Weights-Modell, das Video und Audio synchron in einem Durchgang mit nativem 4K und offenem Trainingscode generiert.

    globenewswire.com

  22. Gemini Omni FlashGoogle DeepMindGeschlossen

    Erstes Modell der Gemini-Omni-Familie, das generative Medien mit Gemins Weltwissen vereint und Video aus jeder Eingabemodalität per Konversation erzeugt und editiert.

    blog.googleblog.googleblog.google

  23. Qwen-Robot SuiteAlibaba (Qwen)Geschlossen

    Erstes umfassendes Robotik-/Embodied-Modellpaket von Alibaba (Qwen)

    alibabacloud.com

  24. Seedance 2.5ByteDanceGeschlossen

    Erster nativer 30-Sekunden-Clip in einem einzigen Durchgang

    theinformation.comexplainx.ai

  25. FLUX 3Black Forest LabsGeschlossen⚠ strittig

    Erstes Modell mit gemeinsam trainierter Video-, Audio- und Action-Generierung aus einem Backbone.

    globenewswire.com

  26. Gemini Robotics 2 (mit ER 2 und On-Device 2)Google DeepMindGeschlossen

    Erstes Gemini-Robotikmodell mit Ganzkörpersteuerung und Kollaboration mehrerer, auch unterschiedlicher Roboter

    deepmind.googleblog.googletheverge.com

Audio · 27 Premieren

Erstmalig in Audio & Stimme

  1. Whisper (large-v1)OpenAIOffen

    Erstes Open-Source-ASR-Modell, das die Qualität mehrsprachiger Transkription auf kommerziellem Niveau weitgehend erreicht

    openai.comtechcrunch.comarxiv.org

  2. VALL-EMicrosoftGeschlossen

    Erstes sprachmodellbasiertes Zero-Shot-TTS, das Sprecherähnlichkeit aus einer 3-sekündigen Referenzaufnahme erreicht

    arxiv.orgmicrosoft.com

  3. ElevenLabs Beta Launch (instant voice cloning + TTS)ElevenLabsGeschlossen

    Erstes breit zugängliches Consumer-Webprodukt, das sofortiges Voice-Cloning und emotionsbewusstes TTS in einer einzigen Oberfläche vereint

    voicebot.aielevenlabs.io

  4. BarkSuno AIOffen

    Erstes Open-Source-Modell, das ausdrucksstarke Sprache mit eingebetteten nonverbalen Lauten und Hintergrundgeräuschen in einem einzigen Durchgang erzeugt

    github.comhuggingface.co

  5. Meta MusicGen (open-source)Meta AIOffen

    Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie

    arxiv.orggithub.commusically.com

  6. Meta SeamlessM4TMetaOffen

    Erstes einheitliches multimodales und mehrsprachiges Sprachübersetzungsmodell

    ai.meta.com

  7. Stability AI Stable Audio 1.0Stability AIGeschlossen

    Erstes kommerzielles Text-to-Audio-Produkt mit expliziter Timing-Konditionierung für eine nutzergesteuerte Tracklänge in 44,1-kHz-Qualität

    stability.aimusically.comdigitalmusicnews.com

  8. Suno public launch (Chirp / v2 model)Suno AIGeschlossen

    Erstes Massenmarktprodukt, das vollständige Gesangssongs (Songtext + Melodie + Arrangement) durchgängig aus einem Text-Prompt erzeugt

    en.wikipedia.orghelp.suno.com

  9. GPT-4o native speech-to-speech (demo)OpenAIGeschlossen

    Erstes Spitzen-LLM, das Audio nativ und durchgängig verarbeitet und so die Latenz der STT→LLM→TTS-Kette beseitigt

    openai.comtechcrunch.com

  10. Microsoft VALL-E 2MicrosoftGeschlossen

    Erstes TTS-Modell, das auf formalen Benchmarks für Verständlichkeit und Natürlichkeit Werte auf menschlichem Niveau erreicht

    arxiv.orgmicrosoft.com

  11. Kyutai MoshiKyutaiOffen

    Erstes Echtzeit-Voll-Duplex-Sprachdialog-Foundation-Model

    github.comarxiv.org

  12. Udio v1.5UdioGeschlossen

    Erster KI-Musikgenerator, der integrierte Stem-Trennung und Upload-basiertes Audio-Remixing in einem Produkt ausliefert

    udio.commusically.com

  13. Hume AI EVI 2Hume AIGeschlossen

    Erste allgemein verfügbare Entwickler-API für emotional intelligente Voice-to-Voice-Konversation

    hume.aimarktechpost.com

  14. OpenAI Realtime API (public beta)OpenAIGeschlossen

    Erste Entwickler-API, die ein durchgängiges Speech-to-Speech-Modell auf Frontier-Niveau für den Bau produktiver Sprachagenten bereitstellt

    openai.comsimonwillison.net

  15. F5-TTSShanghai Jiao Tong University / Cambridge UniversityOffen

    Erste Architektur aus Diffusion-Transformer mit Flow Matching, die auf Zero-Shot-TTS angewendet wird und autoregressive Qualität erreicht oder übertrifft

    arxiv.orggithub.com

  16. Kokoro-82M v0.19hexgrad (independent)Offen

    Erstes Modell mit unter 100M Parametern, das Platz 1 auf einem öffentlichen TTS-Qualitäts-Leaderboard erreicht

    huggingface.co

  17. Sesame CSM (conversational speech model) demoSesame AIOffen

    Erstes Open-Source-Modell, das explizit auf den psychologischen Benchmark der 'Voice Presence' für dialogorientierte KI abzielt

    sesame.comgithub.com

  18. OpenAI gpt-4o-transcribe / gpt-4o-mini-tts audio modelsOpenAIGeschlossen

    Erstes öffentlich verfügbares instruierbares TTS-Modell, bei dem sich der Vortragsstil per natürlichsprachlichen Anweisungen festlegen lässt

    openai.comsimonwillison.net

  19. ElevenLabs Eleven v3 (alpha)ElevenLabsGeschlossen

    Erstes TTS-Modell mit inline skriptbaren Audio Tags zur Steuerung von Emotion und Vortrag innerhalb einer laufenden Synthese

    elevenlabs.ioelevenlabs.io

  20. OpenAI gpt-realtime (Realtime API GA)OpenAIGeschlossen

    Erste hochmoderne Speech-to-Speech-API, die in der allgemeinen Verfügbarkeit eine SIP-Telefonie-Integration enthält

    community.openai.comchatlyai.app

  21. MAI-Voice-1Microsoft AIGeschlossen

    Erstes hauseigenes Speech-Generation-Modell der Microsoft-AI-(MAI)-Sparte.

    microsoft.ai

  22. Suno v5 + Suno StudioSuno AIGeschlossen

    Erster KI-Musikgenerator, der eine integrierte generative Digital Audio Workstation auslieferte (Mehrspur + MIDI-Export)

    prnewswire.commusically.com

  23. Suno v5.5 (voice capture + custom models)Suno AIGeschlossen

    Erster KI-Musikgenerator für Endnutzer, der es ermöglicht, die eigene Singstimme und den persönlichen Katalog als Generierungs-Priors einzubetten

    suno.commusicbusinessworldwide.com

  24. MAI-Transcribe-1Microsoft AIGeschlossen

    Erstes hauseigenes Speech-to-Text-/Transkriptions-Modell von Microsoft AI.

    microsoft.aimicrosoft.ai

  25. MOSS-AudioOpenMOSS / MOSI.AI / Shanghai Innovation InstituteOffen

    Eines der ersten Open-Weights-Foundation-Modelle, das Verstehen von Sprache, Umgebungsklang und Musik samt zeitbewusstem Reasoning in einem Modell vereint.

    github.comopenmoss.ai

  26. OpenAI gpt-realtime-2 (mit gpt-realtime-translate und gpt-realtime-whisper)OpenAIGeschlossen

    Erstes OpenAI-Sprachmodell mit GPT-5-Klasse-Reasoning fuer Live-Sprachdialoge.

    openai.comtechcrunch.com

  27. GPT-Live (GPT-Live-1 / mini)OpenAIGeschlossen

    Erste Full-Duplex-Sprachmodellfamilie von OpenAI (gleichzeitiges Hören und Sprechen) für ChatGPT Voice.

    openai.com

Strittig · 8 Fälle

Ansprüche, die nicht ganz halten

Diese 8 Einträge tragen einen First-of-Kind-Anspruch, der sich bei der Prüfung nicht in seiner ursprünglichen Fassung bestätigen ließ — meist, weil ein anderes Release vorher da war oder weil eine Zahl aus der Berichterstattung, nicht aus der Primärquelle stammte. Der Anspruch wurde dann abgeschwächt und der Eintrag markiert. Der Prüfvermerk steht hier ungekürzt: Das ist der unbequeme Teil eines kuratierten Datensatzes und gehört öffentlich hin, nicht in eine interne Notiz.

Lesart

Warum Premieren mehr sagen als Releases

Ein Release beantwortet die Frage „wurde etwas veröffentlicht?“. Eine Premiere beantwortet die Frage „hat sich verschoben, was überhaupt möglich ist?“. Für Planung zählt die zweite: Wer eine Fähigkeit einsetzen will, die es noch nicht gibt, wartet — wer eine einsetzen will, die seit zwei Jahren existiert und inzwischen von sechs Anbietern kommt, verhandelt Preise.

Die Verteilung über die vier Modalitäten sagt dabei etwas, das die Gesamtzahl verdeckt. Text hat mit 40 Premieren die meisten, aber Audio und Video liegen mit 27 und 26 nah dahinter — und in Bild sind es nur 21. Bild ist die Modalität, in der am meisten veröffentlicht und am wenigsten erstmalig geschafft wird: Der Sprung von „unbrauchbar“ auf „einsetzbar“ lag hier früh, danach folgte Qualität, nicht Fähigkeit.

Zweite Beobachtung: 41 der 114 Premieren kamen mit offenen Gewichten. Offene Modelle sind in diesem Datensatz also nicht bloß die günstigere Kopie des Frontiers — sie haben rund ein Drittel der dokumentierten Erstmaligkeiten selbst geliefert. Wie sich dieser Anteil über die Jahre entwickelt hat, ist eine eigene Geschichte, und keine, die sich in Richtung „offen gewinnt“ bewegt.

Wer diese Liste als Rangliste liest, liest sie falsch. Sie ist ein Protokoll: Diese Fähigkeit war an diesem Tag zum ersten Mal erreichbar, und hier steht der Beleg. Alles andere — ob es wichtig war, ob es hielt, ob es sich durchsetzte — steht nicht darin.

Methode

Woher die Zahlen kommen

Grundlage ist ein handkuratierter Datensatz fähigkeitsverändernder Releases generativer KI. Aufgenommen wird ein Release nur, wenn es etwas konnte, was vorher kein öffentlich verfügbares Modell konnte — reine Preisänderungen, Rebrands und Punktversionen ohne neue Fähigkeit bleiben draußen. Jedes Datum ist gegen eine Primärquelle geprüft (Ankündigung, Paper oder Release-Notes des Labors); unbestätigte Daten sind als solche markiert statt als Fakt dargestellt. Zwei redaktionelle Marker im Zeitstrahl (Newsletter-Start, snipKI-Gründung) sind keine Releases und zählen in keiner Zahl auf dieser Seite mit. Stand der letzten Verifikation: 6. August 2026.

Die Auswahl ist kuratiert, also unvermeidlich eine Wertung. Sie ist nachprüfbar: jede Zeile hat ein Datum und einen Link. Diese Teilmenge als JSON · vollständige API

Zitieren

Frei nutzbar mit Namensnennung

Alle Zahlen und Tabellen dieser Seite stehen unter CC-BY-4.0. Nutze sie in Präsentationen, Artikeln, Modellen — mit dieser Zeile:

Erstmalig: 114 belegte Premieren — Die Beschleunigung — KI-Zeitstrahl von snipKI (https://timeline.snipki.de)
https://timeline.snipki.de/erstmalig

KI-Zeitstrahl von snipKI · the KI Enablement Company

gebaut von snipki.de