Erstmalig · Premieren
Erstmalig: 114 belegte Premieren
114 von 245 Releases tragen einen belegten „Erster, der …“-Anspruch: 40 in Text, 27 in Audio, 26 in Video, 21 in Bild. 41 davon kamen mit offenen Gewichten. Bei 8 ist der Anspruch oder das Datum strittig — mit Begründung, warum.
„Erster“ ist die am häufigsten behauptete und am seltensten geprüfte Aussage der KI-Branche. Jede Pressemitteilung enthält eine; fast keine nennt, gegen welchen Stand sie gemessen wurde. Diese Seite hält 114 solcher Ansprüche fest — mit Datum, Labor und Link, und mit einer offenen Kennzeichnung dort, wo der Anspruch nicht hält.
Alle 114 haben mindestens eine Primärquelle. 41 kamen mit offenen Gewichten, 8 sind als strittig markiert — inklusive Begründung, warum.
Definition
Was hier als „Erster“ zählt
Aufgenommen wird ein Anspruch nur, wenn eine Fähigkeit zum ersten Mal öffentlich verfügbar war — nicht, wenn eine Zahl auf einem Benchmark zum ersten Mal erreicht wurde. Ein Modell, das etwas besser kann, ist kein Erster. Ein Modell, das etwas kann, was vorher kein öffentlich zugängliches Modell konnte, ist einer.
„Öffentlich verfügbar“ ist dabei die härtere Hürde als „angekündigt“. Ein Forschungspapier ohne Zugang begründet keinen Ersten in diesem Datensatz; eine Wartelisten-Demo, die nachweislich Nutzer erreichte, schon. Deshalb steht bei Text nicht GPT-3, sondern InstructGPT am Anfang: die Fähigkeit, Anweisungen zuverlässig zu folgen, war die Neuerung, die alles Weitere trug.
Und: Ein Anspruch gilt nur so weit, wie er belegbar ist. Wo eine ursprüngliche Formulierung zu weit ging, wurde sie abgeschwächt statt gelöscht — und der Eintrag als strittig markiert. Diese Fälle stehen weiter unten, einzeln begründet.
Verteilung
Wo die Premieren liegen
| Modalität | Premieren | Erste | Jüngste |
|---|---|---|---|
| Text | 40 | InstructGPT 27.01.2022 | Muse Code (Beta) & Muse Spark 1.2 05.08.2026 |
| Bild | 21 | Stable Diffusion 1.4 (public release) 22.08.2022 | Muse Image 07.07.2026 |
| Video | 26 | Make-A-Video 29.09.2022 | Gemini Robotics 2 (mit ER 2 und On-Device 2) 30.07.2026 |
| Audio | 27 | Whisper (large-v1) 21.09.2022 | GPT-Live (GPT-Live-1 / mini) 08.07.2026 |
Pro Jahr: 2022 → 7, 2023 → 24, 2024 → 27, 2025 → 27, 2026 → 29. Bemerkenswert ist, dass die Zahl der Premieren seit 2023 kaum steigt, während die Zahl der Releases sich vervielfacht hat. 2023 kamen 24 Premieren auf 37 Releases, 2026 sind es 29 auf 101. Es erscheint also nicht mehr Neues — es erscheint dasselbe Neue häufiger und von mehr Häusern.
Text · 40 Premieren
Erstmalig in Text & Reasoning
- InstructGPTOpenAIGeschlossen
Erstes per RLHF instruktionsoptimiertes Produktionsmodell
- ChatGPT (GPT-3.5-turbo)OpenAIGeschlossen
Erste kostenlose Chat-Oberfläche für ein Frontier-LLM mit Reichweite im Massenmarkt
- LLaMA 1MetaOffen
Erste offen verfügbare LLM-Familie, die mit den damaligen Modellen der GPT-3-Klasse konkurrenzfähig war
- GPT-4OpenAIGeschlossen
Erstes öffentlich ausgerolltes LLM, das in einer breiten Palette berufsqualifizierender Prüfungen über dem menschlichen Durchschnitt abschnitt
- AutoGPTSignificant GravitasOffen
Erster viraler autonomer KI-Agent
Erste LLM-Familie mit einem Kontextfenster von 100.000 Tokens, die über eine kostenlose öffentliche Consumer-Chat-Oberfläche verfügbar war
Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet
- Mistral 7BMistral AIOffen
Erstes Open-Weights-Modell mit 7B, das ein 13B-Modell auf ganzer Linie in Standard-Benchmarks schlägt
- Gemini 1.0Google DeepMindGeschlossen
Erstes Modell, das den Durchschnitt menschlicher Experten im MMLU übertrifft (90,0 % gegenüber einer Baseline menschlicher Experten von etwa 89 %)
- Mixtral 8x7BMistral AIOffen
Erstes Open-Weights-Sparse-MoE-Modell dieser Größenordnung, das die Leistung von GPT-3.5 erreicht
- Gemini 1.5 ProGoogle DeepMindGeschlossen
Erstes Modell mit einem Kontextfenster von 1 Million Tokens
- Google GemmaGoogleOffen
Googles erstes offenes Sprachmodell
- Microsoft Phi-3 (Phi-3-mini)MicrosoftOffen
Wegweisendes SLM-auf-dem-Gerät
- Llama 3.1 405BMetaOffen
Erstes Open-Weights-Modell mit über 400B Parametern, das mit geschlossenen Frontier-Modellen konkurrenzfähig ist
- OpenAI o1-previewOpenAIGeschlossen
Erstes öffentlich eingesetztes LLM, das interne Reasoning-Tokens (Skalierung der Rechenleistung zur Inferenzzeit) als Produktfunktion nutzt
- Claude 3.5 Sonnet (v2) with Computer UseAnthropicGeschlossen
Erstes Frontier-KI-Modell, das Computer-Use (GUI-Automatisierung) in einer öffentlichen Beta anbietet
- OpenAI o3 (preview/announcement)OpenAIGeschlossen
Erstes Modell, das beim ARC-AGI 75 % überschreitet
Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht
- DeepSeek-R1DeepSeekOffen
Erstes Open-Weights-Reasoning-Modell, das die Leistung auf o1-Niveau erreicht, unter MIT-Lizenz
- OpenAI OperatorOpenAIGeschlossen
Erster Mainstream-Agent, der den Browser selbst bedient
Erstes Hybrid-Modell für schnelles und erweitertes Reasoning in einem einzigen Deployment
Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens
- xAI Grok 4xAIGeschlossen
Erstes Modell, das rund 50 % auf „Humanity's Last Exam" erreichte
- GPT-5OpenAIGeschlossen
Erstes einheitliches Modell aus schnellem Modus und Reasoning mit automatischem Compute-Routing in einem einzigen API-Endpunkt
- MAI-1-previewMicrosoft AIGeschlossen
Erstes vollständig hauseigenes, End-to-End trainiertes Foundation-LLM von Microsoft AI.
- GLM-5Zhipu AI (Z.ai)Offen
Erstes Frontier-Open-Weights-Modell einer börsennotierten Foundation-Model-Firma (Zhipu/Z.ai).
- GLM-5.1Zhipu / Z.aiOffen
Erstes Open-Weights-Modell an der Spitze von SWE-Bench Pro
- Muse SparkMeta (Superintelligence Labs)Geschlossen
Erstes Modell von Meta Superintelligence Labs und Metas erster strategischer Wechsel von Open-Weights zu einem geschlossenen Frontier-Modell.
- ERNIE 5.1 PreviewBaiduGeschlossen
Erstes chinesisches LLM in den globalen Top 5 der LMArena Search Arena.
- MiniMax M3MiniMaxOffen
Laut MiniMax erstes Open-Weights-Modell, das Frontier-Coding, 1M-Kontext und native Multimodalität in einer einzigen Architektur kombiniert.
- MAI-Thinking-1Microsoft AIGeschlossen
Erstes von Microsoft AI vollständig in-house entwickeltes Reasoning-/Thinking-Modell, trainiert ohne Distillation aus Drittanbieter-Modellen.
- MAI-Code-1-FlashMicrosoft AIGeschlossen
Erstes hauseigenes, agentisches Coding-Modell von Microsoft AI.
- Claude Fable 5AnthropicGeschlossen
Erstes öffentlich zugängliches Modell der Mythos-Klasse von Anthropic (oberhalb der Opus-Klasse).
- DiffusionGemma 26B-A4BGoogle DeepMindOffen
Erstes großes Open-Weights-Text-Diffusionsmodell von Google, das Text in parallelen Blöcken statt autoregressiv Token für Token erzeugt.
- Ornith-1.0DeepReinforceOffen
Erste offene Modellfamilie, die ihre eigenen RL-Scaffolds (Task-Harnesses) lernt
- LongCat-2.0MeituanOffen
Erstes Billionen-Parameter-Modell, das komplett auf inländischen chinesischen KI-Chips trainiert und ausgeführt wird.
- Claude Fable 5 (Wiederveröffentlichung)AnthropicGeschlossen
Erstes Frontier-Modell, das durch eine US-Exportkontrolle vorübergehend abgeschaltet und nach Aufhebung wieder in Betrieb genommen wurde.
- InklingThinking Machines LabOffen
Erstes öffentlich verfügbares Modell von Thinking Machines Lab (Mira Murati).
- Gemini 3.5 Flash CyberGoogleGeschlossen
Googles erster öffentlich benannter, auf Cybersecurity spezialisierter Vertical-Finetune.
- Muse Code (Beta) & Muse Spark 1.2MetaGeschlossen
Erster eigener Terminal-Coding-Agent von Meta.
Bild · 21 Premieren
Erstmalig in Bild
- Stable Diffusion 1.4 (public release)Stability AI / CompVis / RunwayMLOffen
Erstes breit verteiltes Open-Weights-Modell für Text-zu-Bild, das auf einer Consumer-GPU lauffähig ist
- DALL-E 2 (public launch, no waitlist)OpenAIGeschlossen
Erstes geschlossenes Frontier-Modell für Text-zu-Bild, das ohne Warteliste vollständig der Öffentlichkeit zugänglich war
- DreamFusionGoogleGeschlossen
Durchbruch bei Text-zu-3D
- Adobe Firefly (beta)AdobeGeschlossen
Erstes kommerziell freigestelltes Text-zu-Bild-Modell, das vollständig auf lizenzierten Inhalten trainiert wurde
- Stable Diffusion XL 1.0 (SDXL)Stability AIOffen
Erstes Open-Weights-Modell mit einer zweistufigen Pipeline aus Basismodell und Refiner bei nativer Auflösung von 1024 Pixeln
- Ideogram 0.1 (public launch)Ideogram AIGeschlossen
Erstes öffentlich verfügbares Modell, das auf die genaue Darstellung von Text in Bildern spezialisiert ist
- DALL-E 3OpenAIGeschlossen
Erstes Bildgenerierungsmodell, das nativ in eine große LLM-Chat-Oberfläche (ChatGPT) eingebettet ist
- Google Imagen 2Google DeepMindGeschlossen
Erster Einsatz des unsichtbaren KI-Wasserzeichens SynthID im produktiven Maßstab
- Stable Diffusion 3 Medium (open weights)Stability AIOffen
Erstes Open-Weights-Modell, das die Architektur eines Multimodal Diffusion Transformer (MMDiT) für die Text-to-Image-Generierung nutzt
- FLUX.1 (pro / dev / schnell)Black Forest LabsOffen
Erstes Apache-lizenziertes Modell, das Bildqualität auf Frontier-Niveau erreicht (FLUX.1[schnell])
- Stable Diffusion 3.5 LargeStability AIOffen
Erstes Open-Weights-Bildgenerierungsmodell mit über 8B Parametern, das unter einer freizügigen kommerziellen Lizenz veröffentlicht wurde
- Recraft V3RecraftGeschlossen
Erstes Modell, das korrekte, mehrwortige Langtextpassagen innerhalb von Bildern erzeugt
- GPT-4o Native Image Generation (gpt-image-1)OpenAIGeschlossen
Erstes nativ multimodales LLM, bei dem Bildgenerierung und sprachliches Reasoning dieselben Modellgewichte teilen
- FLUX.1 Kontext [pro] + [max]Black Forest LabsGeschlossen
Erstes Flow-Matching-Modell mit gemeinsamer, kontextbezogener Text-und-Bild-Bearbeitung (Beibehaltung der Identität des Referenzbilds über iterative Bearbeitungen hinweg)
- FLUX.1 Kontext [dev] (open weights)Black Forest LabsOffen
Erstes Open-Weights-Modell, das die Leistung proprietärer Modelle bei der iterativen, kontextbewussten Bildbearbeitung erreichte
- Nano Banana (Gemini 2.5 Flash Image)GoogleGeschlossen
Erstes Bildmodell, das konversationelles Mehrfach-Editieren mit Konsistenz mainstreamfähig machte
- Seedream 4.0ByteDanceGeschlossen
Erstes Modell eines chinesischen Labors an der Spitze globaler Bild-Arenen
- MAI-Image-1Microsoft AIGeschlossen
Erstes hauseigenes Bildgenerierungs-Modell von Microsoft AI.
- gpt-image-2 (ChatGPT Images 2.0)OpenAIGeschlossen
Erstes weit verbreitetes Bildgenerierungsmodell mit explizitem, der Generierung vorgeschaltetem Reasoning-/Thinking-Schritt.
- Ideogram 4.0IdeogramOffen
Erstes Open-Weights-Modell von Ideogram, das seine Spitzentechnologie fuer Design- und Text-Rendering oeffentlich freigab.
- Muse ImageMeta (Superintelligence Labs)Geschlossen
Erstes Bildgenerierungsmodell der Meta Superintelligence Labs.
Video · 26 Premieren
Erstmalig in Video
- Make-A-VideoMetaGeschlossen
Erstes prominentes Text-zu-Video-Modell
- Runway Gen-1RunwayGeschlossen
Erstes kommerziell verfügbares KI-System zur Video-zu-Video-Generierung
- Runway Gen-2RunwayGeschlossen
Erster öffentlich verfügbarer Text-zu-Video-Generator
Erstes breit zugängliches Open-Source-Modell für Text-zu-Video
- Stable Video Diffusion (SVD)Stability AIOffen
Erstes breit veröffentlichtes Open-Weights-Diffusionsmodell für Image-to-Video
- OpenAI Sora (preview announcement)OpenAIGeschlossen
Erste Demonstration von minutenlangem, fotorealistischem KI-Video aus Text auf diesem Qualitätsniveau
- Kuaishou Kling 1.0KuaishouGeschlossen
Erstes kommerzielles Modell, das durchgehende Videogenerierung von 2 Minuten in 1080p unterstützt
- Luma Dream MachineLuma AIGeschlossen
Erstes Verbraucher-Videomodell, das rein auf einem video-nativen multimodalen Transformer aufgebaut ist
- Meta Movie GenMetaGeschlossen
Erstes Frontier-Labor-Modell mit gemeinsam erzeugtem synchronem Ton zum Video plus Ein-Foto-Personalisierung
- Genmo Mochi 1GenmoOffen
Größtes Open-Source-Text-zu-Video-Modell zum Zeitpunkt der Veröffentlichung (10B Parameter, Apache 2.0)
Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)
- Tencent HunyuanVideoTencentOffen
Größtes Open-Source-Videogenerierungsmodell zum Zeitpunkt der Veröffentlichung (13B Parameter), erstes offenes Modell, das die kommerzielle Frontier-Qualität erreicht
- Alibaba Wan 2.1Alibaba (Wan Team)Offen
Erstes Open-Source-Modell, das die VBench-Bestenliste für Videoqualität anführte und alle geschlossenen Modelle übertraf
- Runway Gen-4RunwayGeschlossen
Erstes kommerzielles Videomodell, das aus Referenzbildern eine zuverlässige Figuren- und Szenenkonsistenz über mehrere Einstellungen hinweg liefert
- Google Veo 3Google DeepMindGeschlossen
Erstes hochmodernes Videomodell mit nativer Generierung von synchronisiertem Audio, Sprache und Soundeffekten
- Seedance 1.0ByteDanceGeschlossen
Erstes Videomodell, das natives Multi-Shot-Storytelling als Standard zeigte
- MiniMax Hailuo 02MiniMaxGeschlossen
NCR-Architektur (Noise-aware Compute Redistribution)
- Runway AlephRunwayGeschlossen
Erstes leistungsfähiges allgemeines In-Context-Videobearbeitungsmodell
- Google DeepMind Genie 3Google DeepMindGeschlossen
Echtzeit-Weltmodell als neue Modalität
- Luma Ray3Luma AIGeschlossen
Erstes „Reasoning"-Videomodell und erstes mit hochwertigem 16-Bit-HDR
- LTX-2LightricksOffen
Erstes produktionsreifes Open-Weights-Modell, das Video und Audio synchron in einem Durchgang mit nativem 4K und offenem Trainingscode generiert.
- Gemini Omni FlashGoogle DeepMindGeschlossen
Erstes Modell der Gemini-Omni-Familie, das generative Medien mit Gemins Weltwissen vereint und Video aus jeder Eingabemodalität per Konversation erzeugt und editiert.
- Qwen-Robot SuiteAlibaba (Qwen)Geschlossen
Erstes umfassendes Robotik-/Embodied-Modellpaket von Alibaba (Qwen)
- Seedance 2.5ByteDanceGeschlossen
Erster nativer 30-Sekunden-Clip in einem einzigen Durchgang
Erstes Modell mit gemeinsam trainierter Video-, Audio- und Action-Generierung aus einem Backbone.
- Gemini Robotics 2 (mit ER 2 und On-Device 2)Google DeepMindGeschlossen
Erstes Gemini-Robotikmodell mit Ganzkörpersteuerung und Kollaboration mehrerer, auch unterschiedlicher Roboter
Audio · 27 Premieren
Erstmalig in Audio & Stimme
- Whisper (large-v1)OpenAIOffen
Erstes Open-Source-ASR-Modell, das die Qualität mehrsprachiger Transkription auf kommerziellem Niveau weitgehend erreicht
- VALL-EMicrosoftGeschlossen
Erstes sprachmodellbasiertes Zero-Shot-TTS, das Sprecherähnlichkeit aus einer 3-sekündigen Referenzaufnahme erreicht
- ElevenLabs Beta Launch (instant voice cloning + TTS)ElevenLabsGeschlossen
Erstes breit zugängliches Consumer-Webprodukt, das sofortiges Voice-Cloning und emotionsbewusstes TTS in einer einzigen Oberfläche vereint
- BarkSuno AIOffen
Erstes Open-Source-Modell, das ausdrucksstarke Sprache mit eingebetteten nonverbalen Lauten und Hintergrundgeräuschen in einem einzigen Durchgang erzeugt
- Meta MusicGen (open-source)Meta AIOffen
Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie
- Meta SeamlessM4TMetaOffen
Erstes einheitliches multimodales und mehrsprachiges Sprachübersetzungsmodell
- Stability AI Stable Audio 1.0Stability AIGeschlossen
Erstes kommerzielles Text-to-Audio-Produkt mit expliziter Timing-Konditionierung für eine nutzergesteuerte Tracklänge in 44,1-kHz-Qualität
- Suno public launch (Chirp / v2 model)Suno AIGeschlossen
Erstes Massenmarktprodukt, das vollständige Gesangssongs (Songtext + Melodie + Arrangement) durchgängig aus einem Text-Prompt erzeugt
- GPT-4o native speech-to-speech (demo)OpenAIGeschlossen
Erstes Spitzen-LLM, das Audio nativ und durchgängig verarbeitet und so die Latenz der STT→LLM→TTS-Kette beseitigt
- Microsoft VALL-E 2MicrosoftGeschlossen
Erstes TTS-Modell, das auf formalen Benchmarks für Verständlichkeit und Natürlichkeit Werte auf menschlichem Niveau erreicht
- Kyutai MoshiKyutaiOffen
Erstes Echtzeit-Voll-Duplex-Sprachdialog-Foundation-Model
- Udio v1.5UdioGeschlossen
Erster KI-Musikgenerator, der integrierte Stem-Trennung und Upload-basiertes Audio-Remixing in einem Produkt ausliefert
- Hume AI EVI 2Hume AIGeschlossen
Erste allgemein verfügbare Entwickler-API für emotional intelligente Voice-to-Voice-Konversation
- OpenAI Realtime API (public beta)OpenAIGeschlossen
Erste Entwickler-API, die ein durchgängiges Speech-to-Speech-Modell auf Frontier-Niveau für den Bau produktiver Sprachagenten bereitstellt
- F5-TTSShanghai Jiao Tong University / Cambridge UniversityOffen
Erste Architektur aus Diffusion-Transformer mit Flow Matching, die auf Zero-Shot-TTS angewendet wird und autoregressive Qualität erreicht oder übertrifft
- Kokoro-82M v0.19hexgrad (independent)Offen
Erstes Modell mit unter 100M Parametern, das Platz 1 auf einem öffentlichen TTS-Qualitäts-Leaderboard erreicht
- Sesame CSM (conversational speech model) demoSesame AIOffen
Erstes Open-Source-Modell, das explizit auf den psychologischen Benchmark der 'Voice Presence' für dialogorientierte KI abzielt
- OpenAI gpt-4o-transcribe / gpt-4o-mini-tts audio modelsOpenAIGeschlossen
Erstes öffentlich verfügbares instruierbares TTS-Modell, bei dem sich der Vortragsstil per natürlichsprachlichen Anweisungen festlegen lässt
- ElevenLabs Eleven v3 (alpha)ElevenLabsGeschlossen
Erstes TTS-Modell mit inline skriptbaren Audio Tags zur Steuerung von Emotion und Vortrag innerhalb einer laufenden Synthese
- OpenAI gpt-realtime (Realtime API GA)OpenAIGeschlossen
Erste hochmoderne Speech-to-Speech-API, die in der allgemeinen Verfügbarkeit eine SIP-Telefonie-Integration enthält
- MAI-Voice-1Microsoft AIGeschlossen
Erstes hauseigenes Speech-Generation-Modell der Microsoft-AI-(MAI)-Sparte.
- Suno v5 + Suno StudioSuno AIGeschlossen
Erster KI-Musikgenerator, der eine integrierte generative Digital Audio Workstation auslieferte (Mehrspur + MIDI-Export)
- Suno v5.5 (voice capture + custom models)Suno AIGeschlossen
Erster KI-Musikgenerator für Endnutzer, der es ermöglicht, die eigene Singstimme und den persönlichen Katalog als Generierungs-Priors einzubetten
- MAI-Transcribe-1Microsoft AIGeschlossen
Erstes hauseigenes Speech-to-Text-/Transkriptions-Modell von Microsoft AI.
- MOSS-AudioOpenMOSS / MOSI.AI / Shanghai Innovation InstituteOffen
Eines der ersten Open-Weights-Foundation-Modelle, das Verstehen von Sprache, Umgebungsklang und Musik samt zeitbewusstem Reasoning in einem Modell vereint.
- OpenAI gpt-realtime-2 (mit gpt-realtime-translate und gpt-realtime-whisper)OpenAIGeschlossen
Erstes OpenAI-Sprachmodell mit GPT-5-Klasse-Reasoning fuer Live-Sprachdialoge.
- GPT-Live (GPT-Live-1 / mini)OpenAIGeschlossen
Erste Full-Duplex-Sprachmodellfamilie von OpenAI (gleichzeitiges Hören und Sprechen) für ChatGPT Voice.
Strittig · 8 Fälle
Ansprüche, die nicht ganz halten
Diese 8 Einträge tragen einen First-of-Kind-Anspruch, der sich bei der Prüfung nicht in seiner ursprünglichen Fassung bestätigen ließ — meist, weil ein anderes Release vorher da war oder weil eine Zahl aus der Berichterstattung, nicht aus der Primärquelle stammte. Der Anspruch wurde dann abgeschwächt und der Eintrag markiert. Der Prüfvermerk steht hier ungekürzt: Das ist der unbequeme Teil eines kuratierten Datensatzes und gehört öffentlich hin, nicht in eine interne Notiz.
20.03.2023 · Alibaba DAMO Academy
ModelScope Text-to-Video
Anspruch (korrigiert): Erstes breit zugängliches Open-Source-Modell für Text-zu-Video
Mehrere Quellen verorten den Hugging-Face-Upload auf etwa den 19.–22. März 2023. Eine Quelle nennt den 19. März als Datum, an dem ein Link zum Modell auf HuggingFace geteilt wurde; eine andere spricht von „im Laufe des Wochenendes ab dem 22. März“ und verortet ihn auf etwa den 18.–19. März. Der genaue Tag lässt sich anhand einer einzelnen maßgeblichen Primärquelle nicht tagesgenau bestätigen. Das Datum wurde als beste Schätzung passend zum breiteren Nachrichtenzyklus auf den 20. März gesetzt; disputed=true spiegelt die tagesgenaue Unsicherheit wider.
11.07.2023 · Anthropic
Claude 2
Anspruch (korrigiert): Erste LLM-Familie mit einem Kontextfenster von 100.000 Tokens, die über eine kostenlose öffentliche Consumer-Chat-Oberfläche verfügbar war
Die ursprüngliche firstOfKind-Aussage („erstes kommerziell verfügbares LLM mit einem Kontextfenster von 100.000“) ist unzutreffend: Anthropic kündigte den 100.000-Token-Kontext für Claude 1 bereits am 11. Mai 2023 an — vor dem Start von Claude 2. Claude 2 startete mit demselben Limit von 100.000. Die Aussage wurde abgeschwächt, um die Dimension der öffentlichen Oberfläche zu betonen, die die eigentliche Neuerung ist. Als umstritten markiert, weil der First-of-Kind-Anspruch zu weit gefasst war.
18.07.2023 · Meta
Llama 2
Anspruch (korrigiert): Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet
Die ursprüngliche Aussage „erstes Open-Weight-Modell der Frontier-Klasse mit einer Lizenz für kommerzielle Nutzung“ ist umstritten: Falcon 40B (TII) erhielt im Mai/Juni 2023 eine Apache-2.0-Lizenz für kommerzielle Nutzung, also vor dem Start von Llama 2 am 18. Juli. Llama 2 verwendet zudem keine vollständig offene Lizenz (es schränkt Nutzer mit über 700 Mio. monatlich aktiven Nutzern ein und untersagt in bestimmten Kontexten, die Ausgaben zur Verbesserung anderer LLMs zu verwenden). Die Aussage wurde zu „bedeutendes Frontier-Labor“ abgeschwächt. Als umstritten markiert.
22.11.2024 · Lightricks
Lightricks LTX-Video (LTXV)
Anspruch (korrigiert): Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)
Wikipedia nennt 'November 2024', ohne den Tag anzugeben. Das RAIL-M-Lizenzdokument verweist auf Version 0.9, und der Titel des Artikels im ComfyUI-Wiki verwendet '2024-11-23' als Veröffentlichungsdatum zur Berichterstattung über das Release. Mehrere Quellen bestätigen den 22. November 2024 als Veröffentlichungstag. Disputed=true spiegelt wider, dass sich der genaue Tag (22. vs. 23.) nicht aus einer einzigen eindeutigen Primärquelle bestätigen lässt; der Monat November 2024 ist sicher.
26.12.2024 · DeepSeek
DeepSeek-V3
Anspruch (korrigiert): Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht
Das arXiv-Paper wurde am 27. Dezember 2024 (UTC) eingereicht. Die Modellgewichte und das GitHub-Release wurden etwa am 26. Dezember 2024 veröffentlicht. Eine geringfügige Zeitzonen-Unklarheit (26. Dez. vs. 27. Dez.) macht die taggenaue Angabe unsicher; entsprechend als strittig markiert. Die Zahl von 5,6 Mio. US-Dollar Trainingskosten stammt aus dem Paper selbst.
24.02.2025 · Anthropic
Claude 3.7 Sonnet
Anspruch (korrigiert): Erstes Hybrid-Modell für schnelles und erweitertes Reasoning in einem einzigen Deployment
Datum bestätigt als 24. Februar 2025. Der im ursprünglichen Eintrag genannte SWE-bench-Wert von 80,8 % findet sich nicht in der offiziellen Ankündigung von Anthropic; die offiziellen Zahlen lauten 63,7 % (reines pass@1) und 70,3 % (mit High-Compute-Scaffolding). Der Wert von 80,8 % stammt vermutlich aus der Evaluierung über ein Drittanbieter-Agent-Harness. Die Beschreibung der Fähigkeit wurde auf 70,3 % korrigiert und aufgrund der Abweichung beim Wert als umstritten markiert.
05.04.2025 · Meta
Llama 4 (Scout / Maverick)
Anspruch (korrigiert): Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens
Datum bestätigt als 5. April 2025 anhand des offiziellen Meta-AI-Blogs. Die Behauptung zur einzelnen H100 ist technisch nur mit INT4-Quantisierung zutreffend; der maximale Kontext betrug bei dieser Konfiguration ~35K Tokens, nicht die vollen 10 Mio. Der volle Kontext von 10 Mio. erforderte 8 H100s. Die Behauptung zum Kontextfenster von 10 Mio. ist real, aber die Formulierung 'einzelne H100' überzeichnet die Zugänglichkeit. Aufgrund der umstrittenen Behauptung zur einzelnen H100 als umstritten markiert.
23.07.2026 · Black Forest Labs
FLUX 3
Anspruch (korrigiert): Erstes Modell mit gemeinsam trainierter Video-, Audio- und Action-Generierung aus einem Backbone.
Ankündigungsdatum 23.07.2026 gegen die offizielle Pressemitteilung von Black Forest Labs (GlobeNewswire) verifiziert; von unabhängiger Berichterstattung (VentureBeat, TechTimes) bestätigt. Als unbestätigt markiert, weil zum Ankündigungszeitpunkt keine Benchmarks veröffentlicht waren und nur FLUX 3 Video und Action als gated Early Access für ausgewählte Partner verfügbar sind; die 20-Sekunden-Angabe stammt aus der Berichterstattung, nicht aus der Pressemitteilung.
Lesart
Warum Premieren mehr sagen als Releases
Ein Release beantwortet die Frage „wurde etwas veröffentlicht?“. Eine Premiere beantwortet die Frage „hat sich verschoben, was überhaupt möglich ist?“. Für Planung zählt die zweite: Wer eine Fähigkeit einsetzen will, die es noch nicht gibt, wartet — wer eine einsetzen will, die seit zwei Jahren existiert und inzwischen von sechs Anbietern kommt, verhandelt Preise.
Die Verteilung über die vier Modalitäten sagt dabei etwas, das die Gesamtzahl verdeckt. Text hat mit 40 Premieren die meisten, aber Audio und Video liegen mit 27 und 26 nah dahinter — und in Bild sind es nur 21. Bild ist die Modalität, in der am meisten veröffentlicht und am wenigsten erstmalig geschafft wird: Der Sprung von „unbrauchbar“ auf „einsetzbar“ lag hier früh, danach folgte Qualität, nicht Fähigkeit.
Zweite Beobachtung: 41 der 114 Premieren kamen mit offenen Gewichten. Offene Modelle sind in diesem Datensatz also nicht bloß die günstigere Kopie des Frontiers — sie haben rund ein Drittel der dokumentierten Erstmaligkeiten selbst geliefert. Wie sich dieser Anteil über die Jahre entwickelt hat, ist eine eigene Geschichte, und keine, die sich in Richtung „offen gewinnt“ bewegt.
Wer diese Liste als Rangliste liest, liest sie falsch. Sie ist ein Protokoll: Diese Fähigkeit war an diesem Tag zum ersten Mal erreichbar, und hier steht der Beleg. Alles andere — ob es wichtig war, ob es hielt, ob es sich durchsetzte — steht nicht darin.
Methode
Woher die Zahlen kommen
Grundlage ist ein handkuratierter Datensatz fähigkeitsverändernder Releases generativer KI. Aufgenommen wird ein Release nur, wenn es etwas konnte, was vorher kein öffentlich verfügbares Modell konnte — reine Preisänderungen, Rebrands und Punktversionen ohne neue Fähigkeit bleiben draußen. Jedes Datum ist gegen eine Primärquelle geprüft (Ankündigung, Paper oder Release-Notes des Labors); unbestätigte Daten sind als solche markiert statt als Fakt dargestellt. Zwei redaktionelle Marker im Zeitstrahl (Newsletter-Start, snipKI-Gründung) sind keine Releases und zählen in keiner Zahl auf dieser Seite mit. Stand der letzten Verifikation: 6. August 2026.
Die Auswahl ist kuratiert, also unvermeidlich eine Wertung. Sie ist nachprüfbar: jede Zeile hat ein Datum und einen Link. Diese Teilmenge als JSON · vollständige API
Zitieren
Frei nutzbar mit Namensnennung
Alle Zahlen und Tabellen dieser Seite stehen unter CC-BY-4.0. Nutze sie in Präsentationen, Artikeln, Modellen — mit dieser Zeile:
Erstmalig: 114 belegte Premieren — Die Beschleunigung — KI-Zeitstrahl von snipKI (https://timeline.snipki.de)
https://timeline.snipki.de/erstmaligKI-Zeitstrahl von snipKI · the KI Enablement Company