{"meta":{"lastVerified":"6. August 2026","lastVerifiedISO":"2026-08-06","windowStart":"2022-08","windowEnd":"2026-08","total":247,"placeholder":false,"version":"v1","slice":"erstmalig","claim":"114 von 245 Releases tragen einen belegten „Erster, der …“-Anspruch: 40 in Text, 27 in Audio, 26 in Video, 21 in Bild. 41 davon kamen mit offenen Gewichten. Bei 8 ist der Anspruch oder das Datum strittig — mit Begründung, warum.","page":"https://timeline.snipki.de/erstmalig","license":"CC-BY-4.0","attribution":"Die Beschleunigung — KI-Zeitstrahl von snipKI (https://timeline.snipki.de)","source":"https://timeline.snipki.de","basis":"245 Releases (redaktionelle Marker ausgenommen)","byModality":{"text":40,"image":21,"video":26,"audio":27}},"count":114,"firsts":[{"id":"text-instructgpt-2022-01-27","date":"2022-01-27","datePrecision":"day","modality":"text","name":"InstructGPT","org":"OpenAI","license":"closed","firstOfKind":"Erstes per RLHF instruktionsoptimiertes Produktionsmodell","sources":["https://openai.com/index/instruction-following/"],"disputed":false},{"id":"image-stable-diffusion-1-4-public-release-2022-08-22","date":"2022-08-22","datePrecision":"day","modality":"image","name":"Stable Diffusion 1.4 (public release)","org":"Stability AI / CompVis / RunwayML","license":"open","firstOfKind":"Erstes breit verteiltes Open-Weights-Modell für Text-zu-Bild, das auf einer Consumer-GPU lauffähig ist","sources":["https://stability.ai/news-updates/stable-diffusion-public-release","https://en.wikipedia.org/wiki/Stable_Diffusion"],"disputed":false},{"id":"audio-whisper-large-v1-2022-09-21","date":"2022-09-21","datePrecision":"day","modality":"audio","name":"Whisper (large-v1)","org":"OpenAI","license":"open","firstOfKind":"Erstes Open-Source-ASR-Modell, das die Qualität mehrsprachiger Transkription auf kommerziellem Niveau weitgehend erreicht","sources":["https://openai.com/index/whisper/","https://techcrunch.com/2022/09/21/openai-open-sources-whisper-a-multilingual-speech-recognition-system/","https://arxiv.org/abs/2212.04356"],"disputed":false},{"id":"image-dall-e-2-public-launch-no-waitlist-2022-09-28","date":"2022-09-28","datePrecision":"day","modality":"image","name":"DALL-E 2 (public launch, no waitlist)","org":"OpenAI","license":"closed","firstOfKind":"Erstes geschlossenes Frontier-Modell für Text-zu-Bild, das ohne Warteliste vollständig der Öffentlichkeit zugänglich war","sources":["https://openai.com/index/dall-e-now-available-without-waitlist/","https://siliconangle.com/2022/09/28/openai-removes-waitlist-dall-e-2-powerful-text-image-ai-generator/"],"disputed":false},{"id":"video-make-a-video-2022-09-29","date":"2022-09-29","datePrecision":"day","modality":"video","name":"Make-A-Video","org":"Meta","license":"closed","firstOfKind":"Erstes prominentes Text-zu-Video-Modell","sources":["https://ai.meta.com/blog/generative-ai-text-to-video/"],"disputed":false},{"id":"image-dreamfusion-2022-09-29","date":"2022-09-29","datePrecision":"day","modality":"image","name":"DreamFusion","org":"Google","license":"closed","firstOfKind":"Durchbruch bei Text-zu-3D","sources":["https://arxiv.org/abs/2209.14988"],"disputed":false},{"id":"text-chatgpt-gpt-3-5-turbo-2022-11-30","date":"2022-11-30","datePrecision":"day","modality":"text","name":"ChatGPT (GPT-3.5-turbo)","org":"OpenAI","license":"closed","firstOfKind":"Erste kostenlose Chat-Oberfläche für ein Frontier-LLM mit Reichweite im Massenmarkt","sources":["https://openai.com/index/chatgpt/","https://en.wikipedia.org/wiki/ChatGPT"],"disputed":false},{"id":"audio-vall-e-2023-01-05","date":"2023-01-05","datePrecision":"day","modality":"audio","name":"VALL-E","org":"Microsoft","license":"closed","firstOfKind":"Erstes sprachmodellbasiertes Zero-Shot-TTS, das Sprecherähnlichkeit aus einer 3-sekündigen Referenzaufnahme erreicht","sources":["https://arxiv.org/abs/2301.02111","https://www.microsoft.com/en-us/research/publication/neural-codec-language-models-are-zero-shot-text-to-speech-synthesizers/"],"disputed":false},{"id":"audio-elevenlabs-beta-launch-instant-voice-cloning-tts-2023-01-23","date":"2023-01-23","datePrecision":"day","modality":"audio","name":"ElevenLabs Beta Launch (instant voice cloning + TTS)","org":"ElevenLabs","license":"closed","firstOfKind":"Erstes breit zugängliches Consumer-Webprodukt, das sofortiges Voice-Cloning und emotionsbewusstes TTS in einer einzigen Oberfläche vereint","sources":["https://voicebot.ai/2023/01/23/synthetic-speech-startup-elevenlabs-raises-2m-for-ai-voices-with-context-relevant-emotion/","https://elevenlabs.io/blog/elevenlabs-comes-out-of-beta-and-releases-eleven-multilingual-v2-a-foundational-ai-speech-model-for-nearly-30-languages"],"disputed":false},{"id":"video-runway-gen-1-2023-02-06","date":"2023-02-06","datePrecision":"day","modality":"video","name":"Runway Gen-1","org":"Runway","license":"closed","firstOfKind":"Erstes kommerziell verfügbares KI-System zur Video-zu-Video-Generierung","sources":["https://runwayml.com/research/gen-1","https://arxiv.org/abs/2302.03011","https://www.ghacks.net/2023/02/08/runway-launches-ground-breaking-gen-1-video-generation-ai-system/"],"disputed":false},{"id":"text-llama-1-2023-02-24","date":"2023-02-24","datePrecision":"day","modality":"text","name":"LLaMA 1","org":"Meta","license":"open","firstOfKind":"Erste offen verfügbare LLM-Familie, die mit den damaligen Modellen der GPT-3-Klasse konkurrenzfähig war","sources":["https://ai.meta.com/blog/large-language-model-llama-meta-ai/"],"disputed":false},{"id":"text-gpt-4-2023-03-14","date":"2023-03-14","datePrecision":"day","modality":"text","name":"GPT-4","org":"OpenAI","license":"closed","firstOfKind":"Erstes öffentlich ausgerolltes LLM, das in einer breiten Palette berufsqualifizierender Prüfungen über dem menschlichen Durchschnitt abschnitt","sources":["https://openai.com/research/gpt-4","https://techcrunch.com/2023/03/14/openai-releases-gpt-4-ai-that-it-claims-is-state-of-the-art/"],"disputed":false},{"id":"video-runway-gen-2-2023-03-20","date":"2023-03-20","datePrecision":"day","modality":"video","name":"Runway Gen-2","org":"Runway","license":"closed","firstOfKind":"Erster öffentlich verfügbarer Text-zu-Video-Generator","sources":["https://runwayml.com/research/gen-2","https://petapixel.com/2023/03/20/runway-gen-2-is-the-first-publicly-available-text-to-video-generator/","https://siliconangle.com/2023/03/20/runway-debuts-ai-model-can-generate-videos-text/"],"disputed":false},{"id":"video-modelscope-text-to-video-2023-03-20","date":"2023-03-20","datePrecision":"day","modality":"video","name":"ModelScope Text-to-Video","org":"Alibaba DAMO Academy","license":"open","firstOfKind":"Erstes breit zugängliches Open-Source-Modell für Text-zu-Video","sources":["https://huggingface.co/ali-vilab/modelscope-damo-text-to-video-synthesis","https://huggingface.co/ali-vilab/text-to-video-ms-1.7b"],"disputed":true,"verificationNote":"Mehrere Quellen verorten den Hugging-Face-Upload auf etwa den 19.–22. März 2023. Eine Quelle nennt den 19. März als Datum, an dem ein Link zum Modell auf HuggingFace geteilt wurde; eine andere spricht von „im Laufe des Wochenendes ab dem 22. März“ und verortet ihn auf etwa den 18.–19. März. Der genaue Tag lässt sich anhand einer einzelnen maßgeblichen Primärquelle nicht tagesgenau bestätigen. Das Datum wurde als beste Schätzung passend zum breiteren Nachrichtenzyklus auf den 20. März gesetzt; disputed=true spiegelt die tagesgenaue Unsicherheit wider."},{"id":"image-adobe-firefly-beta-2023-03-21","date":"2023-03-21","datePrecision":"day","modality":"image","name":"Adobe Firefly (beta)","org":"Adobe","license":"closed","firstOfKind":"Erstes kommerziell freigestelltes Text-zu-Bild-Modell, das vollständig auf lizenzierten Inhalten trainiert wurde","sources":["https://news.adobe.com/news/news-details/2023/adobe-unveils-firefly-a-family-of-new-creative-generative-ai","https://techcrunch.com/2023/03/21/adobe-firefly-generative-ai/"],"disputed":false},{"id":"text-autogpt-2023-03-30","date":"2023-03-30","datePrecision":"day","modality":"text","name":"AutoGPT","org":"Significant Gravitas","license":"open","firstOfKind":"Erster viraler autonomer KI-Agent","sources":["https://github.com/Significant-Gravitas/AutoGPT"],"disputed":false},{"id":"audio-bark-2023-04-01","date":"2023-04-01","datePrecision":"month","modality":"audio","name":"Bark","org":"Suno AI","license":"open","firstOfKind":"Erstes Open-Source-Modell, das ausdrucksstarke Sprache mit eingebetteten nonverbalen Lauten und Hintergrundgeräuschen in einem einzigen Durchgang erzeugt","sources":["https://github.com/suno-ai/bark","https://huggingface.co/suno/bark"],"disputed":false},{"id":"audio-meta-musicgen-open-source-2023-06-08","date":"2023-06-08","datePrecision":"day","modality":"audio","name":"Meta MusicGen (open-source)","org":"Meta AI","license":"open","firstOfKind":"Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie","sources":["https://arxiv.org/abs/2306.05284","https://github.com/facebookresearch/audiocraft","https://musically.com/2023/06/12/metas-new-musicgen-ai-was-trained-on-20k-hours-of-licensed-music/"],"disputed":false},{"id":"text-claude-2-2023-07-11","date":"2023-07-11","datePrecision":"day","modality":"text","name":"Claude 2","org":"Anthropic","license":"closed","firstOfKind":"Erste LLM-Familie mit einem Kontextfenster von 100.000 Tokens, die über eine kostenlose öffentliche Consumer-Chat-Oberfläche verfügbar war","sources":["https://www.anthropic.com/news/claude-2","https://anthropic.com/index/100k-context-windows"],"disputed":true,"verificationNote":"Die ursprüngliche firstOfKind-Aussage („erstes kommerziell verfügbares LLM mit einem Kontextfenster von 100.000“) ist unzutreffend: Anthropic kündigte den 100.000-Token-Kontext für Claude 1 bereits am 11. Mai 2023 an — vor dem Start von Claude 2. Claude 2 startete mit demselben Limit von 100.000. Die Aussage wurde abgeschwächt, um die Dimension der öffentlichen Oberfläche zu betonen, die die eigentliche Neuerung ist. Als umstritten markiert, weil der First-of-Kind-Anspruch zu weit gefasst war."},{"id":"text-llama-2-2023-07-18","date":"2023-07-18","datePrecision":"day","modality":"text","name":"Llama 2","org":"Meta","license":"open","firstOfKind":"Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet","sources":["https://about.fb.com/news/2023/07/llama-2/","https://ai.meta.com/blog/llama-2-updates-connect-2023/"],"disputed":true,"verificationNote":"Die ursprüngliche Aussage „erstes Open-Weight-Modell der Frontier-Klasse mit einer Lizenz für kommerzielle Nutzung“ ist umstritten: Falcon 40B (TII) erhielt im Mai/Juni 2023 eine Apache-2.0-Lizenz für kommerzielle Nutzung, also vor dem Start von Llama 2 am 18. Juli. Llama 2 verwendet zudem keine vollständig offene Lizenz (es schränkt Nutzer mit über 700 Mio. monatlich aktiven Nutzern ein und untersagt in bestimmten Kontexten, die Ausgaben zur Verbesserung anderer LLMs zu verwenden). Die Aussage wurde zu „bedeutendes Frontier-Labor“ abgeschwächt. Als umstritten markiert."},{"id":"image-stable-diffusion-xl-1-0-sdxl-2023-07-26","date":"2023-07-26","datePrecision":"day","modality":"image","name":"Stable Diffusion XL 1.0 (SDXL)","org":"Stability AI","license":"open","firstOfKind":"Erstes Open-Weights-Modell mit einer zweistufigen Pipeline aus Basismodell und Refiner bei nativer Auflösung von 1024 Pixeln","sources":["https://stability.ai/news/stable-diffusion-sdxl-1-announcement","https://www.prnewswire.com/news-releases/stability-ai-announces-stable-diffusion-xl-1-0--featured-on-amazon-bedrock-301886507.html"],"disputed":false},{"id":"image-ideogram-0-1-public-launch-2023-08-22","date":"2023-08-22","datePrecision":"day","modality":"image","name":"Ideogram 0.1 (public launch)","org":"Ideogram AI","license":"closed","firstOfKind":"Erstes öffentlich verfügbares Modell, das auf die genaue Darstellung von Text in Bildern spezialisiert ist","sources":["https://ideogram.ai/launch","https://en.wikipedia.org/wiki/Ideogram_(text-to-image_model)"],"disputed":false},{"id":"audio-seamless-m4t-2023-08-22","date":"2023-08-22","datePrecision":"day","modality":"audio","name":"Meta SeamlessM4T","org":"Meta","license":"open","firstOfKind":"Erstes einheitliches multimodales und mehrsprachiges Sprachübersetzungsmodell","sources":["https://ai.meta.com/blog/seamless-m4t/"],"disputed":false},{"id":"audio-stability-ai-stable-audio-1-0-2023-09-13","date":"2023-09-13","datePrecision":"day","modality":"audio","name":"Stability AI Stable Audio 1.0","org":"Stability AI","license":"closed","firstOfKind":"Erstes kommerzielles Text-to-Audio-Produkt mit expliziter Timing-Konditionierung für eine nutzergesteuerte Tracklänge in 44,1-kHz-Qualität","sources":["https://stability.ai/research/stable-audio-efficient-timing-latent-diffusion","https://musically.com/2023/09/13/stable-diffusion-maker-launches-stable-audio-text-to-music-ai/","https://www.digitalmusicnews.com/2023/09/13/stability-ai-launches-stable-audio-music-generating-tool/"],"disputed":false},{"id":"text-mistral-7b-2023-09-27","date":"2023-09-27","datePrecision":"day","modality":"text","name":"Mistral 7B","org":"Mistral AI","license":"open","firstOfKind":"Erstes Open-Weights-Modell mit 7B, das ein 13B-Modell auf ganzer Linie in Standard-Benchmarks schlägt","sources":["https://mistral.ai/news/announcing-mistral-7b/"],"disputed":false},{"id":"image-dall-e-3-2023-10-19","date":"2023-10-19","datePrecision":"day","modality":"image","name":"DALL-E 3","org":"OpenAI","license":"closed","firstOfKind":"Erstes Bildgenerierungsmodell, das nativ in eine große LLM-Chat-Oberfläche (ChatGPT) eingebettet ist","sources":["https://openai.com/index/dall-e-3-is-now-available-in-chatgpt-plus-and-enterprise/","https://openai.com/index/dall-e-3/"],"disputed":false},{"id":"video-stable-video-diffusion-svd-2023-11-21","date":"2023-11-21","datePrecision":"day","modality":"video","name":"Stable Video Diffusion (SVD)","org":"Stability AI","license":"open","firstOfKind":"Erstes breit veröffentlichtes Open-Weights-Diffusionsmodell für Image-to-Video","sources":["https://stability.ai/news-updates/stable-video-diffusion-open-ai-video-model","https://venturebeat.com/ai/stability-ai-debuts-stable-video-diffusion-models-in-research-preview"],"disputed":false},{"id":"text-gemini-1-0-2023-12-06","date":"2023-12-06","datePrecision":"day","modality":"text","name":"Gemini 1.0","org":"Google DeepMind","license":"closed","firstOfKind":"Erstes Modell, das den Durchschnitt menschlicher Experten im MMLU übertrifft (90,0 % gegenüber einer Baseline menschlicher Experten von etwa 89 %)","sources":["https://blog.google/technology/ai/google-gemini-ai/"],"disputed":false},{"id":"text-mixtral-8x7b-2023-12-11","date":"2023-12-11","datePrecision":"day","modality":"text","name":"Mixtral 8x7B","org":"Mistral AI","license":"open","firstOfKind":"Erstes Open-Weights-Sparse-MoE-Modell dieser Größenordnung, das die Leistung von GPT-3.5 erreicht","sources":["https://mistral.ai/news/mixtral-of-experts/"],"disputed":false},{"id":"image-google-imagen-2-2023-12-13","date":"2023-12-13","datePrecision":"day","modality":"image","name":"Google Imagen 2","org":"Google DeepMind","license":"closed","firstOfKind":"Erster Einsatz des unsichtbaren KI-Wasserzeichens SynthID im produktiven Maßstab","sources":["https://cloud.google.com/blog/products/ai-machine-learning/imagen-2-on-vertex-ai-is-now-generally-available","https://techcrunch.com/2023/12/13/google-debuts-imagen-2-with-text-and-logo-generation/"],"disputed":false},{"id":"audio-suno-public-launch-chirp-v2-model-2023-12-20","date":"2023-12-20","datePrecision":"day","modality":"audio","name":"Suno public launch (Chirp / v2 model)","org":"Suno AI","license":"closed","firstOfKind":"Erstes Massenmarktprodukt, das vollständige Gesangssongs (Songtext + Melodie + Arrangement) durchgängig aus einem Text-Prompt erzeugt","sources":["https://en.wikipedia.org/wiki/Suno_(platform)","https://help.suno.com/en/articles/5782721"],"disputed":false},{"id":"text-gemini-1-5-pro-2024-02-15","date":"2024-02-15","datePrecision":"day","modality":"text","name":"Gemini 1.5 Pro","org":"Google DeepMind","license":"closed","firstOfKind":"Erstes Modell mit einem Kontextfenster von 1 Million Tokens","sources":["https://blog.google/innovation-and-ai/products/google-gemini-next-generation-model-february-2024/","https://9to5google.com/2024/02/15/gemini-1-5-announcement/"],"disputed":false},{"id":"video-openai-sora-preview-announcement-2024-02-15","date":"2024-02-15","datePrecision":"day","modality":"video","name":"OpenAI Sora (preview announcement)","org":"OpenAI","license":"closed","firstOfKind":"Erste Demonstration von minutenlangem, fotorealistischem KI-Video aus Text auf diesem Qualitätsniveau","sources":["https://en.wikipedia.org/wiki/Sora_(text-to-video_model)","https://www.technologyreview.com/2024/02/15/1088401/openai-amazing-new-generative-ai-video-model-sora/"],"disputed":false},{"id":"text-google-gemma-2024-02-21","date":"2024-02-21","datePrecision":"day","modality":"text","name":"Google Gemma","org":"Google","license":"open","firstOfKind":"Googles erstes offenes Sprachmodell","sources":["https://blog.google/technology/developers/gemma-open-models/"],"disputed":false},{"id":"text-phi-3-mini-2024-04-23","date":"2024-04-23","datePrecision":"day","modality":"text","name":"Microsoft Phi-3 (Phi-3-mini)","org":"Microsoft","license":"open","firstOfKind":"Wegweisendes SLM-auf-dem-Gerät","sources":["https://azure.microsoft.com/en-us/blog/introducing-phi-3-redefining-whats-possible-with-slms/"],"disputed":false},{"id":"audio-gpt-4o-native-speech-to-speech-demo-2024-05-13","date":"2024-05-13","datePrecision":"day","modality":"audio","name":"GPT-4o native speech-to-speech (demo)","org":"OpenAI","license":"closed","firstOfKind":"Erstes Spitzen-LLM, das Audio nativ und durchgängig verarbeitet und so die Latenz der STT→LLM→TTS-Kette beseitigt","sources":["https://openai.com/index/hello-gpt-4o/","https://techcrunch.com/2024/05/13/openais-newest-model-is-gpt-4o/"],"disputed":false},{"id":"audio-microsoft-vall-e-2-2024-06-08","date":"2024-06-08","datePrecision":"day","modality":"audio","name":"Microsoft VALL-E 2","org":"Microsoft","license":"closed","firstOfKind":"Erstes TTS-Modell, das auf formalen Benchmarks für Verständlichkeit und Natürlichkeit Werte auf menschlichem Niveau erreicht","sources":["https://arxiv.org/abs/2406.05370","https://www.microsoft.com/en-us/research/publication/vall-e-2-neural-codec-language-models-are-human-parity-zero-shot-text-to-speech-synthesizers-2/"],"disputed":false},{"id":"video-kuaishou-kling-1-0-2024-06-10","date":"2024-06-10","datePrecision":"day","modality":"video","name":"Kuaishou Kling 1.0","org":"Kuaishou","license":"closed","firstOfKind":"Erstes kommerzielles Modell, das durchgehende Videogenerierung von 2 Minuten in 1080p unterstützt","sources":["https://www.prnewswire.com/news-releases/kuaishou-unveils-proprietary-video-generation-model-kling-testing-now-available-302168757.html","https://ir.kuaishou.com/news-releases/news-release-details/kuaishou-unveils-proprietary-video-generation-model-kling"],"disputed":false},{"id":"image-stable-diffusion-3-medium-open-weights-2024-06-12","date":"2024-06-12","datePrecision":"day","modality":"image","name":"Stable Diffusion 3 Medium (open weights)","org":"Stability AI","license":"open","firstOfKind":"Erstes Open-Weights-Modell, das die Architektur eines Multimodal Diffusion Transformer (MMDiT) für die Text-to-Image-Generierung nutzt","sources":["https://stability.ai/news/stable-diffusion-3","https://x.com/StabilityAI/status/1797462536117444794"],"disputed":false},{"id":"video-luma-dream-machine-2024-06-12","date":"2024-06-12","datePrecision":"day","modality":"video","name":"Luma Dream Machine","org":"Luma AI","license":"closed","firstOfKind":"Erstes Verbraucher-Videomodell, das rein auf einem video-nativen multimodalen Transformer aufgebaut ist","sources":["https://en.wikipedia.org/wiki/Dream_Machine_(text-to-video_model)","https://radiancefields.com/luma-ai-announces-dream-machine"],"disputed":false},{"id":"audio-kyutai-moshi-2024-07-03","date":"2024-07-03","datePrecision":"day","modality":"audio","name":"Kyutai Moshi","org":"Kyutai","license":"open","firstOfKind":"Erstes Echtzeit-Voll-Duplex-Sprachdialog-Foundation-Model","sources":["https://github.com/kyutai-labs/moshi","https://arxiv.org/abs/2410.00037"],"disputed":false},{"id":"text-llama-3-1-405b-2024-07-23","date":"2024-07-23","datePrecision":"day","modality":"text","name":"Llama 3.1 405B","org":"Meta","license":"open","firstOfKind":"Erstes Open-Weights-Modell mit über 400B Parametern, das mit geschlossenen Frontier-Modellen konkurrenzfähig ist","sources":["https://ai.meta.com/blog/meta-llama-3-1/"],"disputed":false},{"id":"audio-udio-v1-5-2024-07-24","date":"2024-07-24","datePrecision":"day","modality":"audio","name":"Udio v1.5","org":"Udio","license":"closed","firstOfKind":"Erster KI-Musikgenerator, der integrierte Stem-Trennung und Upload-basiertes Audio-Remixing in einem Produkt ausliefert","sources":["https://www.udio.com/blog/introducing-v1-5","https://musically.com/2024/07/25/udio-update-lets-people-upload-and-remix-their-own-tracks/"],"disputed":false},{"id":"image-flux-1-pro-dev-schnell-2024-08-01","date":"2024-08-01","datePrecision":"day","modality":"image","name":"FLUX.1 (pro / dev / schnell)","org":"Black Forest Labs","license":"open","firstOfKind":"Erstes Apache-lizenziertes Modell, das Bildqualität auf Frontier-Niveau erreicht (FLUX.1[schnell])","sources":["https://bfl.ai/announcements","https://venturebeat.com/ai/stable-diffusion-creators-launch-black-forest-labs-secure-31m-for-flux-1-ai-image-generator"],"disputed":false},{"id":"audio-hume-ai-evi-2-2024-09-11","date":"2024-09-11","datePrecision":"day","modality":"audio","name":"Hume AI EVI 2","org":"Hume AI","license":"closed","firstOfKind":"Erste allgemein verfügbare Entwickler-API für emotional intelligente Voice-to-Voice-Konversation","sources":["https://www.hume.ai/blog/introducing-evi2","https://www.marktechpost.com/2024/09/13/hume-ai-introduces-empathic-voice-interface-2-evi-2/"],"disputed":false},{"id":"text-openai-o1-preview-2024-09-12","date":"2024-09-12","datePrecision":"day","modality":"text","name":"OpenAI o1-preview","org":"OpenAI","license":"closed","firstOfKind":"Erstes öffentlich eingesetztes LLM, das interne Reasoning-Tokens (Skalierung der Rechenleistung zur Inferenzzeit) als Produktfunktion nutzt","sources":["https://openai.com/index/introducing-openai-o1-preview/","https://en.wikipedia.org/wiki/OpenAI_o1"],"disputed":false},{"id":"audio-openai-realtime-api-public-beta-2024-10-01","date":"2024-10-01","datePrecision":"day","modality":"audio","name":"OpenAI Realtime API (public beta)","org":"OpenAI","license":"closed","firstOfKind":"Erste Entwickler-API, die ein durchgängiges Speech-to-Speech-Modell auf Frontier-Niveau für den Bau produktiver Sprachagenten bereitstellt","sources":["https://openai.com/index/introducing-the-realtime-api/","https://simonwillison.net/2024/Oct/1/openai-devday-2024-live-blog/"],"disputed":false},{"id":"video-meta-movie-gen-2024-10-04","date":"2024-10-04","datePrecision":"day","modality":"video","name":"Meta Movie Gen","org":"Meta","license":"closed","firstOfKind":"Erstes Frontier-Labor-Modell mit gemeinsam erzeugtem synchronem Ton zum Video plus Ein-Foto-Personalisierung","sources":["https://ai.meta.com/research/publications/movie-gen-a-cast-of-media-foundation-models/"],"disputed":false},{"id":"audio-f5-tts-2024-10-09","date":"2024-10-09","datePrecision":"day","modality":"audio","name":"F5-TTS","org":"Shanghai Jiao Tong University / Cambridge University","license":"open","firstOfKind":"Erste Architektur aus Diffusion-Transformer mit Flow Matching, die auf Zero-Shot-TTS angewendet wird und autoregressive Qualität erreicht oder übertrifft","sources":["https://arxiv.org/abs/2410.06885","https://github.com/SWivid/F5-TTS"],"disputed":false},{"id":"text-claude-3-5-sonnet-v2-with-computer-use-2024-10-22","date":"2024-10-22","datePrecision":"day","modality":"text","name":"Claude 3.5 Sonnet (v2) with Computer Use","org":"Anthropic","license":"closed","firstOfKind":"Erstes Frontier-KI-Modell, das Computer-Use (GUI-Automatisierung) in einer öffentlichen Beta anbietet","sources":["https://www.anthropic.com/news/3-5-models-and-computer-use"],"disputed":false},{"id":"image-stable-diffusion-3-5-large-2024-10-22","date":"2024-10-22","datePrecision":"day","modality":"image","name":"Stable Diffusion 3.5 Large","org":"Stability AI","license":"open","firstOfKind":"Erstes Open-Weights-Bildgenerierungsmodell mit über 8B Parametern, das unter einer freizügigen kommerziellen Lizenz veröffentlicht wurde","sources":["https://stability.ai/news-updates/introducing-stable-diffusion-3-5","https://siliconangle.com/2024/10/22/stable-ai-releases-next-gen-open-source-stable-diffusion-3-5-text-image-ai-model-family/"],"disputed":false},{"id":"video-genmo-mochi-1-2024-10-22","date":"2024-10-22","datePrecision":"day","modality":"video","name":"Genmo Mochi 1","org":"Genmo","license":"open","firstOfKind":"Größtes Open-Source-Text-zu-Video-Modell zum Zeitpunkt der Veröffentlichung (10B Parameter, Apache 2.0)","sources":["https://siliconangle.com/2024/10/22/genmo-introduces-mochi-1-open-source-text-video-generation-model/","https://github.com/genmoai/mochi","https://www.genmo.ai/blog/mochi-1-a-new-sota-in-open-text-to-video"],"disputed":false},{"id":"image-recraft-v3-2024-10-30","date":"2024-10-30","datePrecision":"day","modality":"image","name":"Recraft V3","org":"Recraft","license":"closed","firstOfKind":"Erstes Modell, das korrekte, mehrwortige Langtextpassagen innerhalb von Bildern erzeugt","sources":["https://www.recraft.ai/blog/recraft-introduces-a-revolutionary-ai-model-that-thinks-in-design-language","https://en.wikipedia.org/wiki/Recraft"],"disputed":false},{"id":"video-lightricks-ltx-video-ltxv-2024-11-22","date":"2024-11-22","datePrecision":"day","modality":"video","name":"Lightricks LTX-Video (LTXV)","org":"Lightricks","license":"open","firstOfKind":"Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)","sources":["https://github.com/Lightricks/LTX-Video","https://comfyui-wiki.com/en/news/2024-11-23-ltx-video-release","https://dataconomy.com/2024/11/26/lightricks-launches-open-source-ai-model-for-faster-video-generation/"],"disputed":true,"verificationNote":"Wikipedia nennt 'November 2024', ohne den Tag anzugeben. Das RAIL-M-Lizenzdokument verweist auf Version 0.9, und der Titel des Artikels im ComfyUI-Wiki verwendet '2024-11-23' als Veröffentlichungsdatum zur Berichterstattung über das Release. Mehrere Quellen bestätigen den 22. November 2024 als Veröffentlichungstag. Disputed=true spiegelt wider, dass sich der genaue Tag (22. vs. 23.) nicht aus einer einzigen eindeutigen Primärquelle bestätigen lässt; der Monat November 2024 ist sicher."},{"id":"video-tencent-hunyuanvideo-2024-12-03","date":"2024-12-03","datePrecision":"day","modality":"video","name":"Tencent HunyuanVideo","org":"Tencent","license":"open","firstOfKind":"Größtes Open-Source-Videogenerierungsmodell zum Zeitpunkt der Veröffentlichung (13B Parameter), erstes offenes Modell, das die kommerzielle Frontier-Qualität erreicht","sources":["https://github.com/Tencent-Hunyuan/HunyuanVideo","https://technode.com/2024/12/04/tencent-launches-and-open-sources-hunyuan-video-generation-model/"],"disputed":false},{"id":"text-openai-o3-preview-announcement-2024-12-20","date":"2024-12-20","datePrecision":"day","modality":"text","name":"OpenAI o3 (preview/announcement)","org":"OpenAI","license":"closed","firstOfKind":"Erstes Modell, das beim ARC-AGI 75 % überschreitet","sources":["https://arcprize.org/blog/oai-o3-pub-breakthrough","https://en.wikipedia.org/wiki/OpenAI_o3"],"disputed":false},{"id":"audio-kokoro-82m-v0-19-2024-12-25","date":"2024-12-25","datePrecision":"day","modality":"audio","name":"Kokoro-82M v0.19","org":"hexgrad (independent)","license":"open","firstOfKind":"Erstes Modell mit unter 100M Parametern, das Platz 1 auf einem öffentlichen TTS-Qualitäts-Leaderboard erreicht","sources":["https://huggingface.co/hexgrad/Kokoro-82M"],"disputed":false},{"id":"text-deepseek-v3-2024-12-26","date":"2024-12-26","datePrecision":"day","modality":"text","name":"DeepSeek-V3","org":"DeepSeek","license":"open","firstOfKind":"Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht","sources":["https://arxiv.org/abs/2412.19437"],"disputed":true,"verificationNote":"Das arXiv-Paper wurde am 27. Dezember 2024 (UTC) eingereicht. Die Modellgewichte und das GitHub-Release wurden etwa am 26. Dezember 2024 veröffentlicht. Eine geringfügige Zeitzonen-Unklarheit (26. Dez. vs. 27. Dez.) macht die taggenaue Angabe unsicher; entsprechend als strittig markiert. Die Zahl von 5,6 Mio. US-Dollar Trainingskosten stammt aus dem Paper selbst."},{"id":"text-deepseek-r1-2025-01-20","date":"2025-01-20","datePrecision":"day","modality":"text","name":"DeepSeek-R1","org":"DeepSeek","license":"open","firstOfKind":"Erstes Open-Weights-Reasoning-Modell, das die Leistung auf o1-Niveau erreicht, unter MIT-Lizenz","sources":["https://github.com/deepseek-ai/DeepSeek-R1","https://arxiv.org/abs/2501.12948"],"disputed":false},{"id":"text-openai-operator-2025-01-23","date":"2025-01-23","datePrecision":"day","modality":"text","name":"OpenAI Operator","org":"OpenAI","license":"closed","firstOfKind":"Erster Mainstream-Agent, der den Browser selbst bedient","sources":["https://openai.com/index/computer-using-agent/"],"disputed":false},{"id":"text-claude-3-7-sonnet-2025-02-24","date":"2025-02-24","datePrecision":"day","modality":"text","name":"Claude 3.7 Sonnet","org":"Anthropic","license":"closed","firstOfKind":"Erstes Hybrid-Modell für schnelles und erweitertes Reasoning in einem einzigen Deployment","sources":["https://www.anthropic.com/news/claude-3-7-sonnet"],"disputed":true,"verificationNote":"Datum bestätigt als 24. Februar 2025. Der im ursprünglichen Eintrag genannte SWE-bench-Wert von 80,8 % findet sich nicht in der offiziellen Ankündigung von Anthropic; die offiziellen Zahlen lauten 63,7 % (reines pass@1) und 70,3 % (mit High-Compute-Scaffolding). Der Wert von 80,8 % stammt vermutlich aus der Evaluierung über ein Drittanbieter-Agent-Harness. Die Beschreibung der Fähigkeit wurde auf 70,3 % korrigiert und aufgrund der Abweichung beim Wert als umstritten markiert."},{"id":"video-alibaba-wan-2-1-2025-02-25","date":"2025-02-25","datePrecision":"day","modality":"video","name":"Alibaba Wan 2.1","org":"Alibaba (Wan Team)","license":"open","firstOfKind":"Erstes Open-Source-Modell, das die VBench-Bestenliste für Videoqualität anführte und alle geschlossenen Modelle übertraf","sources":["https://www.alibabacloud.com/blog/alibaba-unveils-its-latest-open-source-video-generation-model_602167","https://github.com/Wan-Video/Wan2.1","https://comfyui-wiki.com/en/news/2025-02-25-alibaba-wanx-2-1-video-model-open-source"],"disputed":false},{"id":"audio-sesame-csm-conversational-speech-model-demo-2025-02-27","date":"2025-02-27","datePrecision":"day","modality":"audio","name":"Sesame CSM (conversational speech model) demo","org":"Sesame AI","license":"open","firstOfKind":"Erstes Open-Source-Modell, das explizit auf den psychologischen Benchmark der 'Voice Presence' für dialogorientierte KI abzielt","sources":["https://www.sesame.com/research/crossing_the_uncanny_valley_of_voice","https://github.com/SesameAILabs/csm"],"disputed":false},{"id":"audio-openai-gpt-4o-transcribe-gpt-4o-mini-tts-audio-models-2025-03-20","date":"2025-03-20","datePrecision":"day","modality":"audio","name":"OpenAI gpt-4o-transcribe / gpt-4o-mini-tts audio models","org":"OpenAI","license":"closed","firstOfKind":"Erstes öffentlich verfügbares instruierbares TTS-Modell, bei dem sich der Vortragsstil per natürlichsprachlichen Anweisungen festlegen lässt","sources":["https://openai.com/index/introducing-our-next-generation-audio-models/","https://simonwillison.net/2025/Mar/20/new-openai-audio-models/"],"disputed":false},{"id":"image-gpt-4o-native-image-generation-gpt-image-1-2025-03-25","date":"2025-03-25","datePrecision":"day","modality":"image","name":"GPT-4o Native Image Generation (gpt-image-1)","org":"OpenAI","license":"closed","firstOfKind":"Erstes nativ multimodales LLM, bei dem Bildgenerierung und sprachliches Reasoning dieselben Modellgewichte teilen","sources":["https://openai.com/index/introducing-4o-image-generation/","https://openai.com/index/gpt-4o-image-generation-system-card-addendum/"],"disputed":false},{"id":"video-runway-gen-4-2025-03-31","date":"2025-03-31","datePrecision":"day","modality":"video","name":"Runway Gen-4","org":"Runway","license":"closed","firstOfKind":"Erstes kommerzielles Videomodell, das aus Referenzbildern eine zuverlässige Figuren- und Szenenkonsistenz über mehrere Einstellungen hinweg liefert","sources":["https://runwayml.com/research/introducing-runway-gen-4","https://techcrunch.com/2025/03/31/runway-releases-an-impressive-new-video-generating-ai-model","https://siliconangle.com/2025/03/31/runway-launches-new-gen-4-ai-video-generator/"],"disputed":false},{"id":"text-llama-4-scout-maverick-2025-04-05","date":"2025-04-05","datePrecision":"day","modality":"text","name":"Llama 4 (Scout / Maverick)","org":"Meta","license":"open","firstOfKind":"Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens","sources":["https://ai.meta.com/blog/llama-4-multimodal-intelligence/"],"disputed":true,"verificationNote":"Datum bestätigt als 5. April 2025 anhand des offiziellen Meta-AI-Blogs. Die Behauptung zur einzelnen H100 ist technisch nur mit INT4-Quantisierung zutreffend; der maximale Kontext betrug bei dieser Konfiguration ~35K Tokens, nicht die vollen 10 Mio. Der volle Kontext von 10 Mio. erforderte 8 H100s. Die Behauptung zum Kontextfenster von 10 Mio. ist real, aber die Formulierung 'einzelne H100' überzeichnet die Zugänglichkeit. Aufgrund der umstrittenen Behauptung zur einzelnen H100 als umstritten markiert."},{"id":"video-google-veo-3-2025-05-20","date":"2025-05-20","datePrecision":"day","modality":"video","name":"Google Veo 3","org":"Google DeepMind","license":"closed","firstOfKind":"Erstes hochmodernes Videomodell mit nativer Generierung von synchronisiertem Audio, Sprache und Soundeffekten","sources":["https://cloud.google.com/blog/products/ai-machine-learning/announcing-veo-3-imagen-4-and-lyria-2-on-vertex-ai","https://9to5google.com/2025/05/20/google-io-2025-live-blog-news-hub/"],"disputed":false},{"id":"image-flux-1-kontext-pro-max-2025-05-29","date":"2025-05-29","datePrecision":"day","modality":"image","name":"FLUX.1 Kontext [pro] + [max]","org":"Black Forest Labs","license":"closed","firstOfKind":"Erstes Flow-Matching-Modell mit gemeinsamer, kontextbezogener Text-und-Bild-Bearbeitung (Beibehaltung der Identität des Referenzbilds über iterative Bearbeitungen hinweg)","sources":["https://bfl.ai/announcements/flux-1-kontext","https://www.businesswire.com/news/home/20250529605562/en/Black-Forest-Labs-Launches-FLUX.1-Kontext-a-Breakthrough-in-Context-aware-Image-Generation-and-Editing"],"disputed":false},{"id":"audio-elevenlabs-eleven-v3-alpha-2025-06-03","date":"2025-06-03","datePrecision":"day","modality":"audio","name":"ElevenLabs Eleven v3 (alpha)","org":"ElevenLabs","license":"closed","firstOfKind":"Erstes TTS-Modell mit inline skriptbaren Audio Tags zur Steuerung von Emotion und Vortrag innerhalb einer laufenden Synthese","sources":["https://elevenlabs.io/blog/eleven-v3","https://elevenlabs.io/blog/eleven-v3-is-now-generally-available"],"disputed":false},{"id":"video-seedance-1-0-2025-06-11","date":"2025-06-11","datePrecision":"day","modality":"video","name":"Seedance 1.0","org":"ByteDance","license":"closed","firstOfKind":"Erstes Videomodell, das natives Multi-Shot-Storytelling als Standard zeigte","sources":["https://seed.bytedance.com/en/blog/tech-report-of-seedance-1-0-is-now-publicly-available"],"disputed":false},{"id":"video-minimax-hailuo-02-2025-06-18","date":"2025-06-18","datePrecision":"day","modality":"video","name":"MiniMax Hailuo 02","org":"MiniMax","license":"closed","firstOfKind":"NCR-Architektur (Noise-aware Compute Redistribution)","sources":["https://www.minimax.io/news/minimax-hailuo-02"],"disputed":false},{"id":"image-flux-1-kontext-dev-open-weights-2025-06-26","date":"2025-06-26","datePrecision":"day","modality":"image","name":"FLUX.1 Kontext [dev] (open weights)","org":"Black Forest Labs","license":"open","firstOfKind":"Erstes Open-Weights-Modell, das die Leistung proprietärer Modelle bei der iterativen, kontextbewussten Bildbearbeitung erreichte","sources":["https://bfl.ai/blog/flux-1-kontext-dev","https://huggingface.co/black-forest-labs/FLUX.1-Kontext-dev"],"disputed":false},{"id":"text-grok-4-2025-07-09","date":"2025-07-09","datePrecision":"day","modality":"text","name":"xAI Grok 4","org":"xAI","license":"closed","firstOfKind":"Erstes Modell, das rund 50 % auf „Humanity's Last Exam\" erreichte","sources":["https://x.ai/news/grok-4"],"disputed":false},{"id":"video-runway-aleph-2025-07-25","date":"2025-07-25","datePrecision":"day","modality":"video","name":"Runway Aleph","org":"Runway","license":"closed","firstOfKind":"Erstes leistungsfähiges allgemeines In-Context-Videobearbeitungsmodell","sources":["https://runwayml.com/research/introducing-runway-aleph"],"disputed":false},{"id":"video-google-deepmind-genie-3-2025-08-05","date":"2025-08-05","datePrecision":"day","modality":"video","name":"Google DeepMind Genie 3","org":"Google DeepMind","license":"closed","firstOfKind":"Echtzeit-Weltmodell als neue Modalität","sources":["https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/"],"disputed":false},{"id":"text-gpt-5-2025-08-07","date":"2025-08-07","datePrecision":"day","modality":"text","name":"GPT-5","org":"OpenAI","license":"closed","firstOfKind":"Erstes einheitliches Modell aus schnellem Modus und Reasoning mit automatischem Compute-Routing in einem einzigen API-Endpunkt","sources":["https://openai.com/index/introducing-gpt-5/","https://en.wikipedia.org/wiki/GPT-5"],"disputed":false},{"id":"image-nano-banana-2025-08-26","date":"2025-08-26","datePrecision":"day","modality":"image","name":"Nano Banana (Gemini 2.5 Flash Image)","org":"Google","license":"closed","firstOfKind":"Erstes Bildmodell, das konversationelles Mehrfach-Editieren mit Konsistenz mainstreamfähig machte","sources":["https://developers.googleblog.com/introducing-gemini-2-5-flash-image/"],"disputed":false},{"id":"audio-openai-gpt-realtime-realtime-api-ga-2025-08-28","date":"2025-08-28","datePrecision":"day","modality":"audio","name":"OpenAI gpt-realtime (Realtime API GA)","org":"OpenAI","license":"closed","firstOfKind":"Erste hochmoderne Speech-to-Speech-API, die in der allgemeinen Verfügbarkeit eine SIP-Telefonie-Integration enthält","sources":["https://community.openai.com/t/introducing-gpt-realtime-in-the-api-livestream-on-august-28/1355020","https://chatlyai.app/news/openai-realtime-api-ga-gpt-aug-2025"],"disputed":false},{"id":"audio-mai-voice-1-2025-08-28","date":"2025-08-28","datePrecision":"day","modality":"audio","name":"MAI-Voice-1","org":"Microsoft AI","license":"closed","firstOfKind":"Erstes hauseigenes Speech-Generation-Modell der Microsoft-AI-(MAI)-Sparte.","sources":["https://microsoft.ai/news/two-new-in-house-models/"],"disputed":false},{"id":"text-mai-1-preview-2025-08-28","date":"2025-08-28","datePrecision":"day","modality":"text","name":"MAI-1-preview","org":"Microsoft AI","license":"closed","firstOfKind":"Erstes vollständig hauseigenes, End-to-End trainiertes Foundation-LLM von Microsoft AI.","sources":["https://microsoft.ai/news/two-new-in-house-models/"],"disputed":false},{"id":"image-seedream-4-0-2025-09-09","date":"2025-09-09","datePrecision":"day","modality":"image","name":"Seedream 4.0","org":"ByteDance","license":"closed","firstOfKind":"Erstes Modell eines chinesischen Labors an der Spitze globaler Bild-Arenen","sources":["https://seed.bytedance.com/en/blog/seedream-4-0-officially-released-beyond-drawing-into-imagination"],"disputed":false},{"id":"video-luma-ray3-2025-09-18","date":"2025-09-18","datePrecision":"day","modality":"video","name":"Luma Ray3","org":"Luma AI","license":"closed","firstOfKind":"Erstes „Reasoning\"-Videomodell und erstes mit hochwertigem 16-Bit-HDR","sources":["https://lumalabs.ai/ray","https://www.businesswire.com/news/home/20250918470219/en/"],"disputed":false},{"id":"audio-suno-v5-suno-studio-2025-09-23","date":"2025-09-23","datePrecision":"day","modality":"audio","name":"Suno v5 + Suno Studio","org":"Suno AI","license":"closed","firstOfKind":"Erster KI-Musikgenerator, der eine integrierte generative Digital Audio Workstation auslieferte (Mehrspur + MIDI-Export)","sources":["https://www.prnewswire.com/news-releases/suno-introduces-suno-studio-a-generative-audio-workstation-built-for-all-creatives-from-seasoned-pros-to-aspiring-artists-302567486.html","https://musically.com/2025/09/25/suno-launches-v5-claiming-its-the-worlds-best-music-model/"],"disputed":false},{"id":"image-mai-image-1-2025-10-13","date":"2025-10-13","datePrecision":"day","modality":"image","name":"MAI-Image-1","org":"Microsoft AI","license":"closed","firstOfKind":"Erstes hauseigenes Bildgenerierungs-Modell von Microsoft AI.","sources":["https://microsoft.ai/news/introducing-mai-image-1-debuting-in-the-top-10-on-lmarena/"],"disputed":false},{"id":"video-ltx-2-2026-01-06","date":"2026-01-06","datePrecision":"day","modality":"video","name":"LTX-2","org":"Lightricks","license":"open","firstOfKind":"Erstes produktionsreifes Open-Weights-Modell, das Video und Audio synchron in einem Durchgang mit nativem 4K und offenem Trainingscode generiert.","sources":["https://www.globenewswire.com/news-release/2026/01/06/3213304/0/en/Lightricks-Open-Sources-LTX-2-the-First-Production-Ready-Audio-and-Video-Generation-Model-With-Truly-Open-Weights.html"],"disputed":false},{"id":"text-glm-5-2026-02-11","date":"2026-02-11","datePrecision":"day","modality":"text","name":"GLM-5","org":"Zhipu AI (Z.ai)","license":"open","firstOfKind":"Erstes Frontier-Open-Weights-Modell einer börsennotierten Foundation-Model-Firma (Zhipu/Z.ai).","sources":["https://huggingface.co/blog/mlabonne/glm-5","https://www.scmp.com/tech/article/3343239/chinas-zhipu-ai-launches-new-major-model-glm-5-challenge-its-rivals"],"disputed":false},{"id":"audio-suno-v5-5-voice-capture-custom-models-2026-03-26","date":"2026-03-26","datePrecision":"day","modality":"audio","name":"Suno v5.5 (voice capture + custom models)","org":"Suno AI","license":"closed","firstOfKind":"Erster KI-Musikgenerator für Endnutzer, der es ermöglicht, die eigene Singstimme und den persönlichen Katalog als Generierungs-Priors einzubetten","sources":["https://suno.com/blog/v5-5","https://www.musicbusinessworldwide.com/suno-launches-v5-5-ai-model-with-voice-capture-and-personalization-features/"],"disputed":false},{"id":"audio-mai-transcribe-1-2026-04-02","date":"2026-04-02","datePrecision":"day","modality":"audio","name":"MAI-Transcribe-1","org":"Microsoft AI","license":"closed","firstOfKind":"Erstes hauseigenes Speech-to-Text-/Transkriptions-Modell von Microsoft AI.","sources":["https://microsoft.ai/news/state-of-the-art-speech-recognition-with-mai-transcribe-1/","https://microsoft.ai/news/today-were-announcing-3-new-world-class-mai-models-available-in-foundry/"],"disputed":false},{"id":"text-glm-5-1-2026-04-07","date":"2026-04-07","datePrecision":"day","modality":"text","name":"GLM-5.1","org":"Zhipu / Z.ai","license":"open","firstOfKind":"Erstes Open-Weights-Modell an der Spitze von SWE-Bench Pro","sources":["https://huggingface.co/zai-org/GLM-5"],"disputed":false},{"id":"text-muse-spark-2026-04-08","date":"2026-04-08","datePrecision":"day","modality":"text","name":"Muse Spark","org":"Meta (Superintelligence Labs)","license":"closed","firstOfKind":"Erstes Modell von Meta Superintelligence Labs und Metas erster strategischer Wechsel von Open-Weights zu einem geschlossenen Frontier-Modell.","sources":["https://ai.meta.com/blog/introducing-muse-spark-msl/","https://about.fb.com/news/2026/04/introducing-muse-spark-meta-superintelligence-labs/"],"disputed":false},{"id":"audio-moss-audio-2026-04-13","date":"2026-04-13","datePrecision":"day","modality":"audio","name":"MOSS-Audio","org":"OpenMOSS / MOSI.AI / Shanghai Innovation Institute","license":"open","firstOfKind":"Eines der ersten Open-Weights-Foundation-Modelle, das Verstehen von Sprache, Umgebungsklang und Musik samt zeitbewusstem Reasoning in einem Modell vereint.","sources":["https://github.com/OpenMOSS/MOSS-Audio","https://openmoss.ai/MOSS-Audio/"],"disputed":false},{"id":"image-gpt-image-2-chatgpt-images-2-0-2026-04-21","date":"2026-04-21","datePrecision":"day","modality":"image","name":"gpt-image-2 (ChatGPT Images 2.0)","org":"OpenAI","license":"closed","firstOfKind":"Erstes weit verbreitetes Bildgenerierungsmodell mit explizitem, der Generierung vorgeschaltetem Reasoning-/Thinking-Schritt.","sources":["https://openai.com/index/introducing-chatgpt-images-2-0/","https://techcrunch.com/2026/04/21/chatgpts-new-images-2-0-model-is-surprisingly-good-at-generating-text/","https://en.wikipedia.org/wiki/GPT_Image"],"disputed":false},{"id":"text-ernie-5-1-preview-2026-04-30","date":"2026-04-30","datePrecision":"day","modality":"text","name":"ERNIE 5.1 Preview","org":"Baidu","license":"closed","firstOfKind":"Erstes chinesisches LLM in den globalen Top 5 der LMArena Search Arena.","sources":["https://ernie.baidu.com/blog/posts/ernie-5.1-preview-0430-release-on-lmarena/","https://www.remio.ai/post/baidu-ernie-5-1-hits-no-1-chinese-model-on-lmarena-built-at-6-of-the-normal-training-cost"],"disputed":false},{"id":"audio-openai-gpt-realtime-2-mit-gpt-realtime-translate-und-gpt-realtime-whisper-2026-05-07","date":"2026-05-07","datePrecision":"day","modality":"audio","name":"OpenAI gpt-realtime-2 (mit gpt-realtime-translate und gpt-realtime-whisper)","org":"OpenAI","license":"closed","firstOfKind":"Erstes OpenAI-Sprachmodell mit GPT-5-Klasse-Reasoning fuer Live-Sprachdialoge.","sources":["https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/","https://techcrunch.com/2026/05/07/openai-launches-new-voice-intelligence-features-in-its-api/"],"disputed":false},{"id":"video-gemini-omni-flash-2026-05-19","date":"2026-05-19","datePrecision":"day","modality":"video","name":"Gemini Omni Flash","org":"Google DeepMind","license":"closed","firstOfKind":"Erstes Modell der Gemini-Omni-Familie, das generative Medien mit Gemins Weltwissen vereint und Video aus jeder Eingabemodalität per Konversation erzeugt und editiert.","sources":["https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/","https://blog.google/innovation-and-ai/sundar-pichai-io-2026/","https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/"],"disputed":false},{"id":"text-minimax-m3-2026-06-01","date":"2026-06-01","datePrecision":"day","modality":"text","name":"MiniMax M3","org":"MiniMax","license":"open","firstOfKind":"Laut MiniMax erstes Open-Weights-Modell, das Frontier-Coding, 1M-Kontext und native Multimodalität in einer einzigen Architektur kombiniert.","sources":["https://www.minimax.io/blog/minimax-m3","https://www.marktechpost.com/2026/06/01/minimax-releases-minimax-m3-with-msa-architecture-supporting-1m-token-context-native-multimodality-and-agentic-coding/"],"disputed":false},{"id":"text-mai-thinking-1-2026-06-02","date":"2026-06-02","datePrecision":"day","modality":"text","name":"MAI-Thinking-1","org":"Microsoft AI","license":"closed","firstOfKind":"Erstes von Microsoft AI vollständig in-house entwickeltes Reasoning-/Thinking-Modell, trainiert ohne Distillation aus Drittanbieter-Modellen.","sources":["https://microsoft.ai/news/introducing-mai-thinking-1/","https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/"],"disputed":false},{"id":"text-mai-code-1-flash-2026-06-02","date":"2026-06-02","datePrecision":"day","modality":"text","name":"MAI-Code-1-Flash","org":"Microsoft AI","license":"closed","firstOfKind":"Erstes hauseigenes, agentisches Coding-Modell von Microsoft AI.","sources":["https://microsoft.ai/news/introducingmai-code-1-flash/","https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/"],"disputed":false},{"id":"image-ideogram-4-0-2026-06-03","date":"2026-06-03","datePrecision":"day","modality":"image","name":"Ideogram 4.0","org":"Ideogram","license":"open","firstOfKind":"Erstes Open-Weights-Modell von Ideogram, das seine Spitzentechnologie fuer Design- und Text-Rendering oeffentlich freigab.","sources":["https://ideogram.ai/news/ideogram-4.0/","https://ideogram.ai/blog/ideogram-4.0/"],"disputed":false},{"id":"text-claude-fable-5-2026-06-09","date":"2026-06-09","datePrecision":"day","modality":"text","name":"Claude Fable 5","org":"Anthropic","license":"closed","firstOfKind":"Erstes öffentlich zugängliches Modell der Mythos-Klasse von Anthropic (oberhalb der Opus-Klasse).","sources":["https://www.anthropic.com/news/claude-fable-5-mythos-5","https://techcrunch.com/2026/06/09/anthropic-released-claude-fable-5-its-most-powerful-model-publicly-days-after-warning-ai-is-getting-too-dangerous/"],"disputed":false},{"id":"text-diffusiongemma-26b-a4b-2026-06-10","date":"2026-06-10","datePrecision":"day","modality":"text","name":"DiffusionGemma 26B-A4B","org":"Google DeepMind","license":"open","firstOfKind":"Erstes großes Open-Weights-Text-Diffusionsmodell von Google, das Text in parallelen Blöcken statt autoregressiv Token für Token erzeugt.","sources":["https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/","https://www.marktechpost.com/2026/06/10/google-ai-releases-diffusiongemma-a-26b-moe-open-model-using-text-diffusion-for-up-to-4x-faster-generation/"],"disputed":false},{"id":"video-qwen-robot-suite-2026-06-17","date":"2026-06-17","datePrecision":"day","modality":"video","name":"Qwen-Robot Suite","org":"Alibaba (Qwen)","license":"closed","firstOfKind":"Erstes umfassendes Robotik-/Embodied-Modellpaket von Alibaba (Qwen)","sources":["https://www.alibabacloud.com/blog/qwen-robotworld-boundless-worlds-for-embodied-agents_603268"],"disputed":false},{"id":"video-seedance-2-5-2026-06-23","date":"2026-06-23","datePrecision":"day","modality":"video","name":"Seedance 2.5","org":"ByteDance","license":"closed","firstOfKind":"Erster nativer 30-Sekunden-Clip in einem einzigen Durchgang","sources":["https://www.theinformation.com/briefings/bytedance-unveils-seedance-2-5-video-model","https://www.explainx.ai/blog/seedance-2-5-bytedance-30-second-4k-ai-video-2026"],"disputed":false},{"id":"text-ornith-1-0-2026-06-25","date":"2026-06-25","datePrecision":"day","modality":"text","name":"Ornith-1.0","org":"DeepReinforce","license":"open","firstOfKind":"Erste offene Modellfamilie, die ihre eigenen RL-Scaffolds (Task-Harnesses) lernt","sources":["https://deep-reinforce.com/ornith_1_0.html","https://www.marktechpost.com/2026/06/25/deepreinforce-releases-ornith-1-0-an-open-source-coding-model-family-that-learns-its-own-rl-scaffolds/","https://huggingface.co/collections/deepreinforce-ai/ornith-10"],"disputed":false},{"id":"text-longcat-2-0-2026-06-29","date":"2026-06-29","datePrecision":"day","modality":"text","name":"LongCat-2.0","org":"Meituan","license":"open","firstOfKind":"Erstes Billionen-Parameter-Modell, das komplett auf inländischen chinesischen KI-Chips trainiert und ausgeführt wird.","sources":["https://www.longcatai.org/models/longcat-2","https://venturebeat.com/technology/meituan-open-sources-longcat-2-0-the-1-6t-near-frontier-agentic-coding-model-thats-been-leading-openrouter-trained-entirely-on-chinese-chips"],"disputed":false},{"id":"text-claude-fable-5-redeploy-2026-07-01","date":"2026-07-01","datePrecision":"day","modality":"text","name":"Claude Fable 5 (Wiederveröffentlichung)","org":"Anthropic","license":"closed","firstOfKind":"Erstes Frontier-Modell, das durch eine US-Exportkontrolle vorübergehend abgeschaltet und nach Aufhebung wieder in Betrieb genommen wurde.","sources":["https://www.anthropic.com/news/redeploying-fable-5","https://www.cnbc.com/2026/06/30/anthropic-says-trump-admin-has-lifted-export-controls-on-claude-fable-5-and-mythos-5.html"],"disputed":false},{"id":"image-muse-image-2026-07-07","date":"2026-07-07","datePrecision":"day","modality":"image","name":"Muse Image","org":"Meta (Superintelligence Labs)","license":"closed","firstOfKind":"Erstes Bildgenerierungsmodell der Meta Superintelligence Labs.","sources":["https://about.fb.com/news/2026/07/introducing-muse-image-meta-ai/"],"disputed":false},{"id":"audio-gpt-live-2026-07-08","date":"2026-07-08","datePrecision":"day","modality":"audio","name":"GPT-Live (GPT-Live-1 / mini)","org":"OpenAI","license":"closed","firstOfKind":"Erste Full-Duplex-Sprachmodellfamilie von OpenAI (gleichzeitiges Hören und Sprechen) für ChatGPT Voice.","sources":["https://openai.com/index/introducing-gpt-live/"],"disputed":false},{"id":"text-inkling-2026-07-15","date":"2026-07-15","datePrecision":"day","modality":"text","name":"Inkling","org":"Thinking Machines Lab","license":"open","firstOfKind":"Erstes öffentlich verfügbares Modell von Thinking Machines Lab (Mira Murati).","sources":["https://thinkingmachines.ai/","https://fortune.com/2026/07/15/what-is-mira-murati-thinking-machines-first-ai-model-inkling/","https://www.bloomberg.com/news/articles/2026-07-15/murati-s-thinking-machines-releases-first-ai-model-for-broad-use"],"disputed":false},{"id":"text-gemini-3-5-flash-cyber-2026-07-21","date":"2026-07-21","datePrecision":"day","modality":"text","name":"Gemini 3.5 Flash Cyber","org":"Google","license":"closed","firstOfKind":"Googles erster öffentlich benannter, auf Cybersecurity spezialisierter Vertical-Finetune.","sources":["https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/","https://deepmind.google/blog/introducing-gemini-3-5-flash-cyber/"],"disputed":false},{"id":"video-flux-3-2026-07-23","date":"2026-07-23","datePrecision":"day","modality":"video","name":"FLUX 3","org":"Black Forest Labs","license":"closed","firstOfKind":"Erstes Modell mit gemeinsam trainierter Video-, Audio- und Action-Generierung aus einem Backbone.","sources":["https://www.globenewswire.com/news-release/2026/07/23/3332364/0/en/black-forest-labs-unveils-flux-3-a-new-multimodal-frontier-model-for-visual-intelligence.html"],"disputed":true,"verificationNote":"Ankündigungsdatum 23.07.2026 gegen die offizielle Pressemitteilung von Black Forest Labs (GlobeNewswire) verifiziert; von unabhängiger Berichterstattung (VentureBeat, TechTimes) bestätigt. Als unbestätigt markiert, weil zum Ankündigungszeitpunkt keine Benchmarks veröffentlicht waren und nur FLUX 3 Video und Action als gated Early Access für ausgewählte Partner verfügbar sind; die 20-Sekunden-Angabe stammt aus der Berichterstattung, nicht aus der Pressemitteilung."},{"id":"video-gemini-robotics-2-2026-07-30","date":"2026-07-30","datePrecision":"day","modality":"video","name":"Gemini Robotics 2 (mit ER 2 und On-Device 2)","org":"Google DeepMind","license":"closed","firstOfKind":"Erstes Gemini-Robotikmodell mit Ganzkörpersteuerung und Kollaboration mehrerer, auch unterschiedlicher Roboter","sources":["https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/","https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/","https://www.theverge.com/tech/973276/google-deepmind-gemini-robotics-2-whole-body"],"disputed":false},{"id":"text-muse-code-muse-spark-1-2-2026-08-05","date":"2026-08-05","datePrecision":"day","modality":"text","name":"Muse Code (Beta) & Muse Spark 1.2","org":"Meta","license":"closed","firstOfKind":"Erster eigener Terminal-Coding-Agent von Meta.","sources":["https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2","https://research.meta.ai/static/muse-spark-1-2-methodology","https://developer.meta.com/ai/products/muse-code"],"disputed":false}]}