{"meta":{"lastVerified":"6. August 2026","lastVerifiedISO":"2026-08-06","windowStart":"2022-08","windowEnd":"2026-08","total":247,"placeholder":false,"version":"v1","slice":"offenheit","claim":"Der Anteil offener Gewichte erreichte 2023 mit 38 % seinen Höchststand und fiel 2025 auf 17 %. Zwischen dem 26. Juni 2025 und dem 6. Januar 2026 liegen 194 Tage, in denen dieser Datensatz keinen einzigen Release mit offenen Gewichten verzeichnet — bei 16 geschlossenen, davon 12 mit Premierenanspruch. Trotzdem stammen 41 der 114 belegten Premieren von offenen Modellen.","page":"https://timeline.snipki.de/offenheit","license":"CC-BY-4.0","attribution":"Die Beschleunigung — KI-Zeitstrahl von snipKI (https://timeline.snipki.de)","source":"https://timeline.snipki.de","basis":"245 Releases (redaktionelle Marker ausgenommen)","openCount":72,"openShare":29.4,"pendingWeights":[{"id":"text-kimi-k3-2026-07-16","reason":"Zum Launch nur über App und API; die Gewichte folgten am 27. Juli 2026 als eigener Eintrag.","date":"2026-07-16"},{"id":"video-minimax-h3-2026-07-31","reason":"Als Open-Weights-Modell angekündigt; die Gewichte folgten am 5. August 2026 als eigener Eintrag — in der EU allerdings nicht lizenziert.","date":"2026-07-31"}],"openCountStrict":70},"byYear":[{"year":2022,"open":5,"closed":9,"total":14,"openSharePercent":36},{"year":2023,"open":14,"closed":23,"total":37,"openSharePercent":38},{"year":2024,"open":17,"closed":35,"total":52,"openSharePercent":33},{"year":2025,"open":7,"closed":34,"total":41,"openSharePercent":17},{"year":2026,"open":29,"closed":72,"total":101,"openSharePercent":29}],"byModality":[{"modality":"text","open":37,"total":102,"openSharePercent":36},{"modality":"audio","open":15,"total":54,"openSharePercent":28},{"modality":"image","open":11,"total":45,"openSharePercent":24},{"modality":"video","open":9,"total":44,"openSharePercent":20}],"longestGapWithoutOpen":{"days":194,"from":"2025-06-26","to":"2026-01-06","precededBy":{"id":"image-flux-1-kontext-dev-open-weights-2025-06-26","name":"FLUX.1 Kontext [dev] (open weights)","org":"Black Forest Labs"},"endedBy":{"id":"video-ltx-2-2026-01-06","name":"LTX-2","org":"Lightricks"},"closedReleasesInside":16,"firstOfKindInside":12,"inside":[{"id":"text-grok-4-2025-07-09","date":"2025-07-09","name":"xAI Grok 4","org":"xAI","modality":"text","firstOfKind":"Erstes Modell, das rund 50 % auf „Humanity's Last Exam\" erreichte"},{"id":"text-openai-chatgpt-agent-2025-07-17","date":"2025-07-17","name":"OpenAI ChatGPT Agent","org":"OpenAI","modality":"text","firstOfKind":""},{"id":"video-runway-aleph-2025-07-25","date":"2025-07-25","name":"Runway Aleph","org":"Runway","modality":"video","firstOfKind":"Erstes leistungsfähiges allgemeines In-Context-Videobearbeitungsmodell"},{"id":"video-google-deepmind-genie-3-2025-08-05","date":"2025-08-05","name":"Google DeepMind Genie 3","org":"Google DeepMind","modality":"video","firstOfKind":"Echtzeit-Weltmodell als neue Modalität"},{"id":"text-gpt-5-2025-08-07","date":"2025-08-07","name":"GPT-5","org":"OpenAI","modality":"text","firstOfKind":"Erstes einheitliches Modell aus schnellem Modus und Reasoning mit automatischem Compute-Routing in einem einzigen API-Endpunkt"},{"id":"image-nano-banana-2025-08-26","date":"2025-08-26","name":"Nano Banana (Gemini 2.5 Flash Image)","org":"Google","modality":"image","firstOfKind":"Erstes Bildmodell, das konversationelles Mehrfach-Editieren mit Konsistenz mainstreamfähig machte"},{"id":"audio-openai-gpt-realtime-realtime-api-ga-2025-08-28","date":"2025-08-28","name":"OpenAI gpt-realtime (Realtime API GA)","org":"OpenAI","modality":"audio","firstOfKind":"Erste hochmoderne Speech-to-Speech-API, die in der allgemeinen Verfügbarkeit eine SIP-Telefonie-Integration enthält"},{"id":"audio-mai-voice-1-2025-08-28","date":"2025-08-28","name":"MAI-Voice-1","org":"Microsoft AI","modality":"audio","firstOfKind":"Erstes hauseigenes Speech-Generation-Modell der Microsoft-AI-(MAI)-Sparte."},{"id":"text-mai-1-preview-2025-08-28","date":"2025-08-28","name":"MAI-1-preview","org":"Microsoft AI","modality":"text","firstOfKind":"Erstes vollständig hauseigenes, End-to-End trainiertes Foundation-LLM von Microsoft AI."},{"id":"image-seedream-4-0-2025-09-09","date":"2025-09-09","name":"Seedream 4.0","org":"ByteDance","modality":"image","firstOfKind":"Erstes Modell eines chinesischen Labors an der Spitze globaler Bild-Arenen"},{"id":"video-luma-ray3-2025-09-18","date":"2025-09-18","name":"Luma Ray3","org":"Luma AI","modality":"video","firstOfKind":"Erstes „Reasoning\"-Videomodell und erstes mit hochwertigem 16-Bit-HDR"},{"id":"audio-suno-v5-suno-studio-2025-09-23","date":"2025-09-23","name":"Suno v5 + Suno Studio","org":"Suno AI","modality":"audio","firstOfKind":"Erster KI-Musikgenerator, der eine integrierte generative Digital Audio Workstation auslieferte (Mehrspur + MIDI-Export)"},{"id":"text-claude-sonnet-4-5-2025-09-29","date":"2025-09-29","name":"Claude Sonnet 4.5","org":"Anthropic","modality":"text","firstOfKind":""},{"id":"video-openai-sora-2-2025-09-30","date":"2025-09-30","name":"OpenAI Sora 2","org":"OpenAI","modality":"video","firstOfKind":""},{"id":"image-mai-image-1-2025-10-13","date":"2025-10-13","name":"MAI-Image-1","org":"Microsoft AI","modality":"image","firstOfKind":"Erstes hauseigenes Bildgenerierungs-Modell von Microsoft AI."},{"id":"text-gemini-3-2025-11-18","date":"2025-11-18","name":"Gemini 3","org":"Google DeepMind","modality":"text","firstOfKind":""}]},"orgPolicy":{"onlyOpen":["DeepReinforce","DeepSeek","Fish Audio","Genmo","Kyutai","Lightricks","Meituan","Mistral","Moonshot","OpenMOSS","Sesame AI","Shanghai Jiao Tong University","Significant Gravitas","StepFun","TII","Tencent","Thinking Machines Lab","Zhipu","hexgrad","poolside"],"onlyClosed":["Adobe","Ant Group","Anthropic","Apple","Baidu","ByteDance","Cognition","ElevenLabs","Hume AI","Kuaishou","Luma AI","Midjourney","Pika Labs","Recraft","Sakana AI","Udio","xAI"],"mixed":["Alibaba","Black Forest Labs","Google","Ideogram","Meta","Microsoft","MiniMax","OpenAI","Runway","Stability AI","Suno"],"jointCredits":[{"org":"OpenMOSS / MOSI.AI / Shanghai Innovation Institute","lead":"OpenMOSS","alsoCredited":["MOSI.AI","Shanghai Innovation Institute"],"hidden":["MOSI.AI","Shanghai Innovation Institute"],"count":1},{"org":"RunwayML / Stability AI","lead":"Runway","alsoCredited":["Stability AI"],"hidden":[],"count":1},{"org":"Shanghai Jiao Tong University / Cambridge University","lead":"Shanghai Jiao Tong University","alsoCredited":["Cambridge University"],"hidden":["Cambridge University"],"count":1},{"org":"Stability AI / CompVis / RunwayML","lead":"Stability AI","alsoCredited":["CompVis","Runway"],"hidden":["CompVis"],"count":1}]},"count":72,"open":[{"id":"image-stable-diffusion-1-4-public-release-2022-08-22","date":"2022-08-22","datePrecision":"day","modality":"image","name":"Stable Diffusion 1.4 (public release)","org":"Stability AI / CompVis / RunwayML","firstOfKind":"Erstes breit verteiltes Open-Weights-Modell für Text-zu-Bild, das auf einer Consumer-GPU lauffähig ist","capability":"Erstes leistungsfähiges Open-Weights-Diffusionsmodell für Text-zu-Bild, das auf Consumer-GPUs läuft und 512×512-Bilder in Sekunden erzeugt","sources":["https://stability.ai/news-updates/stable-diffusion-public-release","https://en.wikipedia.org/wiki/Stable_Diffusion"]},{"id":"audio-whisper-large-v1-2022-09-21","date":"2022-09-21","datePrecision":"day","modality":"audio","name":"Whisper (large-v1)","org":"OpenAI","firstOfKind":"Erstes Open-Source-ASR-Modell, das die Qualität mehrsprachiger Transkription auf kommerziellem Niveau weitgehend erreicht","capability":"Mehrsprachige Open-Source-ASR, trainiert auf 680.000 Stunden Web-Audio, die über 99 Sprachen hinweg eine nahezu menschliche Transkriptionsqualität erreicht","sources":["https://openai.com/index/whisper/","https://techcrunch.com/2022/09/21/openai-open-sources-whisper-a-multilingual-speech-recognition-system/","https://arxiv.org/abs/2212.04356"]},{"id":"image-stable-diffusion-1-5-2022-10-20","date":"2022-10-20","datePrecision":"day","modality":"image","name":"Stable Diffusion 1.5","org":"RunwayML / Stability AI","firstOfKind":"","capability":"Verbesserte Bildqualität, bessere Ästhetik und höhere Prompt-Treue gegenüber SD 1.4 auf derselben 512×512-Architektur","sources":["https://huggingface.co/runwayml/stable-diffusion-v1-5","https://en.wikipedia.org/wiki/Stable_Diffusion"]},{"id":"image-stable-diffusion-2-0-2022-11-24","date":"2022-11-24","datePrecision":"day","modality":"image","name":"Stable Diffusion 2.0","org":"Stability AI","firstOfKind":"","capability":"Native Auflösung von 768×768, neuer OpenCLIP-Text-Encoder, Depth-to-Image-Pipeline und ein 4×-Upscaler-Modell","sources":["https://stability.ai/news-updates/stable-diffusion-v2-release","https://en.wikipedia.org/wiki/Stable_Diffusion"]},{"id":"audio-whisper-large-v2-2022-12-08","date":"2022-12-08","datePrecision":"day","modality":"audio","name":"Whisper large-v2","org":"OpenAI","firstOfKind":"","capability":"Verbessertes Whisper-Modell mit einer um etwa 10–15 % geringeren Wortfehlerrate, insbesondere bei verrauschten Aufnahmen, das 2,5-mal länger und mit Regularisierung trainiert wurde","sources":["https://github.com/openai/whisper/blob/main/model-card.md","https://huggingface.co/openai/whisper-large-v2"]},{"id":"text-llama-1-2023-02-24","date":"2023-02-24","datePrecision":"day","modality":"text","name":"LLaMA 1","org":"Meta","firstOfKind":"Erste offen verfügbare LLM-Familie, die mit den damaligen Modellen der GPT-3-Klasse konkurrenzfähig war","capability":"Hochwertiges, forschungstaugliches LLM (7B–65B), veröffentlicht mit offenen Gewichten unter einer nichtkommerziellen Lizenz","sources":["https://ai.meta.com/blog/large-language-model-llama-meta-ai/"]},{"id":"video-modelscope-text-to-video-2023-03-20","date":"2023-03-20","datePrecision":"day","modality":"video","name":"ModelScope Text-to-Video","org":"Alibaba DAMO Academy","firstOfKind":"Erstes breit zugängliches Open-Source-Modell für Text-zu-Video","capability":"Open-Weight-Diffusionsmodell mit 1,7 Mrd. Parametern für Text-zu-Video, das kurze Clips aus englischen Prompts erzeugt","sources":["https://huggingface.co/ali-vilab/modelscope-damo-text-to-video-synthesis","https://huggingface.co/ali-vilab/text-to-video-ms-1.7b"]},{"id":"text-autogpt-2023-03-30","date":"2023-03-30","datePrecision":"day","modality":"text","name":"AutoGPT","org":"Significant Gravitas","firstOfKind":"Erster viraler autonomer KI-Agent","capability":"Open-Source-Agent, der GPT-4-Aufrufe verkettet, um ein Ziel selbstständig mit Web- und Datei-Tools zu verfolgen.","sources":["https://github.com/Significant-Gravitas/AutoGPT"]},{"id":"audio-bark-2023-04-01","date":"2023-04-01","datePrecision":"month","modality":"audio","name":"Bark","org":"Suno AI","firstOfKind":"Erstes Open-Source-Modell, das ausdrucksstarke Sprache mit eingebetteten nonverbalen Lauten und Hintergrundgeräuschen in einem einzigen Durchgang erzeugt","capability":"Open-Source-TTS auf Transformer-Basis mit Zero-Shot-Voice-Cloning, nonverbalen Lautäußerungen (Lachen, Seufzen), Hintergrundmusik und Unterstützung für über 100 Sprachen","sources":["https://github.com/suno-ai/bark","https://huggingface.co/suno/bark"]},{"id":"audio-meta-musicgen-open-source-2023-06-08","date":"2023-06-08","datePrecision":"day","modality":"audio","name":"Meta MusicGen (open-source)","org":"Meta AI","firstOfKind":"Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie","capability":"Open-Source-Musikgenerierung mit Steuerung über Text und optionale Melodie-Referenz, verfügbar als Code und Modellgewichte; Gewichte unter CC-BY-NC 4.0","sources":["https://arxiv.org/abs/2306.05284","https://github.com/facebookresearch/audiocraft","https://musically.com/2023/06/12/metas-new-musicgen-ai-was-trained-on-20k-hours-of-licensed-music/"]},{"id":"text-llama-2-2023-07-18","date":"2023-07-18","datePrecision":"day","modality":"text","name":"Llama 2","org":"Meta","firstOfKind":"Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet","capability":"Open-Weight-LLM (7B–70B), das über eine Partnerschaft von Meta und Microsoft kostenlos für Forschung und kommerzielle Nutzung veröffentlicht wurde","sources":["https://about.fb.com/news/2023/07/llama-2/","https://ai.meta.com/blog/llama-2-updates-connect-2023/"]},{"id":"image-stable-diffusion-xl-1-0-sdxl-2023-07-26","date":"2023-07-26","datePrecision":"day","modality":"image","name":"Stable Diffusion XL 1.0 (SDXL)","org":"Stability AI","firstOfKind":"Erstes Open-Weights-Modell mit einer zweistufigen Pipeline aus Basismodell und Refiner bei nativer Auflösung von 1024 Pixeln","capability":"Pipeline aus einem Basismodell mit 3,5 Mrd. Parametern und einem Refiner mit 6,6 Mrd. Parametern, die nativ 1024×1024 erzeugt, mit verbessertem semantischem Verständnis, besserer Beleuchtung und vereinfachtem Prompting","sources":["https://stability.ai/news/stable-diffusion-sdxl-1-announcement","https://www.prnewswire.com/news-releases/stability-ai-announces-stable-diffusion-xl-1-0--featured-on-amazon-bedrock-301886507.html"]},{"id":"audio-meta-audiocraft-musicgen-audiogen-encodec-2023-08-02","date":"2023-08-02","datePrecision":"day","modality":"audio","name":"Meta AudioCraft (MusicGen + AudioGen + EnCodec)","org":"Meta AI","firstOfKind":"","capability":"Open-Source-Framework zur Audiogenerierung, das Text-zu-Musik (MusicGen), Text-zu-Soundeffekten (AudioGen) und einen verbesserten neuronalen Audio-Codec (EnCodec) in einer Bibliothek vereint","sources":["https://about.fb.com/news/2023/08/audiocraft-generative-ai-for-music-and-audio/","https://github.com/facebookresearch/audiocraft"]},{"id":"text-qwen-7b-2023-08-03","date":"2023-08-03","datePrecision":"day","modality":"text","name":"Qwen-7B","org":"Alibaba","firstOfKind":"","capability":"Erstes offenes Modell der Qwen-Familie von Alibaba.","sources":["https://github.com/QwenLM/Qwen"]},{"id":"audio-seamless-m4t-2023-08-22","date":"2023-08-22","datePrecision":"day","modality":"audio","name":"Meta SeamlessM4T","org":"Meta","firstOfKind":"Erstes einheitliches multimodales und mehrsprachiges Sprachübersetzungsmodell","capability":"Ein einziges multimodales Modell für Sprach- und Text-Übersetzung/Transkription über rund 100 Sprachen (ASR, Sprache-zu-Text, Sprache-zu-Sprache, Text-zu-Sprache, Text-zu-Text).","sources":["https://ai.meta.com/blog/seamless-m4t/"]},{"id":"text-falcon-180b-2023-09-06","date":"2023-09-06","datePrecision":"day","modality":"text","name":"Falcon 180B","org":"TII","firstOfKind":"","capability":"180B-Parameter-Modell auf 3,5 Billionen Tokens; bei Veröffentlichung das größte offen verfügbare LLM.","sources":["https://huggingface.co/blog/falcon-180b"]},{"id":"text-mistral-7b-2023-09-27","date":"2023-09-27","datePrecision":"day","modality":"text","name":"Mistral 7B","org":"Mistral AI","firstOfKind":"Erstes Open-Weights-Modell mit 7B, das ein 13B-Modell auf ganzer Linie in Standard-Benchmarks schlägt","capability":"Modell mit 7,3 Mrd. Parametern, das Llama 2 13B in allen Benchmarks und Llama 1 34B in vielen übertrifft – mittels Sliding-Window-Attention","sources":["https://mistral.ai/news/announcing-mistral-7b/"]},{"id":"video-stable-video-diffusion-svd-2023-11-21","date":"2023-11-21","datePrecision":"day","modality":"video","name":"Stable Video Diffusion (SVD)","org":"Stability AI","firstOfKind":"Erstes breit veröffentlichtes Open-Weights-Diffusionsmodell für Image-to-Video","capability":"Open-Weights-Modell für Image-to-Video, das aus einem einzelnen Referenzbild 14–25 Frames bei 3–30 fps erzeugt","sources":["https://stability.ai/news-updates/stable-video-diffusion-open-ai-video-model","https://venturebeat.com/ai/stability-ai-debuts-stable-video-diffusion-models-in-research-preview"]},{"id":"text-mixtral-8x7b-2023-12-11","date":"2023-12-11","datePrecision":"day","modality":"text","name":"Mixtral 8x7B","org":"Mistral AI","firstOfKind":"Erstes Open-Weights-Sparse-MoE-Modell dieser Größenordnung, das die Leistung von GPT-3.5 erreicht","capability":"Sparse-Mixture-of-Experts-Modell mit 46,7 Mrd. Parametern insgesamt, aber nur 12,9 Mrd. aktiven pro Token, das GPT-3.5 in Benchmarks erreicht – bei sechsmal schnellerer Inferenz als Llama 2 70B","sources":["https://mistral.ai/news/mixtral-of-experts/"]},{"id":"text-google-gemma-2024-02-21","date":"2024-02-21","datePrecision":"day","modality":"text","name":"Google Gemma","org":"Google","firstOfKind":"Googles erstes offenes Sprachmodell","capability":"Googles erste offene LLM-Familie (2B/7B), abgeleitet aus der Gemini-Forschung, mit offenen Gewichten zur freien und kommerziellen Nutzung.","sources":["https://blog.google/technology/developers/gemma-open-models/"]},{"id":"text-llama-3-8b-70b-2024-04-18","date":"2024-04-18","datePrecision":"day","modality":"text","name":"Llama 3 (8B / 70B)","org":"Meta","firstOfKind":"","capability":"Beste quelloffene 8B- und 70B-Modelle bei Erscheinen, mit 128K Kontext und verbessertem Reasoning, Coding und Befolgen von Anweisungen","sources":["https://ai.meta.com/blog/meta-llama-3/"]},{"id":"text-phi-3-mini-2024-04-23","date":"2024-04-23","datePrecision":"day","modality":"text","name":"Microsoft Phi-3 (Phi-3-mini)","org":"Microsoft","firstOfKind":"Wegweisendes SLM-auf-dem-Gerät","capability":"3,8-Mrd.-Parameter-Open-SLM, das die Leistung deutlich größerer Modelle erreicht und lokal auf einem Smartphone läuft.","sources":["https://azure.microsoft.com/en-us/blog/introducing-phi-3-redefining-whats-possible-with-slms/"]},{"id":"audio-stability-stable-audio-open-2024-06-05","date":"2024-06-05","datePrecision":"day","modality":"audio","name":"Stability Stable Audio Open","org":"Stability AI","firstOfKind":"","capability":"Open-Weights-Diffusionsmodell für Text-to-Audio zur Erzeugung von bis zu 47 Sekunden an Soundeffekten und Samples, verfügbar für die nichtkommerzielle Nutzung","sources":["https://stability.ai/news-updates/introducing-stable-audio-open","https://x.com/StabilityAI/status/1798399596848381981"]},{"id":"image-stable-diffusion-3-medium-open-weights-2024-06-12","date":"2024-06-12","datePrecision":"day","modality":"image","name":"Stable Diffusion 3 Medium (open weights)","org":"Stability AI","firstOfKind":"Erstes Open-Weights-Modell, das die Architektur eines Multimodal Diffusion Transformer (MMDiT) für die Text-to-Image-Generierung nutzt","capability":"Architektur eines Multimodal Diffusion Transformer (MMDiT) mit 2 Mrd. Parametern, mit verbesserter Typografie, besserer Anatomie und Textkonditionierung über T5-XXL","sources":["https://stability.ai/news/stable-diffusion-3","https://x.com/StabilityAI/status/1797462536117444794"]},{"id":"audio-kyutai-moshi-2024-07-03","date":"2024-07-03","datePrecision":"day","modality":"audio","name":"Kyutai Moshi","org":"Kyutai","firstOfKind":"Erstes Echtzeit-Voll-Duplex-Sprachdialog-Foundation-Model","capability":"Voll-duplexes Echtzeit-Sprache-zu-Sprache-Dialogmodell (rund 200 ms Latenz) mit dem Mimi-Neural-Codec — hört und spricht gleichzeitig, ohne starres Abwechseln.","sources":["https://github.com/kyutai-labs/moshi","https://arxiv.org/abs/2410.00037"]},{"id":"text-llama-3-1-405b-2024-07-23","date":"2024-07-23","datePrecision":"day","modality":"text","name":"Llama 3.1 405B","org":"Meta","firstOfKind":"Erstes Open-Weights-Modell mit über 400B Parametern, das mit geschlossenen Frontier-Modellen konkurrenzfähig ist","capability":"Open-Weights-Modell mit 405B Parametern und 128K Kontext, das GPT-4o und Claude 3.5 Sonnet in zentralen Evaluierungen erreicht, mit einer destillationsfreundlichen Lizenz","sources":["https://ai.meta.com/blog/meta-llama-3-1/"]},{"id":"image-flux-1-pro-dev-schnell-2024-08-01","date":"2024-08-01","datePrecision":"day","modality":"image","name":"FLUX.1 (pro / dev / schnell)","org":"Black Forest Labs","firstOfKind":"Erstes Apache-lizenziertes Modell, das Bildqualität auf Frontier-Niveau erreicht (FLUX.1[schnell])","capability":"Modellreihe mit 12B Parametern auf Basis von Flow Matching: FLUX.1[schnell] (Apache 2.0, 10× schneller dank Destillation), FLUX.1[dev] (Open Weights, nicht kommerziell), FLUX.1[pro] (geschlossene API), allesamt auf dem Qualitätsniveau von Midjourney v6","sources":["https://bfl.ai/announcements","https://venturebeat.com/ai/stable-diffusion-creators-launch-black-forest-labs-secure-31m-for-flux-1-ai-image-generator"]},{"id":"text-qwen2-5-2024-09-19","date":"2024-09-19","datePrecision":"day","modality":"text","name":"Qwen2.5","org":"Alibaba","firstOfKind":"","capability":"Volle 0,5B–72B-Familie mit starkem Coding/Mathe; eines der größten Open-Source-Releases.","sources":["https://qwenlm.github.io/blog/qwen2.5/"]},{"id":"text-llama-3-2-vision-edge-2024-09-25","date":"2024-09-25","datePrecision":"day","modality":"text","name":"Llama 3.2 (Vision + Edge)","org":"Meta","firstOfKind":"","capability":"Metas erste offene multimodale Modelle (11B/90B Vision) plus 1B/3B-Textmodelle für Mobil/Edge.","sources":["https://ai.meta.com/blog/llama-3-2-connect-2024-vision-edge-mobile-devices/"]},{"id":"audio-f5-tts-2024-10-09","date":"2024-10-09","datePrecision":"day","modality":"audio","name":"F5-TTS","org":"Shanghai Jiao Tong University / Cambridge University","firstOfKind":"Erste Architektur aus Diffusion-Transformer mit Flow Matching, die auf Zero-Shot-TTS angewendet wird und autoregressive Qualität erreicht oder übertrifft","capability":"TTS auf Basis eines Diffusion-Transformers mit Flow Matching, das Zero-Shot-Voice-Cloning mit hoher Natürlichkeit aus kurzem Referenzaudio erreicht und Chinesisch sowie Englisch unterstützt","sources":["https://arxiv.org/abs/2410.06885","https://github.com/SWivid/F5-TTS"]},{"id":"image-stable-diffusion-3-5-large-2024-10-22","date":"2024-10-22","datePrecision":"day","modality":"image","name":"Stable Diffusion 3.5 Large","org":"Stability AI","firstOfKind":"Erstes Open-Weights-Bildgenerierungsmodell mit über 8B Parametern, das unter einer freizügigen kommerziellen Lizenz veröffentlicht wurde","capability":"MMDiT-X-Modell mit 8,1B Parametern und drei parallelen Text-Encodern (OpenCLIP, CLIP, T5-XXL), mit einer freizügigen kommerziellen Lizenz für bis zu 1 Mio. US-Dollar Jahresumsatz, lauffähig auf Consumer-Hardware","sources":["https://stability.ai/news-updates/introducing-stable-diffusion-3-5","https://siliconangle.com/2024/10/22/stable-ai-releases-next-gen-open-source-stable-diffusion-3-5-text-image-ai-model-family/"]},{"id":"video-genmo-mochi-1-2024-10-22","date":"2024-10-22","datePrecision":"day","modality":"video","name":"Genmo Mochi 1","org":"Genmo","firstOfKind":"Größtes Open-Source-Text-zu-Video-Modell zum Zeitpunkt der Veröffentlichung (10B Parameter, Apache 2.0)","capability":"Text-zu-Video-Modell mit 10B Parametern unter Apache 2.0, das 480p-Clips bei 30 fps mit hoher Bewegungsqualität und Prompt-Treue erzeugt","sources":["https://siliconangle.com/2024/10/22/genmo-introduces-mochi-1-open-source-text-video-generation-model/","https://github.com/genmoai/mochi","https://www.genmo.ai/blog/mochi-1-a-new-sota-in-open-text-to-video"]},{"id":"video-lightricks-ltx-video-ltxv-2024-11-22","date":"2024-11-22","datePrecision":"day","modality":"video","name":"Lightricks LTX-Video (LTXV)","org":"Lightricks","firstOfKind":"Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)","capability":"DiT-basiertes Text-zu-Video-Modell mit 2B Parametern, das 5 Sekunden Video in 768×512 schneller als in Echtzeit erzeugt (4 s Generierung für einen 5-Sekunden-Clip)","sources":["https://github.com/Lightricks/LTX-Video","https://comfyui-wiki.com/en/news/2024-11-23-ltx-video-release","https://dataconomy.com/2024/11/26/lightricks-launches-open-source-ai-model-for-faster-video-generation/"]},{"id":"video-tencent-hunyuanvideo-2024-12-03","date":"2024-12-03","datePrecision":"day","modality":"video","name":"Tencent HunyuanVideo","org":"Tencent","firstOfKind":"Größtes Open-Source-Videogenerierungsmodell zum Zeitpunkt der Veröffentlichung (13B Parameter), erstes offenes Modell, das die kommerzielle Frontier-Qualität erreicht","capability":"Transformer mit 13B Parametern, der von Dual-Stream auf Single-Stream umschaltet, für detailgetreue Text-zu-Video-Generierung mit vollständig offenen Gewichten","sources":["https://github.com/Tencent-Hunyuan/HunyuanVideo","https://technode.com/2024/12/04/tencent-launches-and-open-sources-hunyuan-video-generation-model/"]},{"id":"audio-kokoro-82m-v0-19-2024-12-25","date":"2024-12-25","datePrecision":"day","modality":"audio","name":"Kokoro-82M v0.19","org":"hexgrad (independent)","firstOfKind":"Erstes Modell mit unter 100M Parametern, das Platz 1 auf einem öffentlichen TTS-Qualitäts-Leaderboard erreicht","capability":"Apache-lizenziertes TTS-Modell mit 82M Parametern, das bei seinem Start Platz 1 in der Hugging Face TTS Arena belegte und natürliche englische Sprache für unter 1 US-Dollar pro Million Zeichen erzeugt","sources":["https://huggingface.co/hexgrad/Kokoro-82M"]},{"id":"text-deepseek-v3-2024-12-26","date":"2024-12-26","datePrecision":"day","modality":"text","name":"DeepSeek-V3","org":"DeepSeek","firstOfKind":"Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht","capability":"Open-Weights-Modell mit 671B Parametern als sparses MoE, das GPT-4o und Claude 3.5 Sonnet bei Benchmarks erreicht und für nur 5,6 Mio. US-Dollar an Rechenleistung trainiert wurde","sources":["https://arxiv.org/abs/2412.19437"]},{"id":"text-deepseek-r1-2025-01-20","date":"2025-01-20","datePrecision":"day","modality":"text","name":"DeepSeek-R1","org":"DeepSeek","firstOfKind":"Erstes Open-Weights-Reasoning-Modell, das die Leistung auf o1-Niveau erreicht, unter MIT-Lizenz","capability":"Offenes, MIT-lizenziertes Reasoning-Modell, das mit Reinforcement Learning nahezu von Grund auf (mit minimalen überwachten Daten) trainiert wurde und OpenAI o1 bei Mathematik-, Coding- und Wissenschafts-Benchmarks erreicht","sources":["https://github.com/deepseek-ai/DeepSeek-R1","https://arxiv.org/abs/2501.12948"]},{"id":"audio-kokoro-tts-v1-0-2025-01-27","date":"2025-01-27","datePrecision":"day","modality":"audio","name":"Kokoro TTS v1.0","org":"hexgrad (independent)","firstOfKind":"","capability":"Erweiterte Version von Kokoro mit Unterstützung für 8 Sprachen (Englisch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Mandarin, Portugiesisch) und 54 Stimmen unter Apache 2.0","sources":["https://huggingface.co/hexgrad/Kokoro-82M"]},{"id":"video-alibaba-wan-2-1-2025-02-25","date":"2025-02-25","datePrecision":"day","modality":"video","name":"Alibaba Wan 2.1","org":"Alibaba (Wan Team)","firstOfKind":"Erstes Open-Source-Modell, das die VBench-Bestenliste für Videoqualität anführte und alle geschlossenen Modelle übertraf","capability":"Apache-2.0-Suite von Modellen zur Videogenerierung (bis zu 14 Mrd. Parameter) für Text-zu-Video, Bild-zu-Video sowie Interpolation des ersten/letzten Frames in 720p","sources":["https://www.alibabacloud.com/blog/alibaba-unveils-its-latest-open-source-video-generation-model_602167","https://github.com/Wan-Video/Wan2.1","https://comfyui-wiki.com/en/news/2025-02-25-alibaba-wanx-2-1-video-model-open-source"]},{"id":"audio-sesame-csm-conversational-speech-model-demo-2025-02-27","date":"2025-02-27","datePrecision":"day","modality":"audio","name":"Sesame CSM (conversational speech model) demo","org":"Sesame AI","firstOfKind":"Erstes Open-Source-Modell, das explizit auf den psychologischen Benchmark der 'Voice Presence' für dialogorientierte KI abzielt","capability":"Modell zur dialogorientierten Sprachgenerierung, das kontextbewusste, emotional ausdrucksstarke Dialoge mit menschenähnlicher Prosodie und Mehrsprecher-Handhabung erzeugt","sources":["https://www.sesame.com/research/crossing_the_uncanny_valley_of_voice","https://github.com/SesameAILabs/csm"]},{"id":"text-llama-4-scout-maverick-2025-04-05","date":"2025-04-05","datePrecision":"day","modality":"text","name":"Llama 4 (Scout / Maverick)","org":"Meta","firstOfKind":"Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens","capability":"Nativ multimodale offene MoE-Modelle; Scout bietet ein Kontextfenster von 10 Mio. Tokens (das mit INT4-Quantisierung auf eine einzige H100 passt), Maverick nutzt 128 Experten","sources":["https://ai.meta.com/blog/llama-4-multimodal-intelligence/"]},{"id":"text-alibaba-qwen3-2025-04-29","date":"2025-04-29","datePrecision":"day","modality":"text","name":"Alibaba Qwen3","org":"Alibaba","firstOfKind":"","capability":"Open-Weights-Familie (0,6B–235B MoE) mit umschaltbarem „Thinking/Non-Thinking\"-Reasoning.","sources":["https://qwenlm.github.io/blog/qwen3/"]},{"id":"image-flux-1-kontext-dev-open-weights-2025-06-26","date":"2025-06-26","datePrecision":"day","modality":"image","name":"FLUX.1 Kontext [dev] (open weights)","org":"Black Forest Labs","firstOfKind":"Erstes Open-Weights-Modell, das die Leistung proprietärer Modelle bei der iterativen, kontextbewussten Bildbearbeitung erreichte","capability":"Open-Weights-Modell mit 12 Mrd. Parametern zur kontextbezogenen Bildbearbeitung mit Figurenbeibehaltung, lokalen und globalen Bearbeitungen, kompatibel mit ComfyUI und HuggingFace Diffusers","sources":["https://bfl.ai/blog/flux-1-kontext-dev","https://huggingface.co/black-forest-labs/FLUX.1-Kontext-dev"]},{"id":"video-ltx-2-2026-01-06","date":"2026-01-06","datePrecision":"day","modality":"video","name":"LTX-2","org":"Lightricks","firstOfKind":"Erstes produktionsreifes Open-Weights-Modell, das Video und Audio synchron in einem Durchgang mit nativem 4K und offenem Trainingscode generiert.","capability":"LTX-2 erzeugt synchronisiertes Video und Audio in einem einzigen Durchgang mit nativer 4K-Auflösung bei 50 Bildern pro Sekunde und bis zu 20 Sekunden Länge, inklusive ausdrucksstarkem Ton, akkuratem Lip-Sync und Umgebungsgeräuschen. Das Modell (14B Video- plus 5B Audio-Parameter) läuft auf Consumer-GPUs.","sources":["https://www.globenewswire.com/news-release/2026/01/06/3213304/0/en/Lightricks-Open-Sources-LTX-2-the-First-Production-Ready-Audio-and-Video-Generation-Model-With-Truly-Open-Weights.html"]},{"id":"image-flux-2-klein-2026-01-15","date":"2026-01-15","datePrecision":"day","modality":"image","name":"FLUX.2 [klein]","org":"Black Forest Labs","firstOfKind":"","capability":"Kompakte Open-Weights-Modellfamilie (4B und 9B), die Bildgenerierung und -Editing in einer Architektur vereint und Text-to-Image, Single-Reference-Editing sowie Multi-Reference-Generierung in unter einer Sekunde auf Consumer-Hardware (ab ca. 13 GB VRAM) liefert.","sources":["https://bfl.ai/blog/flux2-klein-towards-interactive-visual-intelligence","https://huggingface.co/black-forest-labs/FLUX.2-klein-4B"]},{"id":"image-hunyuanimage-3-0-instruct-2026-01-26","date":"2026-01-26","datePrecision":"day","modality":"image","name":"HunyuanImage 3.0-Instruct","org":"Tencent","firstOfKind":"","capability":"Natives multimodales Open-Weights-Modell (80B MoE, ca. 13B aktive Parameter) mit Fokus auf praezisem, instruktionsgesteuertem Image-Editing: Reasoning-gestuetztes Prompt-Enhancement, Image-to-Image, Multi-Image-Fusion (bis zu 3 Eingabebilder) und Chain-of-Thought.","sources":["https://github.com/Tencent-Hunyuan/HunyuanImage-3.0"]},{"id":"text-kimi-k2-5-2026-01-27","date":"2026-01-27","datePrecision":"day","modality":"text","name":"Kimi K2.5","org":"Moonshot AI","firstOfKind":"","capability":"Nativ multimodales, agentisches Open-Weights-Modell mit einer 1-Billion-Parameter-Mixture-of-Experts-Architektur (etwa 32 Mrd. aktive Parameter), das auf rund 15 Billionen gemischten Bild- und Text-Tokens trainiert wurde. Es versteht Text, Bilder und Video und bringt einen Agent-Swarm mit, der komplexe Aufgaben auf bis zu 100 parallele Sub-Agents aufteilt.","sources":["https://techcrunch.com/2026/01/27/chinas-moonshot-releases-a-new-open-source-model-kimi-k2-5-and-a-coding-agent/","https://siliconangle.com/2026/01/27/moonshot-ai-releases-open-source-kimi-k2-5-model-1t-parameters/"]},{"id":"text-glm-5-2026-02-11","date":"2026-02-11","datePrecision":"day","modality":"text","name":"GLM-5","org":"Zhipu AI (Z.ai)","firstOfKind":"Erstes Frontier-Open-Weights-Modell einer börsennotierten Foundation-Model-Firma (Zhipu/Z.ai).","capability":"Open-Weights-MoE-Frontier-Modell mit 744B Total-Parametern (rund 40-44B aktiv), 200K-Kontextfenster und DeepSeek-Sparse-Attention, ausgelegt auf agentische Engineering- und langlaufende Coding-Workflows. Erreichte 77,8 % auf SWE-bench Verified und 92,7 % auf AIME 2026.","sources":["https://huggingface.co/blog/mlabonne/glm-5","https://www.scmp.com/tech/article/3343239/chinas-zhipu-ai-launches-new-major-model-glm-5-challenge-its-rivals"]},{"id":"audio-fish-audio-s2-2026-03-09","date":"2026-03-09","datePrecision":"day","modality":"audio","name":"Fish Audio S2","org":"Fish Audio","firstOfKind":"","capability":"Open-Weights-TTS-Modell mit Dual-AR-Architektur (rund 4B Parameter auf der Zeitachse, 400M auf der Tiefenachse), trainiert auf ueber 10 Millionen Stunden Audio in etwa 50 Sprachen. Erlaubt feinkoernige Inline-Steuerung von Prosodie und Emotion ueber natuerlichsprachliche Tags wie [laugh], [whispers] oder [super happy]. Veroeffentlicht mit Model-Weights, Fine-Tuning-Code und einer SGLang-basierten Streaming-Inferenz-Engine.","sources":["https://fish.audio/blog/fish-audio-open-sources-s2/"]},{"id":"text-glm-5-1-2026-04-07","date":"2026-04-07","datePrecision":"day","modality":"text","name":"GLM-5.1","org":"Zhipu / Z.ai","firstOfKind":"Erstes Open-Weights-Modell an der Spitze von SWE-Bench Pro","capability":"754B-Parameter-MoE; erstes Open-Source-Modell auf Platz 1 von SWE-Bench Pro (58,4%), vor Claude Opus 4.6.","sources":["https://huggingface.co/zai-org/GLM-5"]},{"id":"audio-moss-audio-2026-04-13","date":"2026-04-13","datePrecision":"day","modality":"audio","name":"MOSS-Audio","org":"OpenMOSS / MOSI.AI / Shanghai Innovation Institute","firstOfKind":"Eines der ersten Open-Weights-Foundation-Modelle, das Verstehen von Sprache, Umgebungsklang und Musik samt zeitbewusstem Reasoning in einem Modell vereint.","capability":"Open-Source-Foundation-Modell fuer einheitliches Audio-Verstehen ueber komplexe reale Audioszenen hinweg: Sprachverstehen, Umgebungsgeraeusche, Musikverstehen, Audio-Captioning, zeitbewusstes Question-Answering und mehrstufiges Reasoning. Veroeffentlicht in vier Varianten (4B und 8B, jeweils als Instruct und Thinking) mit Audio-Encoder plus Qwen3-Backbone; Weights auf Hugging Face und Code auf GitHub.","sources":["https://github.com/OpenMOSS/MOSS-Audio","https://openmoss.ai/MOSS-Audio/"]},{"id":"text-kimi-k2-6-2026-04-20","date":"2026-04-20","datePrecision":"day","modality":"text","name":"Kimi K2.6","org":"Moonshot AI","firstOfKind":"","capability":"Open-Weights-Modell auf 1-Billion-Parameter-MoE-Basis (32 Mrd. aktive Parameter), spezialisiert auf agentisches Coding und Langzeit-Aufgaben. Es kann laut Moonshot bis zu rund 13 Stunden durchgehend coden und bringt ein Agent-Swarm-System mit bis zu 300 spezialisierten Sub-Agents und bis zu 4.000 koordinierten Schritten pro Lauf.","sources":["https://www.yicaiglobal.com/news/chinas-moonshot-ai-releases-kimi-k26-pushing-boundaries-in-coding-multi-agent-capabilities"]},{"id":"text-deepseek-v4-preview-2026-04-24","date":"2026-04-24","datePrecision":"day","modality":"text","name":"DeepSeek V4 (Preview)","org":"DeepSeek","firstOfKind":"","capability":"Open-Weights-Flaggschiff in zwei Varianten: V4-Pro (1,6 Bio. Parameter total, 49 Mrd. aktiv) und V4-Flash (284 Mrd. total, 13 Mrd. aktiv), beide standardmäßig mit 1-Mio.-Token-Kontext und neuartigen Attention-Mechanismen. V4-Pro bietet verbesserte agentische Fähigkeiten und Reasoning der Spitzenklasse in Mathematik, STEM und Coding.","sources":["https://api-docs.deepseek.com/news/news260424"]},{"id":"text-mistral-medium-3-5-2026-04-28","date":"2026-04-28","datePrecision":"day","modality":"text","name":"Mistral Medium 3.5","org":"Mistral AI","firstOfKind":"","capability":"Frontier-multimodales Modell mit einstellbarem reasoning_effort und 256k Kontext; neuer Standard für Le Chat.","sources":["https://docs.mistral.ai/models/model-cards/mistral-medium-3-5-26-04"]},{"id":"audio-stable-audio-3-0-2026-05-20","date":"2026-05-20","datePrecision":"day","modality":"audio","name":"Stable Audio 3.0","org":"Stability AI","firstOfKind":"","capability":"Modellfamilie zur Audiogenerierung aus vier Modellen: Small SFX, Small, Medium und Large. Erzeugt vollstaendige Kompositionen von bis zu rund sechs Minuten mit erhaltener musikalischer Struktur, mit Variable-Length-Generierung, Audio-Inpainting (Segment-Editing und Fortsetzung) sowie LoRA-Fine-Tuning. Trainiert ausschliesslich auf lizenzierten und Creative-Commons-Daten.","sources":["https://stability.ai/news-updates/meet-stable-audio-3-the-model-family-built-for-artistic-experimentation-with-open-weight-models","https://techcrunch.com/2026/05/20/stability-ai-release-a-new-audio-model-that-can-create-six-minute-songs/"]},{"id":"text-step-3-7-flash-2026-05-29","date":"2026-05-29","datePrecision":"day","modality":"text","name":"Step 3.7 Flash","org":"StepFun","firstOfKind":"","capability":"Vision-Language-MoE-Modell mit 198B Total-Parametern (rund 11B aktiv), das einen 1,8B-Vision-Encoder mit einem 196B-Sprach-Backbone koppelt und Charts, PDFs, UI-Wireframes und App-GUIs ohne separate Vision-API verarbeitet. Ausgelegt auf Coding-Agenten und Such-Workflows.","sources":["https://www.marktechpost.com/2026/05/29/stepfun-releases-step-3-7-flash-a-198b-moe-vision-language-model-for-coding-agents-and-search-workflows/","https://www.digitalapplied.com/blog/stepfun-step-3-7-flash-196b-moe-agentic-vision-release"]},{"id":"text-minimax-m3-2026-06-01","date":"2026-06-01","datePrecision":"day","modality":"text","name":"MiniMax M3","org":"MiniMax","firstOfKind":"Laut MiniMax erstes Open-Weights-Modell, das Frontier-Coding, 1M-Kontext und native Multimodalität in einer einzigen Architektur kombiniert.","capability":"Nativ multimodales Open-Weights-Modell mit der neuen MSA-Architektur (MiniMax Sparse Attention), 1M-Kontextfenster, Bild- und Video-Input sowie Computer-Use, das Frontier-Coding (SWE-Bench Pro 59,0 %) mit langlaufender autonomer Ausführung über 24+ Stunden verbindet.","sources":["https://www.minimax.io/blog/minimax-m3","https://www.marktechpost.com/2026/06/01/minimax-releases-minimax-m3-with-msa-architecture-supporting-1m-token-context-native-multimodality-and-agentic-coding/"]},{"id":"image-ideogram-4-0-2026-06-03","date":"2026-06-03","datePrecision":"day","modality":"image","name":"Ideogram 4.0","org":"Ideogram","firstOfKind":"Erstes Open-Weights-Modell von Ideogram, das seine Spitzentechnologie fuer Design- und Text-Rendering oeffentlich freigab.","capability":"Erstes Open-Weights-Foundation-Modell von Ideogram (9.3B, Single-Stream-Diffusion-Transformer mit 34 Layern und Qwen3-VL-8B-Instruct als Text-Encoder), spezialisiert auf Design-Arbeit: branchenfuehrendes Text-Rendering (0.97 X-Omni English OCR), Bounding-Box-Layout-Kontrolle, strukturiertes JSON-Prompting, native Transparenz und 2K-Aufloesung; laeuft mit Quantisierung auf einer einzelnen 24-GB-GPU.","sources":["https://ideogram.ai/news/ideogram-4.0/","https://ideogram.ai/blog/ideogram-4.0/"]},{"id":"text-diffusiongemma-26b-a4b-2026-06-10","date":"2026-06-10","datePrecision":"day","modality":"text","name":"DiffusionGemma 26B-A4B","org":"Google DeepMind","firstOfKind":"Erstes großes Open-Weights-Text-Diffusionsmodell von Google, das Text in parallelen Blöcken statt autoregressiv Token für Token erzeugt.","capability":"Experimentelles offenes Text-Diffusion-Modell auf Gemma-4-Basis mit 26B MoE-Parametern (rund 3,8B aktiv), das 256-Token-Blöcke parallel statt sequenziell generiert und so bis zu 4x schnellere Textgenerierung erreicht (über 1.000 Tokens/s auf einer einzelnen H100).","sources":["https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/","https://www.marktechpost.com/2026/06/10/google-ai-releases-diffusiongemma-a-26b-moe-open-model-using-text-diffusion-for-up-to-4x-faster-generation/"]},{"id":"text-kimi-k2-7-code-2026-06-12","date":"2026-06-12","datePrecision":"day","modality":"text","name":"Kimi K2.7 Code","org":"Moonshot AI","firstOfKind":"","capability":"Coding-fokussiertes agentisches MoE-Modell mit 1T Total-Parametern (32B aktiv, 384 Experts) und 256K-Kontextfenster, das mehrstufig plant, editiert, Tools ausführt und debuggt. Reduziert die Zahl der Thinking-Tokens gegenüber K2.6 um rund 30 Prozent.","sources":["https://huggingface.co/moonshotai/Kimi-K2.7-Code","https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6/"]},{"id":"text-glm-5-2-2026-06-13","date":"2026-06-13","datePrecision":"day","modality":"text","name":"GLM-5.2","org":"Zhipu AI (Z.ai)","firstOfKind":"","capability":"Agentisch ausgerichtetes Coding-Modell auf Basis derselben 744B-MoE-Architektur wie GLM-5, mit einem nutzbaren Kontextfenster von 1M Tokens, bis zu 131.072 Output-Tokens und einem neuen System mit zwei Reasoning-Stufen (High und Max).","sources":["https://www.digitalapplied.com/blog/glm-5-2-zai-flagship-coding-plan-release","https://aitoolly.com/ai-news/article/2026-06-14-zhipu-ai-releases-glm-52-a-fully-open-source-frontier-model-featuring-a-1m-context-window"]},{"id":"text-ornith-1-0-2026-06-25","date":"2026-06-25","datePrecision":"day","modality":"text","name":"Ornith-1.0","org":"DeepReinforce","firstOfKind":"Erste offene Modellfamilie, die ihre eigenen RL-Scaffolds (Task-Harnesses) lernt","capability":"Selbst-verbessernde, quelloffene Modellfamilie für agentisches Programmieren — vom 9B-Dense-Modell für Edge-Geräte bis zum 397B-MoE-Spitzenmodell (zudem 31B Dense und 35B MoE), aufgebaut auf Gemma 4 und Qwen 3.5. Neuartiger Trainingsansatz: Im RL erzeugt das Modell nicht nur die Lösung, sondern auch das aufgabenspezifische Scaffold (den Harness), das diese Lösung steuert, und optimiert beides gemeinsam. Das 397B-Modell erreicht 77,5 auf Terminal-Bench 2.1 und 82,4 auf SWE-Bench Verified.","sources":["https://deep-reinforce.com/ornith_1_0.html","https://www.marktechpost.com/2026/06/25/deepreinforce-releases-ornith-1-0-an-open-source-coding-model-family-that-learns-its-own-rl-scaffolds/","https://huggingface.co/collections/deepreinforce-ai/ornith-10"]},{"id":"text-longcat-2-0-2026-06-29","date":"2026-06-29","datePrecision":"day","modality":"text","name":"LongCat-2.0","org":"Meituan","firstOfKind":"Erstes Billionen-Parameter-Modell, das komplett auf inländischen chinesischen KI-Chips trainiert und ausgeführt wird.","capability":"Quelloffenes 1,6-Billionen-Parameter-MoE-Modell (aktiviert ~48B Parameter pro Token, 33–56B je nach Komplexität) mit nativem 1-Mio.-Token-Kontext, veröffentlicht unter MIT-Lizenz auf GitHub und Hugging Face. Auf agentisches Coding ausgelegt: SWE-bench Pro 59,5, Terminal-Bench 70,8.","sources":["https://www.longcatai.org/models/longcat-2","https://venturebeat.com/technology/meituan-open-sources-longcat-2-0-the-1-6t-near-frontier-agentic-coding-model-thats-been-leading-openrouter-trained-entirely-on-chinese-chips"]},{"id":"text-hy3-hunyuan-2026-07-06","date":"2026-07-06","datePrecision":"day","modality":"text","name":"Hy3 (Hunyuan)","org":"Tencent (Hunyuan)","firstOfKind":"","capability":"Offizielle Version des Hunyuan-Hy3: 295B-MoE-Modell mit 21B aktiven Parametern und 256K-Kontext, veröffentlicht unter Apache-2.0-Lizenz. Gegenüber der Preview (23.04.) weitere Fortschritte bei Code-Generierung und Agenten-Fähigkeiten sowie mehr Stabilität; API über Tencent Cloud TokenHub. Erreicht laut Tencent flagship-nahe Intelligenz bei 2–5× kleinerem Parameter-Budget.","sources":["https://hy.tencent.com/research/hy3","https://www.tencent.com/en-us/articles/2202386.html"]},{"id":"text-inkling-2026-07-15","date":"2026-07-15","datePrecision":"day","modality":"text","name":"Inkling","org":"Thinking Machines Lab","firstOfKind":"Erstes öffentlich verfügbares Modell von Thinking Machines Lab (Mira Murati).","capability":"Erstes Modell von Mira Muratis Thinking Machines Lab — ein quelloffenes „Interaktionsmodell“, das Anfragen über verschiedene Medien hinweg verarbeitet und dabei Kosten gegen Leistung ausbalanciert. Frei verfügbar (Open-Weights zum Herunterladen und Anpassen); das Unternehmen monetarisiert nicht Inkling selbst, sondern das separate Fine-Tuning-Werkzeug Tinker.","sources":["https://thinkingmachines.ai/","https://fortune.com/2026/07/15/what-is-mira-murati-thinking-machines-first-ai-model-inkling/","https://www.bloomberg.com/news/articles/2026-07-15/murati-s-thinking-machines-releases-first-ai-model-for-broad-use"]},{"id":"text-kimi-k3-2026-07-16","date":"2026-07-16","datePrecision":"day","modality":"text","name":"Kimi K3","org":"Moonshot AI","firstOfKind":"","capability":"Neues MoE-Flaggschiff mit rund 2,8 Billionen Parametern, neuer „Kimi Delta Attention“-Architektur und 1-Mio.-Token-Kontext, ausgelegt auf langlaufendes Coding und Agenten-Workloads. Zwei Varianten zum Start: K3 Max (Chat/Agent) und K3 Swarm Max (massiv-paralleles Processing). Zum Launch nur über Kimi Code und die Kimi-App (ab ¥199-Tarif) nutzbar; die herunterladbaren Gewichte folgten am 27.07.2026.","sources":["https://www.marktechpost.com/2026/07/16/moonshot-ai-releases-kimi-k3-a-2-8-trillion-parameter-open-moe-model-with-kimi-delta-attention-and-1m-context/","https://simonwillison.net/2026/Jul/16/kimi-k3/"]},{"id":"text-laguna-s-2-1-2026-07-21","date":"2026-07-21","datePrecision":"day","modality":"text","name":"Laguna S 2.1","org":"poolside","firstOfKind":"","capability":"Offenes MoE-Modell für agentisches Coding: 118 Mrd. Parameter total, davon nur 8 Mrd. pro Token aktiv, bis zu 1 Mio. Token Kontext und getrennte Thinking-/No-Thinking-Modi. Laut poolside 70,2 % auf Terminal-Bench 2.1 (mit Thinking), 78,5 % auf SWE-Bench Multilingual, 40,4 % auf DeepSWE v1.1 und 46,2 % auf SWE Atlas (Codebase-QnA). Gewichte auf Hugging Face unter OpenMDW-1.1 (BF16 plus FP8- und NVFP4-Quantisierungen), lauffähig auf einer einzelnen NVIDIA DGX Spark.","sources":["https://poolside.ai/blog/introducing-laguna-s-2-1","https://huggingface.co/poolside/Laguna-S-2.1"]},{"id":"text-kimi-k3-open-weights-2026-07-27","date":"2026-07-27","datePrecision":"day","modality":"text","name":"Kimi K3 (Open Weights)","org":"Moonshot AI","firstOfKind":"","capability":"Moonshot lädt die vollständigen Gewichte des K3-Flaggschiffs auf Hugging Face: 2,8 Billionen Parameter total, davon rund 104 Mrd. pro Token aktiv, 1.048.576 Token Kontext, ausgeliefert mit nativer MXFP4-Quantisierung und MXFP8-Aktivierungen. Das Modell ist damit selbst hostbar — allerdings unter einer eigenen „Kimi K3 License\", die für kommerzielle Nutzung eine separate Vereinbarung verlangt, nicht unter einer OSI-Lizenz.","sources":["https://huggingface.co/moonshotai/Kimi-K3","https://artificialanalysis.ai/models/kimi-k3"]},{"id":"video-minimax-h3-2026-07-31","date":"2026-07-31","datePrecision":"day","modality":"video","name":"MiniMax H3","org":"MiniMax","firstOfKind":"","capability":"Von MiniMax als „Open-Weights\"-Videomodell angekündigt: H3 nimmt Text, Bild, Video und Audio in einer gemeinsamen Anfrage als Kontext (bis 7.000 Zeichen Prompt, bis 9 Referenzbilder, 3 Videoclips, 3 Audioclips — Audio nur zusammen mit Bild oder Video) und gibt natives 2K mit synchronem Stereo-Ton aus, 4 bis 15 Sekunden in ganzzahligen Schritten. Neben reiner Generierung nennt MiniMax Bearbeitung vorhandener Aufnahmen und Bewegungsübertragung zwischen Videos. Architektonisch führt eine neue „H3-Omni\"-Transformer-Struktur Text-zu-Bild, Text-zu-Video, Bild-zu-Video und Audio in einem Rahmen zusammen — laut MiniMax rund 30 % mehr Trainingsdurchsatz —, dazu kommt ein neu entworfener Tokenizer (H3-VAE) mit hoher Kompression. Zum Preis sagt MiniMax nur relativ: 2K koste pro Sekunde weniger als ein Drittel vergleichbarer marktüblicher Modelle. Live ist H3 als „MiniMax-H3\" in der API und im MiniMax Hub; die Gewichte sollen „innerhalb weniger Tage\" vollständig offengelegt werden.","sources":["https://platform.minimax.io/docs/release-notes/models","https://platform.minimax.io/docs/guides/video-generation","https://news.aibase.com/news/30033"]},{"id":"text-deepseek-v4-flash-0731-2026-07-31","date":"2026-07-31","datePrecision":"day","modality":"text","name":"DeepSeek-V4-Flash-0731","org":"DeepSeek","firstOfKind":"","capability":"Ablösung der V4-Flash-Preview vom 24.04.2026 bei unveränderter Architektur und Größe (284 Mrd. Parameter total, rund 13 Mrd. aktiv, plus Modul für spekulatives Decoding): Laut DeepSeeks eigenem Changelog wurde das Modell nicht neu vortrainiert, sondern ausschließlich neu nachtrainiert („re-post-training\"). Der Zugewinn liegt entsprechend bei agentischen Aufgaben — Terminal Bench 2.1 82,7, Cybergym 76,7, Toolathlon-Verified 70,3, DSBench-FullStack 68,7, DSBench-Hard 59,6, DeepSWE 54,4, NL2Repo 54,2, dazu 25,2 auf Agents' Last Exam und 25,1 auf AutomationBench Public. Der Denkaufwand ist in drei Stufen steuerbar (low, high, max), das Kontextfenster bleibt bei 1 Mio. Tokens mit bis zu 384K Ausgabe-Tokens. Neu sind das native Responses-API-Format (nur für Flash, nicht für Pro) und eine Anpassung für den Betrieb unter Codex. Preise: 0,14 USD Eingabe (Cache-Miss), 0,0028 USD bei Cache-Treffer und 0,28 USD Ausgabe pro Mio. Tokens — rund ein Drittel von V4-Pro (0,435/0,87 USD). Auf dem Artificial-Analysis-Intelligence-Index erreicht Flash-0731 in der Stufe max 50 Punkte, V4-Pro 44. Gewichte unter MIT-Lizenz auf Hugging Face.","sources":["https://api-docs.deepseek.com/updates","https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","https://api-docs.deepseek.com/quick_start/pricing","https://artificialanalysis.ai/models/deepseek-v4-flash"]},{"id":"text-shieldstral-2026-08-04","date":"2026-08-04","datePrecision":"day","modality":"text","name":"Shieldstral 1.0 3B","org":"Mistral AI","firstOfKind":"","capability":"Ein Klassifikator für Inhaltsmoderation mit 3 Mrd. Parametern, der keine feste Kategorienliste vorhersagt, sondern eine in natürlicher Sprache formulierte Richtlinie zur Laufzeit als Eingabe nimmt und einen kontinuierlichen Sicherheitswert zurückgibt. Technisch ist die Aufgabe auf eine binäre Ja/Nein-Frage reduziert: feste Systemnachricht, ein einziger Vorwärtsdurchlauf, ein einziges Ausgabetoken, dessen Wahrscheinlichkeit als Schwellwert dient. Derselbe Checkpoint lässt sich damit auf neue Richtlinien umstellen, ohne ihn nachzutrainieren. Basis ist Ministral-3-3B-Base-2512 mit nativem Pixtral-Bildencoder; über dieselbe Schnittstelle moderiert werden reiner Text, reine Bilder und Text-Bild-Kombinationen, in zwölf Sprachen einschließlich Deutsch. Trainiert auf Sequenzen bis 32K Tokens (theoretisch 256K), lauffähig auf einer einzelnen 16-GB-GPU. Lizenz: Apache 2.0, Gewichte auf Hugging Face, dazu ein technischer Bericht.","sources":["https://mistral.ai/news/shieldstral/","https://huggingface.co/mistralai/Shieldstral-1.0-3B","https://arxiv.org/abs/2607.25857"]},{"id":"video-minimax-h3-open-weights-2026-08-05","date":"2026-08-05","datePrecision":"day","modality":"video","name":"MiniMax H3 (Open Weights)","org":"MiniMax","firstOfKind":"","capability":"MiniMax löst die Ankündigung vom 31.07.2026 ein und legt die Gewichte von H3 auf Hugging Face offen (MiniMaxAI/MiniMax-H3, ohne Zugangsschranke). Erst damit werden die Kennzahlen prüfbar: 33 Mrd. Parameter dicht besetzt in einem einzigen Strom — die modalitätsspezifischen Teile sitzen nur in den Ein- und Ausgabeschichten und in den AdaLN-Zweigen, nicht in getrennten Expertentürmen. Ausgabe 4 bis 15 Sekunden, bis 2K (voreingestellt 768 px kürzere Kante), 24 Bilder/s, Stereo-Ton mit 32 kHz, Seitenverhältnisse von 21:9 bis 9:16; als Text- und Bildencoder dient Qwen3-VL-32B unter Apache 2.0. Die Lizenz ist keine Open-Source-Lizenz, sondern ein „MiniMax H3 Community License Agreement“ mit einer entscheidenden Klausel: Als „Excluded Territories“ ausgenommen sind die Europäische Union, das Vereinigte Königreich, Südkorea und die USA. Untersagt ist dort nicht nur der Betrieb des Modells, sondern ausdrücklich auch Vervielfältigung, Bearbeitung, Weitergabe und Vorführung — und dasselbe gilt für die erzeugten Videos. Ab 20 Mio. US-Dollar Jahresumsatz braucht es zusätzlich eine schriftliche Genehmigung, kommerzielle Oberflächen müssen „MiniMax H3“ sichtbar nennen; Gerichtsstand ist Hongkong, Lizenzgeberin die Nanonoble Pte. Ltd. in Singapur.","sources":["https://huggingface.co/MiniMaxAI/MiniMax-H3","https://platform.minimax.io/docs/release-notes/models"]}]}