{"meta":{"lastVerified":"22. September 2026","lastVerifiedISO":"2026-09-22","windowStart":"2022-08","windowEnd":"2026-09","total":286,"placeholder":false,"version":"v1","slice":"offenheit","claim":"Der Anteil offener Gewichte erreichte 2023 mit 38 % seinen Höchststand und fiel 2025 auf 17 %. Zwischen dem 26. Juni 2025 und dem 6. Januar 2026 liegen 194 Tage, in denen dieser Datensatz keinen einzigen Release mit offenen Gewichten verzeichnet — bei 16 geschlossenen, davon 12 mit Premierenanspruch. Trotzdem stammen 41 der 117 belegten Premieren von offenen Modellen.","page":"https://timeline.snipki.de/offenheit","license":"CC-BY-4.0","attribution":"Die Beschleunigung — KI-Zeitstrahl von snipKI (https://timeline.snipki.de)","source":"https://timeline.snipki.de","basis":"284 Releases (redaktionelle Marker ausgenommen)","openCount":89,"openShare":31.3,"pendingWeights":[{"id":"text-kimi-k3-2026-07-16","reason":"Zum Launch nur über App und API; die Gewichte folgten am 27. Juli 2026 als eigener Eintrag.","date":"2026-07-16"},{"id":"video-minimax-h3-2026-07-31","reason":"Als Open-Weights-Modell angekündigt; die Gewichte folgten am 5. August 2026 als eigener Eintrag — in der EU allerdings nicht lizenziert.","date":"2026-07-31"},{"id":"text-glm-5-3-2026-08-14","reason":"Gewichte laut Z.ai erst zwei Wochen nach dem Launch, nach Abschluss von Sicherheitsprüfung und Hardening — am 14. August 2026 nicht herunterladbar.","date":"2026-08-14"},{"id":"text-step-5-preview-2026-09-20","reason":"Offene Gewichte laut StepFun erst zum 15. Oktober 2026; am 20. September 2026 enthielt das angelegte HuggingFace-Repository nur eine .gitattributes-Datei.","date":"2026-09-20"}],"openCountStrict":85},"byYear":[{"year":2022,"open":5,"closed":9,"total":14,"openSharePercent":36},{"year":2023,"open":14,"closed":23,"total":37,"openSharePercent":38},{"year":2024,"open":17,"closed":35,"total":52,"openSharePercent":33},{"year":2025,"open":7,"closed":34,"total":41,"openSharePercent":17},{"year":2026,"open":46,"closed":94,"total":140,"openSharePercent":33}],"byModality":[{"modality":"text","open":51,"total":130,"openSharePercent":39},{"modality":"audio","open":16,"total":58,"openSharePercent":28},{"modality":"image","open":12,"total":48,"openSharePercent":25},{"modality":"video","open":10,"total":48,"openSharePercent":21}],"longestGapWithoutOpen":{"days":194,"from":"2025-06-26","to":"2026-01-06","precededBy":{"id":"image-flux-1-kontext-dev-open-weights-2025-06-26","name":"FLUX.1 Kontext [dev] (open weights)","org":"Black Forest Labs"},"endedBy":{"id":"video-ltx-2-2026-01-06","name":"LTX-2","org":"Lightricks"},"closedReleasesInside":16,"firstOfKindInside":12,"inside":[{"id":"text-grok-4-2025-07-09","date":"2025-07-09","name":"xAI Grok 4","org":"xAI","modality":"text","firstOfKind":"Erstes Modell, das rund 50 % auf „Humanity's Last Exam\" erreichte"},{"id":"text-openai-chatgpt-agent-2025-07-17","date":"2025-07-17","name":"OpenAI ChatGPT Agent","org":"OpenAI","modality":"text","firstOfKind":""},{"id":"video-runway-aleph-2025-07-25","date":"2025-07-25","name":"Runway Aleph","org":"Runway","modality":"video","firstOfKind":"Erstes leistungsfähiges allgemeines In-Context-Videobearbeitungsmodell"},{"id":"video-google-deepmind-genie-3-2025-08-05","date":"2025-08-05","name":"Google DeepMind Genie 3","org":"Google DeepMind","modality":"video","firstOfKind":"Echtzeit-Weltmodell als neue Modalität"},{"id":"text-gpt-5-2025-08-07","date":"2025-08-07","name":"GPT-5","org":"OpenAI","modality":"text","firstOfKind":"Erstes einheitliches Modell aus schnellem Modus und Reasoning mit automatischem Compute-Routing in einem einzigen API-Endpunkt"},{"id":"image-nano-banana-2025-08-26","date":"2025-08-26","name":"Nano Banana (Gemini 2.5 Flash Image)","org":"Google","modality":"image","firstOfKind":"Erstes Bildmodell, das konversationelles Mehrfach-Editieren mit Konsistenz mainstreamfähig machte"},{"id":"audio-openai-gpt-realtime-realtime-api-ga-2025-08-28","date":"2025-08-28","name":"OpenAI gpt-realtime (Realtime API GA)","org":"OpenAI","modality":"audio","firstOfKind":"Erste hochmoderne Speech-to-Speech-API, die in der allgemeinen Verfügbarkeit eine SIP-Telefonie-Integration enthält"},{"id":"audio-mai-voice-1-2025-08-28","date":"2025-08-28","name":"MAI-Voice-1","org":"Microsoft AI","modality":"audio","firstOfKind":"Erstes hauseigenes Speech-Generation-Modell der Microsoft-AI-(MAI)-Sparte."},{"id":"text-mai-1-preview-2025-08-28","date":"2025-08-28","name":"MAI-1-preview","org":"Microsoft AI","modality":"text","firstOfKind":"Erstes vollständig hauseigenes, End-to-End trainiertes Foundation-LLM von Microsoft AI."},{"id":"image-seedream-4-0-2025-09-09","date":"2025-09-09","name":"Seedream 4.0","org":"ByteDance","modality":"image","firstOfKind":"Erstes Modell eines chinesischen Labors an der Spitze globaler Bild-Arenen"},{"id":"video-luma-ray3-2025-09-18","date":"2025-09-18","name":"Luma Ray3","org":"Luma AI","modality":"video","firstOfKind":"Erstes „Reasoning\"-Videomodell und erstes mit hochwertigem 16-Bit-HDR"},{"id":"audio-suno-v5-suno-studio-2025-09-23","date":"2025-09-23","name":"Suno v5 + Suno Studio","org":"Suno AI","modality":"audio","firstOfKind":"Erster KI-Musikgenerator, der eine integrierte generative Digital Audio Workstation auslieferte (Mehrspur + MIDI-Export)"},{"id":"text-claude-sonnet-4-5-2025-09-29","date":"2025-09-29","name":"Claude Sonnet 4.5","org":"Anthropic","modality":"text","firstOfKind":""},{"id":"video-openai-sora-2-2025-09-30","date":"2025-09-30","name":"OpenAI Sora 2","org":"OpenAI","modality":"video","firstOfKind":""},{"id":"image-mai-image-1-2025-10-13","date":"2025-10-13","name":"MAI-Image-1","org":"Microsoft AI","modality":"image","firstOfKind":"Erstes hauseigenes Bildgenerierungs-Modell von Microsoft AI."},{"id":"text-gemini-3-2025-11-18","date":"2025-11-18","name":"Gemini 3","org":"Google DeepMind","modality":"text","firstOfKind":""}]},"orgPolicy":{"onlyOpen":["DeepReinforce","Fish Audio","Genmo","Kyutai","Lightricks","Meituan","Mistral","Moonshot","NVIDIA","OpenMOSS","Sesame AI","Shanghai AI Laboratory","Shanghai Jiao Tong University","Significant Gravitas","StepFun","TII","Tencent","Thinking Machines Lab","Xiaomi","Zhipu","hexgrad","poolside"],"onlyClosed":["Adobe","Ant Group","Anthropic","Apple","Baidu","ByteDance","Cognition","ElevenLabs","Hume AI","Kuaishou","Luma AI","Midjourney","Pika Labs","Recraft","Sakana AI","TypeSafe AI","Udio","World Labs","fal","xAI"],"mixed":["Alibaba","Black Forest Labs","DeepSeek","Google","Ideogram","Meta","Microsoft","MiniMax","OpenAI","Runway","Stability AI","Suno"],"jointCredits":[{"org":"OpenMOSS / MOSI.AI / Shanghai Innovation Institute","lead":"OpenMOSS","alsoCredited":["MOSI.AI","Shanghai Innovation Institute"],"hidden":["MOSI.AI","Shanghai Innovation Institute"],"count":1},{"org":"RunwayML / Stability AI","lead":"Runway","alsoCredited":["Stability AI"],"hidden":[],"count":1},{"org":"Shanghai Jiao Tong University / Cambridge University","lead":"Shanghai Jiao Tong University","alsoCredited":["Cambridge University"],"hidden":["Cambridge University"],"count":1},{"org":"Stability AI / CompVis / RunwayML","lead":"Stability AI","alsoCredited":["CompVis","Runway"],"hidden":["CompVis"],"count":1}]},"count":89,"open":[{"id":"image-stable-diffusion-1-4-public-release-2022-08-22","date":"2022-08-22","datePrecision":"day","modality":"image","name":"Stable Diffusion 1.4 (public release)","org":"Stability AI / CompVis / RunwayML","firstOfKind":"Erstes breit verteiltes Open-Weights-Modell für Text-zu-Bild, das auf einer Consumer-GPU lauffähig ist","capability":"Erstes leistungsfähiges Open-Weights-Diffusionsmodell für Text-zu-Bild, das auf Consumer-GPUs läuft und 512×512-Bilder in Sekunden erzeugt","sources":["https://stability.ai/news-updates/stable-diffusion-public-release","https://en.wikipedia.org/wiki/Stable_Diffusion"]},{"id":"audio-whisper-large-v1-2022-09-21","date":"2022-09-21","datePrecision":"day","modality":"audio","name":"Whisper (large-v1)","org":"OpenAI","firstOfKind":"Erstes Open-Source-ASR-Modell, das die Qualität mehrsprachiger Transkription auf kommerziellem Niveau weitgehend erreicht","capability":"Mehrsprachige Open-Source-ASR, trainiert auf 680.000 Stunden Web-Audio, die über 99 Sprachen hinweg eine nahezu menschliche Transkriptionsqualität erreicht","sources":["https://openai.com/index/whisper/","https://techcrunch.com/2022/09/21/openai-open-sources-whisper-a-multilingual-speech-recognition-system/","https://arxiv.org/abs/2212.04356"]},{"id":"image-stable-diffusion-1-5-2022-10-20","date":"2022-10-20","datePrecision":"day","modality":"image","name":"Stable Diffusion 1.5","org":"RunwayML / Stability AI","firstOfKind":"","capability":"Verbesserte Bildqualität, bessere Ästhetik und höhere Prompt-Treue gegenüber SD 1.4 auf derselben 512×512-Architektur","sources":["https://huggingface.co/runwayml/stable-diffusion-v1-5","https://en.wikipedia.org/wiki/Stable_Diffusion"]},{"id":"image-stable-diffusion-2-0-2022-11-24","date":"2022-11-24","datePrecision":"day","modality":"image","name":"Stable Diffusion 2.0","org":"Stability AI","firstOfKind":"","capability":"Native Auflösung von 768×768, neuer OpenCLIP-Text-Encoder, Depth-to-Image-Pipeline und ein 4×-Upscaler-Modell","sources":["https://stability.ai/news-updates/stable-diffusion-v2-release","https://en.wikipedia.org/wiki/Stable_Diffusion"]},{"id":"audio-whisper-large-v2-2022-12-08","date":"2022-12-08","datePrecision":"day","modality":"audio","name":"Whisper large-v2","org":"OpenAI","firstOfKind":"","capability":"Verbessertes Whisper-Modell mit einer um etwa 10–15 % geringeren Wortfehlerrate, insbesondere bei verrauschten Aufnahmen, das 2,5-mal länger und mit Regularisierung trainiert wurde","sources":["https://github.com/openai/whisper/blob/main/model-card.md","https://huggingface.co/openai/whisper-large-v2"]},{"id":"text-llama-1-2023-02-24","date":"2023-02-24","datePrecision":"day","modality":"text","name":"LLaMA 1","org":"Meta","firstOfKind":"Erste offen verfügbare LLM-Familie, die mit den damaligen Modellen der GPT-3-Klasse konkurrenzfähig war","capability":"Hochwertiges, forschungstaugliches LLM (7B–65B), veröffentlicht mit offenen Gewichten unter einer nichtkommerziellen Lizenz","sources":["https://ai.meta.com/blog/large-language-model-llama-meta-ai/"]},{"id":"video-modelscope-text-to-video-2023-03-20","date":"2023-03-20","datePrecision":"day","modality":"video","name":"ModelScope Text-to-Video","org":"Alibaba DAMO Academy","firstOfKind":"Erstes breit zugängliches Open-Source-Modell für Text-zu-Video","capability":"Open-Weight-Diffusionsmodell mit 1,7 Mrd. Parametern für Text-zu-Video, das kurze Clips aus englischen Prompts erzeugt","sources":["https://huggingface.co/ali-vilab/modelscope-damo-text-to-video-synthesis","https://huggingface.co/ali-vilab/text-to-video-ms-1.7b"]},{"id":"text-autogpt-2023-03-30","date":"2023-03-30","datePrecision":"day","modality":"text","name":"AutoGPT","org":"Significant Gravitas","firstOfKind":"Erster viraler autonomer KI-Agent","capability":"Open-Source-Agent, der GPT-4-Aufrufe verkettet, um ein Ziel selbstständig mit Web- und Datei-Tools zu verfolgen.","sources":["https://github.com/Significant-Gravitas/AutoGPT"]},{"id":"audio-bark-2023-04-01","date":"2023-04-01","datePrecision":"month","modality":"audio","name":"Bark","org":"Suno AI","firstOfKind":"Erstes Open-Source-Modell, das ausdrucksstarke Sprache mit eingebetteten nonverbalen Lauten und Hintergrundgeräuschen in einem einzigen Durchgang erzeugt","capability":"Open-Source-TTS auf Transformer-Basis mit Zero-Shot-Voice-Cloning, nonverbalen Lautäußerungen (Lachen, Seufzen), Hintergrundmusik und Unterstützung für über 100 Sprachen","sources":["https://github.com/suno-ai/bark","https://huggingface.co/suno/bark"]},{"id":"audio-meta-musicgen-open-source-2023-06-08","date":"2023-06-08","datePrecision":"day","modality":"audio","name":"Meta MusicGen (open-source)","org":"Meta AI","firstOfKind":"Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie","capability":"Open-Source-Musikgenerierung mit Steuerung über Text und optionale Melodie-Referenz, verfügbar als Code und Modellgewichte; Gewichte unter CC-BY-NC 4.0","sources":["https://arxiv.org/abs/2306.05284","https://github.com/facebookresearch/audiocraft","https://musically.com/2023/06/12/metas-new-musicgen-ai-was-trained-on-20k-hours-of-licensed-music/"]},{"id":"text-llama-2-2023-07-18","date":"2023-07-18","datePrecision":"day","modality":"text","name":"Llama 2","org":"Meta","firstOfKind":"Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet","capability":"Open-Weight-LLM (7B–70B), das über eine Partnerschaft von Meta und Microsoft kostenlos für Forschung und kommerzielle Nutzung veröffentlicht wurde","sources":["https://about.fb.com/news/2023/07/llama-2/","https://ai.meta.com/blog/llama-2-updates-connect-2023/"]},{"id":"image-stable-diffusion-xl-1-0-sdxl-2023-07-26","date":"2023-07-26","datePrecision":"day","modality":"image","name":"Stable Diffusion XL 1.0 (SDXL)","org":"Stability AI","firstOfKind":"Erstes Open-Weights-Modell mit einer zweistufigen Pipeline aus Basismodell und Refiner bei nativer Auflösung von 1024 Pixeln","capability":"Pipeline aus einem Basismodell mit 3,5 Mrd. Parametern und einem Refiner mit 6,6 Mrd. Parametern, die nativ 1024×1024 erzeugt, mit verbessertem semantischem Verständnis, besserer Beleuchtung und vereinfachtem Prompting","sources":["https://stability.ai/news/stable-diffusion-sdxl-1-announcement","https://www.prnewswire.com/news-releases/stability-ai-announces-stable-diffusion-xl-1-0--featured-on-amazon-bedrock-301886507.html"]},{"id":"audio-meta-audiocraft-musicgen-audiogen-encodec-2023-08-02","date":"2023-08-02","datePrecision":"day","modality":"audio","name":"Meta AudioCraft (MusicGen + AudioGen + EnCodec)","org":"Meta AI","firstOfKind":"","capability":"Open-Source-Framework zur Audiogenerierung, das Text-zu-Musik (MusicGen), Text-zu-Soundeffekten (AudioGen) und einen verbesserten neuronalen Audio-Codec (EnCodec) in einer Bibliothek vereint","sources":["https://about.fb.com/news/2023/08/audiocraft-generative-ai-for-music-and-audio/","https://github.com/facebookresearch/audiocraft"]},{"id":"text-qwen-7b-2023-08-03","date":"2023-08-03","datePrecision":"day","modality":"text","name":"Qwen-7B","org":"Alibaba","firstOfKind":"","capability":"Erstes offenes Modell der Qwen-Familie von Alibaba.","sources":["https://github.com/QwenLM/Qwen"]},{"id":"audio-seamless-m4t-2023-08-22","date":"2023-08-22","datePrecision":"day","modality":"audio","name":"Meta SeamlessM4T","org":"Meta","firstOfKind":"Erstes einheitliches multimodales und mehrsprachiges Sprachübersetzungsmodell","capability":"Ein einziges multimodales Modell für Sprach- und Text-Übersetzung/Transkription über rund 100 Sprachen (ASR, Sprache-zu-Text, Sprache-zu-Sprache, Text-zu-Sprache, Text-zu-Text).","sources":["https://ai.meta.com/blog/seamless-m4t/"]},{"id":"text-falcon-180b-2023-09-06","date":"2023-09-06","datePrecision":"day","modality":"text","name":"Falcon 180B","org":"TII","firstOfKind":"","capability":"180B-Parameter-Modell auf 3,5 Billionen Tokens; bei Veröffentlichung das größte offen verfügbare LLM.","sources":["https://huggingface.co/blog/falcon-180b"]},{"id":"text-mistral-7b-2023-09-27","date":"2023-09-27","datePrecision":"day","modality":"text","name":"Mistral 7B","org":"Mistral AI","firstOfKind":"Erstes Open-Weights-Modell mit 7B, das ein 13B-Modell auf ganzer Linie in Standard-Benchmarks schlägt","capability":"Modell mit 7,3 Mrd. Parametern, das Llama 2 13B in allen Benchmarks und Llama 1 34B in vielen übertrifft – mittels Sliding-Window-Attention","sources":["https://mistral.ai/news/announcing-mistral-7b/"]},{"id":"video-stable-video-diffusion-svd-2023-11-21","date":"2023-11-21","datePrecision":"day","modality":"video","name":"Stable Video Diffusion (SVD)","org":"Stability AI","firstOfKind":"Erstes breit veröffentlichtes Open-Weights-Diffusionsmodell für Image-to-Video","capability":"Open-Weights-Modell für Image-to-Video, das aus einem einzelnen Referenzbild 14–25 Frames bei 3–30 fps erzeugt","sources":["https://stability.ai/news-updates/stable-video-diffusion-open-ai-video-model","https://venturebeat.com/ai/stability-ai-debuts-stable-video-diffusion-models-in-research-preview"]},{"id":"text-mixtral-8x7b-2023-12-11","date":"2023-12-11","datePrecision":"day","modality":"text","name":"Mixtral 8x7B","org":"Mistral AI","firstOfKind":"Erstes Open-Weights-Sparse-MoE-Modell dieser Größenordnung, das die Leistung von GPT-3.5 erreicht","capability":"Sparse-Mixture-of-Experts-Modell mit 46,7 Mrd. Parametern insgesamt, aber nur 12,9 Mrd. aktiven pro Token, das GPT-3.5 in Benchmarks erreicht – bei sechsmal schnellerer Inferenz als Llama 2 70B","sources":["https://mistral.ai/news/mixtral-of-experts/"]},{"id":"text-google-gemma-2024-02-21","date":"2024-02-21","datePrecision":"day","modality":"text","name":"Google Gemma","org":"Google","firstOfKind":"Googles erstes offenes Sprachmodell","capability":"Googles erste offene LLM-Familie (2B/7B), abgeleitet aus der Gemini-Forschung, mit offenen Gewichten zur freien und kommerziellen Nutzung.","sources":["https://blog.google/technology/developers/gemma-open-models/"]},{"id":"text-llama-3-8b-70b-2024-04-18","date":"2024-04-18","datePrecision":"day","modality":"text","name":"Llama 3 (8B / 70B)","org":"Meta","firstOfKind":"","capability":"Beste quelloffene 8B- und 70B-Modelle bei Erscheinen, mit 128K Kontext und verbessertem Reasoning, Coding und Befolgen von Anweisungen","sources":["https://ai.meta.com/blog/meta-llama-3/"]},{"id":"text-phi-3-mini-2024-04-23","date":"2024-04-23","datePrecision":"day","modality":"text","name":"Microsoft Phi-3 (Phi-3-mini)","org":"Microsoft","firstOfKind":"Wegweisendes SLM-auf-dem-Gerät","capability":"3,8-Mrd.-Parameter-Open-SLM, das die Leistung deutlich größerer Modelle erreicht und lokal auf einem Smartphone läuft.","sources":["https://azure.microsoft.com/en-us/blog/introducing-phi-3-redefining-whats-possible-with-slms/"]},{"id":"audio-stability-stable-audio-open-2024-06-05","date":"2024-06-05","datePrecision":"day","modality":"audio","name":"Stability Stable Audio Open","org":"Stability AI","firstOfKind":"","capability":"Open-Weights-Diffusionsmodell für Text-to-Audio zur Erzeugung von bis zu 47 Sekunden an Soundeffekten und Samples, verfügbar für die nichtkommerzielle Nutzung","sources":["https://stability.ai/news-updates/introducing-stable-audio-open","https://x.com/StabilityAI/status/1798399596848381981"]},{"id":"image-stable-diffusion-3-medium-open-weights-2024-06-12","date":"2024-06-12","datePrecision":"day","modality":"image","name":"Stable Diffusion 3 Medium (open weights)","org":"Stability AI","firstOfKind":"Erstes Open-Weights-Modell, das die Architektur eines Multimodal Diffusion Transformer (MMDiT) für die Text-to-Image-Generierung nutzt","capability":"Architektur eines Multimodal Diffusion Transformer (MMDiT) mit 2 Mrd. Parametern, mit verbesserter Typografie, besserer Anatomie und Textkonditionierung über T5-XXL","sources":["https://stability.ai/news/stable-diffusion-3","https://x.com/StabilityAI/status/1797462536117444794"]},{"id":"audio-kyutai-moshi-2024-07-03","date":"2024-07-03","datePrecision":"day","modality":"audio","name":"Kyutai Moshi","org":"Kyutai","firstOfKind":"Erstes Echtzeit-Voll-Duplex-Sprachdialog-Foundation-Model","capability":"Voll-duplexes Echtzeit-Sprache-zu-Sprache-Dialogmodell (rund 200 ms Latenz) mit dem Mimi-Neural-Codec — hört und spricht gleichzeitig, ohne starres Abwechseln.","sources":["https://github.com/kyutai-labs/moshi","https://arxiv.org/abs/2410.00037"]},{"id":"text-llama-3-1-405b-2024-07-23","date":"2024-07-23","datePrecision":"day","modality":"text","name":"Llama 3.1 405B","org":"Meta","firstOfKind":"Erstes Open-Weights-Modell mit über 400B Parametern, das mit geschlossenen Frontier-Modellen konkurrenzfähig ist","capability":"Open-Weights-Modell mit 405B Parametern und 128K Kontext, das GPT-4o und Claude 3.5 Sonnet in zentralen Evaluierungen erreicht, mit einer destillationsfreundlichen Lizenz","sources":["https://ai.meta.com/blog/meta-llama-3-1/"]},{"id":"image-flux-1-pro-dev-schnell-2024-08-01","date":"2024-08-01","datePrecision":"day","modality":"image","name":"FLUX.1 (pro / dev / schnell)","org":"Black Forest Labs","firstOfKind":"Erstes Apache-lizenziertes Modell, das Bildqualität auf Frontier-Niveau erreicht (FLUX.1[schnell])","capability":"Modellreihe mit 12B Parametern auf Basis von Flow Matching: FLUX.1[schnell] (Apache 2.0, 10× schneller dank Destillation), FLUX.1[dev] (Open Weights, nicht kommerziell), FLUX.1[pro] (geschlossene API), allesamt auf dem Qualitätsniveau von Midjourney v6","sources":["https://bfl.ai/announcements","https://venturebeat.com/ai/stable-diffusion-creators-launch-black-forest-labs-secure-31m-for-flux-1-ai-image-generator"]},{"id":"text-qwen2-5-2024-09-19","date":"2024-09-19","datePrecision":"day","modality":"text","name":"Qwen2.5","org":"Alibaba","firstOfKind":"","capability":"Volle 0,5B–72B-Familie mit starkem Coding/Mathe; eines der größten Open-Source-Releases.","sources":["https://qwenlm.github.io/blog/qwen2.5/"]},{"id":"text-llama-3-2-vision-edge-2024-09-25","date":"2024-09-25","datePrecision":"day","modality":"text","name":"Llama 3.2 (Vision + Edge)","org":"Meta","firstOfKind":"","capability":"Metas erste offene multimodale Modelle (11B/90B Vision) plus 1B/3B-Textmodelle für Mobil/Edge.","sources":["https://ai.meta.com/blog/llama-3-2-connect-2024-vision-edge-mobile-devices/"]},{"id":"audio-f5-tts-2024-10-09","date":"2024-10-09","datePrecision":"day","modality":"audio","name":"F5-TTS","org":"Shanghai Jiao Tong University / Cambridge University","firstOfKind":"Erste Architektur aus Diffusion-Transformer mit Flow Matching, die auf Zero-Shot-TTS angewendet wird und autoregressive Qualität erreicht oder übertrifft","capability":"TTS auf Basis eines Diffusion-Transformers mit Flow Matching, das Zero-Shot-Voice-Cloning mit hoher Natürlichkeit aus kurzem Referenzaudio erreicht und Chinesisch sowie Englisch unterstützt","sources":["https://arxiv.org/abs/2410.06885","https://github.com/SWivid/F5-TTS"]},{"id":"image-stable-diffusion-3-5-large-2024-10-22","date":"2024-10-22","datePrecision":"day","modality":"image","name":"Stable Diffusion 3.5 Large","org":"Stability AI","firstOfKind":"Erstes Open-Weights-Bildgenerierungsmodell mit über 8B Parametern, das unter einer freizügigen kommerziellen Lizenz veröffentlicht wurde","capability":"MMDiT-X-Modell mit 8,1B Parametern und drei parallelen Text-Encodern (OpenCLIP, CLIP, T5-XXL), mit einer freizügigen kommerziellen Lizenz für bis zu 1 Mio. US-Dollar Jahresumsatz, lauffähig auf Consumer-Hardware","sources":["https://stability.ai/news-updates/introducing-stable-diffusion-3-5","https://siliconangle.com/2024/10/22/stable-ai-releases-next-gen-open-source-stable-diffusion-3-5-text-image-ai-model-family/"]},{"id":"video-genmo-mochi-1-2024-10-22","date":"2024-10-22","datePrecision":"day","modality":"video","name":"Genmo Mochi 1","org":"Genmo","firstOfKind":"Größtes Open-Source-Text-zu-Video-Modell zum Zeitpunkt der Veröffentlichung (10B Parameter, Apache 2.0)","capability":"Text-zu-Video-Modell mit 10B Parametern unter Apache 2.0, das 480p-Clips bei 30 fps mit hoher Bewegungsqualität und Prompt-Treue erzeugt","sources":["https://siliconangle.com/2024/10/22/genmo-introduces-mochi-1-open-source-text-video-generation-model/","https://github.com/genmoai/mochi","https://www.genmo.ai/blog/mochi-1-a-new-sota-in-open-text-to-video"]},{"id":"video-lightricks-ltx-video-ltxv-2024-11-22","date":"2024-11-22","datePrecision":"day","modality":"video","name":"Lightricks LTX-Video (LTXV)","org":"Lightricks","firstOfKind":"Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)","capability":"DiT-basiertes Text-zu-Video-Modell mit 2B Parametern, das 5 Sekunden Video in 768×512 schneller als in Echtzeit erzeugt (4 s Generierung für einen 5-Sekunden-Clip)","sources":["https://github.com/Lightricks/LTX-Video","https://comfyui-wiki.com/en/news/2024-11-23-ltx-video-release","https://dataconomy.com/2024/11/26/lightricks-launches-open-source-ai-model-for-faster-video-generation/"]},{"id":"video-tencent-hunyuanvideo-2024-12-03","date":"2024-12-03","datePrecision":"day","modality":"video","name":"Tencent HunyuanVideo","org":"Tencent","firstOfKind":"Größtes Open-Source-Videogenerierungsmodell zum Zeitpunkt der Veröffentlichung (13B Parameter), erstes offenes Modell, das die kommerzielle Frontier-Qualität erreicht","capability":"Transformer mit 13B Parametern, der von Dual-Stream auf Single-Stream umschaltet, für detailgetreue Text-zu-Video-Generierung mit vollständig offenen Gewichten","sources":["https://github.com/Tencent-Hunyuan/HunyuanVideo","https://technode.com/2024/12/04/tencent-launches-and-open-sources-hunyuan-video-generation-model/"]},{"id":"audio-kokoro-82m-v0-19-2024-12-25","date":"2024-12-25","datePrecision":"day","modality":"audio","name":"Kokoro-82M v0.19","org":"hexgrad (independent)","firstOfKind":"Erstes Modell mit unter 100M Parametern, das Platz 1 auf einem öffentlichen TTS-Qualitäts-Leaderboard erreicht","capability":"Apache-lizenziertes TTS-Modell mit 82M Parametern, das bei seinem Start Platz 1 in der Hugging Face TTS Arena belegte und natürliche englische Sprache für unter 1 US-Dollar pro Million Zeichen erzeugt","sources":["https://huggingface.co/hexgrad/Kokoro-82M"]},{"id":"text-deepseek-v3-2024-12-26","date":"2024-12-26","datePrecision":"day","modality":"text","name":"DeepSeek-V3","org":"DeepSeek","firstOfKind":"Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht","capability":"Open-Weights-Modell mit 671B Parametern als sparses MoE, das GPT-4o und Claude 3.5 Sonnet bei Benchmarks erreicht und für nur 5,6 Mio. US-Dollar an Rechenleistung trainiert wurde","sources":["https://arxiv.org/abs/2412.19437"]},{"id":"text-deepseek-r1-2025-01-20","date":"2025-01-20","datePrecision":"day","modality":"text","name":"DeepSeek-R1","org":"DeepSeek","firstOfKind":"Erstes Open-Weights-Reasoning-Modell, das die Leistung auf o1-Niveau erreicht, unter MIT-Lizenz","capability":"Offenes, MIT-lizenziertes Reasoning-Modell, das mit Reinforcement Learning nahezu von Grund auf (mit minimalen überwachten Daten) trainiert wurde und OpenAI o1 bei Mathematik-, Coding- und Wissenschafts-Benchmarks erreicht","sources":["https://github.com/deepseek-ai/DeepSeek-R1","https://arxiv.org/abs/2501.12948"]},{"id":"audio-kokoro-tts-v1-0-2025-01-27","date":"2025-01-27","datePrecision":"day","modality":"audio","name":"Kokoro TTS v1.0","org":"hexgrad (independent)","firstOfKind":"","capability":"Erweiterte Version von Kokoro mit Unterstützung für 8 Sprachen (Englisch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Mandarin, Portugiesisch) und 54 Stimmen unter Apache 2.0","sources":["https://huggingface.co/hexgrad/Kokoro-82M"]},{"id":"video-alibaba-wan-2-1-2025-02-25","date":"2025-02-25","datePrecision":"day","modality":"video","name":"Alibaba Wan 2.1","org":"Alibaba (Wan Team)","firstOfKind":"Erstes Open-Source-Modell, das die VBench-Bestenliste für Videoqualität anführte und alle geschlossenen Modelle übertraf","capability":"Apache-2.0-Suite von Modellen zur Videogenerierung (bis zu 14 Mrd. Parameter) für Text-zu-Video, Bild-zu-Video sowie Interpolation des ersten/letzten Frames in 720p","sources":["https://www.alibabacloud.com/blog/alibaba-unveils-its-latest-open-source-video-generation-model_602167","https://github.com/Wan-Video/Wan2.1","https://comfyui-wiki.com/en/news/2025-02-25-alibaba-wanx-2-1-video-model-open-source"]},{"id":"audio-sesame-csm-conversational-speech-model-demo-2025-02-27","date":"2025-02-27","datePrecision":"day","modality":"audio","name":"Sesame CSM (conversational speech model) demo","org":"Sesame AI","firstOfKind":"Erstes Open-Source-Modell, das explizit auf den psychologischen Benchmark der 'Voice Presence' für dialogorientierte KI abzielt","capability":"Modell zur dialogorientierten Sprachgenerierung, das kontextbewusste, emotional ausdrucksstarke Dialoge mit menschenähnlicher Prosodie und Mehrsprecher-Handhabung erzeugt","sources":["https://www.sesame.com/research/crossing_the_uncanny_valley_of_voice","https://github.com/SesameAILabs/csm"]},{"id":"text-llama-4-scout-maverick-2025-04-05","date":"2025-04-05","datePrecision":"day","modality":"text","name":"Llama 4 (Scout / Maverick)","org":"Meta","firstOfKind":"Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens","capability":"Nativ multimodale offene MoE-Modelle; Scout bietet ein Kontextfenster von 10 Mio. Tokens (das mit INT4-Quantisierung auf eine einzige H100 passt), Maverick nutzt 128 Experten","sources":["https://ai.meta.com/blog/llama-4-multimodal-intelligence/"]},{"id":"text-alibaba-qwen3-2025-04-29","date":"2025-04-29","datePrecision":"day","modality":"text","name":"Alibaba Qwen3","org":"Alibaba","firstOfKind":"","capability":"Open-Weights-Familie (0,6B–235B MoE) mit umschaltbarem „Thinking/Non-Thinking\"-Reasoning.","sources":["https://qwenlm.github.io/blog/qwen3/"]},{"id":"image-flux-1-kontext-dev-open-weights-2025-06-26","date":"2025-06-26","datePrecision":"day","modality":"image","name":"FLUX.1 Kontext [dev] (open weights)","org":"Black Forest Labs","firstOfKind":"Erstes Open-Weights-Modell, das die Leistung proprietärer Modelle bei der iterativen, kontextbewussten Bildbearbeitung erreichte","capability":"Open-Weights-Modell mit 12 Mrd. Parametern zur kontextbezogenen Bildbearbeitung mit Figurenbeibehaltung, lokalen und globalen Bearbeitungen, kompatibel mit ComfyUI und HuggingFace Diffusers","sources":["https://bfl.ai/blog/flux-1-kontext-dev","https://huggingface.co/black-forest-labs/FLUX.1-Kontext-dev"]},{"id":"video-ltx-2-2026-01-06","date":"2026-01-06","datePrecision":"day","modality":"video","name":"LTX-2","org":"Lightricks","firstOfKind":"Erstes produktionsreifes Open-Weights-Modell, das Video und Audio synchron in einem Durchgang mit nativem 4K und offenem Trainingscode generiert.","capability":"LTX-2 erzeugt synchronisiertes Video und Audio in einem einzigen Durchgang mit nativer 4K-Auflösung bei 50 Bildern pro Sekunde und bis zu 20 Sekunden Länge, inklusive ausdrucksstarkem Ton, akkuratem Lip-Sync und Umgebungsgeräuschen. Das Modell (14B Video- plus 5B Audio-Parameter) läuft auf Consumer-GPUs.","sources":["https://www.globenewswire.com/news-release/2026/01/06/3213304/0/en/Lightricks-Open-Sources-LTX-2-the-First-Production-Ready-Audio-and-Video-Generation-Model-With-Truly-Open-Weights.html"]},{"id":"image-flux-2-klein-2026-01-15","date":"2026-01-15","datePrecision":"day","modality":"image","name":"FLUX.2 [klein]","org":"Black Forest Labs","firstOfKind":"","capability":"Kompakte Open-Weights-Modellfamilie (4B und 9B), die Bildgenerierung und -Editing in einer Architektur vereint und Text-to-Image, Single-Reference-Editing sowie Multi-Reference-Generierung in unter einer Sekunde auf Consumer-Hardware (ab ca. 13 GB VRAM) liefert.","sources":["https://bfl.ai/blog/flux2-klein-towards-interactive-visual-intelligence","https://huggingface.co/black-forest-labs/FLUX.2-klein-4B"]},{"id":"image-hunyuanimage-3-0-instruct-2026-01-26","date":"2026-01-26","datePrecision":"day","modality":"image","name":"HunyuanImage 3.0-Instruct","org":"Tencent","firstOfKind":"","capability":"Natives multimodales Open-Weights-Modell (80B MoE, ca. 13B aktive Parameter) mit Fokus auf praezisem, instruktionsgesteuertem Image-Editing: Reasoning-gestuetztes Prompt-Enhancement, Image-to-Image, Multi-Image-Fusion (bis zu 3 Eingabebilder) und Chain-of-Thought.","sources":["https://github.com/Tencent-Hunyuan/HunyuanImage-3.0"]},{"id":"text-kimi-k2-5-2026-01-27","date":"2026-01-27","datePrecision":"day","modality":"text","name":"Kimi K2.5","org":"Moonshot AI","firstOfKind":"","capability":"Nativ multimodales, agentisches Open-Weights-Modell mit einer 1-Billion-Parameter-Mixture-of-Experts-Architektur (etwa 32 Mrd. aktive Parameter), das auf rund 15 Billionen gemischten Bild- und Text-Tokens trainiert wurde. Es versteht Text, Bilder und Video und bringt einen Agent-Swarm mit, der komplexe Aufgaben auf bis zu 100 parallele Sub-Agents aufteilt.","sources":["https://techcrunch.com/2026/01/27/chinas-moonshot-releases-a-new-open-source-model-kimi-k2-5-and-a-coding-agent/","https://siliconangle.com/2026/01/27/moonshot-ai-releases-open-source-kimi-k2-5-model-1t-parameters/"]},{"id":"text-glm-5-2026-02-11","date":"2026-02-11","datePrecision":"day","modality":"text","name":"GLM-5","org":"Zhipu AI (Z.ai)","firstOfKind":"Erstes Frontier-Open-Weights-Modell einer börsennotierten Foundation-Model-Firma (Zhipu/Z.ai).","capability":"Open-Weights-MoE-Frontier-Modell mit 744B Total-Parametern (rund 40-44B aktiv), 200K-Kontextfenster und DeepSeek-Sparse-Attention, ausgelegt auf agentische Engineering- und langlaufende Coding-Workflows. Erreichte 77,8 % auf SWE-bench Verified und 92,7 % auf AIME 2026.","sources":["https://huggingface.co/blog/mlabonne/glm-5","https://www.scmp.com/tech/article/3343239/chinas-zhipu-ai-launches-new-major-model-glm-5-challenge-its-rivals"]},{"id":"audio-fish-audio-s2-2026-03-09","date":"2026-03-09","datePrecision":"day","modality":"audio","name":"Fish Audio S2","org":"Fish Audio","firstOfKind":"","capability":"Open-Weights-TTS-Modell mit Dual-AR-Architektur (rund 4B Parameter auf der Zeitachse, 400M auf der Tiefenachse), trainiert auf ueber 10 Millionen Stunden Audio in etwa 50 Sprachen. Erlaubt feinkoernige Inline-Steuerung von Prosodie und Emotion ueber natuerlichsprachliche Tags wie [laugh], [whispers] oder [super happy]. Veroeffentlicht mit Model-Weights, Fine-Tuning-Code und einer SGLang-basierten Streaming-Inferenz-Engine.","sources":["https://fish.audio/blog/fish-audio-open-sources-s2/"]},{"id":"text-glm-5-1-2026-04-07","date":"2026-04-07","datePrecision":"day","modality":"text","name":"GLM-5.1","org":"Zhipu / Z.ai","firstOfKind":"Erstes Open-Weights-Modell an der Spitze von SWE-Bench Pro","capability":"754B-Parameter-MoE; erstes Open-Source-Modell auf Platz 1 von SWE-Bench Pro (58,4%), vor Claude Opus 4.6.","sources":["https://huggingface.co/zai-org/GLM-5"]},{"id":"audio-moss-audio-2026-04-13","date":"2026-04-13","datePrecision":"day","modality":"audio","name":"MOSS-Audio","org":"OpenMOSS / MOSI.AI / Shanghai Innovation Institute","firstOfKind":"Eines der ersten Open-Weights-Foundation-Modelle, das Verstehen von Sprache, Umgebungsklang und Musik samt zeitbewusstem Reasoning in einem Modell vereint.","capability":"Open-Source-Foundation-Modell fuer einheitliches Audio-Verstehen ueber komplexe reale Audioszenen hinweg: Sprachverstehen, Umgebungsgeraeusche, Musikverstehen, Audio-Captioning, zeitbewusstes Question-Answering und mehrstufiges Reasoning. Veroeffentlicht in vier Varianten (4B und 8B, jeweils als Instruct und Thinking) mit Audio-Encoder plus Qwen3-Backbone; Weights auf Hugging Face und Code auf GitHub.","sources":["https://github.com/OpenMOSS/MOSS-Audio","https://openmoss.ai/MOSS-Audio/"]},{"id":"text-kimi-k2-6-2026-04-20","date":"2026-04-20","datePrecision":"day","modality":"text","name":"Kimi K2.6","org":"Moonshot AI","firstOfKind":"","capability":"Open-Weights-Modell auf 1-Billion-Parameter-MoE-Basis (32 Mrd. aktive Parameter), spezialisiert auf agentisches Coding und Langzeit-Aufgaben. Es kann laut Moonshot bis zu rund 13 Stunden durchgehend coden und bringt ein Agent-Swarm-System mit bis zu 300 spezialisierten Sub-Agents und bis zu 4.000 koordinierten Schritten pro Lauf.","sources":["https://www.yicaiglobal.com/news/chinas-moonshot-ai-releases-kimi-k26-pushing-boundaries-in-coding-multi-agent-capabilities"]},{"id":"text-deepseek-v4-preview-2026-04-24","date":"2026-04-24","datePrecision":"day","modality":"text","name":"DeepSeek V4 (Preview)","org":"DeepSeek","firstOfKind":"","capability":"Open-Weights-Flaggschiff in zwei Varianten: V4-Pro (1,6 Bio. Parameter total, 49 Mrd. aktiv) und V4-Flash (284 Mrd. total, 13 Mrd. aktiv), beide standardmäßig mit 1-Mio.-Token-Kontext und neuartigen Attention-Mechanismen. V4-Pro bietet verbesserte agentische Fähigkeiten und Reasoning der Spitzenklasse in Mathematik, STEM und Coding.","sources":["https://api-docs.deepseek.com/news/news260424"]},{"id":"text-mistral-medium-3-5-2026-04-28","date":"2026-04-28","datePrecision":"day","modality":"text","name":"Mistral Medium 3.5","org":"Mistral AI","firstOfKind":"","capability":"Frontier-multimodales Modell mit einstellbarem reasoning_effort und 256k Kontext; neuer Standard für Le Chat.","sources":["https://docs.mistral.ai/models/model-cards/mistral-medium-3-5-26-04"]},{"id":"audio-stable-audio-3-0-2026-05-20","date":"2026-05-20","datePrecision":"day","modality":"audio","name":"Stable Audio 3.0","org":"Stability AI","firstOfKind":"","capability":"Modellfamilie zur Audiogenerierung aus vier Modellen: Small SFX, Small, Medium und Large. Erzeugt vollstaendige Kompositionen von bis zu rund sechs Minuten mit erhaltener musikalischer Struktur, mit Variable-Length-Generierung, Audio-Inpainting (Segment-Editing und Fortsetzung) sowie LoRA-Fine-Tuning. Trainiert ausschliesslich auf lizenzierten und Creative-Commons-Daten.","sources":["https://stability.ai/news-updates/meet-stable-audio-3-the-model-family-built-for-artistic-experimentation-with-open-weight-models","https://techcrunch.com/2026/05/20/stability-ai-release-a-new-audio-model-that-can-create-six-minute-songs/"]},{"id":"text-hy-mt2-2026-05-21","date":"2026-05-21","datePrecision":"day","modality":"text","name":"Hy-MT2 (1,8B / 7B / 30B-A3B)","org":"Tencent (Hunyuan)","firstOfKind":"","capability":"Drei Übersetzungsmodelle unter Apache 2.0, ausdrücklich als „fast thinking“ ausgelegt: kein Denkblock, das Modell antwortet direkt. Zwei dichte Modelle (Architektur HunYuanDenseV1, je 32 Schichten, verborgene Dimension 2048 bzw. 4096, FFN-Zwischendimension 6144 bzw. 14.336, 16 bzw. 32 Abfrage- und 4 bzw. 8 KV-Köpfe bei Kopfdimension 128, QK-Norm, geteilte Ein- und Ausgabe-Embeddings, Vokabular 120.818 bzw. 128.167) und ein MoE-Modell (HYV3, 48 Schichten, 128 Experten plus ein geteilter, acht aktive pro Token, Expertendimension 768, verborgene Dimension 2048, 32 Abfrage- und 4 KV-Köpfe, Sigmoid-Router mit Expertenbias und Skalierungsfaktor 2,826, erste Schicht dicht mit FFN-Dimension 6912, rope_theta 11.158.840); Kontextfenster laut config.json in allen drei Fällen 262.144 Token, empfohlene Ausgabelänge 4096. Übersetzt zwischen 33 Sprachen, die Sprachtabelle führt zusätzlich Tibetisch, Kasachisch, Mongolisch, Uigurisch und Kantonesisch. Die Trainingskette ist der eigentliche Beitrag: Auf ein MT-orientiertes Mid-Training mit rund 1 Bio. Token Übersetzungsdaten folgt „Family-Centric Post-training“ — die Daten werden nicht gemischt, sondern nach Sprachfamilien getrennt (westeuropäisch, ostasiatisch, rechtsläufig-nahöstlich), und je Familie entsteht ein eigener Lehrer. Dessen Signal kommt ohne ein größeres Modell zustande: Der „Chimera Teacher“ trainiert nichts Neues, sondern verschmilzt Kandidatenübersetzungen mehrerer bestehender Hy-Modelle mit dem Datensatz-Label zu einem Referenzsatz und bewertet daran die Ausgabe des Schülers (Forward-KL, implementiert auf Hy3-Preview). Danach GRPO je Familie mit zweistufiger Belohnung — ein Regelfilter setzt Wiederholungsschleifen und Sprachmischungen sofort auf 0, erst dann urteilt ein LLM nach der MQM-Fehlertypologie über fünf Dimensionen (Terminologie, Genauigkeit, sprachliche Konventionen, Stil, Instruktionsbefolgung) —, zum Schluss Cross-family OPD, das alle Familienlehrer plus einen Hy-Instruct-Lehrer für allgemeine Anweisungen über Reverse-KL in ein einziges Modell destilliert. Selbstberichtete Werte als XCOMET-XXL / CometKiwi / GEMBA (×100), FLORES-200 über alle 1.056 Richtungen: 1,8B 79,77 / 73,41 / 78,64, 7B 86,89 / 76,03 / 87,23, 30B-A3B 87,47 / 76,34 / 88,79 (Vorgänger HY-MT1.5-7B: 80,98 / 73,36 / 78,30). WMT25: 7B 63,86 / 71,21 / 82,24, 30B-A3B 62,89 / 71,08 / 84,34 — bei GEMBA der beste Wert des Vergleichsfeldes, über Gemini 3.1 Pro und GPT-5.5. Mandarin⇔Minderheitensprachen 62,05 und 62,44 XCOMET-XXL. Auf den hauseigenen Sets DomainMTBench (Durchschnitt XCOMET / GEMBA) 30B-A3B 95,04 / 93,73, 7B 94,92 / 92,79, 1,8B 93,41 / 91,08; WildMTBench 7B 90,28 / 88,93, 30B-A3B 89,87 / 89,25; IFMTBench (Gesamt) 84,69, 83,14 und 69,36. Quantisierung als eigene Trainingsstufe, nicht als Nachbearbeitung: FP8, Q4_K_M, 2 Bit und 1,25 Bit, letztere beiden per QAT mit Distillation, die 1,25-Bit-Fassung als ternäre Darstellung mit feingranularer Sparsifizierung (Verfahren „Sherry“, Werkzeugkasten AngelSlim). Das 1,8B-Modell schrumpft damit auf rund 440 MB.","sources":["https://huggingface.co/tencent/Hy-MT2-30B-A3B","https://huggingface.co/tencent/Hy-MT2-1.8B","https://github.com/Tencent-Hunyuan/Hy-MT2","https://arxiv.org/abs/2605.22064"]},{"id":"text-step-3-7-flash-2026-05-29","date":"2026-05-29","datePrecision":"day","modality":"text","name":"Step 3.7 Flash","org":"StepFun","firstOfKind":"","capability":"Vision-Language-MoE-Modell mit 198B Total-Parametern (rund 11B aktiv), das einen 1,8B-Vision-Encoder mit einem 196B-Sprach-Backbone koppelt und Charts, PDFs, UI-Wireframes und App-GUIs ohne separate Vision-API verarbeitet. Ausgelegt auf Coding-Agenten und Such-Workflows.","sources":["https://www.marktechpost.com/2026/05/29/stepfun-releases-step-3-7-flash-a-198b-moe-vision-language-model-for-coding-agents-and-search-workflows/","https://www.digitalapplied.com/blog/stepfun-step-3-7-flash-196b-moe-agentic-vision-release"]},{"id":"text-minimax-m3-2026-06-01","date":"2026-06-01","datePrecision":"day","modality":"text","name":"MiniMax M3","org":"MiniMax","firstOfKind":"Laut MiniMax erstes Open-Weights-Modell, das Frontier-Coding, 1M-Kontext und native Multimodalität in einer einzigen Architektur kombiniert.","capability":"Nativ multimodales Open-Weights-Modell mit der neuen MSA-Architektur (MiniMax Sparse Attention), 1M-Kontextfenster, Bild- und Video-Input sowie Computer-Use, das Frontier-Coding (SWE-Bench Pro 59,0 %) mit langlaufender autonomer Ausführung über 24+ Stunden verbindet.","sources":["https://www.minimax.io/blog/minimax-m3","https://www.marktechpost.com/2026/06/01/minimax-releases-minimax-m3-with-msa-architecture-supporting-1m-token-context-native-multimodality-and-agentic-coding/"]},{"id":"image-ideogram-4-0-2026-06-03","date":"2026-06-03","datePrecision":"day","modality":"image","name":"Ideogram 4.0","org":"Ideogram","firstOfKind":"Erstes Open-Weights-Modell von Ideogram, das seine Spitzentechnologie fuer Design- und Text-Rendering oeffentlich freigab.","capability":"Erstes Open-Weights-Foundation-Modell von Ideogram (9.3B, Single-Stream-Diffusion-Transformer mit 34 Layern und Qwen3-VL-8B-Instruct als Text-Encoder), spezialisiert auf Design-Arbeit: branchenfuehrendes Text-Rendering (0.97 X-Omni English OCR), Bounding-Box-Layout-Kontrolle, strukturiertes JSON-Prompting, native Transparenz und 2K-Aufloesung; laeuft mit Quantisierung auf einer einzelnen 24-GB-GPU.","sources":["https://ideogram.ai/news/ideogram-4.0/","https://ideogram.ai/blog/ideogram-4.0/"]},{"id":"text-diffusiongemma-26b-a4b-2026-06-10","date":"2026-06-10","datePrecision":"day","modality":"text","name":"DiffusionGemma 26B-A4B","org":"Google DeepMind","firstOfKind":"Erstes großes Open-Weights-Text-Diffusionsmodell von Google, das Text in parallelen Blöcken statt autoregressiv Token für Token erzeugt.","capability":"Experimentelles offenes Text-Diffusion-Modell auf Gemma-4-Basis mit 26B MoE-Parametern (rund 3,8B aktiv), das 256-Token-Blöcke parallel statt sequenziell generiert und so bis zu 4x schnellere Textgenerierung erreicht (über 1.000 Tokens/s auf einer einzelnen H100).","sources":["https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/","https://www.marktechpost.com/2026/06/10/google-ai-releases-diffusiongemma-a-26b-moe-open-model-using-text-diffusion-for-up-to-4x-faster-generation/"]},{"id":"text-kimi-k2-7-code-2026-06-12","date":"2026-06-12","datePrecision":"day","modality":"text","name":"Kimi K2.7 Code","org":"Moonshot AI","firstOfKind":"","capability":"Coding-fokussiertes agentisches MoE-Modell mit 1T Total-Parametern (32B aktiv, 384 Experts) und 256K-Kontextfenster, das mehrstufig plant, editiert, Tools ausführt und debuggt. Reduziert die Zahl der Thinking-Tokens gegenüber K2.6 um rund 30 Prozent.","sources":["https://huggingface.co/moonshotai/Kimi-K2.7-Code","https://www.marktechpost.com/2026/06/12/moonshot-ai-releases-kimi-k2-7-code-a-coding-model-reporting-21-8-on-kimi-code-bench-v2-over-k2-6/"]},{"id":"text-glm-5-2-2026-06-13","date":"2026-06-13","datePrecision":"day","modality":"text","name":"GLM-5.2","org":"Zhipu AI (Z.ai)","firstOfKind":"","capability":"Agentisch ausgerichtetes Coding-Modell auf Basis derselben 744B-MoE-Architektur wie GLM-5, mit einem nutzbaren Kontextfenster von 1M Tokens, bis zu 131.072 Output-Tokens und einem neuen System mit zwei Reasoning-Stufen (High und Max).","sources":["https://www.digitalapplied.com/blog/glm-5-2-zai-flagship-coding-plan-release","https://aitoolly.com/ai-news/article/2026-06-14-zhipu-ai-releases-glm-52-a-fully-open-source-frontier-model-featuring-a-1m-context-window"]},{"id":"text-ornith-1-0-2026-06-25","date":"2026-06-25","datePrecision":"day","modality":"text","name":"Ornith-1.0","org":"DeepReinforce","firstOfKind":"Erste offene Modellfamilie, die ihre eigenen RL-Scaffolds (Task-Harnesses) lernt","capability":"Selbst-verbessernde, quelloffene Modellfamilie für agentisches Programmieren — vom 9B-Dense-Modell für Edge-Geräte bis zum 397B-MoE-Spitzenmodell (zudem 31B Dense und 35B MoE), aufgebaut auf Gemma 4 und Qwen 3.5. Neuartiger Trainingsansatz: Im RL erzeugt das Modell nicht nur die Lösung, sondern auch das aufgabenspezifische Scaffold (den Harness), das diese Lösung steuert, und optimiert beides gemeinsam. Das 397B-Modell erreicht 77,5 auf Terminal-Bench 2.1 und 82,4 auf SWE-Bench Verified.","sources":["https://deep-reinforce.com/ornith_1_0.html","https://www.marktechpost.com/2026/06/25/deepreinforce-releases-ornith-1-0-an-open-source-coding-model-family-that-learns-its-own-rl-scaffolds/","https://huggingface.co/collections/deepreinforce-ai/ornith-10"]},{"id":"text-longcat-2-0-2026-06-29","date":"2026-06-29","datePrecision":"day","modality":"text","name":"LongCat-2.0","org":"Meituan","firstOfKind":"Erstes Billionen-Parameter-Modell, das komplett auf inländischen chinesischen KI-Chips trainiert und ausgeführt wird.","capability":"Quelloffenes 1,6-Billionen-Parameter-MoE-Modell (aktiviert ~48B Parameter pro Token, 33–56B je nach Komplexität) mit nativem 1-Mio.-Token-Kontext, veröffentlicht unter MIT-Lizenz auf GitHub und Hugging Face. Auf agentisches Coding ausgelegt: SWE-bench Pro 59,5, Terminal-Bench 70,8.","sources":["https://www.longcatai.org/models/longcat-2","https://venturebeat.com/technology/meituan-open-sources-longcat-2-0-the-1-6t-near-frontier-agentic-coding-model-thats-been-leading-openrouter-trained-entirely-on-chinese-chips"]},{"id":"text-hy3-hunyuan-2026-07-06","date":"2026-07-06","datePrecision":"day","modality":"text","name":"Hy3 (Hunyuan)","org":"Tencent (Hunyuan)","firstOfKind":"","capability":"Offizielle Version des Hunyuan-Hy3: 295B-MoE-Modell mit 21B aktiven Parametern und 256K-Kontext, veröffentlicht unter Apache-2.0-Lizenz. Gegenüber der Preview (23.04.) weitere Fortschritte bei Code-Generierung und Agenten-Fähigkeiten sowie mehr Stabilität; API über Tencent Cloud TokenHub. Erreicht laut Tencent flagship-nahe Intelligenz bei 2–5× kleinerem Parameter-Budget.","sources":["https://hy.tencent.com/research/hy3","https://www.tencent.com/en-us/articles/2202386.html"]},{"id":"text-inkling-2026-07-15","date":"2026-07-15","datePrecision":"day","modality":"text","name":"Inkling","org":"Thinking Machines Lab","firstOfKind":"Erstes öffentlich verfügbares Modell von Thinking Machines Lab (Mira Murati).","capability":"Erstes Modell von Mira Muratis Thinking Machines Lab — ein quelloffenes „Interaktionsmodell“, das Anfragen über verschiedene Medien hinweg verarbeitet und dabei Kosten gegen Leistung ausbalanciert. Frei verfügbar (Open-Weights zum Herunterladen und Anpassen); das Unternehmen monetarisiert nicht Inkling selbst, sondern das separate Fine-Tuning-Werkzeug Tinker.","sources":["https://thinkingmachines.ai/","https://fortune.com/2026/07/15/what-is-mira-murati-thinking-machines-first-ai-model-inkling/","https://www.bloomberg.com/news/articles/2026-07-15/murati-s-thinking-machines-releases-first-ai-model-for-broad-use"]},{"id":"text-kimi-k3-2026-07-16","date":"2026-07-16","datePrecision":"day","modality":"text","name":"Kimi K3","org":"Moonshot AI","firstOfKind":"","capability":"Neues MoE-Flaggschiff mit rund 2,8 Billionen Parametern, neuer „Kimi Delta Attention“-Architektur und 1-Mio.-Token-Kontext, ausgelegt auf langlaufendes Coding und Agenten-Workloads. Zwei Varianten zum Start: K3 Max (Chat/Agent) und K3 Swarm Max (massiv-paralleles Processing). Zum Launch nur über Kimi Code und die Kimi-App (ab ¥199-Tarif) nutzbar; die herunterladbaren Gewichte folgten am 27.07.2026.","sources":["https://www.marktechpost.com/2026/07/16/moonshot-ai-releases-kimi-k3-a-2-8-trillion-parameter-open-moe-model-with-kimi-delta-attention-and-1m-context/","https://simonwillison.net/2026/Jul/16/kimi-k3/"]},{"id":"text-laguna-s-2-1-2026-07-21","date":"2026-07-21","datePrecision":"day","modality":"text","name":"Laguna S 2.1","org":"poolside","firstOfKind":"","capability":"Offenes MoE-Modell für agentisches Coding: 118 Mrd. Parameter total, davon nur 8 Mrd. pro Token aktiv, bis zu 1 Mio. Token Kontext und getrennte Thinking-/No-Thinking-Modi. Laut poolside 70,2 % auf Terminal-Bench 2.1 (mit Thinking), 78,5 % auf SWE-Bench Multilingual, 40,4 % auf DeepSWE v1.1 und 46,2 % auf SWE Atlas (Codebase-QnA). Gewichte auf Hugging Face unter OpenMDW-1.1 (BF16 plus FP8- und NVFP4-Quantisierungen), lauffähig auf einer einzelnen NVIDIA DGX Spark.","sources":["https://poolside.ai/blog/introducing-laguna-s-2-1","https://huggingface.co/poolside/Laguna-S-2.1"]},{"id":"text-kimi-k3-open-weights-2026-07-27","date":"2026-07-27","datePrecision":"day","modality":"text","name":"Kimi K3 (Open Weights)","org":"Moonshot AI","firstOfKind":"","capability":"Moonshot lädt die vollständigen Gewichte des K3-Flaggschiffs auf Hugging Face: 2,8 Billionen Parameter total, davon rund 104 Mrd. pro Token aktiv, 1.048.576 Token Kontext, ausgeliefert mit nativer MXFP4-Quantisierung und MXFP8-Aktivierungen. Das Modell ist damit selbst hostbar — allerdings unter einer eigenen „Kimi K3 License\", die für kommerzielle Nutzung eine separate Vereinbarung verlangt, nicht unter einer OSI-Lizenz.","sources":["https://huggingface.co/moonshotai/Kimi-K3","https://artificialanalysis.ai/models/kimi-k3"]},{"id":"video-minimax-h3-2026-07-31","date":"2026-07-31","datePrecision":"day","modality":"video","name":"MiniMax H3","org":"MiniMax","firstOfKind":"","capability":"Von MiniMax als „Open-Weights\"-Videomodell angekündigt: H3 nimmt Text, Bild, Video und Audio in einer gemeinsamen Anfrage als Kontext (bis 7.000 Zeichen Prompt, bis 9 Referenzbilder, 3 Videoclips, 3 Audioclips — Audio nur zusammen mit Bild oder Video) und gibt natives 2K mit synchronem Stereo-Ton aus, 4 bis 15 Sekunden in ganzzahligen Schritten. Neben reiner Generierung nennt MiniMax Bearbeitung vorhandener Aufnahmen und Bewegungsübertragung zwischen Videos. Architektonisch führt eine neue „H3-Omni\"-Transformer-Struktur Text-zu-Bild, Text-zu-Video, Bild-zu-Video und Audio in einem Rahmen zusammen — laut MiniMax rund 30 % mehr Trainingsdurchsatz —, dazu kommt ein neu entworfener Tokenizer (H3-VAE) mit hoher Kompression. Zum Preis sagt MiniMax nur relativ: 2K koste pro Sekunde weniger als ein Drittel vergleichbarer marktüblicher Modelle. Live ist H3 als „MiniMax-H3\" in der API und im MiniMax Hub; die Gewichte sollen „innerhalb weniger Tage\" vollständig offengelegt werden.","sources":["https://platform.minimax.io/docs/release-notes/models","https://platform.minimax.io/docs/guides/video-generation","https://news.aibase.com/news/30033"]},{"id":"text-deepseek-v4-flash-0731-2026-07-31","date":"2026-07-31","datePrecision":"day","modality":"text","name":"DeepSeek-V4-Flash-0731","org":"DeepSeek","firstOfKind":"","capability":"Ablösung der V4-Flash-Preview vom 24.04.2026 bei unveränderter Architektur und Größe (284 Mrd. Parameter total, rund 13 Mrd. aktiv, plus Modul für spekulatives Decoding): Laut DeepSeeks eigenem Changelog wurde das Modell nicht neu vortrainiert, sondern ausschließlich neu nachtrainiert („re-post-training\"). Der Zugewinn liegt entsprechend bei agentischen Aufgaben — Terminal Bench 2.1 82,7, Cybergym 76,7, Toolathlon-Verified 70,3, DSBench-FullStack 68,7, DSBench-Hard 59,6, DeepSWE 54,4, NL2Repo 54,2, dazu 25,2 auf Agents' Last Exam und 25,1 auf AutomationBench Public. Der Denkaufwand ist in drei Stufen steuerbar (low, high, max), das Kontextfenster bleibt bei 1 Mio. Tokens mit bis zu 384K Ausgabe-Tokens. Neu sind das native Responses-API-Format (nur für Flash, nicht für Pro) und eine Anpassung für den Betrieb unter Codex. Preise: 0,14 USD Eingabe (Cache-Miss), 0,0028 USD bei Cache-Treffer und 0,28 USD Ausgabe pro Mio. Tokens — rund ein Drittel von V4-Pro (0,435/0,87 USD). Auf dem Artificial-Analysis-Intelligence-Index erreicht Flash-0731 in der Stufe max 50 Punkte, V4-Pro 44. Gewichte unter MIT-Lizenz auf Hugging Face.","sources":["https://api-docs.deepseek.com/updates","https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731","https://api-docs.deepseek.com/quick_start/pricing","https://artificialanalysis.ai/models/deepseek-v4-flash"]},{"id":"text-shieldstral-2026-08-04","date":"2026-08-04","datePrecision":"day","modality":"text","name":"Shieldstral 1.0 3B","org":"Mistral AI","firstOfKind":"","capability":"Ein Klassifikator für Inhaltsmoderation mit 3 Mrd. Parametern, der keine feste Kategorienliste vorhersagt, sondern eine in natürlicher Sprache formulierte Richtlinie zur Laufzeit als Eingabe nimmt und einen kontinuierlichen Sicherheitswert zurückgibt. Technisch ist die Aufgabe auf eine binäre Ja/Nein-Frage reduziert: feste Systemnachricht, ein einziger Vorwärtsdurchlauf, ein einziges Ausgabetoken, dessen Wahrscheinlichkeit als Schwellwert dient. Derselbe Checkpoint lässt sich damit auf neue Richtlinien umstellen, ohne ihn nachzutrainieren. Basis ist Ministral-3-3B-Base-2512 mit nativem Pixtral-Bildencoder; über dieselbe Schnittstelle moderiert werden reiner Text, reine Bilder und Text-Bild-Kombinationen, in zwölf Sprachen einschließlich Deutsch. Trainiert auf Sequenzen bis 32K Tokens (theoretisch 256K), lauffähig auf einer einzelnen 16-GB-GPU. Lizenz: Apache 2.0, Gewichte auf Hugging Face, dazu ein technischer Bericht.","sources":["https://mistral.ai/news/shieldstral/","https://huggingface.co/mistralai/Shieldstral-1.0-3B","https://arxiv.org/abs/2607.25857"]},{"id":"video-minimax-h3-open-weights-2026-08-05","date":"2026-08-05","datePrecision":"day","modality":"video","name":"MiniMax H3 (Open Weights)","org":"MiniMax","firstOfKind":"","capability":"MiniMax löst die Ankündigung vom 31.07.2026 ein und legt die Gewichte von H3 auf Hugging Face offen (MiniMaxAI/MiniMax-H3, ohne Zugangsschranke). Erst damit werden die Kennzahlen prüfbar: 33 Mrd. Parameter dicht besetzt in einem einzigen Strom — die modalitätsspezifischen Teile sitzen nur in den Ein- und Ausgabeschichten und in den AdaLN-Zweigen, nicht in getrennten Expertentürmen. Ausgabe 4 bis 15 Sekunden, bis 2K (voreingestellt 768 px kürzere Kante), 24 Bilder/s, Stereo-Ton mit 32 kHz, Seitenverhältnisse von 21:9 bis 9:16; als Text- und Bildencoder dient Qwen3-VL-32B unter Apache 2.0. Die Lizenz ist keine Open-Source-Lizenz, sondern ein „MiniMax H3 Community License Agreement“ mit einer entscheidenden Klausel: Als „Excluded Territories“ ausgenommen sind die Europäische Union, das Vereinigte Königreich, Südkorea und die USA. Untersagt ist dort nicht nur der Betrieb des Modells, sondern ausdrücklich auch Vervielfältigung, Bearbeitung, Weitergabe und Vorführung — und dasselbe gilt für die erzeugten Videos. Ab 20 Mio. US-Dollar Jahresumsatz braucht es zusätzlich eine schriftliche Genehmigung, kommerzielle Oberflächen müssen „MiniMax H3“ sichtbar nennen; Gerichtsstand ist Hongkong, Lizenzgeberin die Nanonoble Pte. Ltd. in Singapur.","sources":["https://huggingface.co/MiniMaxAI/MiniMax-H3","https://platform.minimax.io/docs/release-notes/models"]},{"id":"text-muse-glimmer-30b-2026-08-10","date":"2026-08-10","datePrecision":"day","modality":"text","name":"Muse Glimmer 30B","org":"Meta (Superintelligence Labs)","firstOfKind":"","capability":"Metas erster Release mit offenen Gewichten seit Llama 4 — und unter Apache 2.0 für sämtliche Bestandteile: BF16-Gewichte, zwei 4-Bit-Quantisierungen, den Entwurfskopf für spekulatives Dekodieren und den Wahrnehmungsencoder. 29,6 Mrd. Parameter dicht (inklusive Encoder), 52 Schichten, Aufmerksamkeitsmuster [lokal, lokal, lokal, global] im Wechsel mit 2.048er Schiebefenster, 32 Abfrage- gegen 2 KV-Köpfe, Kontext 131.072+, Vokabular 202.048; Eingabe Text und Bild über einen eingefrorenen ViT-G/14 mit rund 1,8 Mrd. Parametern (bis 4.096 Bildtoken je Bild), Ausgabe Text, kein Audio. Destilliert aus dem geschlossenen Muse Spark: Logit-Destillation im Pre-Training, dann längere Kontexte und agentenlastige Daten mit reicheren Reasoning-Spuren, zuletzt SFT plus On-Policy-Destillation und Reinforcement Learning. Gebaut ist es für dauerhaft mitlaufende lokale Agenten — Werkzeugaufrufe mit exakten Schemata über lange Abläufe, Fehlerdiagnose und erneuter Versuch statt Abbruch, Denkstärke in vier Stufen (low/medium/high/xhigh) per Systemprompt, über 100 Sprachen, Gerüste OpenClaw und Hermes Agent. Der eigentliche Kniff ist die Hardware-Rechnung: 4-Bit-Quantisierung drückt das Sprachmodell unter 20 GB, sodass KV-Cache, Bildencoder und Entwurfsmodell gemeinsam in 24 bis 32 GB passen — Genauigkeitsverlust laut Meta 1,0 % in der 24-GB- und 0,2 % in der 32-GB-Fassung. Dazu ein Entwurfsmodell nach dem DFlash-Verfahren, das ganze Blöcke von 16 Token in einem Durchlauf vorschlägt: auf einer RTX 5090 von 74,9 auf 233,4 Token/s (3,1×), auf einem MacBook M5 Max von 26,6 auf 50,2 (1,8×), auf einem M4 Max von 23,7 auf 37,8 (1,5×). Wissensstand 4. Januar 2026.","sources":["https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model","https://huggingface.co/meta-models/Muse-Glimmer-30B","https://research.meta.ai/static/muse-glimmer-methodology"]},{"id":"text-nemotron-3-5-lightning-30b-a3b-2026-08-11","date":"2026-08-11","datePrecision":"day","modality":"text","name":"Nemotron 3.5 Lightning 30B-A3B","org":"NVIDIA","firstOfKind":"","capability":"NVIDIAs erster eigener Eintrag in diesem Datensatz — und einer, der nicht Intelligenz, sondern Durchsatz zum Argument macht. 30 Mrd. Parameter mit 3 Mrd. aktiven in einer hybriden Mixture-of-Experts-Architektur: verschränkte Mamba-2- und MoE-Schichten mit einzelnen Aufmerksamkeitsschichten, dazu Multi-Token-Prediction-Köpfe, die mehrere Folgetoken auf einmal vorhersagen — im Training als reicheres Lernsignal, im Betrieb zur Beschleunigung. Kontext bis 1 Mio. Token, für den Betrieb auf einer einzelnen H100 mit 80 GB empfiehlt NVIDIA 256K. Vortrainiert auf über 20 Billionen Token in einem NVFP4-Rezept, also in 4 Bit, mit Megatron-LM; danach Fortsetzung des Vortrainings für die MTP-Köpfe, SFT und mehrstufiges Reinforcement Learning per GRPO über Mathematik, Code, Wissenschaft, Werkzeugnutzung und strukturierte Ausgaben. Sprachen: Englisch samt Programmiersprachen, Spanisch, Französisch, Deutsch, Italienisch, Japanisch. Reasoning ist per Chatvorlage abschaltbar. Veröffentlicht wird unter OpenMDW-1.1 — und zwar Gewichte, Trainingsdaten und Rezepte, einschließlich der Auswertungsrezepte zum Nachrechnen der eigenen Benchmarks. Neben den BF16-Referenzgewichten für Weiterverarbeitung stehen NVFP4-Checkpoints für den Betrieb bereit, dazu Entwurfsmodelle für spekulatives Dekodieren (DFlash sowie DSpark für DGX Spark). Die Leistungsversprechen: bis zu vierfache Ausgabegeschwindigkeit gegenüber ähnlich großen Modellen, auf PinchBench 86 % Genauigkeit bei 10.000 abgearbeiteten Aufgaben und dabei 30 % schneller als Qwen3.6 35B, und die Pareto-Front aus Genauigkeit und Geschwindigkeit für kleine offene Modelle auf dem Intelligence Index von Artificial Analysis. Läuft auf Blackwell (GB200, RTX 5090), Hopper (H100, H200) und Ampere (A100); zu holen über build.nvidia.com, Hugging Face, OpenRouter und ModelScope.","sources":["https://blogs.nvidia.com/blog/nemotron-3-5-lightning/","https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/","https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16"]},{"id":"video-ltx-2-5-2026-08-11","date":"2026-08-11","datePrecision":"day","modality":"video","name":"LTX-2.5","org":"Lightricks","firstOfKind":"","capability":"Nachfolger von LTX-2 vom 06.01.2026, wieder mit 22 Mrd. Parametern, aber mit deutlich verändertem Unterbau: Der Text-Encoder wechselt auf ein Gemma-4-12B mit Projektionsschicht, der Video-VAE lässt sich statt konvolutional selbst als Diffusionsmodell dekodieren, und die Ausgabelänge muss nicht mehr angegeben werden — ein eigener Duration-Head liest sie aus der Bildbeschreibung. Kern der Veröffentlichung ist die Pipeline, die Lightricks „Diffusion Fidelity Rendering“ nennt: Sie erzeugt zunächst Keyframes im Inneren der Sequenz, legt einen Detaillierungsdurchgang in voller Auflösung darüber und kann die Zeitachse in bis zu zwei Runden hochskalieren, was schnelle Bewegung sichtbar zusammenhält. Dazu natives 4K, bis 50 Bilder pro Sekunde, synchron erzeugter Ton — und laut Lightricks mehrere Einstellungen in einer einzigen Generierung, über die hinweg Figur, Umgebung, Lichtstimmung, Stimme und Bildstil erhalten bleiben. Neu ist außerdem eine HDR-Kette: Konditionierung über EXR-Frames und Ausgabe als szenenlineare EXR-Sequenz neben einem BT.2020/HLG-Video, damit das Material ohne verlustbehaftete Zwischenstufe in Farbkorrektur und VFX weiterläuft. Ausgeliefert wird ein Bündel — Basis- und destillierter Transformer (BF16, für die destillierte Fassung zusätzlich int8 und NVFP4), Gemma-4-Encoder in bf16 und int8, drei VAEs (Video, Video-Conv, Audio), räumlicher und zeitlicher Latent-Upscaler mit Faktor 2, eine destillierte LoRA und der Duration-Head —, und jede Komponente ist einzeln ladbar, sodass sich etwa ein NVFP4-Transformer mit einem BF16-VAE mischen lässt. Gehostet stehen zwei Stufen bereit: Fast (2–20 Sekunden, 720p bis 4K, 24/25/48/50 fps, ab 10 Sekunden nur 720p/1080p bei 24/25 fps) und Pro (2–10 Sekunden, 720p/1080p, 24/25/50 fps). Gewichte unter der LTX-2.x Community License, Code als Release v1.2.0 auf GitHub, Unterstützung in ComfyUI ab Tag eins.","sources":["https://github.com/Lightricks/LTX-2/releases/tag/v1.2.0","https://huggingface.co/Lightricks/LTX-2.5","https://blog.comfy.org/p/ltx-25-day-0-support-in-comfyui"]},{"id":"text-qwen3-8-max-open-weights-2026-08-12","date":"2026-08-12","datePrecision":"day","modality":"text","name":"Qwen3.8-Max (Open Weights)","org":"Alibaba","firstOfKind":"","capability":"Neun Tage nach der allgemeinen Verfügbarkeit liefert Alibaba die am 03.08.2026 angekündigten Gewichte: Qwen/Qwen3.8-2.4T-A95B, dazu eine FP8-Fassung, ohne Zugangsschranke herunterladbar. Erst damit wird die Architektur nachprüfbar — 2,4 Bio. Parameter total, rund 95 Mrd. aktiv, 92 Schichten in 23 gleichen Blöcken, die jeweils dreimal ein Gated DeltaNet mit einer Mixture-of-Experts-Schicht kombinieren und einmal eine Gated-Attention-Schicht dazwischenlegen; 512 Experten, von denen 10 geroutet und einer geteilt werden; verborgene Dimension 8192, Vokabular 248.320, Multi-Token-Prediction über mehrere Schritte. Das Kontextfenster steht in der Konfiguration auf 262.144 Token und lässt sich auf 1.010.000 hochziehen. Der Denkaufwand ist in drei Stufen steuerbar (xhigh als Standard, medium, low), Denkspuren lassen sich über preserve_thinking in den Verlauf zurückführen. Neu ist außerdem die erste Benchmarktabelle überhaupt zu diesem Modell — am 03.08. hatte Alibaba noch keine veröffentlicht: Terminal Bench 2.1 86,6, PaperBench 93,0, IFBench 82,8, FrontierSWE 73,5, GPQA-Diamond 92,6, Humanity's Last Exam 43,6, MRCR v2 bei 256K 92,9, DeepSWE 1.1 dagegen nur 56,6. Die offenen Gewichte sind allerdings nicht dasselbe Modell wie in der Cloud: Sie verarbeiten ausschließlich Text, Bildeingabe fehlt, und der Denkmodus lässt sich nicht abschalten. Die Lizenz ist keine Standardlizenz, sondern eine eigene „Qwen3.8-Max License“.","sources":["https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B","https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B-FP8","https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/blob/main/LICENSE"]},{"id":"text-deepseek-v4-pro-0813-2026-08-13","date":"2026-08-13","datePrecision":"day","modality":"text","name":"DeepSeek-V4-Pro-0813","org":"DeepSeek","firstOfKind":"","capability":"Das reguläre V4-Pro, das seit der Preview vom 24.04.2026 aussteht und das die kleine Flash-0731 vom 31.07.2026 zwischenzeitlich überholt hatte: Struktur und Größe bleiben, angebaut ist ein Modul für spekulatives Decoding namens DSpark, dessen Entwurfsgewichte im selben Checkpoint liegen. Die Konfiguration nennt 61 Schichten, verborgene Dimension 7168, 384 geroutete Experten plus einen geteilten mit sechs aktiven pro Token, Vokabular 129.280, eine MTP-Schicht und FP8 als natives Format (e4m3 mit ue8m0-Skalierung); das Kontextfenster steht auf 1.048.576 Token, empfohlen sind bis zu 384K Ausgabe-Tokens. Der Denkaufwand ist in drei Stufen steuerbar (low, high, max). Die selbstberichtete Tabelle setzt V4-Pro-0813 gegen Flash-0731, die beiden Previews, GLM-5.2, Kimi K3, Claude Opus 4.8 und Fable 5: Humanity's Last Exam 42,7 ohne und 60,0 mit Werkzeugen, Terminal Bench 2.1 87,9, NL2Repo 61,5, Cybergym 83,3, DeepSWE 62,7, Toolathlon-Verified 74,1, Agents' Last Exam 25,7, AutomationBench 31,8, dazu die hausinternen DSBench-FullStack 71,1 und DSBench-Hard 67,2. Ungewöhnlich ist die Auslieferung: Statt einer Jinja-Chatvorlage liegt ein eigenes encoding-Verzeichnis bei, und zusammen mit dem Modell erscheint der DeepSeek Harness als eigenes Projekt auf GitHub — das Agentengerüst, mit dem die Tabelle erhoben wurde. Gleichzeitig ist das Modell als deepseek-v4-pro in App, Web und API allgemein verfügbar, mit nativem Responses-API-Format für den Betrieb unter Codex. Gewichte unter MIT-Lizenz.","sources":["https://api-docs.deepseek.com/updates","https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813","https://github.com/deepseek-ai/deepseek-harness"]},{"id":"audio-minimax-music-3-2026-08-13","date":"2026-08-13","datePrecision":"day","modality":"audio","name":"MiniMax Music 3","org":"MiniMax","firstOfKind":"","capability":"MiniMax' erstes Musikmodell mit offenen Gewichten: aus einer Beschreibung und einem Liedtext ein vollständiger Song bis fünf Minuten Länge — gesungen, arrangiert und gemischt, in 32 kHz Stereo mit 16 Bit. Der Aufbau ist eine Kette aus vier Teilen: Ein Global LLM mit 8 Mrd. Parametern, initialisiert aus Qwen3-8B, sagt das erste Codebuch eines achtstufigen Residual-Vector-Quantizers voraus (16.384 semantische Einträge, dann siebenmal 1.024 akustische); ein Local LLM mit 0,6 Mrd. Parametern ergänzt die übrigen Codebücher, wobei beide über verborgene Zustände statt über Token gekoppelt sind; ein Flow-Matching-Modell mit 2,4 Mrd. Parametern erzeugt daraus das Latent eines Flow-VAE; ein Decoder mit 123 Mio. Parametern rendert die Wellenform. Gesteuert wird über zwei Eingaben: den Liedtext mit Strukturmarken — [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro] — und eine Structured Caption, die in drei Blöcken Global Metadata (Genre, Subgenre, Taktart, BPM, Tonart, Stimmungsverlauf, Hörsituation, Produktionsprofil), Vocal Details (Stimmlage, Timbre, Gesangsstil, Harmonien, Begleitgesang, Effekte) und Arrangement (Haupt- und Nebeninstrumente, Instrumentenwechsel je Abschnitt, Groove, Bass, Perkussion, Texturen, Raumeffekte) festlegt. Betrieb über SGLang-Omni, diffusers und ComfyUI, parallel als API auf MiniMax' eigener Plattform; rund 22 GB Videospeicher mit CPU-Auslagerung, ab 8 GB mit schichtweisem Streaming der Gewichte. Die Grenzen nennt MiniMax selbst: nur CUDA, keine Streaming-Ausgabe, höchstens 5.000 Token Eingabe und 9.000 akustische Frames bei 25 Frames pro Sekunde. Lizenz ist eine eigene „MiniMax-Music3 Community License“.","sources":["https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model","https://huggingface.co/MiniMaxAI/MiniMax-Music3","https://modelscope.cn/models/MiniMax/MiniMax-Music3","https://github.com/MiniMax-AI/MiniMax-Music3"]},{"id":"text-glm-5-3-2026-08-14","date":"2026-08-14","datePrecision":"day","modality":"text","name":"GLM-5.3","org":"Zhipu AI (Z.ai)","firstOfKind":"","capability":"Dasselbe Basismodell wie GLM-5.2 — die 744B-MoE-Architektur mit 1-Mio.-Token-Kontext bleibt unangetastet, der gesamte Zugewinn kommt aus skaliertem Post-Training auf synthetisch erzeugten Langhorizont-Umgebungen. Z.ai baut die Aufgaben nicht mehr als Coding-Übungen, sondern als Einheiten echter Expertenarbeit: In einer ML-Infrastruktur-Aufgabe erhält das Modell dieselbe Arbeitsumgebung wie ein Ingenieur — Rechencluster, Storage, interne Dokumentation, Codebase, Experimentergebnisse — und muss Engpässe diagnostizieren, Optimierungen implementieren, Experimente fahren und eine messbare Beschleunigung abliefern, ohne die Korrektheit zu brechen; einzelne Aufgaben entsprechen mehreren Arbeitstagen. Umgebungen und für einen Teil auch das RL-Reward-Signal werden von Pipelines synthetisiert, ein Judge-Agent prüft jede Aufgabe auf Lösbarkeit, Verifier entstehen ohne Zugriff auf die Referenzlösung. Selbstberichtete Werte gegen den eigenen Vorgänger: Terminal-Bench 3.0 28,3 % (4,6), DeepSWE v1.1 66,9 % (46,2), SWE-Marathon v1.1 42,5 % (19,4), FrontierSWE 78,1 % (67,5), Terminal-Bench 2.1 88,2 % (81,0), NL2Repo 58,0 % (48,9), PostTrainBench 39,8 % (31,7), AutomationBench 48,2 % (26,2), Toolathlon Verified 73,0 % (59,9), Agents' Last Exam 28,5 % (23,8), HLE mit Werkzeugen 62,5 % (54,7), GDPval-AA v2 1769 Elo (1508). Auf dem hauseigenen Z.ai Code Bench 50 % über GLM-5.2, bei zugleich sinkendem Token-Verbrauch: 34,5 % bei rund 75K Output-Tokens auf Max-Stufe gegen 23,4 % bei 96K für GLM-5.2, und auf High-Stufe 31,4 % bei rund 50K gegen Claude Opus 4.8 mit 29,5 % bei 120K. Dazu ein zweiter Fähigkeitsblock, den Z.ai selbst als unerwartet beschreibt: CyberGym 84,5 % (77,2) — bester Wert des Benchmarks —, ExploitBench 54,4 % (24,4), ExploitGym 105 gelöste Aufgaben in zwei und 130 in sechs Stunden (29 und 39). Die API kennt drei Denkstufen (low, high, max, Standard max); Thinking lässt sich nicht mehr abschalten.","sources":["https://z.ai/blog/glm-5.3","https://cvd.z.ai/","https://docs.z.ai/devpack/overview"]},{"id":"text-qwen3-8-27b-2026-08-14","date":"2026-08-14","datePrecision":"day","modality":"text","name":"Qwen3.8-27B","org":"Alibaba","firstOfKind":"","capability":"Elf Tage nach der Ankündigung liefert Alibaba das zweite am 03.08.2026 versprochene Modell — und zwar unter Apache 2.0: Qwen3.8-27B, ein dichtes Modell mit 27.781.427.952 Parametern laut Safetensors-Index, dazu eine FP8-Fassung. Die Architektur kommt aus der Qwen3.5-Linie, verzichtet aber auf Mixture-of-Experts: 64 Schichten in 16 gleichen Blöcken, die dreimal Gated DeltaNet mit FFN und einmal Gated Attention mit FFN kombinieren; verborgene Dimension 5120, FFN-Zwischendimension 17.408, 24 Abfrage- und 4 KV-Köpfe bei Kopfdimension 256, DeltaNet mit 48 Value- und 16 QK-Köpfen, Vokabular 248.320 (aufgefüllt), Multi-Token-Prediction über mehrere Schritte. Kontextfenster 262.144 Token laut config.json, per YaRN auf 1.000.000 erweiterbar. Anders als die zwei Tage zuvor veröffentlichte offene Fassung von Qwen3.8-Max ist dies ein natives Vision-Language-Modell: Bild- und Videoverständnis stecken über einen 27-schichtigen Vision-Encoder (Patchgröße 16, Ausgangsdimension 5120, interleaved mRoPE) im Modell selbst, und der Denkmodus lässt sich pro Anfrage abschalten — Denkaufwand in drei Stufen (xhigh als Standard, medium, low), preserve_thinking standardmäßig an. Selbstberichtete Werte gegen Qwen3.6-27B, den gleich großen Vorgänger: Terminal Bench 2.1 73,0 (63,4), SWE-bench Pro 61,7 (53,5), QwenSWEBench 79,0 (49,3), NL2Repo-Bench 42,3 (36,2), DeepSWE 1.1 42,2 (13,3), CoWorkBench 70,7 (61,0), JobBench 33,4 (21,8), Agents' Last Exam 20,4 Pass@1 (10,6), IFBench 79,5 (69,1), GPQA Diamond 89,2 (87,8), HLE 30,8 (24,0), LiveCodeBench v6 90,3 (83,9); auf der Bildseite OSWorld-Verified 84,3 (63,9), WebArena-Verified 64,8 (48,8), AndroidWorld 81,9 (70,3), SWE-MM 38,6 (25,7), Vision2Web 62,9 (45,0), BabyVision 65,7 ohne und 85,6 mit Bildhinweis (28,9), MathVision 90,0 (85,1), OmniDocBench 1.5 91,1 (89,4).","sources":["https://huggingface.co/Qwen/Qwen3.8-27B","https://huggingface.co/Qwen/Qwen3.8-27B-FP8","https://huggingface.co/Qwen/Qwen3.8-27B/blob/main/LICENSE","https://modelscope.cn/models/Qwen/Qwen3.8-27B"]},{"id":"text-glm-5-3-flash-2026-08-26","date":"2026-08-26","datePrecision":"day","modality":"text","name":"GLM-5.3-Flash","org":"Zhipu AI (Z.ai)","firstOfKind":"","capability":"Das erste nativ multimodale Modell der GLM-5-Reihe, und das erste, das nicht aus dem Post-Training eines bestehenden Basismodells kommt, sondern aus einem neu trainierten: 320 Mrd. Parameter gesamt, 18 Mrd. aktiv. Die config.json legt die Architektur offen — 45 Schichten, davon 34 mit linearer Aufmerksamkeit (KDA, 64 Köpfe, Kopfdimension 128, Kurzkonvolution mit Kernel 4) und 11 mit DeepSeeks Sparse Attention auf jeder vierten Lage (Indexer mit 32 Köpfen, top-k 2048), hidden 4096, 288 geroutete Experten plus ein geteilter mit acht aktiven pro Token, Sigmoid-Router mit Skalierung 2,5, die ersten drei Schichten dicht, eine MTP-Schicht, Vokabular 154.880, Kontextfenster 1.048.576 Token, ausgeliefert in FP8 (e4m3, dynamisch). Dazu Manifold-Constrained Hyper-Connections (mHC, vier Ströme, 20 Sinkhorn-Iterationen) und IndexPool, das vier Indexer-Key-Vektoren gewichtet zu einem zusammenfasst, um Latenz und Speicherbedarf des Indexers bei 1 Mio. Token zu drücken. Der Seh-Turm liegt im selben Checkpoint: 24 Schichten, hidden 1024, Patchgröße 14, Bildkante 448, räumliche Zusammenlegung 2, zeitliche Patchgröße 2 — Bilder, Videos und Dateien gehen direkt in den Kontext, Denken lässt sich nicht abschalten. Vortraining auf einem multimodalen 30-Bio.-Token-Korpus. Gegenüber GLM-5.3 sinken nach eigener Rechnung Aufmerksamkeitsrechenaufwand und KV-Cache um Faktor 3,01 bzw. 4,44, gegenüber der GLM-4.5-Reihe halbieren sich aktive Parameter (18 statt 32 Mrd.) und Schichtzahl (45 statt 92) bei ähnlicher Gesamtgröße. Selbstberichtete Werte, jeweils mit GLM-5.2 in Klammern: Terminal Bench 2.1 84,3 (81,0) · DeepSWE v1.1 63,4 (46,2) · NL2Repo 56,3 (48,9) · Toolathlon Verified 78,4 (59,9) · AutomationBench v1.0.6 48,8 (26,2) · Agents' Last Exam 26,3 (20,4) · HLE mit Werkzeugen 55,3 (54,7) · GDPval-AA v2 1773 Elo (1504). Im Sehteil, wo GLM-5.2 nicht antritt, gegen DeepSeek-V4-Vision-Exp und Opus 4.8: OfficeQA Pro 62,4 (57,9 · 48,9) · CharXiv Reasoning mit Werkzeugen 89,4 (80,4 · 89,9) · Chartography mit Werkzeugen 78,0 (64,3 · 75,0) · BabyVision 53,4 (35,1 · 46,8) · MVBench 77,8 (69,4 · 67,1) · MMVU 80,5 (72,7 · 67,4). Auf dem hauseigenen Z.ai Code Bench v1.0 erreicht die Max-Stufe 29,0 gegen 29,5 von Opus 4.8; im Intelligence Index v4.1.1 von Artificial Analysis stehen 57 Punkte bei 0,045 $ pro Aufgabe. Der Preis ist der eigentliche Punkt: Listenpreis 0,15 $ Eingabe und 0,50 $ Ausgabe je 1 Mio. Token, bis zum 09.09.2026 halbiert auf 0,075 bzw. 0,25 $, gecachte Eingabe 0,03 bzw. 0,015 $, Cache-Speicherung befristet kostenlos — GLM-5.3 und GLM-5.2 stehen unverändert bei 1,4 und 4,4 $. Gewichte unter MIT-Lizenz auf HuggingFace (FP8 und BF16), lauffähig unter SGLang, vLLM, TokenSpeed und KTransformers.","sources":["https://z.ai/blog/glm-5.3-flash","https://huggingface.co/zai-org/GLM-5.3-Flash","https://docs.z.ai/guides/llm/glm-5.3-flash","https://docs.z.ai/guides/overview/pricing"]},{"id":"text-qwen3-8-flash-next-2026-08-26","date":"2026-08-26","datePrecision":"day","modality":"text","name":"Qwen3.8-Flash-Next","org":"Alibaba (Qwen)","firstOfKind":"","capability":"Kein Produktmodell, sondern eine Architekturvorschau: Die Modellkarte nennt Qwen3.8-Flash-Next ausdrücklich „an experimental preview of the architecture that will underpin Qwen4“ und „the first open-weight release under this architecture“. 125 Mrd. Parameter gesamt, davon 6 Mrd. pro Token aktiv, dazu 51 Mrd. in einer N-Gram-Einbettung und 4 Mrd. in der Multi-Token-Prediction. Die config.json legt den Aufbau offen: 48 Schichten als zwölf identische Blöcke, in denen dreimal Gated DeltaNet und einmal Qwen Sparse Attention (QSA) jeweils auf eine MoE-Schicht folgen; hidden 2560, Kopfdimension 256 bei 24 Abfrage- und 2 KV-Köpfen, die lineare Aufmerksamkeit mit 48 Value- und 16 QK-Köpfen (Dimension 128, Kurzkonvolution mit Kernel 4), der Indexer als MQA mit vier Abfrage- und einem geteilten Key-Kopf bei Budget 2048 Token und Kompressionsverhältnis 4, also 512 Mikroblöcken; 512 Experten mit zehn gerouteten plus einem geteilten pro Token, Experten-Zwischendimension 640, Sigmoid-Ausgangsgatter, Vokabular 248.320, eine MTP-Schicht mit voller Aufmerksamkeit, Kontextfenster 262.144 Token und per YaRN bis 1.000.000. Drei Bauteile sind neu: QSA wählt nicht einzelne Token, sondern Mikroblöcke aus, was die Latenz im langen Kontext drückt; Gated Residual moduliert vier verbreiterte Residualströme (Rang 320) über ein datenabhängiges Lesegatter und je Zweig einen skalaren Schreibwert; und die N-Gram-Einbettung indexiert 20 Mio. Bi- und Trigramme auf Schicht 2 — 51 Mrd. Parameter, die Speicher kosten, aber kaum Rechenzeit und sich auf speicherarme Beschleuniger auslagern lassen. Dazu ein geändertes Trainingsrezept: Muon und AdamW auf getrennte Gewichtsklassen, neu angepasste Skalierungsgesetze, kein Batch-Size-Warmup mehr. Der Seh-Turm steckt im selben Checkpoint (27 Schichten, hidden 1152, 16 Köpfe, Zwischendimension 4304, Ausgang 2560, 2304 Positionseinbettungen), Eingabe also Text, Bild und Video; Denkmodus standardmäßig an mit reasoning_effort xhigh (dazu medium und low) und über enable_thinking abschaltbar. Selbstberichtete Werte gegen Qwen3.8-27B, Qwen3.7-Plus (397 Mrd./17 Mrd. aktiv), DeepSeek-V4-Flash-0731 und Claude Opus 4.6 Max: DeepSWE 1.1 58,7 · SWE-bench Pro 62,5 · SWE-bench Multilingual 81,0 · NL2Repo-Bench 48,1 · CoWorkBench 73,9 · JobBench 55,7 · Agents' Last Exam 24,3 Pass@1 bei 51,2 Punkten · Toolathlon Verified 73,5 · IFBench 81,3 · GPQA Diamond 91,7 · HLE 35,9 · LiveCodeBench v6 91,9; multimodal ClawEval-MM 64,4 Pass@3 (60,4 im Mittel) · RecreationBench 49,9 · AndroidWorld 84,5 · OSWorld 2.0 19,4 binär bei 52,3 partiell · Vision2Web 64,0 · ERQA 72,3 · LVBench 76,6 · RealWorldQA 88,5 · MathVision 90,6 ohne und 95,7 mit Code-Interpreter · CharXiv Reasoning 84,6 ohne und 90,6 mit. Gewichte in BF16 und FP8 unter der Qwen Community License 1.0; die gehostete Fassung heißt Qwen3.8-Flash, hat 1 Mio. Kontext im Standard samt eingebauter Werkzeuge und kostet bei OpenRouter 0,15 $ Eingabe und 0,47 $ Ausgabe je 1 Mio. Token.","sources":["https://huggingface.co/Qwen/Qwen3.8-Flash-Next","https://huggingface.co/Qwen/Qwen3.8-Flash-Next-FP8","https://huggingface.co/Qwen/Qwen3.8-Flash-Next/blob/main/LICENSE","https://github.com/QwenLM/Qwen3.8-Flash-Next"]},{"id":"text-hy4-preview-2026-08-28","date":"2026-08-28","datePrecision":"day","modality":"text","name":"Hy4-preview","org":"Tencent (Hunyuan)","firstOfKind":"","capability":"Tencents neues Flaggschiff als Vorschau und unter Apache 2.0: 770 Mrd. Parameter gesamt, 49 Mrd. pro Token aktiv, Kontextfenster 1.048.576 Token. Die config.json zeigt 78 Schichten, davon die erste dicht und die übrigen 77 als MoE mit 256 gerouteten Experten plus einem geteilten, top-8 geroutet, Router-Skalierung 2,827; hidden 6144, 64 Aufmerksamkeitsköpfe bei 8 KV-Köpfen, MLA mit Abfragekompression auf 2048 und KV-Kompression auf 512, qk_head_dim 256 (192 ohne plus 64 mit Rotation) und v_head_dim 256, dazu ein lernbarer Attention Sink, gated_mla und Vokabular 120.832. Drei Bauteile tragen den Effizienzanspruch: Gated DSA, also DeepSeeks Sparse Attention mit Gatter (arXiv 2512.02556) und einem Indexer aus 32 Köpfen à 128 Dimensionen bei top-k 2048, ergänzt um IndexCache (arXiv 2603.12201), das den spärlichen Index über Schichten hinweg wiederverwendet; iHC, identische Hyper-Connections mit vier Residualströmen anstelle des einfachen Residualpfads; und eine mitgelieferte MTP-Schicht mit 10 Mrd. Parametern (0,7 Mrd. aktiv) für spekulatives Dekodieren. Skaliert wurde nach eigener Darstellung auf drei Achsen gleichzeitig — Modellgröße, Kontextlänge und Trainingsdaten —, das Ergebnis nennt Tencent „the largest generation-over-generation gain we've measured, and enough to put Hy4 preview at the open-source frontier“. Vier Produktivitätsdomänen wurden mit hauseigenen Fachleuten und gemeinsam mit CodeBuddy und WorkBuddy ausgelegt: Software-Entwicklung, Büro und Analyse, Spieleentwicklung, wissenschaftliches Arbeiten. Selbstberichtete Werte, jeweils mit Hy3 vom 06.07.2026 in Klammern: Terminal Bench 2.1 85,4 (70,8) · DeepSWE 64,3 (28,0) · SWE-bench Pro 65,7 (57,9) · SWE-bench Multilingual 82,9 (75,8) · SWE-Marathon 31,9 (5,0) · CyberGym 78,4 (51,8) · GPQA Diamond 92,3 (90,9) · GDPval-AA v2 1678 Elo (1213) · dazu MathArena Apex 74,2 · CritPt 16,9 · HLE ohne Werkzeuge 43,4. Ein Blindvergleich mit 163 internen Fachleuten über 203 Ingenieuraufgaben ergibt 2,99 Punkte gegen 2,92 für GLM 5.3 (46,8 % Siege, 12,8 % Gleichstände, 40,4 % Niederlagen) und gegen 2,94 für Kimi K3 (51,2 % / 7,9 % / 40,9 %). Gewichte in BF16 und FP8 auf HuggingFace, gespiegelt auf ModelScope, GitCode und CNB; Denkmodus standardmäßig auf „high“, per no_think über chat_template_kwargs abschaltbar, empfohlen temperature 0,9 und top_p 1,0.","sources":["https://huggingface.co/tencent/Hy4-preview","https://huggingface.co/tencent/Hy4-preview-FP8","https://github.com/Tencent-Hunyuan/Hy4-preview"]},{"id":"text-deepseek-v4-1-flash-2026-09-10","date":"2026-09-10","datePrecision":"day","modality":"text","name":"DeepSeek-V4.1-Flash","org":"DeepSeek","firstOfKind":"","capability":"Erstes Modell einer neuen Architekturfamilie, MIT-lizenziert am Erscheinungstag auf Hugging Face und gleichzeitig live in der API unter dem neuen Namen deepseek-flash. 552 Mrd. Parameter im Backbone, multimodal von Grund auf (Bild und Text im selben Modell, kein aufgesetzter Vision-Zweig), Kontextfenster 1 Mio. Token, Ausgabe bis 384K. Kern ist eine Causal-Encoder-Decoder-Architektur (CED): 40 Schichten, aufgeteilt in einen 20-schichtigen kausalen Encoder und einen 20-schichtigen Decoder, dessen globaler KV-Cache nicht aus den eigenen Schichten, sondern aus den letzten Encoder-Zuständen projiziert wird. Daraus folgt die eigentliche Kennzahl: aktiv sind nur 8 Mrd. Parameter beim Einlesen des Prompts (Prefill) und 16 Mrd. beim Erzeugen (Decode) — dieselbe Rechnung wird für Eingabe und Ausgabe unterschiedlich teuer. Dazu Compressed Sparse Attention 2, das jeder Attention-Schicht einen von drei festen Modi zuweist (Full, Reindex, Reuse), um Haupt-KV und Indexer-Schlüssel über Schichten zu teilen, ein hierarchischer Sparse-Indexer, der spätere Indexschichten auf einen Kandidatenpool der ersten Full-Schicht beschränkt, und FP4-Speicherung des Haupt-KV (E2M1, ein E4M3-Skalar je 16 Kanäle). Ergebnis: 890 Byte globaler KV-Cache pro Token, rund ein Viertel von DeepSeek-V4-Flash und laut DeepSeeks eigener Grafik ein 437stel von DeepSeek-V1; SWA Bounded Replay rekonstruiert fehlende Sliding-Window-Zustände durch Nachspielen der letzten n Token, wodurch der auf SSD zu haltende Anteil auf ein Achtel fällt. Weiter verbaut: Single-Pass mHC, ein Engram-Gedächtnis mit 196 Mrd. Parametern, das über Token-Lookup nur punktuell angesprochen wird, DSpark für spekulatives Decoding, 1 geteilter und 384 geroutete Experten je MoE-Schicht bei 6 aktiven pro Token. Vortraining auf 45 Bio. multimodalen Token, Sparse Attention bei 64K Sequenzlänge trainiert, Kontext nach 34 Bio. Token auf 1 Mio. gestreckt; Nachtraining ausdrücklich ohne algorithmische Neuerung (SFT → RL → On-Policy-Distillation), alle Änderungen liegen in der automatisierten Synthese von Agentenaufgaben und -umgebungen. Neu in der Bedienung: Der Denkaufwand ist nicht mehr in drei Stufen, sondern stufenlos als Ganzzahl von 1 bis 100 einstellbar. Selbstberichtete Werte bei maximalem Aufwand — Terminal-Bench 2.1 90,6 (Bestwert der Tabelle, vor Opus 5.0 mit 89,1, GPT-5.6 Sol 88,8, K3 88,3, GLM-5.3 88,2, V4-Pro 87,9), DeepSWE v1.1 74,2 (Opus 5.0 74,0), Codeforces 3.471 Elo, MathArena Apex 65,6, CyberGym 88,1, HLE mit Werkzeugen 63,9, AutomationBench 54,8, Agent's Last Exam 31,8. Preise ab 04:00 UTC desselben Tages und deutlich unter dem Vorgänger: je 1 Mio. Token außerhalb der Spitzenzeiten $0,003 bei Cache-Treffer, $0,15 bei Cache-Fehltreffer, $0,60 Ausgabe; in Spitzenzeiten das Doppelte.","sources":["https://api-docs.deepseek.com/news/news260910","https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash","https://api-docs.deepseek.com/quick_start/pricing"]},{"id":"text-atria-dawn-preview-2026-09-12","date":"2026-09-12","datePrecision":"day","modality":"text","name":"Atria Dawn Preview","org":"Shanghai Artificial Intelligence Laboratory","firstOfKind":"","capability":"Vorabversion eines nach eigener Beschreibung „agentischen Modells der neuen Generation\" — und ausdrücklich kein eigenes Fundament: Atria Dawn sitzt laut Modellkarte auf GLM-5.2, dem 744-Mrd.-Parameter-MoE aus dem Haus Zhipu. Veröffentlicht wird ein FP8-quantisiertes Instruct-Modell mit 256K Kontext (262.144 Token), dessen safetensors-Aufstellung 753,33 Mrd. Parameter summiert (751,23 Mrd. in F8_E4M3, 2,10 Mrd. in BF16) und 755,67 GB Download bedeutet; Architekturkennung glm_moe_dsa, Lizenz MIT, reiner Text — Bildeingaben nimmt das Modell nicht an. Betrieb ab SGLang v0.5.13.post1 oder vLLM v0.23.0, gehosteter Zugang über api.atria-asi.ai international und discovery.intern-ai.org.cn in China. Die selbstberichtete Vergleichstabelle stellt Atria Dawn gegen DeepSeek V4 Pro 0813, Kimi K3, Qwen 3.8 Max, GLM 5.3, GPT 5.6 Sol und Claude Opus 5 — und das Ergebnis ist ungewöhnlich klar zweigeteilt. Vorn liegt das Modell überall dort, wo Suche und Werkzeugnutzung gemessen werden: AutomationBench 53,8, BFCL v4 77,0, DeepSearchQA 96,0, BrowseComp 92,5, laut Pressemitteilung außerdem CyberGym 86,5, jeweils Bestwert des Feldes. Hinten liegt es überall dort, wo Codieren, Terminalarbeit und wirtschaftlicher Nutzen gemessen werden, und zwar hinter Claude Opus 5: Terminal-Bench 2.1 78,3 gegen 90,2, SWE-bench Pro 59,6 gegen 74,7, GDPval 1.583 gegen 1.768, JobBench 50,3 gegen 68,0, DeepResearch Bench II 51,1 gegen 54,1, MLE-bench Lite 86,2 gegen 88,9, WideSearch 81,9 gegen 83,3, Workspace-Bench 65,0 gegen 65,8 und in der Lite-Variante 68,2 gegen 70,1; SkillsBench (66,4) und τ³-Bench Banking (41,2) unterliegen Qwen 3.8 Max mit 66,7 bzw. 55,2. Als Demonstration zeigt das Labor ein in einem Durchlauf gebautes Wettermodell — ViT-Backbone mit über 0,4 Mrd. Parametern, 45.000 Trainingsschritte über 69 atmosphärische Variablen auf WeatherBench2 im Gitter 64×32, Websuche dabei abgeschaltet —, das eine globale Sieben-Tage-Vorhersage in unter einer Minute rechnet und NVIDIAs FourCastNet auf einzelnen Metriken schlägt; dazu ein „MiniOS in 20 Minuten\".","sources":["https://huggingface.co/internlm/Atria-Dawn-Preview-FP8","https://github.com/atria-asi/Atria-Dawn-Preview","https://arxiv.org/abs/2609.15818","https://modelscope.cn/models/Shanghai_AI_Laboratory/Atria-Dawn-Preview-FP8"]},{"id":"text-step-5-preview-2026-09-20","date":"2026-09-20","datePrecision":"day","modality":"text","name":"Step 5 Preview","org":"StepFun","firstOfKind":"","capability":"StepFun stellt Step 5 Preview unter dem Titel „Advancing the Pareto Frontier\" vor: ein spärlich besetztes Mixture-of-Experts-Modell mit 600 Mrd. Parametern gesamt und 27 Mrd. aktiven je Token, 1 Mio. Token Kontext und Bildeingabe. Der Anspruch ist nicht die Spitze, sondern das Verhältnis: „Step 5 Preview scores 44 on the Artificial Analysis Intelligence Index. At a comparable level of intelligence, its task cost is substantially lower.\" Die Vergleichstabelle des Hauses stellt Step 5 (High) gegen GLM-5.3 (Max), Kimi K3 (Max), GPT-6 Astra (Max) und Claude Opus 5 (Max): DeepSWE v1.1 67,7 gegen 66,9 / 67,5 / 74,1 / 74,0; ProgramBench 80,5 gegen 72,0 / 77,8 / 85,4 / 82,3; FrontierFinance 66,4 gegen 64,1 / 62,6 / 55,0 / 69,7; DRACO 83,3 gegen 82,3 / 78,5 / 76,8 / 87,6; Terminal-Bench v4 33,3 gegen 41,9 / 12,6 / 57,9 / 52,3; GDPval-AA v2.1 1566 gegen 1645 / 1524 / 1542 / 1708; AA-Briefcase v1.1 1433 gegen 1526 / 1511 / 1569 / 1673; MMMU-Pro 76,0. Der Schwerpunkt liegt auf langlaufender Arbeit: In einem 24-Stunden-Lauf optimiert das Modell einen MLA-GPU-Kernel auf einer H100 auf 508 TFLOPS gegen 493 bei Claude Opus 5 nach rund 22 Stunden (vier Versuche, bester Lauf berichtet); ein zweiter 24-Stunden-Lauf führt ein automatisiertes Post-Training von Qwen3-30B-A3B durch und hebt AIME24 von 53,3 auf 60,0 Prozent, laut Haus gleichauf mit Claude Opus 5 bei weniger Annotator-Tokens; in Pokémon Red erreicht das Modell ohne spielspezifische Anpassung nach 3.082 Zügen und rund 6 Mio. Tokens drei Arena-Orden, etwa ein Drittel der Hauptgeschichte. Verfügbar ab dem Ankündigungstag über die eigenen Produkte, die API und das AI Studio; für den 15. Oktober 2026 sind offene Gewichte angekündigt.","sources":["https://www.stepfun.com/step-5-preview","https://huggingface.co/stepfun-ai/Step-5-Preview-BF16"]},{"id":"image-qwen-image-2-1-2026-09-20","date":"2026-09-20","datePrecision":"day","modality":"image","name":"Qwen-Image-2.1","org":"Alibaba (Qwen)","firstOfKind":"","capability":"Bildmodell mit 7 Mrd. Parametern im Generierungsteil (32 Single-Stream-DiT-Layer), das Text-zu-Bild und Bildbearbeitung in einem System führt. Drei Fähigkeiten hebt das Haus hervor: native Transparenz, also direkte RGBA-Ausgabe mit Alphakanal statt nachträglichem Freistellen — der empfohlene Prompt benennt sie ausdrücklich („This is an RGBA image with transparency… The image has alpha channel and the background is transparent.\"); bis zu zehn Referenzbilder in einer Anfrage für Kompositionen aus mehreren Motiven; und native 2K-Auflösung bis 2048 × 2048 Pixel über Seitenverhältnisse von 1:1 bis 9:16. Bearbeitet wird lokal über Kreise, aufgemalte Markierungen oder Masken, wobei Personen und Produkte über die Bearbeitung hinweg erhalten bleiben sollen. Die Gewichte liegen als Safetensors in BF16 auf HuggingFace, Inferenz setzt torch ≥ 2.4.0 und transformers ≥ 5.17 voraus. Unterstützung im Ökosystem ab Tag eins: Diffusers über eine eigene QwenImage21Pipeline, ComfyUI nativ, dazu vLLM-Omni und SGLang.","sources":["https://github.com/QwenLM/Qwen-Image-2.1","https://huggingface.co/Qwen/Qwen-Image-2.1"]},{"id":"text-mimo-v2-6-2026-09-22","date":"2026-09-22","datePrecision":"day","modality":"text","name":"MiMo-V2.6-Pro & MiMo-V2.6-Flash","org":"Xiaomi MiMo","firstOfKind":"","capability":"Xiaomi öffnet die MiMo-V2.6-Reihe: zwei nativ omnimodale Modelle, MiMo-V2.6-Pro und MiMo-V2.6-Flash, dazu MiMo-V2.6-Pro-UltraSpeed mit nach eigener Angabe bis zu zwanzigfacher Ausgabegeschwindigkeit bei gleicher Qualität. Für MiMo-V2.6-Pro nennt das Haus 46,32 Punkte im Artificial Analysis Intelligence Index (Bildunterschrift der eigenen Grafik: „Artificial Analysis Intelligence Index v4.3, September 2026\"), vor Kimi K3 und Qwen3.8 Max und damit als „the strongest open-source model to date\" — zu den unveränderten Preisen der Vorgängerreihe V2.5. Ungewöhnlich ist die Offenlegung des Trainings: Der Reinforcement-Learning-Lauf wurde live unter mimo.xiaomi.com/rl gestreamt, dauerte weniger als sechs Tage und umfasste je Modell 30 RL-Schritte über rund 750.000 Trajektorien, zu angegebenen Kosten von etwa 0,85 Mio. USD für Flash und 2,62 Mio. USD für Pro; die Trefferquote auf den Trainingsaufgaben stieg relativ um 25 (Flash) beziehungsweise 12 Prozent, DeepSWE v1.1 von 48,80 auf 65,68 (Flash) und von 58,40 auf 72,57 (Pro). Drei Skalierungsachsen werden benannt: 1.568 Stichproben je Aktualisierung, bis zu 1 Mio. Token Kontext und 3,5 bis 3,7 Mrd. Token je Schritt auf einer vollständig asynchronen Architektur; eine Aufgabenmischung über Programmierung, allgemeine Agenten, visuelle und Cyber-Aufgaben; sowie mehr Rechenzeit für die Bewertung über gruppeninterne Vergleiche. Der Router wurde eingefroren, um Drift zu unterdrücken, und gegen Reward Hacking arbeitet das Haus mit Belohnungsdesign, adversarischer Auswertung, Anomalieerkennung und gegenprüfenden Verifizierern. Mitveröffentlicht werden der technische Bericht, die Trainingsumgebungen und der RL-Code. Verfügbar ab dem Ankündigungstag im AI Studio, in MiMo Code, in MiMo Desktop (erste offizielle Fassung, Ende des Early Access), über die MiMo-API-Plattform und OpenRouter. Preise je Mio. Token in USD (Cache-Treffer / Cache-Fehlschlag / Ausgabe): Flash 0,0028 / 0,14 / 0,28; Pro 0,0036 / 0,435 / 0,87; Pro-UltraSpeed 0,036 / 4,35 / 8,7.","sources":["https://mimo.xiaomi.com/mimo-v2-6","https://huggingface.co/collections/XiaomiMiMo/mimo-v26","https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf"]}]}