← Zurück zum Zeitstrahl

Offenheit · Gewichte

Offenheit: die Lücke von 194 Tagen

Der Anteil offener Gewichte erreichte 2023 mit 38 % seinen Höchststand und fiel 2025 auf 17 %. Zwischen dem 26. Juni 2025 und dem 6. Januar 2026 liegen 194 Tage, in denen dieser Datensatz keinen einzigen Release mit offenen Gewichten verzeichnet — bei 16 geschlossenen, davon 12 mit Premierenanspruch. Trotzdem stammen 41 der 117 belegten Premieren von offenen Modellen.

Über offene Modelle gibt es zwei Erzählungen. Die eine sagt, offene Gewichte holten unaufhaltsam auf. Die andere sagt, sie seien abgehängt. Über 284 primärgeprüfte Releases gemessen ist keine von beiden richtig: der Anteil offener Gewichte schwankt seit vier Jahren um die 30 Prozent, ohne Trend nach oben — und mit einem Einbruch, der nicht dort liegt, wo man ihn vermuten würde.

89 der 284 Releases kamen mit offenen Gewichten, also 31 Prozent. Sie stammen von 34 verschiedenen Häusern — und liefern einen überproportionalen Anteil der belegten Premieren.

Kurve

Der Anteil offener Gewichte pro Jahr

Jede Zeile ist ein Jahr: wie viele Releases offene Gewichte hatten, wie viele proprietär blieben, und der Anteil daraus. Ein Trend nach oben wäre hier als Treppe zu sehen. Er ist es nicht.

JahrOffenGeschlossenAnteil offenVerhältnis
20225936 %
2023142338 %
2024173533 %
202573417 %
2026469433 %

Höchststand 38 Prozent (2023), Tiefpunkt 17 Prozent (2025), aktuell 33 Prozent (2026). Der höchste Wert des Datensatzes liegt damit drei Jahre zurück. Das Jahr 2026 ist noch nicht zu Ende — es reicht bislang bis zum 22. September 2026.

Was in diesen 89 mitzählt

„Offen“ heißt hier: die Gewichte sind herunterladbar, nicht: die Lizenz ist OSI-konform. „Kimi K3 (Open Weights)“ vom 27. Juli 2026 zählt mit, obwohl seine Lizenz für kommerzielle Nutzung eine eigene Vereinbarung verlangt. Bei 4 der 89 Releases waren die Gewichte am Verifikationsdatum außerdem noch nicht verfügbar: Kimi K3 (16. Juli 2026) — Zum Launch nur über App und API; die Gewichte folgten am 27. Juli 2026 als eigener Eintrag. MiniMax H3 (31. Juli 2026) — Als Open-Weights-Modell angekündigt; die Gewichte folgten am 5. August 2026 als eigener Eintrag — in der EU allerdings nicht lizenziert. GLM-5.3 (14. August 2026) — Gewichte laut Z.ai erst zwei Wochen nach dem Launch, nach Abschluss von Sicherheitsprüfung und Hardening — am 14. August 2026 nicht herunterladbar. Step 5 Preview (20. September 2026) — Offene Gewichte laut StepFun erst zum 15. Oktober 2026; am 20. September 2026 enthielt das angelegte HuggingFace-Repository nur eine .gitattributes-Datei. Wer streng zählt, kommt also auf 85 statt 89, und 2026 auf 30 statt 33 Prozent. Beide Befunde dieser Seite — die flache Kurve und die Lücke — hängen nicht daran.

Die Lücke

194 Tage ohne ein einziges offenes Modell

Der auffälligste Befund dieser Seite ist eine Abwesenheit. Zwischen 26. Juni 2025 und 6. Januar 2026 liegen 194 Tage, in denen dieser Datensatz keinen einzigen Release mit offenen Gewichten verzeichnet. Davor endete die Serie mit FLUX.1 Kontext [dev] (open weights) (Black Forest Labs), danach begann sie neu mit LTX-2 (Lightricks).

In dem Fenster erschienen 16 Releases aus 9 Häusern — 12 davon mit einem belegten Premierenanspruch, und alle proprietär. Ein halbes Jahr lang verschob sich also, was möglich war, und keine dieser Verschiebungen war nachbaubar.

Ein Teil der Erklärung liegt allerdings nicht bei der Offenheit, sondern im allgemeinen Tempo: 16 Releases in 194 Tagen sind ein Release alle 12,1 Tage — und damit langsamer als der Jahresschnitt 2025 von 7,98 Tagen. Dieses Halbjahr war insgesamt still, nicht nur auf der offenen Seite. Die Lücke ist also weniger ein Bruch in der Offenheit als die offene Seite einer allgemeinen Pause — nur dass die geschlossene Seite in derselben Pause noch 12 Premieren lieferte und die offene keine.

Wichtige Einschränkung

„Kein offener Release“ heißt hier: keiner, der die Aufnahmeschwelle dieses Datensatzes erreicht — also eine Fähigkeit brachte, die vorher kein öffentlich verfügbares Modell hatte. In diesem Halbjahr wurden sehr wohl offene Gewichte veröffentlicht, darunter Punktversionen und Feintunings etablierter Familien. Die Aussage ist also nicht „es gab nichts Offenes“, sondern: es gab nichts Offenes, das den Stand der Technik verschoben hätte. Wer die Zahl zitiert, sollte diesen Unterschied mitzitieren.

Die 12 Premieren in der Lücke — alle proprietär

  1. xAI Grok 4xAIText★ Premiere

    Erstes Modell, das rund 50 % auf „Humanity's Last Exam" erreichte

    x.ai

  2. Runway AlephRunwayVideo★ Premiere

    Erstes leistungsfähiges allgemeines In-Context-Videobearbeitungsmodell

    runwayml.com

  3. Google DeepMind Genie 3Google DeepMindVideo★ Premiere

    Echtzeit-Weltmodell als neue Modalität

    deepmind.google

  4. GPT-5OpenAIText★ Premiere

    Erstes einheitliches Modell aus schnellem Modus und Reasoning mit automatischem Compute-Routing in einem einzigen API-Endpunkt

    openai.comen.wikipedia.org

  5. Nano Banana (Gemini 2.5 Flash Image)GoogleBild★ Premiere

    Erstes Bildmodell, das konversationelles Mehrfach-Editieren mit Konsistenz mainstreamfähig machte

    developers.googleblog.com

  6. OpenAI gpt-realtime (Realtime API GA)OpenAIAudio★ Premiere

    Erste hochmoderne Speech-to-Speech-API, die in der allgemeinen Verfügbarkeit eine SIP-Telefonie-Integration enthält

    community.openai.comchatlyai.app

  7. MAI-Voice-1Microsoft AIAudio★ Premiere

    Erstes hauseigenes Speech-Generation-Modell der Microsoft-AI-(MAI)-Sparte.

    microsoft.ai

  8. MAI-1-previewMicrosoft AIText★ Premiere

    Erstes vollständig hauseigenes, End-to-End trainiertes Foundation-LLM von Microsoft AI.

    microsoft.ai

  9. Seedream 4.0ByteDanceBild★ Premiere

    Erstes Modell eines chinesischen Labors an der Spitze globaler Bild-Arenen

    seed.bytedance.com

  10. Luma Ray3Luma AIVideo★ Premiere

    Erstes „Reasoning"-Videomodell und erstes mit hochwertigem 16-Bit-HDR

    lumalabs.aibusinesswire.com

  11. Suno v5 + Suno StudioSuno AIAudio★ Premiere

    Erster KI-Musikgenerator, der eine integrierte generative Digital Audio Workstation auslieferte (Mehrspur + MIDI-Export)

    prnewswire.commusically.com

  12. MAI-Image-1Microsoft AIBild★ Premiere

    Erstes hauseigenes Bildgenerierungs-Modell von Microsoft AI.

    microsoft.ai

Gegen die Erwartung

Offene Modelle sind nicht die billige Kopie

Wenn offene Gewichte hinterherliefen, müssten sie unter den Premieren unterrepräsentiert sein: erst macht ein Frontier-Labor etwas möglich, dann zieht die offene Welt nach. Die Daten zeigen das Gegenteil. Offene Modelle stellen 31,3 Prozent der Releases, aber 35,0 Prozent der belegten Premieren — 41 von 117. Das sind 3,7 Prozentpunkte mehr, als ihr Mengenanteil erwarten ließe.

Die Lesart, die dazu passt: offene Veröffentlichung ist in diesem Datensatz keine Nachhut-Strategie, sondern eine Markteintrittsstrategie. Ein Haus ohne Vertriebsapparat und ohne bestehende Nutzerbasis kann Aufmerksamkeit am billigsten erzeugen, indem es etwas herausgibt, das andere weiterverwenden können. Wer schon verteilt, hat diesen Anreiz nicht. Prüfbar ist daran nur die Zahl — die Begründung ist eine Deutung.

Welche Premieren das im Einzelnen sind, mit Datum und Quelle, steht auf der Seite über die belegten Premieren.

Hauspolitik

Offenheit ist selten eine Entscheidung pro Modell

Über Häuser gezählt statt über Releases ergibt sich ein klareres Bild. Von 54 Häusern im Datensatz veröffentlichten 22 ausschließlich offen, 20 ausschließlich geschlossen — und nur 12 taten beides. Für die große Mehrheit ist Offenheit also keine Abwägung pro Release, sondern eine Festlegung des Hauses.

Wie hier ein „Haus“ gezählt wird

Jeder Eintrag trägt zwei Felder: die Urhebernennung, wie sie in der Primärquelle steht („Alibaba (Qwen)“, „Google DeepMind“), und daneben das Haus als eigener, von Hand gesetzter Schlüssel. Gezählt wird ausschließlich das Haus, also die Firma — Teams, Divisionen und Schreibvarianten desselben Unternehmens fallen zusammen.

Eine Unschärfe bleibt, und sie ist nicht auflösbar: 4 Nennungen kreditieren mehrere Firmen gemeinsam. Dort zählt der Release beim federführenden Haus, also bei dem, das ihn veröffentlicht hat — „OpenMOSS / MOSI.AI / Shanghai Innovation Institute“ bei OpenMOSS; „RunwayML / Stability AI“ bei Runway; „Shanghai Jiao Tong University / Cambridge University“ bei Shanghai Jiao Tong University; „Stability AI / CompVis / RunwayML“ bei Stability AI. 4 mitkreditierte Häuser kommen unter keiner anderen Nennung vor und erscheinen deshalb in dieser Zählung überhaupt nicht: MOSI.AI, Shanghai Innovation Institute, Cambridge University, CompVis. Die Zahl 54 ist damit um bis zu 4 zu niedrig, nicht zu hoch.

Praktisch heißt das: die Frage „wird dieses Modell offen kommen?“ ist meist schon beantwortet, bevor das Modell existiert. Die 12 gemischten Häuser sind die interessanten — dort ist die Lizenz tatsächlich eine Entscheidung: Alibaba, Black Forest Labs, DeepSeek, Google, Ideogram, Meta, Microsoft, MiniMax, OpenAI, Runway, Stability AI, Suno.

Gleichzeitig ist die offene Seite weniger konzentriert als erwartet. Die 89 offenen Releases verteilen sich auf 34 Häuser, von denen 19 genau eines beigetragen haben. Die drei produktivsten — Meta (10), Alibaba (9), Stability AI (8) — stellen zusammen nur 30 Prozent. Die geschlossene Seite ist das Gegenteil: dort dominieren wenige Häuser mit zweistelligen Release-Zahlen.

Modalitäten

Wo offen überhaupt vorkommt

Der Gesamtanteil verdeckt, wie unterschiedlich die vier Modalitäten sind.

ModalitätOffenGesamtAnteilVerhältnis
Text5113039 %
Audio165828 %
Bild124825 %
Video104821 %

Text & Reasoning ist mit 39 Prozent die offenste Modalität, Video mit 21 Prozent die geschlossenste. Der plausible Grund ist nicht Ideologie, sondern Kostenstruktur: Text lässt sich auf einer Consumer-GPU sinnvoll weiterverwenden, ein Videomodell nicht. Offene Gewichte, die niemand betreiben kann, erzeugen keine Gegenleistung — und damit fällt der Anreiz weg, sie herauszugeben.

2022 · 5 offene Releases

Offene Gewichte 2022

  1. Stable Diffusion 1.4 (public release)Stability AI / CompVis / RunwayMLBild★ Premiere

    Erstes breit verteiltes Open-Weights-Modell für Text-zu-Bild, das auf einer Consumer-GPU lauffähig ist

    stability.aien.wikipedia.org

  2. Whisper (large-v1)OpenAIAudio★ Premiere

    Erstes Open-Source-ASR-Modell, das die Qualität mehrsprachiger Transkription auf kommerziellem Niveau weitgehend erreicht

    openai.comtechcrunch.comarxiv.org

  3. Stable Diffusion 1.5RunwayML / Stability AIBild

    Verbesserte Bildqualität, bessere Ästhetik und höhere Prompt-Treue gegenüber SD 1.4 auf derselben 512×512-Architektur

    huggingface.coen.wikipedia.org

  4. Stable Diffusion 2.0Stability AIBild

    Native Auflösung von 768×768, neuer OpenCLIP-Text-Encoder, Depth-to-Image-Pipeline und ein 4×-Upscaler-Modell

    stability.aien.wikipedia.org

  5. Whisper large-v2OpenAIAudio

    Verbessertes Whisper-Modell mit einer um etwa 10–15 % geringeren Wortfehlerrate, insbesondere bei verrauschten Aufnahmen, das 2,5-mal länger und mit Regularisierung trainiert wurde

    github.comhuggingface.co

2023 · 14 offene Releases

Offene Gewichte 2023

  1. LLaMA 1MetaText★ Premiere

    Erste offen verfügbare LLM-Familie, die mit den damaligen Modellen der GPT-3-Klasse konkurrenzfähig war

    ai.meta.com

  2. ModelScope Text-to-VideoAlibaba DAMO AcademyVideo★ Premiere

    Erstes breit zugängliches Open-Source-Modell für Text-zu-Video

    huggingface.cohuggingface.co

  3. AutoGPTSignificant GravitasText★ Premiere

    Erster viraler autonomer KI-Agent

    github.com

  4. BarkSuno AIAudio★ Premiere

    Erstes Open-Source-Modell, das ausdrucksstarke Sprache mit eingebetteten nonverbalen Lauten und Hintergrundgeräuschen in einem einzigen Durchgang erzeugt

    github.comhuggingface.co

  5. Meta MusicGen (open-source)Meta AIAudio★ Premiere

    Erstes hochwertiges Open-Weight-Modell zur Musikgenerierung mit Steuerung über Text und Melodie

    arxiv.orggithub.commusically.com

  6. Llama 2MetaText★ Premiere

    Erstes großes Open-Weight-Modell eines bedeutenden Frontier-Labors, das eine breite kommerzielle Nutzung ausdrücklich gestattet

    about.fb.comai.meta.com

  7. Stable Diffusion XL 1.0 (SDXL)Stability AIBild★ Premiere

    Erstes Open-Weights-Modell mit einer zweistufigen Pipeline aus Basismodell und Refiner bei nativer Auflösung von 1024 Pixeln

    stability.aiprnewswire.com

  8. Meta AudioCraft (MusicGen + AudioGen + EnCodec)Meta AIAudio

    Open-Source-Framework zur Audiogenerierung, das Text-zu-Musik (MusicGen), Text-zu-Soundeffekten (AudioGen) und einen verbesserten neuronalen Audio-Codec (EnCodec) in einer Bibliothek vereint

    about.fb.comgithub.com

  9. Qwen-7BAlibabaText

    Erstes offenes Modell der Qwen-Familie von Alibaba.

    github.com

  10. Meta SeamlessM4TMetaAudio★ Premiere

    Erstes einheitliches multimodales und mehrsprachiges Sprachübersetzungsmodell

    ai.meta.com

  11. Falcon 180BTIIText

    180B-Parameter-Modell auf 3,5 Billionen Tokens; bei Veröffentlichung das größte offen verfügbare LLM.

    huggingface.co

  12. Mistral 7BMistral AIText★ Premiere

    Erstes Open-Weights-Modell mit 7B, das ein 13B-Modell auf ganzer Linie in Standard-Benchmarks schlägt

    mistral.ai

  13. Stable Video Diffusion (SVD)Stability AIVideo★ Premiere

    Erstes breit veröffentlichtes Open-Weights-Diffusionsmodell für Image-to-Video

    stability.aiventurebeat.com

  14. Mixtral 8x7BMistral AIText★ Premiere

    Erstes Open-Weights-Sparse-MoE-Modell dieser Größenordnung, das die Leistung von GPT-3.5 erreicht

    mistral.ai

2024 · 17 offene Releases

Offene Gewichte 2024

  1. Google GemmaGoogleText★ Premiere

    Googles erstes offenes Sprachmodell

    blog.google

  2. Llama 3 (8B / 70B)MetaText

    Beste quelloffene 8B- und 70B-Modelle bei Erscheinen, mit 128K Kontext und verbessertem Reasoning, Coding und Befolgen von Anweisungen

    ai.meta.com

  3. Microsoft Phi-3 (Phi-3-mini)MicrosoftText★ Premiere

    Wegweisendes SLM-auf-dem-Gerät

    azure.microsoft.com

  4. Stability Stable Audio OpenStability AIAudio

    Open-Weights-Diffusionsmodell für Text-to-Audio zur Erzeugung von bis zu 47 Sekunden an Soundeffekten und Samples, verfügbar für die nichtkommerzielle Nutzung

    stability.aix.com

  5. Stable Diffusion 3 Medium (open weights)Stability AIBild★ Premiere

    Erstes Open-Weights-Modell, das die Architektur eines Multimodal Diffusion Transformer (MMDiT) für die Text-to-Image-Generierung nutzt

    stability.aix.com

  6. Kyutai MoshiKyutaiAudio★ Premiere

    Erstes Echtzeit-Voll-Duplex-Sprachdialog-Foundation-Model

    github.comarxiv.org

  7. Llama 3.1 405BMetaText★ Premiere

    Erstes Open-Weights-Modell mit über 400B Parametern, das mit geschlossenen Frontier-Modellen konkurrenzfähig ist

    ai.meta.com

  8. FLUX.1 (pro / dev / schnell)Black Forest LabsBild★ Premiere

    Erstes Apache-lizenziertes Modell, das Bildqualität auf Frontier-Niveau erreicht (FLUX.1[schnell])

    bfl.aiventurebeat.com

  9. Qwen2.5AlibabaText

    Volle 0,5B–72B-Familie mit starkem Coding/Mathe; eines der größten Open-Source-Releases.

    qwenlm.github.io

  10. Llama 3.2 (Vision + Edge)MetaText

    Metas erste offene multimodale Modelle (11B/90B Vision) plus 1B/3B-Textmodelle für Mobil/Edge.

    ai.meta.com

  11. F5-TTSShanghai Jiao Tong University / Cambridge UniversityAudio★ Premiere

    Erste Architektur aus Diffusion-Transformer mit Flow Matching, die auf Zero-Shot-TTS angewendet wird und autoregressive Qualität erreicht oder übertrifft

    arxiv.orggithub.com

  12. Stable Diffusion 3.5 LargeStability AIBild★ Premiere

    Erstes Open-Weights-Bildgenerierungsmodell mit über 8B Parametern, das unter einer freizügigen kommerziellen Lizenz veröffentlicht wurde

    stability.aisiliconangle.com

  13. Genmo Mochi 1GenmoVideo★ Premiere

    Größtes Open-Source-Text-zu-Video-Modell zum Zeitpunkt der Veröffentlichung (10B Parameter, Apache 2.0)

    siliconangle.comgithub.comgenmo.ai

  14. Lightricks LTX-Video (LTXV)LightricksVideo★ Premiere

    Erstes Open-Source-Videomodell mit Echtzeit-Generierung (schneller als die Wiedergabe)

    github.comcomfyui-wiki.comdataconomy.com

  15. Tencent HunyuanVideoTencentVideo★ Premiere

    Größtes Open-Source-Videogenerierungsmodell zum Zeitpunkt der Veröffentlichung (13B Parameter), erstes offenes Modell, das die kommerzielle Frontier-Qualität erreicht

    github.comtechnode.com

  16. Kokoro-82M v0.19hexgrad (independent)Audio★ Premiere

    Erstes Modell mit unter 100M Parametern, das Platz 1 auf einem öffentlichen TTS-Qualitäts-Leaderboard erreicht

    huggingface.co

  17. DeepSeek-V3DeepSeekText★ Premiere

    Erstes Open-Weights-Modell, das die Leistung der GPT-4o-Klasse bei Trainingskosten unter 6 Mio. US-Dollar erreicht

    arxiv.org

2025 · 7 offene Releases

Offene Gewichte 2025

  1. DeepSeek-R1DeepSeekText★ Premiere

    Erstes Open-Weights-Reasoning-Modell, das die Leistung auf o1-Niveau erreicht, unter MIT-Lizenz

    github.comarxiv.org

  2. Kokoro TTS v1.0hexgrad (independent)Audio

    Erweiterte Version von Kokoro mit Unterstützung für 8 Sprachen (Englisch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, Mandarin, Portugiesisch) und 54 Stimmen unter Apache 2.0

    huggingface.co

  3. Alibaba Wan 2.1Alibaba (Wan Team)Video★ Premiere

    Erstes Open-Source-Modell, das die VBench-Bestenliste für Videoqualität anführte und alle geschlossenen Modelle übertraf

    alibabacloud.comgithub.comcomfyui-wiki.com

  4. Sesame CSM (conversational speech model) demoSesame AIAudio★ Premiere

    Erstes Open-Source-Modell, das explizit auf den psychologischen Benchmark der 'Voice Presence' für dialogorientierte KI abzielt

    sesame.comgithub.com

  5. Llama 4 (Scout / Maverick)MetaText★ Premiere

    Erstes Open-Weights-Modell mit einem Kontextfenster von 10 Mio. Tokens

    ai.meta.com

  6. Alibaba Qwen3AlibabaText

    Open-Weights-Familie (0,6B–235B MoE) mit umschaltbarem „Thinking/Non-Thinking"-Reasoning.

    qwenlm.github.io

  7. FLUX.1 Kontext [dev] (open weights)Black Forest LabsBild★ Premiere

    Erstes Open-Weights-Modell, das die Leistung proprietärer Modelle bei der iterativen, kontextbewussten Bildbearbeitung erreichte

    bfl.aihuggingface.co

2026 · 46 offene Releases

Offene Gewichte 2026

  1. LTX-2LightricksVideo★ Premiere

    Erstes produktionsreifes Open-Weights-Modell, das Video und Audio synchron in einem Durchgang mit nativem 4K und offenem Trainingscode generiert.

    globenewswire.com

  2. FLUX.2 [klein]Black Forest LabsBild

    Kompakte Open-Weights-Modellfamilie (4B und 9B), die Bildgenerierung und -Editing in einer Architektur vereint und Text-to-Image, Single-Reference-Editing sowie Multi-Reference-Generierung in unter einer Sekunde auf Consumer-Hardware (ab ca. 13 GB VRAM) liefert.

    bfl.aihuggingface.co

  3. HunyuanImage 3.0-InstructTencentBild

    Natives multimodales Open-Weights-Modell (80B MoE, ca. 13B aktive Parameter) mit Fokus auf praezisem, instruktionsgesteuertem Image-Editing: Reasoning-gestuetztes Prompt-Enhancement, Image-to-Image, Multi-Image-Fusion (bis zu 3 Eingabebilder) und Chain-of-Thought.

    github.com

  4. Kimi K2.5Moonshot AIText

    Nativ multimodales, agentisches Open-Weights-Modell mit einer 1-Billion-Parameter-Mixture-of-Experts-Architektur (etwa 32 Mrd. aktive Parameter), das auf rund 15 Billionen gemischten Bild- und Text-Tokens trainiert wurde. Es versteht Text, Bilder und Video und bringt einen Agent-Swarm mit, der komplexe Aufgaben auf bis zu 100 parallele Sub-Agents aufteilt.

    techcrunch.comsiliconangle.com

  5. GLM-5Zhipu AI (Z.ai)Text★ Premiere

    Erstes Frontier-Open-Weights-Modell einer börsennotierten Foundation-Model-Firma (Zhipu/Z.ai).

    huggingface.coscmp.com

  6. Fish Audio S2Fish AudioAudio

    Open-Weights-TTS-Modell mit Dual-AR-Architektur (rund 4B Parameter auf der Zeitachse, 400M auf der Tiefenachse), trainiert auf ueber 10 Millionen Stunden Audio in etwa 50 Sprachen. Erlaubt feinkoernige Inline-Steuerung von Prosodie und Emotion ueber natuerlichsprachliche Tags wie [laugh], [whispers] oder [super happy]. Veroeffentlicht mit Model-Weights, Fine-Tuning-Code und einer SGLang-basierten Streaming-Inferenz-Engine.

    fish.audio

  7. GLM-5.1Zhipu / Z.aiText★ Premiere

    Erstes Open-Weights-Modell an der Spitze von SWE-Bench Pro

    huggingface.co

  8. MOSS-AudioOpenMOSS / MOSI.AI / Shanghai Innovation InstituteAudio★ Premiere

    Eines der ersten Open-Weights-Foundation-Modelle, das Verstehen von Sprache, Umgebungsklang und Musik samt zeitbewusstem Reasoning in einem Modell vereint.

    github.comopenmoss.ai

  9. Kimi K2.6Moonshot AIText

    Open-Weights-Modell auf 1-Billion-Parameter-MoE-Basis (32 Mrd. aktive Parameter), spezialisiert auf agentisches Coding und Langzeit-Aufgaben. Es kann laut Moonshot bis zu rund 13 Stunden durchgehend coden und bringt ein Agent-Swarm-System mit bis zu 300 spezialisierten Sub-Agents und bis zu 4.000 koordinierten Schritten pro Lauf.

    yicaiglobal.com

  10. DeepSeek V4 (Preview)DeepSeekText

    Open-Weights-Flaggschiff in zwei Varianten: V4-Pro (1,6 Bio. Parameter total, 49 Mrd. aktiv) und V4-Flash (284 Mrd. total, 13 Mrd. aktiv), beide standardmäßig mit 1-Mio.-Token-Kontext und neuartigen Attention-Mechanismen. V4-Pro bietet verbesserte agentische Fähigkeiten und Reasoning der Spitzenklasse in Mathematik, STEM und Coding.

    api-docs.deepseek.com

  11. Mistral Medium 3.5Mistral AIText

    Frontier-multimodales Modell mit einstellbarem reasoning_effort und 256k Kontext; neuer Standard für Le Chat.

    docs.mistral.ai

  12. Stable Audio 3.0Stability AIAudio

    Modellfamilie zur Audiogenerierung aus vier Modellen: Small SFX, Small, Medium und Large. Erzeugt vollstaendige Kompositionen von bis zu rund sechs Minuten mit erhaltener musikalischer Struktur, mit Variable-Length-Generierung, Audio-Inpainting (Segment-Editing und Fortsetzung) sowie LoRA-Fine-Tuning. Trainiert ausschliesslich auf lizenzierten und Creative-Commons-Daten.

    stability.aitechcrunch.com

  13. Hy-MT2 (1,8B / 7B / 30B-A3B)Tencent (Hunyuan)Text

    Drei Übersetzungsmodelle unter Apache 2.0, ausdrücklich als „fast thinking“ ausgelegt: kein Denkblock, das Modell antwortet direkt. Zwei dichte Modelle (Architektur HunYuanDenseV1, je 32 Schichten, verborgene Dimension 2048 bzw. 4096, FFN-Zwischendimension 6144 bzw. 14.336, 16 bzw. 32 Abfrage- und 4 bzw. 8 KV-Köpfe bei Kopfdimension 128, QK-Norm, geteilte Ein- und Ausgabe-Embeddings, Vokabular 120.818 bzw. 128.167) und ein MoE-Modell (HYV3, 48 Schichten, 128 Experten plus ein geteilter, acht aktive pro Token, Expertendimension 768, verborgene Dimension 2048, 32 Abfrage- und 4 KV-Köpfe, Sigmoid-Router mit Expertenbias und Skalierungsfaktor 2,826, erste Schicht dicht mit FFN-Dimension 6912, rope_theta 11.158.840); Kontextfenster laut config.json in allen drei Fällen 262.144 Token, empfohlene Ausgabelänge 4096. Übersetzt zwischen 33 Sprachen, die Sprachtabelle führt zusätzlich Tibetisch, Kasachisch, Mongolisch, Uigurisch und Kantonesisch. Die Trainingskette ist der eigentliche Beitrag: Auf ein MT-orientiertes Mid-Training mit rund 1 Bio. Token Übersetzungsdaten folgt „Family-Centric Post-training“ — die Daten werden nicht gemischt, sondern nach Sprachfamilien getrennt (westeuropäisch, ostasiatisch, rechtsläufig-nahöstlich), und je Familie entsteht ein eigener Lehrer. Dessen Signal kommt ohne ein größeres Modell zustande: Der „Chimera Teacher“ trainiert nichts Neues, sondern verschmilzt Kandidatenübersetzungen mehrerer bestehender Hy-Modelle mit dem Datensatz-Label zu einem Referenzsatz und bewertet daran die Ausgabe des Schülers (Forward-KL, implementiert auf Hy3-Preview). Danach GRPO je Familie mit zweistufiger Belohnung — ein Regelfilter setzt Wiederholungsschleifen und Sprachmischungen sofort auf 0, erst dann urteilt ein LLM nach der MQM-Fehlertypologie über fünf Dimensionen (Terminologie, Genauigkeit, sprachliche Konventionen, Stil, Instruktionsbefolgung) —, zum Schluss Cross-family OPD, das alle Familienlehrer plus einen Hy-Instruct-Lehrer für allgemeine Anweisungen über Reverse-KL in ein einziges Modell destilliert. Selbstberichtete Werte als XCOMET-XXL / CometKiwi / GEMBA (×100), FLORES-200 über alle 1.056 Richtungen: 1,8B 79,77 / 73,41 / 78,64, 7B 86,89 / 76,03 / 87,23, 30B-A3B 87,47 / 76,34 / 88,79 (Vorgänger HY-MT1.5-7B: 80,98 / 73,36 / 78,30). WMT25: 7B 63,86 / 71,21 / 82,24, 30B-A3B 62,89 / 71,08 / 84,34 — bei GEMBA der beste Wert des Vergleichsfeldes, über Gemini 3.1 Pro und GPT-5.5. Mandarin⇔Minderheitensprachen 62,05 und 62,44 XCOMET-XXL. Auf den hauseigenen Sets DomainMTBench (Durchschnitt XCOMET / GEMBA) 30B-A3B 95,04 / 93,73, 7B 94,92 / 92,79, 1,8B 93,41 / 91,08; WildMTBench 7B 90,28 / 88,93, 30B-A3B 89,87 / 89,25; IFMTBench (Gesamt) 84,69, 83,14 und 69,36. Quantisierung als eigene Trainingsstufe, nicht als Nachbearbeitung: FP8, Q4_K_M, 2 Bit und 1,25 Bit, letztere beiden per QAT mit Distillation, die 1,25-Bit-Fassung als ternäre Darstellung mit feingranularer Sparsifizierung (Verfahren „Sherry“, Werkzeugkasten AngelSlim). Das 1,8B-Modell schrumpft damit auf rund 440 MB.

    huggingface.cohuggingface.cogithub.comarxiv.org

  14. Step 3.7 FlashStepFunText

    Vision-Language-MoE-Modell mit 198B Total-Parametern (rund 11B aktiv), das einen 1,8B-Vision-Encoder mit einem 196B-Sprach-Backbone koppelt und Charts, PDFs, UI-Wireframes und App-GUIs ohne separate Vision-API verarbeitet. Ausgelegt auf Coding-Agenten und Such-Workflows.

    marktechpost.comdigitalapplied.com

  15. MiniMax M3MiniMaxText★ Premiere

    Laut MiniMax erstes Open-Weights-Modell, das Frontier-Coding, 1M-Kontext und native Multimodalität in einer einzigen Architektur kombiniert.

    minimax.iomarktechpost.com

  16. Ideogram 4.0IdeogramBild★ Premiere

    Erstes Open-Weights-Modell von Ideogram, das seine Spitzentechnologie fuer Design- und Text-Rendering oeffentlich freigab.

    ideogram.aiideogram.ai

  17. DiffusionGemma 26B-A4BGoogle DeepMindText★ Premiere

    Erstes großes Open-Weights-Text-Diffusionsmodell von Google, das Text in parallelen Blöcken statt autoregressiv Token für Token erzeugt.

    blog.googlemarktechpost.com

  18. Kimi K2.7 CodeMoonshot AIText

    Coding-fokussiertes agentisches MoE-Modell mit 1T Total-Parametern (32B aktiv, 384 Experts) und 256K-Kontextfenster, das mehrstufig plant, editiert, Tools ausführt und debuggt. Reduziert die Zahl der Thinking-Tokens gegenüber K2.6 um rund 30 Prozent.

    huggingface.comarktechpost.com

  19. GLM-5.2Zhipu AI (Z.ai)Text

    Agentisch ausgerichtetes Coding-Modell auf Basis derselben 744B-MoE-Architektur wie GLM-5, mit einem nutzbaren Kontextfenster von 1M Tokens, bis zu 131.072 Output-Tokens und einem neuen System mit zwei Reasoning-Stufen (High und Max).

    digitalapplied.comaitoolly.com

  20. Ornith-1.0DeepReinforceText★ Premiere

    Erste offene Modellfamilie, die ihre eigenen RL-Scaffolds (Task-Harnesses) lernt

    deep-reinforce.commarktechpost.comhuggingface.co

  21. LongCat-2.0MeituanText★ Premiere

    Erstes Billionen-Parameter-Modell, das komplett auf inländischen chinesischen KI-Chips trainiert und ausgeführt wird.

    longcatai.orgventurebeat.com

  22. Hy3 (Hunyuan)Tencent (Hunyuan)Text

    Offizielle Version des Hunyuan-Hy3: 295B-MoE-Modell mit 21B aktiven Parametern und 256K-Kontext, veröffentlicht unter Apache-2.0-Lizenz. Gegenüber der Preview (23.04.) weitere Fortschritte bei Code-Generierung und Agenten-Fähigkeiten sowie mehr Stabilität; API über Tencent Cloud TokenHub. Erreicht laut Tencent flagship-nahe Intelligenz bei 2–5× kleinerem Parameter-Budget.

    hy.tencent.comtencent.com

  23. InklingThinking Machines LabText★ Premiere

    Erstes öffentlich verfügbares Modell von Thinking Machines Lab (Mira Murati).

    thinkingmachines.aifortune.combloomberg.com

  24. Kimi K3Moonshot AIText

    Neues MoE-Flaggschiff mit rund 2,8 Billionen Parametern, neuer „Kimi Delta Attention“-Architektur und 1-Mio.-Token-Kontext, ausgelegt auf langlaufendes Coding und Agenten-Workloads. Zwei Varianten zum Start: K3 Max (Chat/Agent) und K3 Swarm Max (massiv-paralleles Processing). Zum Launch nur über Kimi Code und die Kimi-App (ab ¥199-Tarif) nutzbar; die herunterladbaren Gewichte folgten am 27.07.2026.

    marktechpost.comsimonwillison.net

  25. Laguna S 2.1poolsideText

    Offenes MoE-Modell für agentisches Coding: 118 Mrd. Parameter total, davon nur 8 Mrd. pro Token aktiv, bis zu 1 Mio. Token Kontext und getrennte Thinking-/No-Thinking-Modi. Laut poolside 70,2 % auf Terminal-Bench 2.1 (mit Thinking), 78,5 % auf SWE-Bench Multilingual, 40,4 % auf DeepSWE v1.1 und 46,2 % auf SWE Atlas (Codebase-QnA). Gewichte auf Hugging Face unter OpenMDW-1.1 (BF16 plus FP8- und NVFP4-Quantisierungen), lauffähig auf einer einzelnen NVIDIA DGX Spark.

    poolside.aihuggingface.co

  26. Kimi K3 (Open Weights)Moonshot AIText

    Moonshot lädt die vollständigen Gewichte des K3-Flaggschiffs auf Hugging Face: 2,8 Billionen Parameter total, davon rund 104 Mrd. pro Token aktiv, 1.048.576 Token Kontext, ausgeliefert mit nativer MXFP4-Quantisierung und MXFP8-Aktivierungen. Das Modell ist damit selbst hostbar — allerdings unter einer eigenen „Kimi K3 License", die für kommerzielle Nutzung eine separate Vereinbarung verlangt, nicht unter einer OSI-Lizenz.

    huggingface.coartificialanalysis.ai

  27. MiniMax H3MiniMaxVideo

    Von MiniMax als „Open-Weights"-Videomodell angekündigt: H3 nimmt Text, Bild, Video und Audio in einer gemeinsamen Anfrage als Kontext (bis 7.000 Zeichen Prompt, bis 9 Referenzbilder, 3 Videoclips, 3 Audioclips — Audio nur zusammen mit Bild oder Video) und gibt natives 2K mit synchronem Stereo-Ton aus, 4 bis 15 Sekunden in ganzzahligen Schritten. Neben reiner Generierung nennt MiniMax Bearbeitung vorhandener Aufnahmen und Bewegungsübertragung zwischen Videos. Architektonisch führt eine neue „H3-Omni"-Transformer-Struktur Text-zu-Bild, Text-zu-Video, Bild-zu-Video und Audio in einem Rahmen zusammen — laut MiniMax rund 30 % mehr Trainingsdurchsatz —, dazu kommt ein neu entworfener Tokenizer (H3-VAE) mit hoher Kompression. Zum Preis sagt MiniMax nur relativ: 2K koste pro Sekunde weniger als ein Drittel vergleichbarer marktüblicher Modelle. Live ist H3 als „MiniMax-H3" in der API und im MiniMax Hub; die Gewichte sollen „innerhalb weniger Tage" vollständig offengelegt werden.

    platform.minimax.ioplatform.minimax.ionews.aibase.com

  28. DeepSeek-V4-Flash-0731DeepSeekText

    Ablösung der V4-Flash-Preview vom 24.04.2026 bei unveränderter Architektur und Größe (284 Mrd. Parameter total, rund 13 Mrd. aktiv, plus Modul für spekulatives Decoding): Laut DeepSeeks eigenem Changelog wurde das Modell nicht neu vortrainiert, sondern ausschließlich neu nachtrainiert („re-post-training"). Der Zugewinn liegt entsprechend bei agentischen Aufgaben — Terminal Bench 2.1 82,7, Cybergym 76,7, Toolathlon-Verified 70,3, DSBench-FullStack 68,7, DSBench-Hard 59,6, DeepSWE 54,4, NL2Repo 54,2, dazu 25,2 auf Agents' Last Exam und 25,1 auf AutomationBench Public. Der Denkaufwand ist in drei Stufen steuerbar (low, high, max), das Kontextfenster bleibt bei 1 Mio. Tokens mit bis zu 384K Ausgabe-Tokens. Neu sind das native Responses-API-Format (nur für Flash, nicht für Pro) und eine Anpassung für den Betrieb unter Codex. Preise: 0,14 USD Eingabe (Cache-Miss), 0,0028 USD bei Cache-Treffer und 0,28 USD Ausgabe pro Mio. Tokens — rund ein Drittel von V4-Pro (0,435/0,87 USD). Auf dem Artificial-Analysis-Intelligence-Index erreicht Flash-0731 in der Stufe max 50 Punkte, V4-Pro 44. Gewichte unter MIT-Lizenz auf Hugging Face.

    api-docs.deepseek.comhuggingface.coapi-docs.deepseek.comartificialanalysis.ai

  29. Shieldstral 1.0 3BMistral AIText

    Ein Klassifikator für Inhaltsmoderation mit 3 Mrd. Parametern, der keine feste Kategorienliste vorhersagt, sondern eine in natürlicher Sprache formulierte Richtlinie zur Laufzeit als Eingabe nimmt und einen kontinuierlichen Sicherheitswert zurückgibt. Technisch ist die Aufgabe auf eine binäre Ja/Nein-Frage reduziert: feste Systemnachricht, ein einziger Vorwärtsdurchlauf, ein einziges Ausgabetoken, dessen Wahrscheinlichkeit als Schwellwert dient. Derselbe Checkpoint lässt sich damit auf neue Richtlinien umstellen, ohne ihn nachzutrainieren. Basis ist Ministral-3-3B-Base-2512 mit nativem Pixtral-Bildencoder; über dieselbe Schnittstelle moderiert werden reiner Text, reine Bilder und Text-Bild-Kombinationen, in zwölf Sprachen einschließlich Deutsch. Trainiert auf Sequenzen bis 32K Tokens (theoretisch 256K), lauffähig auf einer einzelnen 16-GB-GPU. Lizenz: Apache 2.0, Gewichte auf Hugging Face, dazu ein technischer Bericht.

    mistral.aihuggingface.coarxiv.org

  30. MiniMax H3 (Open Weights)MiniMaxVideo

    MiniMax löst die Ankündigung vom 31.07.2026 ein und legt die Gewichte von H3 auf Hugging Face offen (MiniMaxAI/MiniMax-H3, ohne Zugangsschranke). Erst damit werden die Kennzahlen prüfbar: 33 Mrd. Parameter dicht besetzt in einem einzigen Strom — die modalitätsspezifischen Teile sitzen nur in den Ein- und Ausgabeschichten und in den AdaLN-Zweigen, nicht in getrennten Expertentürmen. Ausgabe 4 bis 15 Sekunden, bis 2K (voreingestellt 768 px kürzere Kante), 24 Bilder/s, Stereo-Ton mit 32 kHz, Seitenverhältnisse von 21:9 bis 9:16; als Text- und Bildencoder dient Qwen3-VL-32B unter Apache 2.0. Die Lizenz ist keine Open-Source-Lizenz, sondern ein „MiniMax H3 Community License Agreement“ mit einer entscheidenden Klausel: Als „Excluded Territories“ ausgenommen sind die Europäische Union, das Vereinigte Königreich, Südkorea und die USA. Untersagt ist dort nicht nur der Betrieb des Modells, sondern ausdrücklich auch Vervielfältigung, Bearbeitung, Weitergabe und Vorführung — und dasselbe gilt für die erzeugten Videos. Ab 20 Mio. US-Dollar Jahresumsatz braucht es zusätzlich eine schriftliche Genehmigung, kommerzielle Oberflächen müssen „MiniMax H3“ sichtbar nennen; Gerichtsstand ist Hongkong, Lizenzgeberin die Nanonoble Pte. Ltd. in Singapur.

    huggingface.coplatform.minimax.io

  31. Muse Glimmer 30BMeta (Superintelligence Labs)Text

    Metas erster Release mit offenen Gewichten seit Llama 4 — und unter Apache 2.0 für sämtliche Bestandteile: BF16-Gewichte, zwei 4-Bit-Quantisierungen, den Entwurfskopf für spekulatives Dekodieren und den Wahrnehmungsencoder. 29,6 Mrd. Parameter dicht (inklusive Encoder), 52 Schichten, Aufmerksamkeitsmuster [lokal, lokal, lokal, global] im Wechsel mit 2.048er Schiebefenster, 32 Abfrage- gegen 2 KV-Köpfe, Kontext 131.072+, Vokabular 202.048; Eingabe Text und Bild über einen eingefrorenen ViT-G/14 mit rund 1,8 Mrd. Parametern (bis 4.096 Bildtoken je Bild), Ausgabe Text, kein Audio. Destilliert aus dem geschlossenen Muse Spark: Logit-Destillation im Pre-Training, dann längere Kontexte und agentenlastige Daten mit reicheren Reasoning-Spuren, zuletzt SFT plus On-Policy-Destillation und Reinforcement Learning. Gebaut ist es für dauerhaft mitlaufende lokale Agenten — Werkzeugaufrufe mit exakten Schemata über lange Abläufe, Fehlerdiagnose und erneuter Versuch statt Abbruch, Denkstärke in vier Stufen (low/medium/high/xhigh) per Systemprompt, über 100 Sprachen, Gerüste OpenClaw und Hermes Agent. Der eigentliche Kniff ist die Hardware-Rechnung: 4-Bit-Quantisierung drückt das Sprachmodell unter 20 GB, sodass KV-Cache, Bildencoder und Entwurfsmodell gemeinsam in 24 bis 32 GB passen — Genauigkeitsverlust laut Meta 1,0 % in der 24-GB- und 0,2 % in der 32-GB-Fassung. Dazu ein Entwurfsmodell nach dem DFlash-Verfahren, das ganze Blöcke von 16 Token in einem Durchlauf vorschlägt: auf einer RTX 5090 von 74,9 auf 233,4 Token/s (3,1×), auf einem MacBook M5 Max von 26,6 auf 50,2 (1,8×), auf einem M4 Max von 23,7 auf 37,8 (1,5×). Wissensstand 4. Januar 2026.

    research.meta.aihuggingface.coresearch.meta.ai

  32. Nemotron 3.5 Lightning 30B-A3BNVIDIAText

    NVIDIAs erster eigener Eintrag in diesem Datensatz — und einer, der nicht Intelligenz, sondern Durchsatz zum Argument macht. 30 Mrd. Parameter mit 3 Mrd. aktiven in einer hybriden Mixture-of-Experts-Architektur: verschränkte Mamba-2- und MoE-Schichten mit einzelnen Aufmerksamkeitsschichten, dazu Multi-Token-Prediction-Köpfe, die mehrere Folgetoken auf einmal vorhersagen — im Training als reicheres Lernsignal, im Betrieb zur Beschleunigung. Kontext bis 1 Mio. Token, für den Betrieb auf einer einzelnen H100 mit 80 GB empfiehlt NVIDIA 256K. Vortrainiert auf über 20 Billionen Token in einem NVFP4-Rezept, also in 4 Bit, mit Megatron-LM; danach Fortsetzung des Vortrainings für die MTP-Köpfe, SFT und mehrstufiges Reinforcement Learning per GRPO über Mathematik, Code, Wissenschaft, Werkzeugnutzung und strukturierte Ausgaben. Sprachen: Englisch samt Programmiersprachen, Spanisch, Französisch, Deutsch, Italienisch, Japanisch. Reasoning ist per Chatvorlage abschaltbar. Veröffentlicht wird unter OpenMDW-1.1 — und zwar Gewichte, Trainingsdaten und Rezepte, einschließlich der Auswertungsrezepte zum Nachrechnen der eigenen Benchmarks. Neben den BF16-Referenzgewichten für Weiterverarbeitung stehen NVFP4-Checkpoints für den Betrieb bereit, dazu Entwurfsmodelle für spekulatives Dekodieren (DFlash sowie DSpark für DGX Spark). Die Leistungsversprechen: bis zu vierfache Ausgabegeschwindigkeit gegenüber ähnlich großen Modellen, auf PinchBench 86 % Genauigkeit bei 10.000 abgearbeiteten Aufgaben und dabei 30 % schneller als Qwen3.6 35B, und die Pareto-Front aus Genauigkeit und Geschwindigkeit für kleine offene Modelle auf dem Intelligence Index von Artificial Analysis. Läuft auf Blackwell (GB200, RTX 5090), Hopper (H100, H200) und Ampere (A100); zu holen über build.nvidia.com, Hugging Face, OpenRouter und ModelScope.

    blogs.nvidia.comdeveloper.nvidia.comhuggingface.co

  33. LTX-2.5LightricksVideo

    Nachfolger von LTX-2 vom 06.01.2026, wieder mit 22 Mrd. Parametern, aber mit deutlich verändertem Unterbau: Der Text-Encoder wechselt auf ein Gemma-4-12B mit Projektionsschicht, der Video-VAE lässt sich statt konvolutional selbst als Diffusionsmodell dekodieren, und die Ausgabelänge muss nicht mehr angegeben werden — ein eigener Duration-Head liest sie aus der Bildbeschreibung. Kern der Veröffentlichung ist die Pipeline, die Lightricks „Diffusion Fidelity Rendering“ nennt: Sie erzeugt zunächst Keyframes im Inneren der Sequenz, legt einen Detaillierungsdurchgang in voller Auflösung darüber und kann die Zeitachse in bis zu zwei Runden hochskalieren, was schnelle Bewegung sichtbar zusammenhält. Dazu natives 4K, bis 50 Bilder pro Sekunde, synchron erzeugter Ton — und laut Lightricks mehrere Einstellungen in einer einzigen Generierung, über die hinweg Figur, Umgebung, Lichtstimmung, Stimme und Bildstil erhalten bleiben. Neu ist außerdem eine HDR-Kette: Konditionierung über EXR-Frames und Ausgabe als szenenlineare EXR-Sequenz neben einem BT.2020/HLG-Video, damit das Material ohne verlustbehaftete Zwischenstufe in Farbkorrektur und VFX weiterläuft. Ausgeliefert wird ein Bündel — Basis- und destillierter Transformer (BF16, für die destillierte Fassung zusätzlich int8 und NVFP4), Gemma-4-Encoder in bf16 und int8, drei VAEs (Video, Video-Conv, Audio), räumlicher und zeitlicher Latent-Upscaler mit Faktor 2, eine destillierte LoRA und der Duration-Head —, und jede Komponente ist einzeln ladbar, sodass sich etwa ein NVFP4-Transformer mit einem BF16-VAE mischen lässt. Gehostet stehen zwei Stufen bereit: Fast (2–20 Sekunden, 720p bis 4K, 24/25/48/50 fps, ab 10 Sekunden nur 720p/1080p bei 24/25 fps) und Pro (2–10 Sekunden, 720p/1080p, 24/25/50 fps). Gewichte unter der LTX-2.x Community License, Code als Release v1.2.0 auf GitHub, Unterstützung in ComfyUI ab Tag eins.

    github.comhuggingface.coblog.comfy.org

  34. Qwen3.8-Max (Open Weights)AlibabaText

    Neun Tage nach der allgemeinen Verfügbarkeit liefert Alibaba die am 03.08.2026 angekündigten Gewichte: Qwen/Qwen3.8-2.4T-A95B, dazu eine FP8-Fassung, ohne Zugangsschranke herunterladbar. Erst damit wird die Architektur nachprüfbar — 2,4 Bio. Parameter total, rund 95 Mrd. aktiv, 92 Schichten in 23 gleichen Blöcken, die jeweils dreimal ein Gated DeltaNet mit einer Mixture-of-Experts-Schicht kombinieren und einmal eine Gated-Attention-Schicht dazwischenlegen; 512 Experten, von denen 10 geroutet und einer geteilt werden; verborgene Dimension 8192, Vokabular 248.320, Multi-Token-Prediction über mehrere Schritte. Das Kontextfenster steht in der Konfiguration auf 262.144 Token und lässt sich auf 1.010.000 hochziehen. Der Denkaufwand ist in drei Stufen steuerbar (xhigh als Standard, medium, low), Denkspuren lassen sich über preserve_thinking in den Verlauf zurückführen. Neu ist außerdem die erste Benchmarktabelle überhaupt zu diesem Modell — am 03.08. hatte Alibaba noch keine veröffentlicht: Terminal Bench 2.1 86,6, PaperBench 93,0, IFBench 82,8, FrontierSWE 73,5, GPQA-Diamond 92,6, Humanity's Last Exam 43,6, MRCR v2 bei 256K 92,9, DeepSWE 1.1 dagegen nur 56,6. Die offenen Gewichte sind allerdings nicht dasselbe Modell wie in der Cloud: Sie verarbeiten ausschließlich Text, Bildeingabe fehlt, und der Denkmodus lässt sich nicht abschalten. Die Lizenz ist keine Standardlizenz, sondern eine eigene „Qwen3.8-Max License“.

    huggingface.cohuggingface.cohuggingface.co

  35. DeepSeek-V4-Pro-0813DeepSeekText

    Das reguläre V4-Pro, das seit der Preview vom 24.04.2026 aussteht und das die kleine Flash-0731 vom 31.07.2026 zwischenzeitlich überholt hatte: Struktur und Größe bleiben, angebaut ist ein Modul für spekulatives Decoding namens DSpark, dessen Entwurfsgewichte im selben Checkpoint liegen. Die Konfiguration nennt 61 Schichten, verborgene Dimension 7168, 384 geroutete Experten plus einen geteilten mit sechs aktiven pro Token, Vokabular 129.280, eine MTP-Schicht und FP8 als natives Format (e4m3 mit ue8m0-Skalierung); das Kontextfenster steht auf 1.048.576 Token, empfohlen sind bis zu 384K Ausgabe-Tokens. Der Denkaufwand ist in drei Stufen steuerbar (low, high, max). Die selbstberichtete Tabelle setzt V4-Pro-0813 gegen Flash-0731, die beiden Previews, GLM-5.2, Kimi K3, Claude Opus 4.8 und Fable 5: Humanity's Last Exam 42,7 ohne und 60,0 mit Werkzeugen, Terminal Bench 2.1 87,9, NL2Repo 61,5, Cybergym 83,3, DeepSWE 62,7, Toolathlon-Verified 74,1, Agents' Last Exam 25,7, AutomationBench 31,8, dazu die hausinternen DSBench-FullStack 71,1 und DSBench-Hard 67,2. Ungewöhnlich ist die Auslieferung: Statt einer Jinja-Chatvorlage liegt ein eigenes encoding-Verzeichnis bei, und zusammen mit dem Modell erscheint der DeepSeek Harness als eigenes Projekt auf GitHub — das Agentengerüst, mit dem die Tabelle erhoben wurde. Gleichzeitig ist das Modell als deepseek-v4-pro in App, Web und API allgemein verfügbar, mit nativem Responses-API-Format für den Betrieb unter Codex. Gewichte unter MIT-Lizenz.

    api-docs.deepseek.comhuggingface.cogithub.com

  36. MiniMax Music 3MiniMaxAudio

    MiniMax' erstes Musikmodell mit offenen Gewichten: aus einer Beschreibung und einem Liedtext ein vollständiger Song bis fünf Minuten Länge — gesungen, arrangiert und gemischt, in 32 kHz Stereo mit 16 Bit. Der Aufbau ist eine Kette aus vier Teilen: Ein Global LLM mit 8 Mrd. Parametern, initialisiert aus Qwen3-8B, sagt das erste Codebuch eines achtstufigen Residual-Vector-Quantizers voraus (16.384 semantische Einträge, dann siebenmal 1.024 akustische); ein Local LLM mit 0,6 Mrd. Parametern ergänzt die übrigen Codebücher, wobei beide über verborgene Zustände statt über Token gekoppelt sind; ein Flow-Matching-Modell mit 2,4 Mrd. Parametern erzeugt daraus das Latent eines Flow-VAE; ein Decoder mit 123 Mio. Parametern rendert die Wellenform. Gesteuert wird über zwei Eingaben: den Liedtext mit Strukturmarken — [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro] — und eine Structured Caption, die in drei Blöcken Global Metadata (Genre, Subgenre, Taktart, BPM, Tonart, Stimmungsverlauf, Hörsituation, Produktionsprofil), Vocal Details (Stimmlage, Timbre, Gesangsstil, Harmonien, Begleitgesang, Effekte) und Arrangement (Haupt- und Nebeninstrumente, Instrumentenwechsel je Abschnitt, Groove, Bass, Perkussion, Texturen, Raumeffekte) festlegt. Betrieb über SGLang-Omni, diffusers und ComfyUI, parallel als API auf MiniMax' eigener Plattform; rund 22 GB Videospeicher mit CPU-Auslagerung, ab 8 GB mit schichtweisem Streaming der Gewichte. Die Grenzen nennt MiniMax selbst: nur CUDA, keine Streaming-Ausgabe, höchstens 5.000 Token Eingabe und 9.000 akustische Frames bei 25 Frames pro Sekunde. Lizenz ist eine eigene „MiniMax-Music3 Community License“.

    minimax.iohuggingface.comodelscope.cngithub.com

  37. GLM-5.3Zhipu AI (Z.ai)Text

    Dasselbe Basismodell wie GLM-5.2 — die 744B-MoE-Architektur mit 1-Mio.-Token-Kontext bleibt unangetastet, der gesamte Zugewinn kommt aus skaliertem Post-Training auf synthetisch erzeugten Langhorizont-Umgebungen. Z.ai baut die Aufgaben nicht mehr als Coding-Übungen, sondern als Einheiten echter Expertenarbeit: In einer ML-Infrastruktur-Aufgabe erhält das Modell dieselbe Arbeitsumgebung wie ein Ingenieur — Rechencluster, Storage, interne Dokumentation, Codebase, Experimentergebnisse — und muss Engpässe diagnostizieren, Optimierungen implementieren, Experimente fahren und eine messbare Beschleunigung abliefern, ohne die Korrektheit zu brechen; einzelne Aufgaben entsprechen mehreren Arbeitstagen. Umgebungen und für einen Teil auch das RL-Reward-Signal werden von Pipelines synthetisiert, ein Judge-Agent prüft jede Aufgabe auf Lösbarkeit, Verifier entstehen ohne Zugriff auf die Referenzlösung. Selbstberichtete Werte gegen den eigenen Vorgänger: Terminal-Bench 3.0 28,3 % (4,6), DeepSWE v1.1 66,9 % (46,2), SWE-Marathon v1.1 42,5 % (19,4), FrontierSWE 78,1 % (67,5), Terminal-Bench 2.1 88,2 % (81,0), NL2Repo 58,0 % (48,9), PostTrainBench 39,8 % (31,7), AutomationBench 48,2 % (26,2), Toolathlon Verified 73,0 % (59,9), Agents' Last Exam 28,5 % (23,8), HLE mit Werkzeugen 62,5 % (54,7), GDPval-AA v2 1769 Elo (1508). Auf dem hauseigenen Z.ai Code Bench 50 % über GLM-5.2, bei zugleich sinkendem Token-Verbrauch: 34,5 % bei rund 75K Output-Tokens auf Max-Stufe gegen 23,4 % bei 96K für GLM-5.2, und auf High-Stufe 31,4 % bei rund 50K gegen Claude Opus 4.8 mit 29,5 % bei 120K. Dazu ein zweiter Fähigkeitsblock, den Z.ai selbst als unerwartet beschreibt: CyberGym 84,5 % (77,2) — bester Wert des Benchmarks —, ExploitBench 54,4 % (24,4), ExploitGym 105 gelöste Aufgaben in zwei und 130 in sechs Stunden (29 und 39). Die API kennt drei Denkstufen (low, high, max, Standard max); Thinking lässt sich nicht mehr abschalten.

    z.aicvd.z.aidocs.z.ai

  38. Qwen3.8-27BAlibabaText

    Elf Tage nach der Ankündigung liefert Alibaba das zweite am 03.08.2026 versprochene Modell — und zwar unter Apache 2.0: Qwen3.8-27B, ein dichtes Modell mit 27.781.427.952 Parametern laut Safetensors-Index, dazu eine FP8-Fassung. Die Architektur kommt aus der Qwen3.5-Linie, verzichtet aber auf Mixture-of-Experts: 64 Schichten in 16 gleichen Blöcken, die dreimal Gated DeltaNet mit FFN und einmal Gated Attention mit FFN kombinieren; verborgene Dimension 5120, FFN-Zwischendimension 17.408, 24 Abfrage- und 4 KV-Köpfe bei Kopfdimension 256, DeltaNet mit 48 Value- und 16 QK-Köpfen, Vokabular 248.320 (aufgefüllt), Multi-Token-Prediction über mehrere Schritte. Kontextfenster 262.144 Token laut config.json, per YaRN auf 1.000.000 erweiterbar. Anders als die zwei Tage zuvor veröffentlichte offene Fassung von Qwen3.8-Max ist dies ein natives Vision-Language-Modell: Bild- und Videoverständnis stecken über einen 27-schichtigen Vision-Encoder (Patchgröße 16, Ausgangsdimension 5120, interleaved mRoPE) im Modell selbst, und der Denkmodus lässt sich pro Anfrage abschalten — Denkaufwand in drei Stufen (xhigh als Standard, medium, low), preserve_thinking standardmäßig an. Selbstberichtete Werte gegen Qwen3.6-27B, den gleich großen Vorgänger: Terminal Bench 2.1 73,0 (63,4), SWE-bench Pro 61,7 (53,5), QwenSWEBench 79,0 (49,3), NL2Repo-Bench 42,3 (36,2), DeepSWE 1.1 42,2 (13,3), CoWorkBench 70,7 (61,0), JobBench 33,4 (21,8), Agents' Last Exam 20,4 Pass@1 (10,6), IFBench 79,5 (69,1), GPQA Diamond 89,2 (87,8), HLE 30,8 (24,0), LiveCodeBench v6 90,3 (83,9); auf der Bildseite OSWorld-Verified 84,3 (63,9), WebArena-Verified 64,8 (48,8), AndroidWorld 81,9 (70,3), SWE-MM 38,6 (25,7), Vision2Web 62,9 (45,0), BabyVision 65,7 ohne und 85,6 mit Bildhinweis (28,9), MathVision 90,0 (85,1), OmniDocBench 1.5 91,1 (89,4).

    huggingface.cohuggingface.cohuggingface.comodelscope.cn

  39. GLM-5.3-FlashZhipu AI (Z.ai)Text

    Das erste nativ multimodale Modell der GLM-5-Reihe, und das erste, das nicht aus dem Post-Training eines bestehenden Basismodells kommt, sondern aus einem neu trainierten: 320 Mrd. Parameter gesamt, 18 Mrd. aktiv. Die config.json legt die Architektur offen — 45 Schichten, davon 34 mit linearer Aufmerksamkeit (KDA, 64 Köpfe, Kopfdimension 128, Kurzkonvolution mit Kernel 4) und 11 mit DeepSeeks Sparse Attention auf jeder vierten Lage (Indexer mit 32 Köpfen, top-k 2048), hidden 4096, 288 geroutete Experten plus ein geteilter mit acht aktiven pro Token, Sigmoid-Router mit Skalierung 2,5, die ersten drei Schichten dicht, eine MTP-Schicht, Vokabular 154.880, Kontextfenster 1.048.576 Token, ausgeliefert in FP8 (e4m3, dynamisch). Dazu Manifold-Constrained Hyper-Connections (mHC, vier Ströme, 20 Sinkhorn-Iterationen) und IndexPool, das vier Indexer-Key-Vektoren gewichtet zu einem zusammenfasst, um Latenz und Speicherbedarf des Indexers bei 1 Mio. Token zu drücken. Der Seh-Turm liegt im selben Checkpoint: 24 Schichten, hidden 1024, Patchgröße 14, Bildkante 448, räumliche Zusammenlegung 2, zeitliche Patchgröße 2 — Bilder, Videos und Dateien gehen direkt in den Kontext, Denken lässt sich nicht abschalten. Vortraining auf einem multimodalen 30-Bio.-Token-Korpus. Gegenüber GLM-5.3 sinken nach eigener Rechnung Aufmerksamkeitsrechenaufwand und KV-Cache um Faktor 3,01 bzw. 4,44, gegenüber der GLM-4.5-Reihe halbieren sich aktive Parameter (18 statt 32 Mrd.) und Schichtzahl (45 statt 92) bei ähnlicher Gesamtgröße. Selbstberichtete Werte, jeweils mit GLM-5.2 in Klammern: Terminal Bench 2.1 84,3 (81,0) · DeepSWE v1.1 63,4 (46,2) · NL2Repo 56,3 (48,9) · Toolathlon Verified 78,4 (59,9) · AutomationBench v1.0.6 48,8 (26,2) · Agents' Last Exam 26,3 (20,4) · HLE mit Werkzeugen 55,3 (54,7) · GDPval-AA v2 1773 Elo (1504). Im Sehteil, wo GLM-5.2 nicht antritt, gegen DeepSeek-V4-Vision-Exp und Opus 4.8: OfficeQA Pro 62,4 (57,9 · 48,9) · CharXiv Reasoning mit Werkzeugen 89,4 (80,4 · 89,9) · Chartography mit Werkzeugen 78,0 (64,3 · 75,0) · BabyVision 53,4 (35,1 · 46,8) · MVBench 77,8 (69,4 · 67,1) · MMVU 80,5 (72,7 · 67,4). Auf dem hauseigenen Z.ai Code Bench v1.0 erreicht die Max-Stufe 29,0 gegen 29,5 von Opus 4.8; im Intelligence Index v4.1.1 von Artificial Analysis stehen 57 Punkte bei 0,045 $ pro Aufgabe. Der Preis ist der eigentliche Punkt: Listenpreis 0,15 $ Eingabe und 0,50 $ Ausgabe je 1 Mio. Token, bis zum 09.09.2026 halbiert auf 0,075 bzw. 0,25 $, gecachte Eingabe 0,03 bzw. 0,015 $, Cache-Speicherung befristet kostenlos — GLM-5.3 und GLM-5.2 stehen unverändert bei 1,4 und 4,4 $. Gewichte unter MIT-Lizenz auf HuggingFace (FP8 und BF16), lauffähig unter SGLang, vLLM, TokenSpeed und KTransformers.

    z.aihuggingface.codocs.z.aidocs.z.ai

  40. Qwen3.8-Flash-NextAlibaba (Qwen)Text

    Kein Produktmodell, sondern eine Architekturvorschau: Die Modellkarte nennt Qwen3.8-Flash-Next ausdrücklich „an experimental preview of the architecture that will underpin Qwen4“ und „the first open-weight release under this architecture“. 125 Mrd. Parameter gesamt, davon 6 Mrd. pro Token aktiv, dazu 51 Mrd. in einer N-Gram-Einbettung und 4 Mrd. in der Multi-Token-Prediction. Die config.json legt den Aufbau offen: 48 Schichten als zwölf identische Blöcke, in denen dreimal Gated DeltaNet und einmal Qwen Sparse Attention (QSA) jeweils auf eine MoE-Schicht folgen; hidden 2560, Kopfdimension 256 bei 24 Abfrage- und 2 KV-Köpfen, die lineare Aufmerksamkeit mit 48 Value- und 16 QK-Köpfen (Dimension 128, Kurzkonvolution mit Kernel 4), der Indexer als MQA mit vier Abfrage- und einem geteilten Key-Kopf bei Budget 2048 Token und Kompressionsverhältnis 4, also 512 Mikroblöcken; 512 Experten mit zehn gerouteten plus einem geteilten pro Token, Experten-Zwischendimension 640, Sigmoid-Ausgangsgatter, Vokabular 248.320, eine MTP-Schicht mit voller Aufmerksamkeit, Kontextfenster 262.144 Token und per YaRN bis 1.000.000. Drei Bauteile sind neu: QSA wählt nicht einzelne Token, sondern Mikroblöcke aus, was die Latenz im langen Kontext drückt; Gated Residual moduliert vier verbreiterte Residualströme (Rang 320) über ein datenabhängiges Lesegatter und je Zweig einen skalaren Schreibwert; und die N-Gram-Einbettung indexiert 20 Mio. Bi- und Trigramme auf Schicht 2 — 51 Mrd. Parameter, die Speicher kosten, aber kaum Rechenzeit und sich auf speicherarme Beschleuniger auslagern lassen. Dazu ein geändertes Trainingsrezept: Muon und AdamW auf getrennte Gewichtsklassen, neu angepasste Skalierungsgesetze, kein Batch-Size-Warmup mehr. Der Seh-Turm steckt im selben Checkpoint (27 Schichten, hidden 1152, 16 Köpfe, Zwischendimension 4304, Ausgang 2560, 2304 Positionseinbettungen), Eingabe also Text, Bild und Video; Denkmodus standardmäßig an mit reasoning_effort xhigh (dazu medium und low) und über enable_thinking abschaltbar. Selbstberichtete Werte gegen Qwen3.8-27B, Qwen3.7-Plus (397 Mrd./17 Mrd. aktiv), DeepSeek-V4-Flash-0731 und Claude Opus 4.6 Max: DeepSWE 1.1 58,7 · SWE-bench Pro 62,5 · SWE-bench Multilingual 81,0 · NL2Repo-Bench 48,1 · CoWorkBench 73,9 · JobBench 55,7 · Agents' Last Exam 24,3 Pass@1 bei 51,2 Punkten · Toolathlon Verified 73,5 · IFBench 81,3 · GPQA Diamond 91,7 · HLE 35,9 · LiveCodeBench v6 91,9; multimodal ClawEval-MM 64,4 Pass@3 (60,4 im Mittel) · RecreationBench 49,9 · AndroidWorld 84,5 · OSWorld 2.0 19,4 binär bei 52,3 partiell · Vision2Web 64,0 · ERQA 72,3 · LVBench 76,6 · RealWorldQA 88,5 · MathVision 90,6 ohne und 95,7 mit Code-Interpreter · CharXiv Reasoning 84,6 ohne und 90,6 mit. Gewichte in BF16 und FP8 unter der Qwen Community License 1.0; die gehostete Fassung heißt Qwen3.8-Flash, hat 1 Mio. Kontext im Standard samt eingebauter Werkzeuge und kostet bei OpenRouter 0,15 $ Eingabe und 0,47 $ Ausgabe je 1 Mio. Token.

    huggingface.cohuggingface.cohuggingface.cogithub.com

  41. Hy4-previewTencent (Hunyuan)Text

    Tencents neues Flaggschiff als Vorschau und unter Apache 2.0: 770 Mrd. Parameter gesamt, 49 Mrd. pro Token aktiv, Kontextfenster 1.048.576 Token. Die config.json zeigt 78 Schichten, davon die erste dicht und die übrigen 77 als MoE mit 256 gerouteten Experten plus einem geteilten, top-8 geroutet, Router-Skalierung 2,827; hidden 6144, 64 Aufmerksamkeitsköpfe bei 8 KV-Köpfen, MLA mit Abfragekompression auf 2048 und KV-Kompression auf 512, qk_head_dim 256 (192 ohne plus 64 mit Rotation) und v_head_dim 256, dazu ein lernbarer Attention Sink, gated_mla und Vokabular 120.832. Drei Bauteile tragen den Effizienzanspruch: Gated DSA, also DeepSeeks Sparse Attention mit Gatter (arXiv 2512.02556) und einem Indexer aus 32 Köpfen à 128 Dimensionen bei top-k 2048, ergänzt um IndexCache (arXiv 2603.12201), das den spärlichen Index über Schichten hinweg wiederverwendet; iHC, identische Hyper-Connections mit vier Residualströmen anstelle des einfachen Residualpfads; und eine mitgelieferte MTP-Schicht mit 10 Mrd. Parametern (0,7 Mrd. aktiv) für spekulatives Dekodieren. Skaliert wurde nach eigener Darstellung auf drei Achsen gleichzeitig — Modellgröße, Kontextlänge und Trainingsdaten —, das Ergebnis nennt Tencent „the largest generation-over-generation gain we've measured, and enough to put Hy4 preview at the open-source frontier“. Vier Produktivitätsdomänen wurden mit hauseigenen Fachleuten und gemeinsam mit CodeBuddy und WorkBuddy ausgelegt: Software-Entwicklung, Büro und Analyse, Spieleentwicklung, wissenschaftliches Arbeiten. Selbstberichtete Werte, jeweils mit Hy3 vom 06.07.2026 in Klammern: Terminal Bench 2.1 85,4 (70,8) · DeepSWE 64,3 (28,0) · SWE-bench Pro 65,7 (57,9) · SWE-bench Multilingual 82,9 (75,8) · SWE-Marathon 31,9 (5,0) · CyberGym 78,4 (51,8) · GPQA Diamond 92,3 (90,9) · GDPval-AA v2 1678 Elo (1213) · dazu MathArena Apex 74,2 · CritPt 16,9 · HLE ohne Werkzeuge 43,4. Ein Blindvergleich mit 163 internen Fachleuten über 203 Ingenieuraufgaben ergibt 2,99 Punkte gegen 2,92 für GLM 5.3 (46,8 % Siege, 12,8 % Gleichstände, 40,4 % Niederlagen) und gegen 2,94 für Kimi K3 (51,2 % / 7,9 % / 40,9 %). Gewichte in BF16 und FP8 auf HuggingFace, gespiegelt auf ModelScope, GitCode und CNB; Denkmodus standardmäßig auf „high“, per no_think über chat_template_kwargs abschaltbar, empfohlen temperature 0,9 und top_p 1,0.

    huggingface.cohuggingface.cogithub.com

  42. DeepSeek-V4.1-FlashDeepSeekText

    Erstes Modell einer neuen Architekturfamilie, MIT-lizenziert am Erscheinungstag auf Hugging Face und gleichzeitig live in der API unter dem neuen Namen deepseek-flash. 552 Mrd. Parameter im Backbone, multimodal von Grund auf (Bild und Text im selben Modell, kein aufgesetzter Vision-Zweig), Kontextfenster 1 Mio. Token, Ausgabe bis 384K. Kern ist eine Causal-Encoder-Decoder-Architektur (CED): 40 Schichten, aufgeteilt in einen 20-schichtigen kausalen Encoder und einen 20-schichtigen Decoder, dessen globaler KV-Cache nicht aus den eigenen Schichten, sondern aus den letzten Encoder-Zuständen projiziert wird. Daraus folgt die eigentliche Kennzahl: aktiv sind nur 8 Mrd. Parameter beim Einlesen des Prompts (Prefill) und 16 Mrd. beim Erzeugen (Decode) — dieselbe Rechnung wird für Eingabe und Ausgabe unterschiedlich teuer. Dazu Compressed Sparse Attention 2, das jeder Attention-Schicht einen von drei festen Modi zuweist (Full, Reindex, Reuse), um Haupt-KV und Indexer-Schlüssel über Schichten zu teilen, ein hierarchischer Sparse-Indexer, der spätere Indexschichten auf einen Kandidatenpool der ersten Full-Schicht beschränkt, und FP4-Speicherung des Haupt-KV (E2M1, ein E4M3-Skalar je 16 Kanäle). Ergebnis: 890 Byte globaler KV-Cache pro Token, rund ein Viertel von DeepSeek-V4-Flash und laut DeepSeeks eigener Grafik ein 437stel von DeepSeek-V1; SWA Bounded Replay rekonstruiert fehlende Sliding-Window-Zustände durch Nachspielen der letzten n Token, wodurch der auf SSD zu haltende Anteil auf ein Achtel fällt. Weiter verbaut: Single-Pass mHC, ein Engram-Gedächtnis mit 196 Mrd. Parametern, das über Token-Lookup nur punktuell angesprochen wird, DSpark für spekulatives Decoding, 1 geteilter und 384 geroutete Experten je MoE-Schicht bei 6 aktiven pro Token. Vortraining auf 45 Bio. multimodalen Token, Sparse Attention bei 64K Sequenzlänge trainiert, Kontext nach 34 Bio. Token auf 1 Mio. gestreckt; Nachtraining ausdrücklich ohne algorithmische Neuerung (SFT → RL → On-Policy-Distillation), alle Änderungen liegen in der automatisierten Synthese von Agentenaufgaben und -umgebungen. Neu in der Bedienung: Der Denkaufwand ist nicht mehr in drei Stufen, sondern stufenlos als Ganzzahl von 1 bis 100 einstellbar. Selbstberichtete Werte bei maximalem Aufwand — Terminal-Bench 2.1 90,6 (Bestwert der Tabelle, vor Opus 5.0 mit 89,1, GPT-5.6 Sol 88,8, K3 88,3, GLM-5.3 88,2, V4-Pro 87,9), DeepSWE v1.1 74,2 (Opus 5.0 74,0), Codeforces 3.471 Elo, MathArena Apex 65,6, CyberGym 88,1, HLE mit Werkzeugen 63,9, AutomationBench 54,8, Agent's Last Exam 31,8. Preise ab 04:00 UTC desselben Tages und deutlich unter dem Vorgänger: je 1 Mio. Token außerhalb der Spitzenzeiten $0,003 bei Cache-Treffer, $0,15 bei Cache-Fehltreffer, $0,60 Ausgabe; in Spitzenzeiten das Doppelte.

    api-docs.deepseek.comhuggingface.coapi-docs.deepseek.com

  43. Atria Dawn PreviewShanghai Artificial Intelligence LaboratoryText

    Vorabversion eines nach eigener Beschreibung „agentischen Modells der neuen Generation" — und ausdrücklich kein eigenes Fundament: Atria Dawn sitzt laut Modellkarte auf GLM-5.2, dem 744-Mrd.-Parameter-MoE aus dem Haus Zhipu. Veröffentlicht wird ein FP8-quantisiertes Instruct-Modell mit 256K Kontext (262.144 Token), dessen safetensors-Aufstellung 753,33 Mrd. Parameter summiert (751,23 Mrd. in F8_E4M3, 2,10 Mrd. in BF16) und 755,67 GB Download bedeutet; Architekturkennung glm_moe_dsa, Lizenz MIT, reiner Text — Bildeingaben nimmt das Modell nicht an. Betrieb ab SGLang v0.5.13.post1 oder vLLM v0.23.0, gehosteter Zugang über api.atria-asi.ai international und discovery.intern-ai.org.cn in China. Die selbstberichtete Vergleichstabelle stellt Atria Dawn gegen DeepSeek V4 Pro 0813, Kimi K3, Qwen 3.8 Max, GLM 5.3, GPT 5.6 Sol und Claude Opus 5 — und das Ergebnis ist ungewöhnlich klar zweigeteilt. Vorn liegt das Modell überall dort, wo Suche und Werkzeugnutzung gemessen werden: AutomationBench 53,8, BFCL v4 77,0, DeepSearchQA 96,0, BrowseComp 92,5, laut Pressemitteilung außerdem CyberGym 86,5, jeweils Bestwert des Feldes. Hinten liegt es überall dort, wo Codieren, Terminalarbeit und wirtschaftlicher Nutzen gemessen werden, und zwar hinter Claude Opus 5: Terminal-Bench 2.1 78,3 gegen 90,2, SWE-bench Pro 59,6 gegen 74,7, GDPval 1.583 gegen 1.768, JobBench 50,3 gegen 68,0, DeepResearch Bench II 51,1 gegen 54,1, MLE-bench Lite 86,2 gegen 88,9, WideSearch 81,9 gegen 83,3, Workspace-Bench 65,0 gegen 65,8 und in der Lite-Variante 68,2 gegen 70,1; SkillsBench (66,4) und τ³-Bench Banking (41,2) unterliegen Qwen 3.8 Max mit 66,7 bzw. 55,2. Als Demonstration zeigt das Labor ein in einem Durchlauf gebautes Wettermodell — ViT-Backbone mit über 0,4 Mrd. Parametern, 45.000 Trainingsschritte über 69 atmosphärische Variablen auf WeatherBench2 im Gitter 64×32, Websuche dabei abgeschaltet —, das eine globale Sieben-Tage-Vorhersage in unter einer Minute rechnet und NVIDIAs FourCastNet auf einzelnen Metriken schlägt; dazu ein „MiniOS in 20 Minuten".

    huggingface.cogithub.comarxiv.orgmodelscope.cn

  44. Step 5 PreviewStepFunText

    StepFun stellt Step 5 Preview unter dem Titel „Advancing the Pareto Frontier" vor: ein spärlich besetztes Mixture-of-Experts-Modell mit 600 Mrd. Parametern gesamt und 27 Mrd. aktiven je Token, 1 Mio. Token Kontext und Bildeingabe. Der Anspruch ist nicht die Spitze, sondern das Verhältnis: „Step 5 Preview scores 44 on the Artificial Analysis Intelligence Index. At a comparable level of intelligence, its task cost is substantially lower." Die Vergleichstabelle des Hauses stellt Step 5 (High) gegen GLM-5.3 (Max), Kimi K3 (Max), GPT-6 Astra (Max) und Claude Opus 5 (Max): DeepSWE v1.1 67,7 gegen 66,9 / 67,5 / 74,1 / 74,0; ProgramBench 80,5 gegen 72,0 / 77,8 / 85,4 / 82,3; FrontierFinance 66,4 gegen 64,1 / 62,6 / 55,0 / 69,7; DRACO 83,3 gegen 82,3 / 78,5 / 76,8 / 87,6; Terminal-Bench v4 33,3 gegen 41,9 / 12,6 / 57,9 / 52,3; GDPval-AA v2.1 1566 gegen 1645 / 1524 / 1542 / 1708; AA-Briefcase v1.1 1433 gegen 1526 / 1511 / 1569 / 1673; MMMU-Pro 76,0. Der Schwerpunkt liegt auf langlaufender Arbeit: In einem 24-Stunden-Lauf optimiert das Modell einen MLA-GPU-Kernel auf einer H100 auf 508 TFLOPS gegen 493 bei Claude Opus 5 nach rund 22 Stunden (vier Versuche, bester Lauf berichtet); ein zweiter 24-Stunden-Lauf führt ein automatisiertes Post-Training von Qwen3-30B-A3B durch und hebt AIME24 von 53,3 auf 60,0 Prozent, laut Haus gleichauf mit Claude Opus 5 bei weniger Annotator-Tokens; in Pokémon Red erreicht das Modell ohne spielspezifische Anpassung nach 3.082 Zügen und rund 6 Mio. Tokens drei Arena-Orden, etwa ein Drittel der Hauptgeschichte. Verfügbar ab dem Ankündigungstag über die eigenen Produkte, die API und das AI Studio; für den 15. Oktober 2026 sind offene Gewichte angekündigt.

    stepfun.comhuggingface.co

  45. Qwen-Image-2.1Alibaba (Qwen)Bild

    Bildmodell mit 7 Mrd. Parametern im Generierungsteil (32 Single-Stream-DiT-Layer), das Text-zu-Bild und Bildbearbeitung in einem System führt. Drei Fähigkeiten hebt das Haus hervor: native Transparenz, also direkte RGBA-Ausgabe mit Alphakanal statt nachträglichem Freistellen — der empfohlene Prompt benennt sie ausdrücklich („This is an RGBA image with transparency… The image has alpha channel and the background is transparent."); bis zu zehn Referenzbilder in einer Anfrage für Kompositionen aus mehreren Motiven; und native 2K-Auflösung bis 2048 × 2048 Pixel über Seitenverhältnisse von 1:1 bis 9:16. Bearbeitet wird lokal über Kreise, aufgemalte Markierungen oder Masken, wobei Personen und Produkte über die Bearbeitung hinweg erhalten bleiben sollen. Die Gewichte liegen als Safetensors in BF16 auf HuggingFace, Inferenz setzt torch ≥ 2.4.0 und transformers ≥ 5.17 voraus. Unterstützung im Ökosystem ab Tag eins: Diffusers über eine eigene QwenImage21Pipeline, ComfyUI nativ, dazu vLLM-Omni und SGLang.

    github.comhuggingface.co

  46. MiMo-V2.6-Pro & MiMo-V2.6-FlashXiaomi MiMoText

    Xiaomi öffnet die MiMo-V2.6-Reihe: zwei nativ omnimodale Modelle, MiMo-V2.6-Pro und MiMo-V2.6-Flash, dazu MiMo-V2.6-Pro-UltraSpeed mit nach eigener Angabe bis zu zwanzigfacher Ausgabegeschwindigkeit bei gleicher Qualität. Für MiMo-V2.6-Pro nennt das Haus 46,32 Punkte im Artificial Analysis Intelligence Index (Bildunterschrift der eigenen Grafik: „Artificial Analysis Intelligence Index v4.3, September 2026"), vor Kimi K3 und Qwen3.8 Max und damit als „the strongest open-source model to date" — zu den unveränderten Preisen der Vorgängerreihe V2.5. Ungewöhnlich ist die Offenlegung des Trainings: Der Reinforcement-Learning-Lauf wurde live unter mimo.xiaomi.com/rl gestreamt, dauerte weniger als sechs Tage und umfasste je Modell 30 RL-Schritte über rund 750.000 Trajektorien, zu angegebenen Kosten von etwa 0,85 Mio. USD für Flash und 2,62 Mio. USD für Pro; die Trefferquote auf den Trainingsaufgaben stieg relativ um 25 (Flash) beziehungsweise 12 Prozent, DeepSWE v1.1 von 48,80 auf 65,68 (Flash) und von 58,40 auf 72,57 (Pro). Drei Skalierungsachsen werden benannt: 1.568 Stichproben je Aktualisierung, bis zu 1 Mio. Token Kontext und 3,5 bis 3,7 Mrd. Token je Schritt auf einer vollständig asynchronen Architektur; eine Aufgabenmischung über Programmierung, allgemeine Agenten, visuelle und Cyber-Aufgaben; sowie mehr Rechenzeit für die Bewertung über gruppeninterne Vergleiche. Der Router wurde eingefroren, um Drift zu unterdrücken, und gegen Reward Hacking arbeitet das Haus mit Belohnungsdesign, adversarischer Auswertung, Anomalieerkennung und gegenprüfenden Verifizierern. Mitveröffentlicht werden der technische Bericht, die Trainingsumgebungen und der RL-Code. Verfügbar ab dem Ankündigungstag im AI Studio, in MiMo Code, in MiMo Desktop (erste offizielle Fassung, Ende des Early Access), über die MiMo-API-Plattform und OpenRouter. Preise je Mio. Token in USD (Cache-Treffer / Cache-Fehlschlag / Ausgabe): Flash 0,0028 / 0,14 / 0,28; Pro 0,0036 / 0,435 / 0,87; Pro-UltraSpeed 0,036 / 4,35 / 8,7.

    mimo.xiaomi.comhuggingface.cohuggingface.co

Lesart

Was aus einer flachen Kurve folgt

Die verbreitete Planungsannahme lautet: was heute nur proprietär verfügbar ist, gibt es in achtzehn Monaten offen — also lohnt es, zu warten. Dieser Datensatz stützt das nicht. Der Anteil offener Gewichte ist über vier Jahre nicht gestiegen, und es gab ein halbes Jahr, in dem er auf null fiel, während zwölf proprietäre Premieren erschienen. Wer 2025 auf die offene Variante gewartet hat, hat sechs Monate gewartet und nichts bekommen.

Umgekehrt taugt die Zahl auch nicht als Abgesang. 89 offene Releases von 34 Häusern sind keine Nischenerscheinung, und der überproportionale Anteil an den Premieren zeigt, dass dort echte Erstleistungen entstehen, nicht nur Nachbauten. Die Kurve ist flach, nicht fallend — und im laufenden Jahr liegt sie mit 33 Prozent wieder über dem Tiefpunkt von 17.

Die praktische Konsequenz ist unbequem, weil sie beide Lager enttäuscht: Offenheit ist kein Fahrplan, auf den man eine Beschaffungsentscheidung setzen kann. Sie ist eine Eigenschaft, die manche Häuser haben und andere nicht, und die sich pro Halbjahr spürbar ändern kann. Wer offene Gewichte braucht — aus Datenschutzgründen, wegen Betrieb im eigenen Rechenzentrum, wegen Abhängigkeitsrisiko —, sollte nach Häusern auswählen, nicht nach Zeitpunkten. Und wer sie nicht braucht, sollte die Lizenzfrage nicht zur Weltanschauung machen: in 69 Prozent der Fälle stellt sie sich ohnehin nicht.

Wie sich das Tempo im gleichen Zeitraum entwickelt hat — inklusive der Verlangsamung, in die diese Lücke fällt — steht auf der Seite über die Kadenz.

Methode

Woher die Zahlen kommen

Grundlage ist ein handkuratierter Datensatz fähigkeitsverändernder Releases generativer KI. Aufgenommen wird ein Release nur, wenn es etwas konnte, was vorher kein öffentlich verfügbares Modell konnte — reine Preisänderungen, Rebrands und Punktversionen ohne neue Fähigkeit bleiben draußen. Jedes Datum ist gegen eine Primärquelle geprüft (Ankündigung, Paper oder Release-Notes des Labors); unbestätigte Daten sind als solche markiert statt als Fakt dargestellt. Zwei redaktionelle Marker im Zeitstrahl (Newsletter-Start, snipKI-Gründung) sind keine Releases und zählen in keiner Zahl auf dieser Seite mit. Stand der letzten Verifikation: 22. September 2026.

Die Auswahl ist kuratiert, also unvermeidlich eine Wertung. Sie ist nachprüfbar: jede Zeile hat ein Datum und einen Link. Diese Teilmenge als JSON · vollständige API

Zitieren

Frei nutzbar mit Namensnennung

Alle Zahlen und Tabellen dieser Seite stehen unter CC-BY-4.0. Nutze sie in Präsentationen, Artikeln, Modellen — mit dieser Zeile:

Offenheit: die Lücke von 194 Tagen — Die Beschleunigung — KI-Zeitstrahl von snipKI (https://timeline.snipki.de)
https://timeline.snipki.de/offenheit

KI-Zeitstrahl von snipKI · the KI Enablement Company

gebaut von snipki.de