TextGeschlossen▸▾
Claude Opus 5.5
Anthropic
Erstes Modell der Claude-5.5-Familie; Sonnet 5.5 und Haiku 5.5 sollen „in den kommenden Wochen“ folgen.
Claude Opus 5.5
Anthropic positioniert Opus 5.5 auf dem Niveau von Claude Fable 5.1 bei den meisten Aufgaben, bei rund 40 % geringeren Kosten als Opus 5 auf typischen Workloads und über 30 % schnellerer Ausgabe. Preise pro Mio. Tokens: 4 USD Eingabe, 20 USD Ausgabe (je 20 % unter Opus 5), Cache-Lesen 0,20 USD (−60 %), Cache-Schreiben 5 USD; ein Fast Mode mit bis zu 2,5-facher Geschwindigkeit kostet 8/40 USD. Herstellerwerte bei maximalem Denkaufwand: Terminal-Bench 4.0 66,4 % (Fable 5.1 55,8 %, Opus 5 52,3 %, GPT-6 Astra 57,9 %), FrontierCode v1.1 54,4 %, CursorBench 4.0 57,8 %, GDPval-AA v2.1 1846 Elo, Humanity's Last Exam mit Tools 67,7 %, OSWorld 2.0 81,8 % (partial); GPT-6 Astra führt weiter auf AutomationBench (41,4 zu 40,0 %) und Terminal-Bench-Science (64,6 zu 58,7 %). Unabhängig misst Artificial Analysis im Intelligence Index v4.3.2 für Opus 5.5 (max, mit Standard-Fallback) 58 Punkte bei 5,98 USD pro Indexaufgabe, 1 Mio. Tokens Kontext und sehr hohem Tokenverbrauch (260 Mio. Ausgabe-Tokens für den Index gegenüber einem Median von 92 Mio.). Ausgeliefert mit Schutzmechanismen der Fable-5.1-Klasse: Cyber-Anfragen werden transparent an Opus 4.8, Biologie- und Frontier-LLM-Aufgaben an Opus 5 umgeleitet; dazu „Preserved Thinking“ gegen Destillation, Wasserzeichen für den EU AI Act, kein Betrieb ohne Thinking. Verfügbar in claude.ai, der Claude Platform (claude-opus-5-5), auf AWS, Google Cloud und Azure; die Fünf-Stunden-Nutzungsgrenzen der Abos wurden angehoben.
Anthropic veröffentlicht eine Woche nach Dario Amodeis Aufruf, die Frontier bewusst zu takten, ein Modell, das nach eigenen Zahlen die neue Spitze ist — und begründet das nicht mit Fähigkeit, sondern mit Effizienz. Das eigentliche Argument ist der Preis pro Aufgabe: weniger Tokens pro Aufgabe, billigere Tokens und ein um 60 % günstigerer Cache, der in Agenten- und Coding-Arbeit den Großteil der Kosten stellt. Artificial Analysis bestätigt die Spitzenposition: 58 Punkte liegen zehn vor dem am selben Tag erschienenen GPT-6 Sol (48) (Daten von Artificial Analysis, https://artificialanalysis.ai/). Die gleiche Messung relativiert aber das Sparversprechen: Opus 5.5 gehört dort zu den gesprächigsten Modellen, und eine Indexaufgabe kostet mit 5,98 USD fast sechsmal so viel wie bei Sol. Zwei Einschränkungen macht Anthropic selbst: Benchmark-Abstände seien auf diesem Niveau ein unzuverlässiger Maßstab, und das Modell scheint häufig zu vermuten, dass es gerade evaluiert wird — genau dort, wo es im eigenen Verhaltensaudit die besten Werte aller getesteten Modelle erzielt. Für Nutzer heißt das Routing auch: Wer mit Opus 5.5 Sicherheits- oder Biologiearbeit macht, bekommt teils still ein älteres Modell.
ⓘ Frühtester-Angaben aus der Ankündigung: eine Code-Migration über 680.000 Zeilen in weniger als einem Tag; Audit und Fehlerbehebung einer Codebasis mit 200.000 Zeilen in unter drei Stunden gegenüber über 20 Stunden bei Opus 5; bei einem internen Recherchetest mit Faktenprüfung bestanden 16 von 18 Berichten, bei Fable 5.1 und Opus 5 keiner. Die HAProxy-Übersetzung von C nach Rust schaffte Opus 5.5 in 9,5 statt 12 Stunden (Fable 5.1) bei 51 % geringeren Kosten. Im Containment-Test versuchte das Modell laut Anthropic rund 85 % seltener als Opus 5 oder Claude Mythos 5.1, Grenzen zu umgehen, und im Gray-Swan-Benchmark teilt es mit Fable 5.1 die niedrigste Erfolgsrate für Prompt Injection. Externe Vorabtests liefen bei METR und Frontier Design. Die Umleitung an ältere Modelle drückt nach Anthropics Fußnote auch die eigenen Benchmark-Werte, weil eingegriffene Aufgaben von Opus 4.8 bzw. Opus 5 erledigt wurden; bei AutomationBench (von Zapier gemessen, ohne Fallback) zählten Eingriffe als Fehlschlag.