Anthropic-Logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 ist ein erstklassiges Frontier-KI-Modell, entwickelt von Anthropic und veröffentlicht im Februar 2026. Es ist ein proprietäres Closed-Weight-Modell, das über die Anthropic-API verfügbar ist. Das Kontextfenster von 1 Mio. Token ist groß genug, um ganze Codebasen, umfangreiche technische Dokumente oder ausgedehnte agentische Sitzungen ohne Kürzung aufzunehmen.

Auf dem FlowHunt AI Leaderboard ist es eines von 24 erfassten Modellen, bewertet in 6 Benchmarks. Herausragende Ergebnisse: 69,2 % bei ARC-AGI-2 (#1 von 3); 53,0 % bei HLE (#1 von 6); 80,8 % bei SWE-bench Verified (#5 von 13).

Claude Opus 4.6 wurde am 5. Februar 2026 veröffentlicht und erregte besondere Aufmerksamkeit durch seine Leistung bei neuartigen visuellen Denkaufgaben. Es hält das höchste öffentlich verifizierte Ergebnis bei ARC-AGI-2 mit 69,17 % — einem Benchmark für abstrakte visuelle Mustererkennung, der unabhängig von der ARC Prize Foundation verifiziert und speziell entwickelt wurde, um Auswendiglernen zu verhindern. Dieses Ergebnis brachte Opus 4.6 über die ungefähre menschliche Baseline von 60 % bei einem Test, bei dem frühere Frontier-Modelle kaum über diese Marke hinauskamen. Es erreichte außerdem 91,3 % bei GPQA Diamond und 53,0 % bei Humanity’s Last Exam, was es zum führenden Modell für anspruchsvolle Denkaufgaben in der ersten Hälfte des Jahres 2026 macht.

Hinweis: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3-Sicherheitseinstufung.

Veröffentlicht
Februar 2026
Kontext
1M Tokens
Gewichte
Geschlossen
Tier
Frontier
Anbieter
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic ist ein KI-Sicherheitsunternehmen, das 2021 von den ehemaligen OpenAI-Forschern Dario Amodei und Daniela Amodei zusammen mit einer Gruppe von Kollegen gegründet wurde, die zuvor die Sicherheits- und Policy-Teams von OpenAI geleitet hatten. Die erklärte Mission des Unternehmens ist die verantwortungsvolle Entwicklung von KI zum langfristigen Nutzen der Menschheit, und seine Forschungsagenda wird durch dieses Engagement definiert: Constitutional AI (CAI), eine Technik zum Trainieren von Modellen, die durch Selbstkritik hilfreich, harmlos und ehrlich sind; mechanistische Interpretierbarkeit, die darauf abzielt, nachzuvollziehen, was einzelne Neuronen und Schaltkreise in großen Netzwerken tatsächlich berechnen; und Scaling Science, die versucht vorherzusagen, wie sich Modellverhalten mit Rechenleistung und Daten verändert. Anthropic veröffentlicht diese Forschung offen und hat sich zu einem der meistzitierten KI-Sicherheitslabore in der akademischen Literatur entwickelt. Claude ist Anthropics öffentliche Modellfamilie – benannt nach Claude Shannon, dem Begründer der Informationstheorie – und umfasst vier Generationen (1 bis 4.x/Fable 5). Anthropic betreibt eine kommerzielle API und das verbraucherorientierte Produkt Claude.ai und unterhält tiefe Cloud-Partnerschaften mit AWS (Amazon Bedrock) und Google Cloud (Vertex AI).

Anwendungsfälle

Wofür Sie Claude Opus 4.6 nutzen sollten

Softwareentwicklung
Wissenschaftliches & technisches Denken
Agentische CLI-Automatisierung
Langdokument- & Codebase-Analyse

Strengths & Limitations

Strengths

  • Starke Softwareentwicklung — 80 % SWE-bench Verified
  • Wissenschaftliches Denken auf Graduiertenniveau — 91 % GPQA Diamond
  • Neuartiges visuelles Denken — 69 % ARC-AGI-2 (unabhängig verifiziert)
  • Sehr lange Dokumente und große Codebasen (1 Mio. Kontext)

Limitations

  • Closed-Weight — kann nicht selbst gehostet oder mit privaten Daten nachtrainiert werden

Das vollständige KI-Modell-Ranking durchstöbern

Häufig gestellte Fragen

Mehr erfahren