
Claude Opus 4.7 — Benchmarks, Fähigkeiten und Anwendungsfälle
Claude Opus 4.7 ist ein proprietäres KI-Modell von Anthropic, eingestuft als Frontier-Stufe mit einem Kontextfenster von 1M Tokens. Entdecken Sie Benchmark-Erge...
Claude Opus 4.6 ist ein erstklassiges Frontier-KI-Modell, entwickelt von Anthropic und veröffentlicht im Februar 2026. Es ist ein proprietäres Closed-Weight-Modell, das über die Anthropic-API verfügbar ist. Das Kontextfenster von 1 Mio. Token ist groß genug, um ganze Codebasen, umfangreiche technische Dokumente oder ausgedehnte agentische Sitzungen ohne Kürzung aufzunehmen.
Auf dem FlowHunt AI Leaderboard ist es eines von 24 erfassten Modellen, bewertet in 6 Benchmarks. Herausragende Ergebnisse: 69,2 % bei ARC-AGI-2 (#1 von 3); 53,0 % bei HLE (#1 von 6); 80,8 % bei SWE-bench Verified (#5 von 13).
Claude Opus 4.6 wurde am 5. Februar 2026 veröffentlicht und erregte besondere Aufmerksamkeit durch seine Leistung bei neuartigen visuellen Denkaufgaben. Es hält das höchste öffentlich verifizierte Ergebnis bei ARC-AGI-2 mit 69,17 % — einem Benchmark für abstrakte visuelle Mustererkennung, der unabhängig von der ARC Prize Foundation verifiziert und speziell entwickelt wurde, um Auswendiglernen zu verhindern. Dieses Ergebnis brachte Opus 4.6 über die ungefähre menschliche Baseline von 60 % bei einem Test, bei dem frühere Frontier-Modelle kaum über diese Marke hinauskamen. Es erreichte außerdem 91,3 % bei GPQA Diamond und 53,0 % bei Humanity’s Last Exam, was es zum führenden Modell für anspruchsvolle Denkaufgaben in der ersten Hälfte des Jahres 2026 macht.
Hinweis: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3-Sicherheitseinstufung.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic ist ein KI-Sicherheitsunternehmen, das 2021 von den ehemaligen OpenAI-Forschern Dario Amodei und Daniela Amodei zusammen mit einer Gruppe von Kollegen gegründet wurde, die zuvor die Sicherheits- und Policy-Teams von OpenAI geleitet hatten. Die erklärte Mission des Unternehmens ist die verantwortungsvolle Entwicklung von KI zum langfristigen Nutzen der Menschheit, und seine Forschungsagenda wird durch dieses Engagement definiert: Constitutional AI (CAI), eine Technik zum Trainieren von Modellen, die durch Selbstkritik hilfreich, harmlos und ehrlich sind; mechanistische Interpretierbarkeit, die darauf abzielt, nachzuvollziehen, was einzelne Neuronen und Schaltkreise in großen Netzwerken tatsächlich berechnen; und Scaling Science, die versucht vorherzusagen, wie sich Modellverhalten mit Rechenleistung und Daten verändert. Anthropic veröffentlicht diese Forschung offen und hat sich zu einem der meistzitierten KI-Sicherheitslabore in der akademischen Literatur entwickelt. Claude ist Anthropics öffentliche Modellfamilie – benannt nach Claude Shannon, dem Begründer der Informationstheorie – und umfasst vier Generationen (1 bis 4.x/Fable 5). Anthropic betreibt eine kommerzielle API und das verbraucherorientierte Produkt Claude.ai und unterhält tiefe Cloud-Partnerschaften mit AWS (Amazon Bedrock) und Google Cloud (Vertex AI).
Anwendungsfälle
Claude Opus 4.6 erzielt 80 % bei SWE-bench Verified — Rang #5 von 13 hier erfassten Modellen. Es löst reale GitHub-Probleme, schreibt produktionsreifen Code in mehreren Sprachen und bewältigt mehrstufige agentische Codierungsworkflows – eine starke Wahl für KI-gestützte Softwareentwicklungsteams.
Mit 91 % bei GPQA Diamond (Rang #5 von 14 Modellen) übertrifft Claude Opus 4.6 die ungefähre menschliche Baseline von ~65 % bei Graduiertenfragen aus Biologie, Chemie und Physik. Nutzen Sie es für die Synthese wissenschaftlicher Literatur, Hypothesenbewertung, medizinische und juristische Frage-Antwort-Stellungen sowie multidisziplinäre Forschungsaufgaben, bei denen tiefes Fachwissen gefragt ist.
Claude Opus 4.6 erreicht 65 % bei Terminal-Bench (Rang #7 von 8 Modellen) und ist damit kompetent für gängige Shell-Scripting-, Befehlszeilen-Workflows und leichte Systemverwaltungsaufgaben in agentischen Pipelines.
Mit einem Kontextfenster von 1 Mio. Token kann Claude Opus 4.6 ganze Software-Repositories, lange juristische Verträge, buchlange Forschungsberichte oder umfangreiche Gesprächsverläufe in einer einzigen Eingabeaufforderung verarbeiten – und ermöglicht so tiefgehende Dokumentenanalyse, codebasenübergreifende Analysen und umfassende Zusammenfassungen ohne Chunking-Heuristiken oder RAG-Pipelines.
Weitere Vergleichsmodelle
Vergleichen Sie alle 24 Modelle in 11 Benchmarks – sortierbar, quellenbasiert und aktualisiert Juni 2026.

Claude Opus 4.7 ist ein proprietäres KI-Modell von Anthropic, eingestuft als Frontier-Stufe mit einem Kontextfenster von 1M Tokens. Entdecken Sie Benchmark-Erge...

Claude Opus 4.8 ist ein proprietäres KI-Modell von Anthropic, eingestuft als Frontier-Stufe mit einem Kontextfenster von 1 Million Token. Entdecken Sie Benchmar...

Claude Sonnet 4.6 ist ein proprietäres KI-Modell von Anthropic, eingestuft als Advanced Tier mit einem Kontextfenster von 1M Token. Es ist direkt in FlowHunt ve...
Cookie-Zustimmung
Wir verwenden Cookies, um Ihr Surferlebnis zu verbessern und unseren Datenverkehr zu analysieren. See our privacy policy.