Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 est un modèle d’IA frontière de premier plan, développé par Anthropic et publié en février 2026. Il s’agit d’un modèle propriétaire à poids fermés, disponible via l’API Anthropic. La fenêtre de contexte de 1 million de tokens est suffisamment grande pour contenir des bases de code entières, de longs documents techniques ou des sessions agentiques étendues sans troncature.

Sur le FlowHunt AI Leaderboard, il fait partie des 24 modèles suivis, évalués sur 6 benchmarks. Scores remarquables : 69,2 % sur ARC-AGI-2 (n°1 sur 3) ; 53,0 % sur HLE (n°1 sur 6) ; 80,8 % sur SWE-bench Verified (n°5 sur 13).

Claude Opus 4.6 a été publié le 5 février 2026 et a particulièrement attiré l’attention pour ses performances dans les tâches de raisonnement visuel inédites. Il détient le score vérifié publiquement le plus élevé sur ARC-AGI-2 avec 69,17 % — un benchmark de reconnaissance de motifs visuels abstraits vérifié indépendamment par la Fondation ARC Prize et conçu spécifiquement pour empêcher la mémorisation. Ce résultat place Opus 4.6 au-dessus du seuil humain d’environ 60 % sur un test que les modèles frontières précédents peinaient à dépasser. Il a également atteint 91,3 % sur GPQA Diamond et 53,0 % sur Humanity’s Last Exam, ce qui en fait le modèle leader pour les tâches de raisonnement complexe au premier semestre 2026.

Note : SOTA ARC-AGI-2 à 69,17 % (3P ARC Prize). Classification de sécurité ASL-3.

Date de sortie
Février 2026
Contexte
1M tokens
Poids
Fermés
Niveau
Frontière
Fournisseur
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic est une entreprise de sécurité de l'IA fondée en 2021 par d'anciens chercheurs d'OpenAI, Dario Amodei et Daniela Amodei, ainsi qu'un groupe de collègues ayant dirigé les équipes de sécurité et de politique d'OpenAI. La mission déclarée de l'entreprise est le développement responsable de l'IA pour le bien à long terme de l'humanité, et son programme de recherche est défini par cet engagement : l'IA Constitutionnelle (CAI), une technique d'entraînement des modèles à être utiles, inoffensifs et honnêtes par l'auto-critique ; l'interprétabilité mécaniste, qui vise à rétro-ingénier ce que les neurones et circuits individuels au sein des grands réseaux calculent réellement ; et la science de la mise à l'échelle, qui tente de prédire comment le comportement des modèles évolue avec la puissance de calcul et les données. Anthropic publie cette recherche ouvertement et est devenu l'un des laboratoires de sécurité de l'IA les plus cités dans la littérature académique. Claude est la famille de modèles publique d'Anthropic — nommée d'après Claude Shannon, le fondateur de la théorie de l'information — et couvre quatre générations (1 à 4.x/Fable 5). Anthropic exploite une API commerciale et un produit grand public Claude.ai, et entretient des partenariats cloud profonds avec AWS (Amazon Bedrock) et Google Cloud (Vertex AI).

Cas d'Usage

Pourquoi Utiliser Claude Opus 4.6

Génie Logiciel
Raisonnement Scientifique et Technique
Automatisation Agentique en Ligne de Commande
Analyse de Longs Documents et de Bases de Code

Strengths & Limitations

Strengths

  • Solide en génie logiciel — 80 % SWE-bench Verified
  • Raisonnement scientifique de niveau graduate — 91 % GPQA Diamond
  • Raisonnement visuel inédit — 69 % ARC-AGI-2 (vérifié indépendamment)
  • Très longs documents et grandes bases de code (contexte de 1M)

Limitations

  • Poids fermés — ne peut pas être auto-hébergé ou affiné sur des données privées

Parcourir le Classement Complet des Modèles d'IA

Questions fréquemment posées

En savoir plus

Claude Opus 4.8 — Benchmarks, capacités et cas d'usage
Claude Opus 4.8 — Benchmarks, capacités et cas d'usage

Claude Opus 4.8 — Benchmarks, capacités et cas d'usage

Claude Opus 4.8 est un modèle d'IA propriétaire d'Anthropic, classé au niveau Frontier avec une fenêtre de contexte de 1 million de tokens. Explorez les scores ...

6 min de lecture
Claude Opus 4.7 — Références, Capacités et Cas d'Usage
Claude Opus 4.7 — Références, Capacités et Cas d'Usage

Claude Opus 4.7 — Références, Capacités et Cas d'Usage

Claude Opus 4.7 est un modèle d'IA propriétaire d'Anthropic, classé au niveau Frontier avec une fenêtre de contexte de 1M de tokens. Découvrez ses scores de réf...

5 min de lecture
Claude Sonnet 4.6 — Benchmarks, capacités et cas d'utilisation
Claude Sonnet 4.6 — Benchmarks, capacités et cas d'utilisation

Claude Sonnet 4.6 — Benchmarks, capacités et cas d'utilisation

Claude Sonnet 4.6 est un modèle d'IA propriétaire d'Anthropic, classé dans la catégorie Advanced avec une fenêtre de contexte de 1 million de tokens. Il est dir...

5 min de lecture