Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 är en toppmodern frontier AI-modell, utvecklad av Anthropic och släppt i februari 2026. Det är en proprietär sluten viktmodell, tillgänglig via Anthropic API. Kontextfönstret på 1M tokens är tillräckligt stort för att rymma hela kodbaser, långa tekniska dokument eller utökade agentiska sessioner utan trunkering.

På FlowHunt AI Leaderboard är den en av 24 spårade modeller, utvärderade över 6 benchmark. Utmärkande poäng: 69,2 % på ARC-AGI-2 (#1 av 3); 53,0 % på HLE (#1 av 6); 80,8 % på SWE-bench Verified (#5 av 13).

Claude Opus 4.6 släpptes den 5 februari 2026 och fick särskild uppmärksamhet för sin prestanda på nya visuella resonemangsuppgifter. Den innehar den högsta offentligt verifierade poängen på ARC-AGI-2 med 69,17 % — ett benchmark för abstrakt visuellt mönsterigenkänning som oberoende verifierats av ARC Prize Foundation och specifikt utformat för att förhindra memorisering. Detta resultat placerade Opus 4.6 över den ungefärliga mänskliga baslinjen på 60 % på ett test som tidigare frontier-modeller haft svårt att överträffa. Den uppnådde också 91,3 % på GPQA Diamond och 53,0 % på Humanity’s Last Exam, vilket gör den till den ledande modellen för svåra resonemangsuppgifter under första halvåret 2026.

Not: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3 säkerhetsklassificering.

Släppt
Februari 2026
Kontext
1M tokens
Vikter
Slutna
Nivå
Frontier
Leverantör
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic är ett AI-säkerhetsföretag som grundades 2021 av tidigare OpenAI-forskarna Dario Amodei och Daniela Amodei, tillsammans med en grupp kollegor som hade lett OpenAIs säkerhets- och policyteam. Företagets uttalade uppdrag är en ansvarsfull utveckling av AI för mänsklighetens långsiktiga nytta, och dess forskningsagenda definieras av detta åtagande: Constitutional AI (CAI), en teknik för att träna modeller att vara hjälpsamma, ofarliga och ärliga genom självkritik; mekanistisk tolkningsbarhet, som syftar till att omvändkonstruera vad enskilda neuroner och kretsar i stora nätverk faktiskt beräknar; och skalningsvetenskap, som försöker förutsäga hur modellbeteende förändras med beräkningskraft och data. Anthropic publicerar denna forskning öppet och har blivit ett av de mest citerade AI-säkerhetslabbarna i akademisk litteratur. Claude är Anthropics publika modellfamilj — uppkallad efter Claude Shannon, informationsteorins grundare — och omfattar fyra generationer (1 till 4.x/Fable 5). Anthropic driver ett kommersiellt API och en konsumentinriktad Claude.ai-produkt, och har djupa molnpartnerskap med AWS (Amazon Bedrock) och Google Cloud (Vertex AI).

Användningsområden

Vad du kan använda Claude Opus 4.6 till

Mjukvaruutveckling
Vetenskapligt & Tekniskt Resonemang
Agentisk CLI-automatisering
Långdokument- och Kodbasanalys

Strengths & Limitations

Strengths

  • Stark mjukvaruutveckling — 80 % SWE-bench Verified
  • Vetenskapligt resonemang på forskarnivå — 91 % GPQA Diamond
  • Nytt visuellt resonemang — 69 % ARC-AGI-2 (oberoende verifierat)
  • Mycket långa dokument och stora kodbaser (1M kontext)

Limitations

  • Slutna vikter — kan inte självhostas eller finjusteras på privata data

Bläddra i hela AI Model Leaderboard

Vanliga frågor

Lär dig mer