Anthropic-logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 er en toppmoderne frontier AI-modell utviklet av Anthropic og utgitt i februar 2026. Det er en proprietær lukket vekt-modell tilgjengelig via Anthropic API. Kontekstvinduet på 1 M tokens er stort nok til å inneholde hele kodebaser, omfattende tekniske dokumenter eller utvidede agent-økter uten avkorting.

På FlowHunt AI Leaderboard er den én av 24 sporede modeller, evaluert på tvers av 6 referansetester. Fremtredende poengsummer: 69,2 % på ARC-AGI-2 (#1 av 3); 53,0 % på HLE (#1 av 6); 80,8 % på SWE-bench Verified (#5 av 13).

Claude Opus 4.6 ble utgitt 5. februar 2026 og vakte særlig oppmerksomhet for sin ytelse på nye visuelle resonneringsoppgaver. Den har den høyeste offentlig verifiserte poengsummen på ARC-AGI-2 med 69,17 % – en referansetest for abstrakt visuell mønstergjenkjenning, uavhengig verifisert av ARC Prize Foundation og spesielt utformet for å forhindre memorisering. Dette resultatet plasserte Opus 4.6 over den omtrentlige menneskelige baselinjen på 60 % på en test som tidligere frontier-modeller hadde slitt med å overgå. Den oppnådde også 91,3 % på GPQA Diamond og 53,0 % på Humanitys siste eksamen (HLE), noe som gjorde den til den ledende modellen for vanskelige resonneringsoppgaver første halvår 2026.

Merk: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3 sikkerhetsklassifisering.

Lansert
Februar 2026
Kontekst
1 M tokens
Vekter
Lukket
Nivå
Frontier
Leverandør
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic er et KI-sikkerhetsselskap grunnlagt i 2021 av de tidligere OpenAI-forskerne Dario Amodei og Daniela Amodei, sammen med en gruppe kolleger som hadde ledet OpenAIs sikkerhets- og policyteam. Selskapets uttalte oppdrag er ansvarlig utvikling av KI til langsiktig nytte for menneskeheten, og forskningsagendaen defineres av dette engasjementet: Constitutional AI (CAI), en teknikk for å trene modeller til å være nyttige, ufarlige og ærlige gjennom selvkritikk; mekanistisk fortolkbarhet, som tar sikte på å reverskonstruere hva individuelle nevroner og kretser i store nettverk faktisk beregner; og skaleringsvitenskap, som forsøker å forutsi hvordan modellatferd endrer seg med regnekraft og data. Anthropic publiserer denne forskningen åpent og har blitt et av de mest siterte KI-sikkerhetslabene i akademisk litteratur. Claude er Anthropics offentlige modellfamilie – oppkalt etter Claude Shannon, grunnleggeren av informasjonsteori – og spenner over fire generasjoner (1 til 4.x/Fable 5). Anthropic driver et kommersielt API og det forbrukerrettede Claude.ai-produktet, og opprettholder dype skypartnerskap med AWS (Amazon Bedrock) og Google Cloud (Vertex AI).

Bruksområder

Hva du bør bruke Claude Opus 4.6 til

Software Engineering
Vitenskapelig og teknisk resonnering
Agentisk CLI-automatisering
Analyse av lange dokumenter og kodebaser

Strengths & Limitations

Strengths

  • Sterk software engineering – 80 % SWE-bench Verified
  • Vitenskapelig resonnering på masternivå – 91 % GPQA Diamond
  • Ny visuell resonnering – 69 % ARC-AGI-2 (uavhengig verifisert)
  • Svært lange dokumenter og store kodebaser (1 M kontekst)

Limitations

  • Lukkede vekter – kan ikke selv vertes eller finjusteres på private data

Se hele AI-modelloversikten

Vanlige spørsmål

Lær mer