
Claude Opus 4.8 — Referansetester, egenskaper og bruksområder
Claude Opus 4.8 er en proprietær AI-modell fra Anthropic, klassifisert som Frontier-nivå med et kontekstvindu på 1M tokens. Utforsk referansetester, styrker og ...
Claude Opus 4.6 er en toppmoderne frontier AI-modell utviklet av Anthropic og utgitt i februar 2026. Det er en proprietær lukket vekt-modell tilgjengelig via Anthropic API. Kontekstvinduet på 1 M tokens er stort nok til å inneholde hele kodebaser, omfattende tekniske dokumenter eller utvidede agent-økter uten avkorting.
På FlowHunt AI Leaderboard er den én av 24 sporede modeller, evaluert på tvers av 6 referansetester. Fremtredende poengsummer: 69,2 % på ARC-AGI-2 (#1 av 3); 53,0 % på HLE (#1 av 6); 80,8 % på SWE-bench Verified (#5 av 13).
Claude Opus 4.6 ble utgitt 5. februar 2026 og vakte særlig oppmerksomhet for sin ytelse på nye visuelle resonneringsoppgaver. Den har den høyeste offentlig verifiserte poengsummen på ARC-AGI-2 med 69,17 % – en referansetest for abstrakt visuell mønstergjenkjenning, uavhengig verifisert av ARC Prize Foundation og spesielt utformet for å forhindre memorisering. Dette resultatet plasserte Opus 4.6 over den omtrentlige menneskelige baselinjen på 60 % på en test som tidligere frontier-modeller hadde slitt med å overgå. Den oppnådde også 91,3 % på GPQA Diamond og 53,0 % på Humanitys siste eksamen (HLE), noe som gjorde den til den ledende modellen for vanskelige resonneringsoppgaver første halvår 2026.
Merk: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3 sikkerhetsklassifisering.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic er et KI-sikkerhetsselskap grunnlagt i 2021 av de tidligere OpenAI-forskerne Dario Amodei og Daniela Amodei, sammen med en gruppe kolleger som hadde ledet OpenAIs sikkerhets- og policyteam. Selskapets uttalte oppdrag er ansvarlig utvikling av KI til langsiktig nytte for menneskeheten, og forskningsagendaen defineres av dette engasjementet: Constitutional AI (CAI), en teknikk for å trene modeller til å være nyttige, ufarlige og ærlige gjennom selvkritikk; mekanistisk fortolkbarhet, som tar sikte på å reverskonstruere hva individuelle nevroner og kretser i store nettverk faktisk beregner; og skaleringsvitenskap, som forsøker å forutsi hvordan modellatferd endrer seg med regnekraft og data. Anthropic publiserer denne forskningen åpent og har blitt et av de mest siterte KI-sikkerhetslabene i akademisk litteratur. Claude er Anthropics offentlige modellfamilie – oppkalt etter Claude Shannon, grunnleggeren av informasjonsteori – og spenner over fire generasjoner (1 til 4.x/Fable 5). Anthropic driver et kommersielt API og det forbrukerrettede Claude.ai-produktet, og opprettholder dype skypartnerskap med AWS (Amazon Bedrock) og Google Cloud (Vertex AI).
Bruksområder
Claude Opus 4.6 oppnår 80 % på SWE-bench Verified – rangert #5 av 13 modeller som spores her. Den løser reelle GitHub-problemer, skriver produksjonsklar kode på tvers av flere språk, og håndterer flertrinns agentiske kodingarbeidsflyter – et sterkt valg for AI-assisterte programvareutviklingsteam.
Med 91 % på GPQA Diamond (#5 av 14 modeller) overgår Claude Opus 4.6 den omtrentlige menneskelige PhD-ekspertbaselinjen på ~65 % på mastergradsnivå innen biologi, kjemi og fysikk. Bruk den til syntese av vitenskapelig litteratur, hypoteseevaluering, medisinske og juridiske spørsmål og svar, og tverrfaglige forskningsoppgaver der dybdekunnskap innen fagfeltet har betydning.
Claude Opus 4.6 oppnår 65 % på Terminal-Bench (#7 av 8 modeller), noe som gjør den kompetent for vanlige shell-skript, kommandolinjearbeidsflyter og lette systemadministrasjonsoppgaver i agentiske pipeliner.
Med et kontekstvindu på 1 M tokens kan Claude Opus 4.6 behandle hele programvarearkiver, lange juridiske kontrakter, boklange forskningsrapporter eller omfattende samtalelogger i én enkelt forespørsel – noe som muliggjør dyptgående dokument-spørsmål og svar, tverrfilsanalyse av kodebaser og omfattende oppsummering uten oppdelingsheuristikker eller RAG-pipeliner.
Mer å sammenligne
Sammenlign alle 24 modellene på tvers av 11 referansetester – sorterbar, med kilder og oppdatert juni 2026.

Claude Opus 4.8 er en proprietær AI-modell fra Anthropic, klassifisert som Frontier-nivå med et kontekstvindu på 1M tokens. Utforsk referansetester, styrker og ...

Claude Opus 4.7 er en proprietær AI-modell fra Anthropic, klassifisert som Frontier-nivå med et kontekstvindu på 1M tokens. Utforsk referansetestresultater, sty...

Claude Sonnet 4.6 er en proprietær AI-modell fra Anthropic, klassifisert som Avansert nivå med et kontekstvindu på 1M tokens. Den er tilgjengelig direkte i Flow...