
Claude Opus 4.8 — Benchmarks, egenskaber og anvendelsesmuligheder
Claude Opus 4.8 er en proprietær AI-model fra Anthropic, klassificeret som Frontier-niveau med en kontekstvindue på 1M tokens. Udforsk benchmark-scoringer, styr...
Claude Opus 4.6 er en topklasse frontier AI-model, udviklet af Anthropic og udgivet i februar 2026. Det er en proprietær closed-weight-model, tilgængelig via Anthropic API. Kontekstvinduet på 1M tokens er stort nok til at rumme hele kodebaser, længere tekniske dokumenter eller udvidede agentiske sessioner uden afkortning.
På FlowHunt AI Leaderboard er den en af 24 spores modeller, evalueret på tværs af 6 benchmarks. Fremtrædende score: 69,2 % på ARC-AGI-2 (#1 af 3); 53,0 % på HLE (#1 af 6); 80,8 % på SWE-bench Verified (#5 af 13).
Claude Opus 4.6 blev udgivet den 5. februar 2026 og fik særlig opmærksomhed for sin præstation inden for nye visuelle ræsonneringsopgaver. Den har den højeste offentligt verificerede score på ARC-AGI-2 med 69,17 % — et benchmark for abstrakt visuel mønstergenkendelse, uafhængigt verificeret af ARC Prize Foundation og designet specifikt til at forhindre memorisering. Dette resultat placerede Opus 4.6 over den cirka 60 % menneskelige baseline på en test, som tidligere frontier-modeller havde haft svært ved at overgå. Den opnåede også 91,3 % på GPQA Diamond og 53,0 % på Humanity’s Last Exam, hvilket gør den til den førende model til svære ræsonneringsopgaver i første halvdel af 2026.
Bemærk: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3 sikkerhedsklassifikation.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic er et AI-sikkerhedsselskab grundlagt i 2021 af tidligere OpenAI-forskere Dario Amodei og Daniela Amodei sammen med en gruppe kolleger, der tidligere havde ledet OpenAIs sikkerheds- og politikafdelinger. Virksomhedens erklærede mission er den ansvarlige udvikling af AI til gavn for menneskeheden på lang sigt, og dens forskningsdagsorden er defineret af dette engagement: Constitutional AI (CAI), en teknik til at træne modeller til at være hjælpsomme, harmløse og ærlige gennem selvkritik; mekanistisk fortolkbarhed, som sigter mod at reverse-engineere, hvad individuelle neuroner og kredsløb i store netværk rent faktisk beregner; og skaleringsvidenskab, som forsøger at forudsige, hvordan modeladfærd ændrer sig med regnekraft og data. Anthropic offentliggør denne forskning åbent og er blevet et af de mest citerede AI-sikkerhedslaboratorier i den akademiske litteratur. Claude er Anthropics offentlige modelfamilie — opkaldt efter Claude Shannon, grundlæggeren af informationsteori — og spænder over fire generationer (1 til 4.x/Fable 5). Anthropic driver en kommerciel API og det forbrugerrettede Claude.ai-produkt og opretholder dybe cloud-partnerskaber med AWS (Amazon Bedrock) og Google Cloud (Vertex AI).
Anvendelsesmuligheder
Claude Opus 4.6 scorer 80 % på SWE-bench Verified — rangeret #5 af 13 modeller spores her. Den løser rigtige GitHub-problemer, skriver produktionsklar kode på tværs af flere sprog og håndterer flertrins agentiske kodningsarbejdsgange — et stærkt valg for AI-assisterede softwareudviklingsteams.
Med 91 % på GPQA Diamond (#5 af 14 modeller) overgår Claude Opus 4.6 den cirka 65 % menneskelige PhD-ekspert-baseline inden for biologi, kemi og fysik på kandidatniveau. Brug den til syntese af videnskabelig litteratur, hypoteseevaluering, medicinsk og juridisk spørgsmål-svar-opgaver samt tværfaglige forskningsopgaver, hvor dyb fagviden er vigtig.
Claude Opus 4.6 opnår 65 % på Terminal-Bench (#7 af 8 modeller), hvilket gør den kompetent til almindelig shell-scripting, kommandolinjearbejdsgange og let systemadministration inden for agentiske pipelines.
Med et kontekstvindue på 1M tokens kan Claude Opus 4.6 indlæse hele softwarelagre, lange juridiske kontrakter, boglange forskningsrapporter eller omfattende samtalehistorikker i en enkelt prompt — hvilket muliggør dybdegående dokument-spørgsmål-svar, tværfil kodebaseræsonnering og omfattende sammenfatning uden chunking-heuristikker eller RAG-pipelines.
Mere at Sammenligne
Sammenlign alle 24 modeller på tværs af 11 benchmarks — sorterbar, kildeangivet og opdateret juni 2026.

Claude Opus 4.8 er en proprietær AI-model fra Anthropic, klassificeret som Frontier-niveau med en kontekstvindue på 1M tokens. Udforsk benchmark-scoringer, styr...

Claude Opus 4.7 er en proprietær AI-model fra Anthropic, klassificeret som Frontier-niveau med et kontekstvindue på 1M tokens. Udforsk benchmark-scorer, styrker...

Claude Sonnet 4.6 er en proprietær AI-model fra Anthropic, klassificeret som Advanced-niveau med et kontekstvindue på 1M tokens. Den er tilgængelig direkte i Fl...
Cookie Samtykke
Vi bruger cookies til at forbedre din browsingoplevelse og analysere vores trafik. See our privacy policy.