
Claude Opus 4.8 — Benchmark, funktioner och användningsområden
Claude Opus 4.8 är en proprietär AI-modell från Anthropic, klassificerad som Frontier-nivå med ett kontextfönster på 1M token. Utforska benchmarkresultat, styrk...
Claude Opus 4.6 är en toppmodern frontier AI-modell, utvecklad av Anthropic och släppt i februari 2026. Det är en proprietär sluten viktmodell, tillgänglig via Anthropic API. Kontextfönstret på 1M tokens är tillräckligt stort för att rymma hela kodbaser, långa tekniska dokument eller utökade agentiska sessioner utan trunkering.
På FlowHunt AI Leaderboard är den en av 24 spårade modeller, utvärderade över 6 benchmark. Utmärkande poäng: 69,2 % på ARC-AGI-2 (#1 av 3); 53,0 % på HLE (#1 av 6); 80,8 % på SWE-bench Verified (#5 av 13).
Claude Opus 4.6 släpptes den 5 februari 2026 och fick särskild uppmärksamhet för sin prestanda på nya visuella resonemangsuppgifter. Den innehar den högsta offentligt verifierade poängen på ARC-AGI-2 med 69,17 % — ett benchmark för abstrakt visuellt mönsterigenkänning som oberoende verifierats av ARC Prize Foundation och specifikt utformat för att förhindra memorisering. Detta resultat placerade Opus 4.6 över den ungefärliga mänskliga baslinjen på 60 % på ett test som tidigare frontier-modeller haft svårt att överträffa. Den uppnådde också 91,3 % på GPQA Diamond och 53,0 % på Humanity’s Last Exam, vilket gör den till den ledande modellen för svåra resonemangsuppgifter under första halvåret 2026.
Not: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3 säkerhetsklassificering.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic är ett AI-säkerhetsföretag som grundades 2021 av tidigare OpenAI-forskarna Dario Amodei och Daniela Amodei, tillsammans med en grupp kollegor som hade lett OpenAIs säkerhets- och policyteam. Företagets uttalade uppdrag är en ansvarsfull utveckling av AI för mänsklighetens långsiktiga nytta, och dess forskningsagenda definieras av detta åtagande: Constitutional AI (CAI), en teknik för att träna modeller att vara hjälpsamma, ofarliga och ärliga genom självkritik; mekanistisk tolkningsbarhet, som syftar till att omvändkonstruera vad enskilda neuroner och kretsar i stora nätverk faktiskt beräknar; och skalningsvetenskap, som försöker förutsäga hur modellbeteende förändras med beräkningskraft och data. Anthropic publicerar denna forskning öppet och har blivit ett av de mest citerade AI-säkerhetslabbarna i akademisk litteratur. Claude är Anthropics publika modellfamilj — uppkallad efter Claude Shannon, informationsteorins grundare — och omfattar fyra generationer (1 till 4.x/Fable 5). Anthropic driver ett kommersiellt API och en konsumentinriktad Claude.ai-produkt, och har djupa molnpartnerskap med AWS (Amazon Bedrock) och Google Cloud (Vertex AI).
Användningsområden
Claude Opus 4.6 får 80 % på SWE-bench Verified — rankad #5 av 13 modeller som spåras här. Den löser verkliga GitHub-problem, skriver produktionsklar kod på flera språk och hanterar flerstegs agentiska kodningsarbetsflöden — ett starkt val för AI-assisterade mjukvaruutvecklingsteam.
Med 91 % på GPQA Diamond (#5 av 14 modeller) överträffar Claude Opus 4.6 den ungefärliga mänskliga PhD-baslinjen på ~65 % när det gäller frågor inom biologi, kemi och fysik på forskarnivå. Använd den för syntes av vetenskaplig litteratur, hypotesutvärdering, medicinska och juridiska frågor och svar samt tvärvetenskapliga forskningsuppgifter där djup domänkunskap spelar roll.
Claude Opus 4.6 uppnår 65 % på Terminal-Bench (#7 av 8 modeller), vilket gör den kompetent för vanliga shell-skript, kommandoradsarbetsflöden och lätta systemadministrationsuppgifter i agentiska pipelines.
Med ett kontextfönster på 1M tokens kan Claude Opus 4.6 läsa in hela mjukvarurepositorier, långa juridiska kontrakt, boklånga forskningsrapporter eller omfattande konversationshistoriker i en enda prompt — vilket möjliggör djupgående dokumentfrågor, tvärfilsresonemang i kodbaser och omfattande sammanfattning utan trunkeringsheuristik eller RAG-pipelines.
Mer att jämföra
Jämför alla 24 modeller över 11 benchmark — sorterbara, källbelagda och uppdaterade juni 2026.

Claude Opus 4.8 är en proprietär AI-modell från Anthropic, klassificerad som Frontier-nivå med ett kontextfönster på 1M token. Utforska benchmarkresultat, styrk...

Claude Opus 4.7 är en proprietär AI-modell från Anthropic, klassificerad som Frontier-nivå med ett kontextfönster på 1M tokens. Utforska prestandamått, styrkor ...

Claude Sonnet 4.6 är en proprietär AI-modell från Anthropic, klassificerad som Advanced-nivå med ett kontextfönster på 1M tokens. Den är direkt tillgänglig i Fl...