Anthropic logo

Anthropic

Claude Opus 4.8

Frontier

Claude Opus 4.8 är en toppmodern frontier-AI-modell, utvecklad av Anthropic och lanserad i maj 2026. Det är en proprietär modell med slutna vikter, tillgänglig via Anthropic API. Kontextfönstret på 1M token är tillräckligt stort för att rymma hela kodbaser, långa tekniska dokument eller utökade agentiska sessioner utan trunkering.

På FlowHunt AI-topplista är den en av 24 spårade modeller, utvärderade över 5 benchmark. Framstående resultat: 61,4 poäng på AA Intelligence Index (#1 av 9); 69,2 % på SWE-bench Pro (#2 av 9); 74,6 % på Terminal-Bench (#2 av 8).

Claude Opus 4.8 lanserades den 28 maj 2026 som en fokuserad punktrelease ovanpå Opus 4.7, där Anthropic beskrev den som en ‘blygsam men påtaglig uppgradering till samma pris.’ Lanseringen följde en snabb kadens: Opus 4.6, 4.7 och 4.8 släpptes alla inom samma kalenderkvartal, vilket speglar Anthropics skifte mot kontinuerlig inkrementell leverans. Trots blygsamma förbättringar i benchmark tog Opus 4.8 förstaplatsen på Artificial Analysis Intelligence Index med 61,4 poäng — det högsta oberoende sammansatta betyget av någon modell vid lanseringstillfället — vilket gör den till den mest välrundade frontier-modellen enligt oberoende tredjepartsmätning, även om den överträffades av Claude Fable 5 inom rena kodningsuppgifter två veckor senare.

Not: Blygsam men påtaglig uppgradering jämfört med 4.7 till samma pris. #1 AA Intelligence Index med 61,4.

Released
Maj 2026
Context
1M token
Weights
Stängda
Tier
Frontier
Provider
Anthropic

Claude Opus 4.8 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified88.6%3 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro69.2%2 of 9SRMulti-language, standardised scaffold
GPQA Diamond93.6%3 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench74.6%2 of 8SRAgentic Linux terminal task completion
AA Intelligence Index61.4 pts1 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
88.6%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
69.2%
Multi-language, standardised scaffold
GPQA ◇ SR
93.6%
Graduate-level Google-proof science Q&A
Terminal SR
74.6%
Agentic Linux terminal task completion
AA Idx AA
61.4 pts
Artificial Analysis composite score (independent)

Claude Opus 4.8 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.8GPT-5.5GPT-5.4
SWE-V88.6%88.7%
SWE-Pro69.2%58.6%59.1%
GPQA ◇93.6%93.6%
Terminal74.6%82.7%
AA Idx61.4 pts60.2 pts

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic är ett AI-säkerhetsföretag som grundades 2021 av tidigare OpenAI-forskarna Dario Amodei och Daniela Amodei, tillsammans med en grupp kollegor som hade lett OpenAIs säkerhets- och policyteam. Företagets uttalade uppdrag är en ansvarsfull utveckling av AI för mänsklighetens långsiktiga nytta, och dess forskningsagenda definieras av detta åtagande: Constitutional AI (CAI), en teknik för att träna modeller att vara hjälpsamma, ofarliga och ärliga genom självkritik; mekanistisk tolkningsbarhet, som syftar till att omvändkonstruera vad enskilda neuroner och kretsar i stora nätverk faktiskt beräknar; och skalningsvetenskap, som försöker förutsäga hur modellbeteende förändras med beräkningskraft och data. Anthropic publicerar denna forskning öppet och har blivit ett av de mest citerade AI-säkerhetslabbarna i akademisk litteratur. Claude är Anthropics publika modellfamilj — uppkallad efter Claude Shannon, informationsteorins grundare — och omfattar fyra generationer (1 till 4.x/Fable 5). Anthropic driver ett kommersiellt API och en konsumentinriktad Claude.ai-produkt, och har djupa molnpartnerskap med AWS (Amazon Bedrock) och Google Cloud (Vertex AI).

Användningsområden

Vad du ska använda Claude Opus 4.8 till

Programvaruteknik
Vetenskapligt & tekniskt resonemang
Agentisk CLI-automation
Analys av långa dokument & kodbaser

Strengths & Limitations

Strengths

  • Stark programvaruteknik — 88 % SWE-bench Verified
  • Vetenskapligt resonemang på forskarnivå — 93 % GPQA Diamond
  • Agentisk Linux/CLI-automation — 74 % Terminal-Bench
  • Sammansatt intelligens — 61 poäng AA Intelligence Index (oberoende)
  • Mycket långa dokument och stora kodbaser (1M kontext)

Limitations

  • Slutna vikter — kan inte självhostas eller finjusteras på privat data

Bläddra i den fullständiga AI-modelltopplistan

Vanliga frågor

Lär dig mer