Anthropic-logo

Anthropic

Claude Opus 4.8

Frontier

Claude Opus 4.8 on huipputason frontier-tekoälymalli, jonka Anthropic on kehittänyt ja joka julkaistiin toukokuussa 2026. Se on oma valmistevertainen suljetun painotuksen malli, joka on saatavilla Anthropic API:n kautta. Yhden miljoonan tokenin konteksti-ikkuna on riittävän suuri käsittelemään kokonaisia koodikantoja, laajoja teknisiä dokumentteja tai pitkäkestoisia agenttisessioita ilman katkaisua.

FlowHunt AI Leaderboardissa se on yksi 24 seuratusta mallista, ja se on arvioitu viidessä vertailutestissä. Huomattavia pistemääriä: 61,4 pistettä AA Intelligence Indexissä (#1/9); 69,2 % SWE-bench Prossa (#2/9); 74,6 % Terminal-Benchissä (#2/8).

Claude Opus 4.8 julkaistiin 28. toukokuuta 2026 kohdennettuna pistepäivityksenä Opus 4.7:n päälle, ja Anthropic kuvaili sitä “vaatimattomaksi mutta konkreettiseksi päivitykseksi samalla hinnalla.” Julkaisu noudatti nopeaa tahtia: Opus 4.6, 4.7 ja 4.8 kaikki toimitettiin samalla kalenterineljänneksellä, mikä kuvastaa Anthropicin siirtymistä kohti jatkuvaa inkrementaalista toimitusta. Vaikka vertailutestien parannukset olivat vaatimattomia, Opus 4.8 nousi Artificial Analysis Intelligence Indexin kärkipaikalle 61,4 pisteellä — korkein riippumaton yhdistelmäpistemäärä mistään mallista julkaisuhetkellä — mikä teki siitä monipuolisimman frontier-mallin riippumattoman kolmannen osapuolen mittauksen mukaan, vaikka Claude Fable 5 ohittikin sen puhtaissa koodaustehtävissä kaksi viikkoa myöhemmin.

Huomautus: Vaatimaton mutta konkreettinen päivitys 4.7:ään verrattuna samalla hinnalla. #1 AA Intelligence Index 61,4 pisteellä.

Julkaistu
Toukokuu 2026
Konteksti
1M tokenia
Painotukset
Suljettu
Taso
Frontier
Tarjoaja
Anthropic

Claude Opus 4.8 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified88.6%3 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro69.2%2 of 9SRMulti-language, standardised scaffold
GPQA Diamond93.6%3 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench74.6%2 of 8SRAgentic Linux terminal task completion
AA Intelligence Index61.4 pts1 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
88.6%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
69.2%
Multi-language, standardised scaffold
GPQA ◇ SR
93.6%
Graduate-level Google-proof science Q&A
Terminal SR
74.6%
Agentic Linux terminal task completion
AA Idx AA
61.4 pts
Artificial Analysis composite score (independent)

Claude Opus 4.8 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.8GPT-5.5GPT-5.4
SWE-V88.6%88.7%
SWE-Pro69.2%58.6%59.1%
GPQA ◇93.6%93.6%
Terminal74.6%82.7%
AA Idx61.4 pts60.2 pts

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic on vuonna 2021 perustettu tekoälyturvallisuusyritys, jonka perustivat entiset OpenAI-tutkijat Dario Amodei ja Daniela Amodei yhdessä kollegoiden kanssa, jotka olivat johtaneet OpenAIN turvallisuus- ja politiikkatiimejä. Yrityksen julkilausuttu tavoite on tekoälyn vastuullinen kehittäminen ihmiskunnan pitkäaikaiseksi hyödyksi, ja sen tutkimusohjelma määräytyy tämän sitoumuksen perusteella: Constitutional AI (CAI) – menetelmä mallien kouluttamiseksi avuliaiksi, vaarattomiksi ja rehellisiksi itsekritiikin avulla; mekanistinen tulkittavuus, jonka tavoitteena on käänteissuunnitella, mitä yksittäiset neuronit ja piirit suurten verkkojen sisällä todellisuudessa laskevat; sekä skaalautumistiede, joka pyrkii ennustamaan, miten mallin käyttäytyminen muuttuu laskentatehon ja datan myötä. Anthropic julkaisee tämän tutkimuksen avoimesti ja on noussut yhdeksi eniten siteeratuista tekoälyturvallisuuslaboratorioista akateemisessa kirjallisuudessa. Claude on Anthropicin julkinen malliperhe – nimetty Claude Shannonin, informaatioteorian perustajan, mukaan – ja se kattaa neljä sukupolvea (1–4.x/Fable 5). Anthropic ylläpitää kaupallista APIa ja kuluttajille suunnattua Claude.ai-tuotetta sekä syviä pilviyhteistyökumppanuuksia AWS:n (Amazon Bedrock) ja Google Cloudin (Vertex AI) kanssa.

Käyttötapaukset

Mihin Claude Opus 4.8:aa Kannattaa Käyttää

Ohjelmistokehitys
Tieteellinen ja Tekninen Päättely
Agenttinen CLI-automaatio
Pitkien Dokumenttien ja Koodikantojen Analyysi

Strengths & Limitations

Strengths

  • Vahva ohjelmistokehitys — 88 % SWE-bench Verified
  • Valmistuneen tason tieteellinen päättely — 93 % GPQA Diamond
  • Agenttinen Linux-/CLI-automaatio — 74 % Terminal-Bench
  • Yhdistelmäälykkyys — 61 pistettä AA Intelligence Index (riippumaton)
  • Erittäin pitkät dokumentit ja suuret koodikannat (1 miljoona kontekstia)

Limitations

  • Suljettu painotus — ei voida isännöidä itse tai hienosäätää yksityisellä datalla

Selaa Koko Tekoälymallien Vertailutaulukkoa

Usein kysytyt kysymykset

Lue lisää