
Claude Opus 4.7 — Testitulokset, ominaisuudet ja käyttötapaukset
Claude Opus 4.7 on Anthropicin kehittämä oma tekoälymalli, joka luokitellaan Frontier-tasolle ja jossa on 1 miljoonan tokenin konteksti-ikkuna. Tutustu testitul...
Claude Opus 4.6 on huippuluokan Frontier-tason tekoälymalli, jonka Anthropic on kehittänyt ja joka julkaistiin helmikuussa 2026. Se on suljettu malli, joka on saatavilla Anthropic API:n kautta. 1 miljoonan tokenin konteksti-ikkuna on riittävän suuri käsittelemään kokonaisia koodikantoja, pitkiä teknisiä asiakirjoja tai laajoja agenttisessioita ilman katkaisua.
FlowHunt AI Leaderboardilla se on yksi 24 seuratusta mallista, arvioituna 6 vertailutestissä. Huomionarvoisia tuloksia: 69,2 % ARC-AGI-2:ssa (#1/3); 53,0 % HLE:ssä (#1/6); 80,8 % SWE-bench Verified -testissä (#5/13).
Claude Opus 4.6 julkaistiin 5. helmikuuta 2026 ja se herätti erityistä huomiota suorituskyvyllään uusissa visuaalisen päättelyn tehtävissä. Se pitää hallussaan korkeinta julkisesti vahvistettua pistemäärää ARC-AGI-2-testissä 69,17 % — abstraktin visuaalisen kuviontunnistuksen vertailutesti, jonka ARC Prize Foundation on riippumattomasti vahvistanut ja joka on suunniteltu erityisesti estämään ulkoa opettelua. Tämä tulos sijoitti Opus 4.6:n noin 60 %:n ihmisen perustason yläpuolelle testissä, jossa aiemmat Frontier-mallit olivat tuskin yltäneet. Se saavutti myös 91,3 % GPQA Diamond -testissä ja 53,0 % Humanity’s Last Exam -testissä, mikä teki siitä johtavan mallin vaikeissa päättelytehtävissä vuoden 2026 ensimmäisellä puoliskolla.
Huomautus: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). ASL-3 turvallisuusluokitus.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic on vuonna 2021 perustettu tekoälyturvallisuusyritys, jonka perustivat entiset OpenAI-tutkijat Dario Amodei ja Daniela Amodei yhdessä kollegoiden kanssa, jotka olivat johtaneet OpenAIN turvallisuus- ja politiikkatiimejä. Yrityksen julkilausuttu tavoite on tekoälyn vastuullinen kehittäminen ihmiskunnan pitkäaikaiseksi hyödyksi, ja sen tutkimusohjelma määräytyy tämän sitoumuksen perusteella: Constitutional AI (CAI) – menetelmä mallien kouluttamiseksi avuliaiksi, vaarattomiksi ja rehellisiksi itsekritiikin avulla; mekanistinen tulkittavuus, jonka tavoitteena on käänteissuunnitella, mitä yksittäiset neuronit ja piirit suurten verkkojen sisällä todellisuudessa laskevat; sekä skaalautumistiede, joka pyrkii ennustamaan, miten mallin käyttäytyminen muuttuu laskentatehon ja datan myötä. Anthropic julkaisee tämän tutkimuksen avoimesti ja on noussut yhdeksi eniten siteeratuista tekoälyturvallisuuslaboratorioista akateemisessa kirjallisuudessa. Claude on Anthropicin julkinen malliperhe – nimetty Claude Shannonin, informaatioteorian perustajan, mukaan – ja se kattaa neljä sukupolvea (1–4.x/Fable 5). Anthropic ylläpitää kaupallista APIa ja kuluttajille suunnattua Claude.ai-tuotetta sekä syviä pilviyhteistyökumppanuuksia AWS:n (Amazon Bedrock) ja Google Cloudin (Vertex AI) kanssa.
Käyttötapaukset
Claude Opus 4.6 saavuttaa 80 % SWE-bench Verified -testissä — sijoitus #5/13 tässä seuratusta mallista. Se ratkaisee oikeita GitHub-ongelmia, kirjoittaa tuotantotason koodia useilla kielillä ja hallitsee monivaiheisia agenttisia koodaustyönkulkuja — vahva valinta tekoälyavusteisille ohjelmistokehitystiimeille.
91 %:n tuloksella GPQA Diamond -testissä (#5/14 mallista) Claude Opus 4.6 ylittää ~65 %:n ihmisen tohtoritason perustason biologisten, kemiallisten ja fysiikan kysymysten osalta. Käytä sitä tieteellisen kirjallisuuden synteesiin, hypoteesien arviointiin, lääketieteellisiin ja oikeudellisiin kysymyksiin sekä monitieteisiin tutkimustehtäviin, joissa syvällinen asiantuntemus on tärkeää.
Claude Opus 4.6 saavuttaa 65 % Terminal-Bench-testissä (#7/8 mallista), mikä tekee siitä pätevän yleisiin komentotulkkaustoimintoihin, komentorivityönkulkuihin ja kevyisiin järjestelmänhallintatehtäviin agenttiputkistoissa.
1 miljoonan tokenin konteksti-ikkunallaan Claude Opus 4.6 pystyy käsittelemään kokonaisia ohjelmistovarastoja, pitkiä oikeudellisia sopimuksia, kirjanmittaisia tutkimusraportteja tai laajoja keskusteluhistorioita yhdessä kehotteessa — mahdollistaen syvällisen dokumenttien kyselyn, tiedostojen välisen koodikannan päättelyn ja kattavan tiivistämisen ilman pilkkomisheuristiikkoja tai RAG-putkistoja.
Lisää vertailtavaa
Vertaa kaikkia 24 mallia 11 vertailutestissä — lajiteltava, lähdeviitteillä varustettu ja päivitetty kesäkuussa 2026.

Claude Opus 4.7 on Anthropicin kehittämä oma tekoälymalli, joka luokitellaan Frontier-tasolle ja jossa on 1 miljoonan tokenin konteksti-ikkuna. Tutustu testitul...

Claude Opus 4.8 on Anthropicin kehittämä oma valmistevertainen tekoälymalli, joka luokitellaan Frontier-tasolle ja jossa on 1 miljoonan tokenin konteksti-ikkuna...

Claude Sonnet 4.6 on Anthropicin oma tekoälymalli, joka luokitellaan Advanced-tasolle ja jossa on 1 miljoonan tokenin konteksti-ikkuna. Se on suoraan saatavilla...