
Claude Opus 4.8 — Benchmarky, schopnosti a prípady použitia
Claude Opus 4.8 je proprietárny AI model od spoločnosti Anthropic, klasifikovaný ako Frontier úroveň s kontextovým oknom 1M tokenov. Preskúmajte výsledky benchm...
Claude Opus 4.6 je špičkový frontier AI model, vyvinutý spoločnosťou Anthropic a vydaný vo februári 2026. Ide o proprietárny model s uzavretými váhami, dostupný cez Anthropic API. Kontextové okno s kapacitou 1 milión tokenov je dostatočne veľké na to, aby obsiahlo celé kódové databázy, rozsiahle technické dokumenty alebo dlhé agentické relácie bez skracovania.
V rebríčku FlowHunt AI Leaderboard je jedným z 24 sledovaných modelov, vyhodnotených na 6 benchmarkoch. Významné skóre: 69,2 % na ARC-AGI-2 (#1 z 3); 53,0 % na HLE (#1 zo 6); 80,8 % na SWE-bench Verified (#5 z 13).
Claude Opus 4.6 bol vydaný 5. februára 2026 a získal osobitnú pozornosť vďaka svojmu výkonu v oblasti nového vizuálneho uvažovania. Dosahuje najvyššie verejne overené skóre na ARC-AGI-2 s hodnotou 69,17 % — čo je benchmark abstraktného rozpoznávania vizuálnych vzorov, nezávisle overený organizáciou ARC Prize Foundation a navrhnutý špeciálne na zabránenie memorovaniu. Tento výsledok umiestnil Opus 4.6 nad približne 60 % hranicu ľudského výkonu v teste, s ktorým mali predchádzajúce frontier modely problém. Dosiahol tiež 91,3 % na GPQA Diamond a 53,0 % na Humanity’s Last Exam, čím sa stal vedúcim modelom pre náročné úlohy uvažovania v prvej polovici roka 2026.
Poznámka: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). Klasifikácia bezpečnosti ASL-3.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic je spoločnosť zaoberajúca sa bezpečnosťou umelej inteligencie, založená v roku 2021 bývalými výskumníkmi OpenAI Dario Amodeiom a Danielou Amodeiovou spolu so skupinou kolegov, ktorí viedli tímy pre bezpečnosť a politiku v OpenAI. Deklarovaným poslaním spoločnosti je zodpovedný vývoj AI v prospech ľudstva z dlhodobého hľadiska a jej výskumná agenda je definovaná týmto záväzkom: Konštitučná AI (CAI), technika na trénovanie modelov, aby boli užitočné, neškodné a čestné prostredníctvom sebareflexie; mechanistická interpretovateľnosť, ktorá sa zameriava na spätné inžinierstvo toho, čo jednotlivé neuróny a okruhy vo veľkých sieťach skutočne vypočítavajú; a veda o škálovaní, ktorá sa snaží predpovedať, ako sa mení správanie modelov s výpočtovým výkonom a dátami. Anthropic zverejňuje tento výskum otvorene a stal sa jedným z najcitovanejších laboratórií bezpečnosti AI v akademickej literatúre. Claude je verejná modelová rodina Anthropicu – pomenovaná po Claudovi Shannonovi, zakladateľovi teórie informácie – a zahŕňa štyri generácie (1 až 4.x/Fable 5). Anthropic prevádzkuje komerčné API a spotrebiteľský produkt Claude.ai a udržiava hlboké cloudové partnerstvá s AWS (Amazon Bedrock) a Google Cloud (Vertex AI).
Prípady použitia
Claude Opus 4.6 dosahuje skóre 80 % v SWE-bench Verified — umiestnenie #5 z 13 modelov sledovaných tu. Rieši skutočné GitHub problémy, píše produkčný kód vo viacerých jazykoch a zvláda viacstupňové agentické programátorské pracovné postupy — je to silná voľba pre tímy využívajúce AI pri vývoji softvéru.
S výsledkom 91 % na GPQA Diamond (#5 zo 14 modelov) prekonáva Claude Opus 4.6 približne 65 % hranicu ľudského výkonu na úrovni PhD pri otázkach z biológie, chémie a fyziky. Použite ho na syntézu vedeckej literatúry, vyhodnocovanie hypotéz, medicínske a právne Q&A a viacodborové výskumné úlohy, kde záleží na hlbokej doménovej znalosti.
Claude Opus 4.6 dosahuje 65 % na Terminal-Bench (#7 z 8 modelov), vďaka čomu je kompetentný pre bežné shell skriptovanie, príkazové riadky a ľahké úlohy správy systémov v rámci agentických pipeline.
S kontextovým oknom 1 milión tokenov dokáže Claude Opus 4.6 spracovať celé softvérové repozitáre, dlhé právne zmluvy, knižne rozsiahle výskumné správy alebo rozsiahle histórie konverzácií v jednej výzve — čo umožňuje hĺbkové Q&A nad dokumentmi, uvažovanie naprieč súbormi v kódovej databáze a komplexné sumarizovanie bez potreby chunkovacích heuristík či RAG pipeline.
Ďalšie na porovnanie
Porovnajte všetkých 24 modelov naprieč 11 benchmarkmi — zoraditeľné, so zdrojmi a aktualizované v júni 2026.

Claude Opus 4.8 je proprietárny AI model od spoločnosti Anthropic, klasifikovaný ako Frontier úroveň s kontextovým oknom 1M tokenov. Preskúmajte výsledky benchm...

Claude Opus 4.7 je proprietárny AI model od Anthropicu, klasifikovaný ako Frontier úroveň s kontextovým oknom 1M tokenov. Preskúmajte benchmarkové skóre, silné ...

Claude Sonnet 4.6 je proprietárny AI model od spoločnosti Anthropic, klasifikovaný ako pokročilý (Advanced) s kontextovým oknom 1M tokenov. Je dostupný priamo v...
Súhlas s cookies
Používame cookies na vylepšenie vášho prehliadania a analýzu našej návštevnosti. See our privacy policy.