Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 je špičkový frontier AI model, vyvinutý spoločnosťou Anthropic a vydaný vo februári 2026. Ide o proprietárny model s uzavretými váhami, dostupný cez Anthropic API. Kontextové okno s kapacitou 1 milión tokenov je dostatočne veľké na to, aby obsiahlo celé kódové databázy, rozsiahle technické dokumenty alebo dlhé agentické relácie bez skracovania.

V rebríčku FlowHunt AI Leaderboard je jedným z 24 sledovaných modelov, vyhodnotených na 6 benchmarkoch. Významné skóre: 69,2 % na ARC-AGI-2 (#1 z 3); 53,0 % na HLE (#1 zo 6); 80,8 % na SWE-bench Verified (#5 z 13).

Claude Opus 4.6 bol vydaný 5. februára 2026 a získal osobitnú pozornosť vďaka svojmu výkonu v oblasti nového vizuálneho uvažovania. Dosahuje najvyššie verejne overené skóre na ARC-AGI-2 s hodnotou 69,17 % — čo je benchmark abstraktného rozpoznávania vizuálnych vzorov, nezávisle overený organizáciou ARC Prize Foundation a navrhnutý špeciálne na zabránenie memorovaniu. Tento výsledok umiestnil Opus 4.6 nad približne 60 % hranicu ľudského výkonu v teste, s ktorým mali predchádzajúce frontier modely problém. Dosiahol tiež 91,3 % na GPQA Diamond a 53,0 % na Humanity’s Last Exam, čím sa stal vedúcim modelom pre náročné úlohy uvažovania v prvej polovici roka 2026.

Poznámka: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). Klasifikácia bezpečnosti ASL-3.

Vydaný
Február 2026
Kontext
1 mil. tokenov
Váhy
Uzavreté
Kategória
Frontier
Poskytovateľ
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic je spoločnosť zaoberajúca sa bezpečnosťou umelej inteligencie, založená v roku 2021 bývalými výskumníkmi OpenAI Dario Amodeiom a Danielou Amodeiovou spolu so skupinou kolegov, ktorí viedli tímy pre bezpečnosť a politiku v OpenAI. Deklarovaným poslaním spoločnosti je zodpovedný vývoj AI v prospech ľudstva z dlhodobého hľadiska a jej výskumná agenda je definovaná týmto záväzkom: Konštitučná AI (CAI), technika na trénovanie modelov, aby boli užitočné, neškodné a čestné prostredníctvom sebareflexie; mechanistická interpretovateľnosť, ktorá sa zameriava na spätné inžinierstvo toho, čo jednotlivé neuróny a okruhy vo veľkých sieťach skutočne vypočítavajú; a veda o škálovaní, ktorá sa snaží predpovedať, ako sa mení správanie modelov s výpočtovým výkonom a dátami. Anthropic zverejňuje tento výskum otvorene a stal sa jedným z najcitovanejších laboratórií bezpečnosti AI v akademickej literatúre. Claude je verejná modelová rodina Anthropicu – pomenovaná po Claudovi Shannonovi, zakladateľovi teórie informácie – a zahŕňa štyri generácie (1 až 4.x/Fable 5). Anthropic prevádzkuje komerčné API a spotrebiteľský produkt Claude.ai a udržiava hlboké cloudové partnerstvá s AWS (Amazon Bedrock) a Google Cloud (Vertex AI).

Prípady použitia

Na čo používať Claude Opus 4.6

Softvérové inžinierstvo
Vedecké a technické uvažovanie
Agentická automatizácia CLI
Analýza dlhých dokumentov a kódových databáz

Strengths & Limitations

Strengths

  • Silné softvérové inžinierstvo — 80 % SWE-bench Verified
  • Vedecké uvažovanie na úrovni PhD — 91 % GPQA Diamond
  • Nové vizuálne uvažovanie — 69 % ARC-AGI-2 (nezávisle overené)
  • Veľmi dlhé dokumenty a rozsiahle kódové databázy (1 mil. kontext)

Limitations

  • Uzavreté váhy — nie je možné samostatné hostovanie ani jemné ladenie na súkromných dátech

Prezrite si celý rebríček AI modelov

Najčastejšie kladené otázky

Zistiť viac

Claude Opus 4.8 — Benchmarky, schopnosti a prípady použitia
Claude Opus 4.8 — Benchmarky, schopnosti a prípady použitia

Claude Opus 4.8 — Benchmarky, schopnosti a prípady použitia

Claude Opus 4.8 je proprietárny AI model od spoločnosti Anthropic, klasifikovaný ako Frontier úroveň s kontextovým oknom 1M tokenov. Preskúmajte výsledky benchm...

5 min čítania
Claude Opus 4.7 — Benchmarky, schopnosti a prípady použitia
Claude Opus 4.7 — Benchmarky, schopnosti a prípady použitia

Claude Opus 4.7 — Benchmarky, schopnosti a prípady použitia

Claude Opus 4.7 je proprietárny AI model od Anthropicu, klasifikovaný ako Frontier úroveň s kontextovým oknom 1M tokenov. Preskúmajte benchmarkové skóre, silné ...

5 min čítania
Claude Sonnet 4.6 — Benchmarky, schopnosti a prípady použitia
Claude Sonnet 4.6 — Benchmarky, schopnosti a prípady použitia

Claude Sonnet 4.6 — Benchmarky, schopnosti a prípady použitia

Claude Sonnet 4.6 je proprietárny AI model od spoločnosti Anthropic, klasifikovaný ako pokročilý (Advanced) s kontextovým oknom 1M tokenov. Je dostupný priamo v...

4 min čítania