Logo Anthropic

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 je špičkový frontier AI model, vyvinutý společností Anthropic a vydaný v únoru 2026. Jedná se o proprietární model s uzavřenými váhami, dostupný prostřednictvím Anthropic API. Kontextové okno o velikosti 1M tokenů je dostatečně velké pro celé kódové základny, rozsáhlé technické dokumenty nebo dlouhé agentské relace bez zkracování.

Na FlowHunt AI Leaderboard je jedním z 24 sledovaných modelů, hodnocených napříč 6 benchmarky. Výrazná skóre: 69,2 % na ARC-AGI-2 (#1 ze 3); 53,0 % na HLE (#1 ze 6); 80,8 % na SWE-bench Verified (#5 ze 13).

Claude Opus 4.6 byl vydán 5. února 2026 a získal zvláštní pozornost díky svému výkonu v nových úlohách vizuálního uvažování. Drží nejvyšší veřejně ověřené skóre na ARC-AGI-2 s hodnotou 69,17 % — benchmark abstraktního rozpoznávání vizuálních vzorů nezávisle ověřený nadací ARC Prize Foundation a navržený speciálně proti zapamatování. Tento výsledek posunul Opus 4.6 nad přibližně 60% lidský baseline v testu, který předchozí frontier modely jen stěží překonávaly. Dosáhl také 91,3 % na GPQA Diamond a 53,0 % na Humanity’s Last Exam, čímž se v první polovině roku 2026 stal vedoucím modelem pro náročné úlohy uvažování.

Poznámka: SOTA ARC-AGI-2 69,17 % (3P ARC Prize). Bezpečnostní klasifikace ASL-3.

Vydáno
Únor 2026
Kontext
1M tokenů
Váhy
Uzavřené
Úroveň
Frontier
Poskytovatel
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic je společnost zabývající se bezpečností umělé inteligence, založená v roce 2021 bývalými výzkumníky OpenAI Dario Amodeim a Danielou Amodei spolu se skupinou kolegů, kteří dříve vedli bezpečnostní a politické týmy OpenAI. Deklarovaným posláním společnosti je odpovědný rozvoj AI pro dlouhodobý prospěch lidstva a její výzkumný program je touto vizí definován: Konstituční AI (CAI) – technika pro trénování modelů k užitečnosti, neškodnosti a poctivosti prostřednictvím sebekritiky; mechanistická interpretovatelnost, jejímž cílem je reverzním inženýrstvím zjistit, co jednotlivé neurony a obvody ve velkých sítích skutečně počítají; a škálovací věda, která se snaží předvídat, jak se chování modelů mění s výpočetním výkonem a daty. Anthropic zveřejňuje tento výzkum otevřeně a stal se jedním z nejcitovanějších AI bezpečnostních laboratoří v akademické literatuře. Claude je veřejná rodina modelů společnosti Anthropic – pojmenovaná po Claudu Shannonovi, zakladateli teorie informace – a zahrnuje čtyři generace (1 až 4.x/Fable 5). Anthropic provozuje komerční API a spotřebitelský produkt Claude.ai a udržuje hluboká cloudová partnerství s AWS (Amazon Bedrock) a Google Cloud (Vertex AI).

Případy použití

K čemu použít Claude Opus 4.6

Softwarové inženýrství
Vědecké a technické uvažování
Agentská automatizace CLI
Analýza dlouhých dokumentů a kódových základen

Strengths & Limitations

Strengths

  • Silné softwarové inženýrství — 80 % SWE-bench Verified
  • Vědecké uvažování na úrovni PhD — 91 % GPQA Diamond
  • Nové vizuální uvažování — 69 % ARC-AGI-2 (nezávisle ověřeno)
  • Velmi dlouhé dokumenty a rozsáhlé kódové základny (1M kontext)

Limitations

  • Uzavřené váhy — nelze hostovat ani fine-tunovat na soukromých datech

Prohlédněte si celý AI Model Leaderboard

Často kladené otázky

Zjistit více

Claude Opus 4.7 — Benchmarky, schopnosti a případy použití
Claude Opus 4.7 — Benchmarky, schopnosti a případy použití

Claude Opus 4.7 — Benchmarky, schopnosti a případy použití

Claude Opus 4.7 je proprietární AI model od společnosti Anthropic, klasifikovaný jako Frontier úroveň s kontextovým oknem 1M tokenů. Prozkoumejte výsledky bench...

5 min čtení
Claude Sonnet 4.6 — Benchmarky, schopnosti a případy použití
Claude Sonnet 4.6 — Benchmarky, schopnosti a případy použití

Claude Sonnet 4.6 — Benchmarky, schopnosti a případy použití

Claude Sonnet 4.6 je proprietární AI model od společnosti Anthropic, klasifikovaný jako Advanced s kontextovým oknem 1M tokenů. Je dostupný přímo v FlowHunt. Pr...

4 min čtení