Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 to najwyższej klasy model AI z pogranicza możliwości, opracowany przez Anthropic i wydany w lutym 2026 roku. Jest to autorski model o zamkniętych wagach, dostępny przez API Anthropic. Okno kontekstowe o wielkości 1 mln tokenów jest wystarczająco duże, aby pomieścić całe bazy kodu źródłowego, obszerne dokumenty techniczne lub rozbudowane sesje agencyjne bez obcinania.

Na liście rankingowej AI FlowHunt jest jednym z 24 śledzonych modeli, ocenianych w 6 benchmarkach. Wyróżniające się wyniki: 69,2% w ARC-AGI-2 (#1 z 3); 53,0% w HLE (#1 z 6); 80,8% w SWE-bench Verified (#5 z 13).

Claude Opus 4.6 został wydany 5 lutego 2026 roku i zyskał szczególną uwagę dzięki swoim osiągom w nowatorskich zadaniach rozumowania wizualnego. Posiada najwyższy publicznie zweryfikowany wynik w ARC-AGI-2 wynoszący 69,17% — benchmark abstrakcyjnego rozpoznawania wzorców wizualnych, niezależnie zweryfikowany przez ARC Prize Foundation i zaprojektowany specjalnie w celu zapobiegania zapamiętywaniu. Wynik ten umieścił Opus 4.6 powyżej około 60% ludzkiego poziomu odniesienia w teście, z którym wcześniejsze modelei z pogranicza możliwości miały trudności. Model osiągnął również 91,3% w GPQA Diamond oraz 53,0% w Humanity’s Last Exam, czyniąc go wiodącym modelem do trudnych zadań wymagających rozumowania w pierwszej połowie 2026 roku.

Uwaga: SOTA ARC-AGI-2 69,17% (3P ARC Prize). Klasyfikacja bezpieczeństwa ASL-3.

Data wydania
Luty 2026
Kontekst
1 mln tokenów
Wagi
Zamknięte
Poziom
Frontier
Dostawca
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic to firma zajmująca się bezpieczeństwem sztucznej inteligencji, założona w 2021 roku przez byłych badaczy OpenAI – Dario Amodei i Danielę Amodei wraz z grupą współpracowników, którzy wcześniej kierowali zespołami ds. bezpieczeństwa i polityki OpenAI. Deklarowaną misją firmy jest odpowiedzialny rozwój AI dla długoterminowego dobra ludzkości, a jej program badawczy określają: Sztuczna Inteligencja Konstytucyjna (CAI) – technika trenowania modeli, by były pomocne, nieszkodliwe i uczciwe poprzez samokrytykę; interpretowalność mechanistyczna, której celem jest inżynieria wsteczna tego, co faktycznie obliczają poszczególne neurony i obwody w dużych sieciach; oraz nauka o skalowaniu, która próbuje przewidzieć, jak zmienia się zachowanie modelu wraz ze wzrostem mocy obliczeniowej i danych. Anthropic publikuje te badania otwarcie i stało się jednym z najczęściej cytowanych laboratoriów bezpieczeństwa AI w literaturze akademickiej. Claude to publiczna rodzina modeli Anthropic – nazwana na cześć Claude'a Shannona, twórcy teorii informacji – i obejmuje cztery generacje (od 1 do 4.x/Fable 5). Anthropic prowadzi komercyjne API oraz konsumencki produkt Claude.ai, a także utrzymuje głęboką współpracę chmurową z AWS (Amazon Bedrock) i Google Cloud (Vertex AI).

Zastosowania

Do czego używać Claude Opus 4.6

Inżynieria oprogramowania
Rozumowanie naukowe i techniczne
Automatyzacja CLI w trybie agencyjnym
Analiza długich dokumentów i baz kodu

Strengths & Limitations

Strengths

  • Silna inżynieria oprogramowania — 80% SWE-bench Verified
  • Naukowe rozumowanie na poziomie doktoranckim — 91% GPQA Diamond
  • Nowatorskie rozumowanie wizualne — 69% ARC-AGI-2 (niezależnie zweryfikowane)
  • Bardzo długie dokumenty i duże bazy kodu (1 mln kontekstu)

Limitations

  • Zamknięte wagi — brak możliwości samodzielnego hostowania lub dostrajania na prywatnych danych

Przeglądaj pełną listę rankingową modeli AI

Najczęściej zadawane pytania

Dowiedz się więcej

Claude Opus 4.8 — Benchmarki, Możliwości i Zastosowania
Claude Opus 4.8 — Benchmarki, Możliwości i Zastosowania

Claude Opus 4.8 — Benchmarki, Możliwości i Zastosowania

Claude Opus 4.8 to autorski model AI od Anthropic, sklasyfikowany jako poziom Frontier z oknem kontekstowym 1 miliona tokenów. Poznaj wyniki benchmarków, mocne ...

5 min czytania
Claude Sonnet 4.6 — Benchmarki, Możliwości i Zastosowania
Claude Sonnet 4.6 — Benchmarki, Możliwości i Zastosowania

Claude Sonnet 4.6 — Benchmarki, Możliwości i Zastosowania

Claude Sonnet 4.6 to zastrzeżony model AI firmy Anthropic, sklasyfikowany jako poziom Advanced z oknem kontekstowym 1 miliona tokenów. Jest dostępny bezpośredni...

4 min czytania