Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 este un model AI de frontieră de top, dezvoltat de Anthropic și lansat în februarie 2026. Este un model proprietar cu greutăți închise, disponibil prin API-ul Anthropic. Fereastra de context de 1M tokeni este suficient de mare pentru a stoca baze de cod întregi, documente tehnice lungi sau sesiuni agentice extinse fără trunchiere.

Pe Leaderboard-ul AI FlowHunt este unul dintre cele 24 de modele urmărite, evaluate pe 6 criterii de referință. Scoruri remarcabile: 69,2% pe ARC-AGI-2 (#1 din 3); 53,0% pe HLE (#1 din 6); 80,8% pe SWE-bench Verified (#5 din 13).

Claude Opus 4.6 a fost lansat pe 5 februarie 2026 și a atras o atenție deosebită pentru performanța sa în sarcinile noi de raționament vizual. Deține cel mai mare scor verificat public pe ARC-AGI-2, de 69,17% — un criteriu de referință pentru recunoașterea modelelor vizuale abstracte, verificat independent de ARC Prize Foundation și conceput special pentru a preveni memorizarea. Acest rezultat a plasat Opus 4.6 peste pragul uman de aproximativ 60% la un test pe care modelele de frontieră anterioare abia reușiseră să-l depășească. De asemenea, a obținut 91,3% pe GPQA Diamond și 53,0% pe Humanity’s Last Exam, devenind modelul lider pentru sarcini dificile de raționament în prima jumătate a anului 2026.

Notă: SOTA ARC-AGI-2 69,17% (3P ARC Prize). Clasificare de siguranță ASL-3.

Lansat
Februarie 2026
Context
1M tokeni
Greutăți
Închise
Nivel
Frontieră
Furnizor
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic este o companie de siguranță AI fondată în 2021 de foștii cercetători OpenAI Dario Amodei și Daniela Amodei, împreună cu un grup de colegi care conduseseră echipele de siguranță și politici ale OpenAI. Misiunea declarată a companiei este dezvoltarea responsabilă a inteligenței artificiale pentru beneficiul pe termen lung al umanității, iar agenda sa de cercetare este definită de acest angajament: AI Constituțional (CAI), o tehnică de instruire a modelelor pentru a fi utile, inofensive și sincere prin autoevaluare critică; interpretabilitatea mecanicistă, care își propune să reconstituie inginerește ceea ce neuronii și circuitele individuale din rețelele mari calculează de fapt; și știința scalării, care încearcă să prezică modul în care comportamentul modelului se schimbă odată cu puterea de calcul și datele. Anthropic publică această cercetare în mod deschis și a devenit unul dintre cele mai citate laboratoare de siguranță AI din literatura academică. Claude este familia de modele publice Anthropic — numită după Claude Shannon, fondatorul teoriei informației — și acoperă patru generații (1 până la 4.x/Fable 5). Anthropic operează un API comercial și produsul consumer-facing Claude.ai, și menține parteneriate cloud profunde cu AWS (Amazon Bedrock) și Google Cloud (Vertex AI).

Cazuri de Utilizare

Pentru Ce Să Folosești Claude Opus 4.6

Inginerie Software
Raționament Științific și Tehnic
Automatizare CLI Agentică
Analiză de Documente Lungi și Baze de Cod

Strengths & Limitations

Strengths

  • Inginerie software puternică — 80% SWE-bench Verified
  • Raționament științific de nivel universitar — 91% GPQA Diamond
  • Raționament vizual inovator — 69% ARC-AGI-2 (verificat independent)
  • Documente foarte lungi și baze de cod mari (context de 1M)

Limitations

  • Greutăți închise — nu poate fi auto-găzduit sau fine-tunat pe date private

Vezi Leaderboard-ul Complet al Modelelor AI

Întrebări frecvente

Află mai multe