Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 è un modello di IA frontier di alto livello, sviluppato da Anthropic e rilasciato a febbraio 2026. È un modello proprietario a pesi chiusi, disponibile tramite l’API di Anthropic. La finestra di contesto di 1 milione di token è abbastanza grande da contenere interi codebase, lunghi documenti tecnici o sessioni agentiche estese senza troncamento.

Nella Classifica IA di FlowHunt è uno dei 24 modelli monitorati, valutati su 6 benchmark. Punteggi di rilievo: 69,2% su ARC-AGI-2 (#1 di 3); 53,0% su HLE (#1 di 6); 80,8% su SWE-bench Verified (#5 di 13).

Claude Opus 4.6 è stato rilasciato il 5 febbraio 2026 e ha attirato particolare attenzione per le sue prestazioni in compiti di ragionamento visivo innovativi. Detiene il punteggio verificato pubblicamente più alto su ARC-AGI-2 con il 69,17% — un benchmark di riconoscimento di pattern visivi astratti verificato in modo indipendente dalla ARC Prize Foundation e progettato specificamente per prevenire la memorizzazione. Questo risultato ha collocato Opus 4.6 al di sopra della baseline umana di circa il 60% in un test con cui i precedenti modelli frontier avevano faticato. Ha inoltre raggiunto il 91,3% su GPQA Diamond e il 53,0% su Humanity’s Last Exam, diventando il modello leader per compiti di ragionamento complesso nella prima metà del 2026.

Nota: SOTA ARC-AGI-2 69,17% (3P ARC Prize). Classificazione di sicurezza ASL-3.

Rilasciato
Febbraio 2026
Contesto
1 milione di token
Pesi
Chiusi
Tier
Frontier
Fornitore
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic è un'azienda di sicurezza dell'IA fondata nel 2021 dagli ex ricercatori di OpenAI Dario Amodei e Daniela Amodei, insieme a un gruppo di colleghi che avevano guidato i team di sicurezza e policy di OpenAI. La missione dichiarata dell'azienda è lo sviluppo responsabile dell'IA per il beneficio a lungo termine dell'umanità, e la sua agenda di ricerca è definita da questo impegno: IA Costituzionale (CAI), una tecnica per addestrare modelli a essere utili, innocui e onesti attraverso l'autocritica; interpretabilità meccanicistica, che mira a fare reverse-engineering di ciò che i singoli neuroni e circuiti all'interno di grandi reti effettivamente calcolano; e scienza della scalabilità, che cerca di prevedere come il comportamento dei modelli cambi con la potenza di calcolo e i dati. Anthropic pubblica questa ricerca apertamente ed è diventato uno dei laboratori di sicurezza dell'IA più citati nella letteratura accademica. Claude è la famiglia di modelli pubblici di Anthropic — dal nome di Claude Shannon, il fondatore della teoria dell'informazione — e copre quattro generazioni (dalla 1 alla 4.x/Fable 5). Anthropic gestisce un'API commerciale e il prodotto consumer Claude.ai, e mantiene profonde partnership cloud con AWS (Amazon Bedrock) e Google Cloud (Vertex AI).

Casi d'Uso

Per Cosa Usare Claude Opus 4.6

Ingegneria del Software
Ragionamento Scientifico e Tecnico
Automazione CLI Agentica
Analisi di Documenti Lunghi e Codebase

Strengths & Limitations

Strengths

  • Forte nell'ingegneria del software — 80% SWE-bench Verified
  • Ragionamento scientifico a livello universitario — 91% GPQA Diamond
  • Ragionamento visivo innovativo — 69% ARC-AGI-2 (verificato indipendentemente)
  • Documenti molto lunghi e grandi codebase (contesto da 1 milione)

Limitations

  • Pesi chiusi — non può essere auto-ospitato o messo a punto su dati privati

Sfoglia la Classifica Completa dei Modelli IA

Domande frequenti

Scopri di più

Claude Opus 4.8 — Benchmark, Capacità e Casi d'Uso
Claude Opus 4.8 — Benchmark, Capacità e Casi d'Uso

Claude Opus 4.8 — Benchmark, Capacità e Casi d'Uso

Claude Opus 4.8 è un modello AI proprietario di Anthropic, classificato di livello Frontier con una finestra di contesto di 1 milione di token. Esplora punteggi...

5 min di lettura
Claude Opus 4.7 — Benchmark, Capacità e Casi d'Uso
Claude Opus 4.7 — Benchmark, Capacità e Casi d'Uso

Claude Opus 4.7 — Benchmark, Capacità e Casi d'Uso

Claude Opus 4.7 è un modello AI proprietario di Anthropic, classificato come livello Frontier con una finestra di contesto di 1 milione di token. Esplora punteg...

5 min di lettura
Claude Sonnet 4.6 — Benchmark, Capacità e Casi d'Uso
Claude Sonnet 4.6 — Benchmark, Capacità e Casi d'Uso

Claude Sonnet 4.6 — Benchmark, Capacità e Casi d'Uso

Claude Sonnet 4.6 è un modello AI proprietario di Anthropic, classificato come livello Advanced con una finestra di contesto di 1 milione di token. È disponibil...

5 min di lettura