Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 é um modelo de IA de fronteira de alto nível, desenvolvido pela Anthropic e lançado em fevereiro de 2026. É um modelo proprietário de pesos fechados, disponível através da API da Anthropic. A janela de contexto de 1M de tokens é grande o suficiente para armazenar bases de código inteiras, documentos técnicos extensos ou sessões agentivas prolongadas sem truncamento.

No FlowHunt AI Leaderboard, é um dos 24 modelos rastreados, avaliados em 6 benchmarks. Pontuações de destaque: 69,2% no ARC-AGI-2 (#1 de 3); 53,0% no HLE (#1 de 6); 80,8% no SWE-bench Verified (#5 de 13).

Claude Opus 4.6 foi lançado em 5 de fevereiro de 2026 e ganhou atenção particular pelo seu desempenho em tarefas inéditas de raciocínio visual. Ele possui a maior pontuação publicamente verificada no ARC-AGI-2 com 69,17% — um benchmark de reconhecimento de padrões visuais abstratos verificado de forma independente pela ARC Prize Foundation e projetado especificamente para prevenir memorização. Esse resultado colocou o Opus 4.6 acima da linha de base humana de aproximadamente 60% em um teste no qual modelos de fronteira anteriores tiveram dificuldade em superar. Ele também alcançou 91,3% no GPQA Diamond e 53,0% no Humanity’s Last Exam, tornando-se o modelo líder para tarefas de raciocínio difíceis no primeiro semestre de 2026.

Nota: SOTA ARC-AGI-2 69,17% (3P ARC Prize). Classificação de segurança ASL-3.

Lançamento
Fevereiro de 2026
Contexto
1M de tokens
Pesos
Fechados
Nível
Frontier
Fornecedor
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

A Anthropic é uma empresa de segurança de IA fundada em 2021 pelos antigos pesquisadores da OpenAI Dario Amodei e Daniela Amodei, juntamente com um grupo de colegas que lideravam as equipas de segurança e políticas da OpenAI. A missão declarada da empresa é o desenvolvimento responsável de IA para o benefício a longo prazo da humanidade, e a sua agenda de investigação é definida por esse compromisso: IA Constitucional (CAI), uma técnica para treinar modelos a serem úteis, inofensivos e honestos através da autocrítica; interpretabilidade mecanicista, que visa reverter a engenharia do que neurónios e circuitos individuais dentro de grandes redes realmente calculam; e ciência de escalabilidade, que tenta prever como o comportamento do modelo muda com computação e dados. A Anthropic publica esta investigação abertamente e tornou-se um dos laboratórios de segurança de IA mais citados na literatura académica. Claude é a família de modelos públicos da Anthropic — nomeada em homenagem a Claude Shannon, o fundador da teoria da informação — e abrange quatro gerações (1 a 4.x/Fable 5). A Anthropic opera uma API comercial e o produto Claude.ai voltado para o consumidor, e mantém parcerias profundas de cloud com a AWS (Amazon Bedrock) e o Google Cloud (Vertex AI).

Casos de Uso

Para Que Usar o Claude Opus 4.6

Engenharia de Software
Raciocínio Científico e Técnico
Automação Agentiva de CLI
Análise de Documentos Longos e Bases de Código

Strengths & Limitations

Strengths

  • Forte engenharia de software — 80% SWE-bench Verified
  • Raciocínio científico de nível de pós-graduação — 91% GPQA Diamond
  • Raciocínio visual inovador — 69% ARC-AGI-2 (verificado independentemente)
  • Documentos muito longos e grandes bases de código (contexto de 1M)

Limitations

  • Pesos fechados — não pode ser auto-hospedado ou ajustado com dados privados

Navegue pelo AI Model Leaderboard Completo

Perguntas frequentes

Saiba mais

Claude Opus 4.8 — Benchmarks, Capacidades e Casos de Uso
Claude Opus 4.8 — Benchmarks, Capacidades e Casos de Uso

Claude Opus 4.8 — Benchmarks, Capacidades e Casos de Uso

Claude Opus 4.8 é um modelo de IA proprietário da Anthropic, classificado como nível Frontier com janela de contexto de 1M de tokens. Explore pontuações de benc...

5 min de leitura
Claude Opus 4.7 — Benchmarks, Capacidades e Casos de Uso
Claude Opus 4.7 — Benchmarks, Capacidades e Casos de Uso

Claude Opus 4.7 — Benchmarks, Capacidades e Casos de Uso

Claude Opus 4.7 é um modelo de IA proprietário da Anthropic, classificado como nível Frontier com janela de contexto de 1M de tokens. Explore pontuações de benc...

5 min de leitura
Claude Sonnet 4.6 — Benchmarks, Capacidades e Casos de Uso
Claude Sonnet 4.6 — Benchmarks, Capacidades e Casos de Uso

Claude Sonnet 4.6 — Benchmarks, Capacidades e Casos de Uso

O Claude Sonnet 4.6 é um modelo de IA proprietário da Anthropic, classificado como nível Advanced com janela de contexto de 1M de tokens. Está disponível direta...

5 min de leitura