Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 es un modelo de IA fronterizo de primer nivel, desarrollado por Anthropic y lanzado en febrero de 2026. Es un modelo propietario de pesos cerrados, disponible a través de la API de Anthropic. La ventana de contexto de 1M de tokens es lo suficientemente grande como para contener bases de código completas, documentos técnicos extensos o sesiones agentivas prolongadas sin truncamiento.

En el FlowHunt AI Leaderboard es uno de los 24 modelos registrados, evaluados en 6 puntos de referencia. Puntuaciones destacadas: 69.2% en ARC-AGI-2 (#1 de 3); 53.0% en HLE (#1 de 6); 80.8% en SWE-bench Verified (#5 de 13).

Claude Opus 4.6 se lanzó el 5 de febrero de 2026 y llamó especialmente la atención por su rendimiento en tareas novedosas de razonamiento visual. Ostenta la puntuación verificada públicamente más alta en ARC-AGI-2 con un 69.17% — un punto de referencia de reconocimiento de patrones visuales abstractos verificado de forma independiente por la ARC Prize Foundation y diseñado específicamente para prevenir la memorización. Este resultado situó a Opus 4.6 por encima de la línea base humana de aproximadamente el 60% en una prueba en la que los modelos fronterizos anteriores habían tenido dificultades para sobresalir. También alcanzó un 91.3% en GPQA Diamond y un 53.0% en Humanity’s Last Exam, convirtiéndolo en el modelo líder para tareas de razonamiento complejo en la primera mitad de 2026.

Nota: SOTA ARC-AGI-2 69.17% (3P ARC Prize). Clasificación de seguridad ASL-3.

Lanzamiento
Febrero 2026
Contexto
1M tokens
Pesos
Cerrados
Nivel
Frontier
Proveedor
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic es una empresa de seguridad de IA fundada en 2021 por los expositores de OpenAI Dario Amodei y Daniela Amodei, junto con un grupo de colegas que habían liderado los equipos de seguridad y políticas de OpenAI. La misión declarada de la empresa es el desarrollo responsable de la IA para el beneficio a largo plazo de la humanidad, y su agenda de investigación está definida por ese compromiso: IA Constitucional (CAI), una técnica para entrenar modelos para que sean útiles, inofensivos y honestos mediante la autocrítica; interpretabilidad mecanicista, que busca realizar ingeniería inversa de lo que las neuronas y circuitos individuales dentro de las grandes redes realmente computan; y ciencia de escalado, que intenta predecir cómo cambia el comportamiento del modelo con la computación y los datos. Anthropic publica esta investigación de forma abierta y se ha convertido en uno de los laboratorios de seguridad de IA más citados en la literatura académica. Claude es la familia de modelos públicos de Anthropic — nombrada en honor a Claude Shannon, el fundador de la teoría de la información — y abarca cuatro generaciones (1 a 4.x/Fable 5). Anthropic opera una API comercial y el producto consumer-facing Claude.ai, y mantiene profundas alianzas en la nube con AWS (Amazon Bedrock) y Google Cloud (Vertex AI).

Casos de Uso

Para Qué Usar Claude Opus 4.6

Ingeniería de Software
Razonamiento Científico y Técnico
Automatización Agentiva de CLI
Análisis de Documentos Extensos y Bases de Código

Strengths & Limitations

Strengths

  • Sólida ingeniería de software — 80% SWE-bench Verified
  • Razonamiento científico de nivel posgrado — 91% GPQA Diamond
  • Razonamiento visual novedoso — 69% ARC-AGI-2 (verificado independientemente)
  • Documentos muy extensos y bases de código grandes (contexto de 1M)

Limitations

  • Pesos cerrados — no se puede auto-alojar ni afinar con datos privados

Explora el Leaderboard Completo de Modelos de IA

Preguntas frecuentes

Saber más

Claude Opus 4.8 — Benchmarks, Capacidades y Casos de Uso
Claude Opus 4.8 — Benchmarks, Capacidades y Casos de Uso

Claude Opus 4.8 — Benchmarks, Capacidades y Casos de Uso

Claude Opus 4.8 es un modelo de IA propietario de Anthropic, clasificado como nivel Frontier con una ventana de contexto de 1M de tokens. Explora puntuaciones d...

6 min de lectura
Claude Sonnet 4.6 — Benchmarks, Capacidades y Casos de Uso
Claude Sonnet 4.6 — Benchmarks, Capacidades y Casos de Uso

Claude Sonnet 4.6 — Benchmarks, Capacidades y Casos de Uso

Claude Sonnet 4.6 es un modelo de IA propietario de Anthropic, clasificado como nivel Avanzado con una ventana de contexto de 1M de tokens. Está disponible dire...

5 min de lectura