
Claude Opus 4.8 — Benchmarks, Capacidades y Casos de Uso
Claude Opus 4.8 es un modelo de IA propietario de Anthropic, clasificado como nivel Frontier con una ventana de contexto de 1M de tokens. Explora puntuaciones d...
Claude Opus 4.6 es un modelo de IA fronterizo de primer nivel, desarrollado por Anthropic y lanzado en febrero de 2026. Es un modelo propietario de pesos cerrados, disponible a través de la API de Anthropic. La ventana de contexto de 1M de tokens es lo suficientemente grande como para contener bases de código completas, documentos técnicos extensos o sesiones agentivas prolongadas sin truncamiento.
En el FlowHunt AI Leaderboard es uno de los 24 modelos registrados, evaluados en 6 puntos de referencia. Puntuaciones destacadas: 69.2% en ARC-AGI-2 (#1 de 3); 53.0% en HLE (#1 de 6); 80.8% en SWE-bench Verified (#5 de 13).
Claude Opus 4.6 se lanzó el 5 de febrero de 2026 y llamó especialmente la atención por su rendimiento en tareas novedosas de razonamiento visual. Ostenta la puntuación verificada públicamente más alta en ARC-AGI-2 con un 69.17% — un punto de referencia de reconocimiento de patrones visuales abstractos verificado de forma independiente por la ARC Prize Foundation y diseñado específicamente para prevenir la memorización. Este resultado situó a Opus 4.6 por encima de la línea base humana de aproximadamente el 60% en una prueba en la que los modelos fronterizos anteriores habían tenido dificultades para sobresalir. También alcanzó un 91.3% en GPQA Diamond y un 53.0% en Humanity’s Last Exam, convirtiéndolo en el modelo líder para tareas de razonamiento complejo en la primera mitad de 2026.
Nota: SOTA ARC-AGI-2 69.17% (3P ARC Prize). Clasificación de seguridad ASL-3.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic es una empresa de seguridad de IA fundada en 2021 por los expositores de OpenAI Dario Amodei y Daniela Amodei, junto con un grupo de colegas que habían liderado los equipos de seguridad y políticas de OpenAI. La misión declarada de la empresa es el desarrollo responsable de la IA para el beneficio a largo plazo de la humanidad, y su agenda de investigación está definida por ese compromiso: IA Constitucional (CAI), una técnica para entrenar modelos para que sean útiles, inofensivos y honestos mediante la autocrítica; interpretabilidad mecanicista, que busca realizar ingeniería inversa de lo que las neuronas y circuitos individuales dentro de las grandes redes realmente computan; y ciencia de escalado, que intenta predecir cómo cambia el comportamiento del modelo con la computación y los datos. Anthropic publica esta investigación de forma abierta y se ha convertido en uno de los laboratorios de seguridad de IA más citados en la literatura académica. Claude es la familia de modelos públicos de Anthropic — nombrada en honor a Claude Shannon, el fundador de la teoría de la información — y abarca cuatro generaciones (1 a 4.x/Fable 5). Anthropic opera una API comercial y el producto consumer-facing Claude.ai, y mantiene profundas alianzas en la nube con AWS (Amazon Bedrock) y Google Cloud (Vertex AI).
Casos de Uso
Claude Opus 4.6 obtiene un 80% en SWE-bench Verified — clasificado #5 de 13 modelos aquí registrados. Resuelve incidencias reales de GitHub, escribe código de calidad de producción en múltiples lenguajes y maneja flujos de trabajo de codificación agentivos de múltiples pasos — una opción sólida para equipos de desarrollo de software asistido por IA.
Con un 91% en GPQA Diamond (#5 de 14 modelos), Claude Opus 4.6 supera la línea base humana de ~65% (expertos con doctorado) en preguntas de biología, química y física de nivel de posgrado. Úsalo para síntesis de literatura científica, evaluación de hipótesis, preguntas y respuestas médicas y legales, y tareas de investigación multidisciplinaria donde el conocimiento profundo del dominio sea relevante.
Claude Opus 4.6 alcanza un 65% en Terminal-Bench (#7 de 8 modelos), lo que lo hace competente para tareas comunes de scripting de shell, flujos de trabajo de línea de comandos y tareas ligeras de administración de sistemas dentro de tuberías agentivas.
Con una ventana de contexto de 1M de tokens, Claude Opus 4.6 puede procesar repositorios de software completos, contratos legales extensos, informes de investigación del tamaño de un libro o historiales de conversaciones amplios en una sola solicitud — permitiendo preguntas y respuestas profundas sobre documentos, razonamiento entre archivos de la base de código y resúmenes exhaustivos sin necesidad de heurísticas de fragmentación ni tuberías de RAG.
Más para Comparar
Compara los 24 modelos en 11 puntos de referencia — ordenable, con fuentes y actualizado a junio de 2026.

Claude Opus 4.8 es un modelo de IA propietario de Anthropic, clasificado como nivel Frontier con una ventana de contexto de 1M de tokens. Explora puntuaciones d...

Claude Opus 4.7 es un modelo de IA propietario de Anthropic, clasificado como nivel Frontier con una ventana de contexto de 1M de tokens. Explora sus puntuacion...

Claude Sonnet 4.6 es un modelo de IA propietario de Anthropic, clasificado como nivel Avanzado con una ventana de contexto de 1M de tokens. Está disponible dire...
Consentimiento de Cookies
Usamos cookies para mejorar tu experiencia de navegación y analizar nuestro tráfico. See our privacy policy.