Logo de DeepSeek

DeepSeek

DeepSeek V4-Pro

FrontierOpen-weightAvailable in FlowHunt

DeepSeek V4-Pro es un modelo de IA frontier de primer nivel, desarrollado por DeepSeek y lanzado en abril de 2026. Como modelo de pesos abiertos, sus pesos entrenados están disponibles públicamente — puedes auto-alojarlo, ajustarlo con datos propietarios o ejecutarlo localmente sin depender de APIs. La ventana de contexto de 1 millón de tokens es lo suficientemente grande como para contener repositorios de código completos, documentos técnicos extensos o sesiones agénticas prolongadas sin truncamiento.

En el FlowHunt AI Leaderboard es uno de los 24 modelos registrados, evaluado en 9 puntos de referencia. Puntuaciones destacadas: 93.5% en LiveCodeBench (#1 de 5); 87.5% en MMLU-Pro (#2 de 8); 46.0% en ARC-AGI-2 (#3 de 3).

DeepSeek V4-Pro fue lanzado el 24 de abril de 2026 como el buque insignia de la cuarta generación de la serie V de DeepSeek. Obtuvo un 93.5% en LiveCodeBench en su lanzamiento — la puntuación más alta en programación competitiva de cualquier modelo medido — y registró la puntuación más alta auto-reportada en SWE-bench Verified fuera de Claude Fable 5, con un 80.6%. El lanzamiento generó un debate significativo cuando CAISI midió de forma independiente la puntuación de V4-Pro en SWE-bench en un 74.0% en lugar del 80.6% que DeepSeek había reportado — una diferencia de 6.6 puntos que DeepSeek atribuyó a diferencias en el andamiaje (scaffolding) y el presupuesto de tokens en la configuración de evaluación. Como modelo de pesos abiertos con una ventana de contexto de 1M y arquitectura MoE de 49B/1.6T, V4-Pro se convirtió en la opción líder auto-alojable para equipos que priorizan el rendimiento en codificación con control total de datos.

Nota: Discrepancia en SWE-bench: SR 80.6% vs CAISI 74%. LiveCodeBench 93.5% es la puntuación más alta reportada.

Lanzamiento
Abril 2026
Parámetros
49B/1.6T MoE
Contexto
1M tokens
Pesos
Abiertos
Nivel
Frontier
Proveedor
DeepSeek

DeepSeek V4-Pro Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.6%6 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro55.4%9 of 9SRMulti-language, standardised scaffold
GPQA Diamond90.1%6 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro87.5%2 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench93.5%1 of 5SRCompetitive programming, continuously updated
Terminal-Bench67.9%4 of 8SRAgentic Linux terminal task completion
ARC-AGI-246.0%3 of 3CNovel visual reasoning, no memorisation
HLE37.7%4 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index52.0 pts6 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.6%
Real GitHub issue resolution (500 verified issues)
Independent: 74.0% (CAISI independent)
SWE-Pro SR
55.4%
Multi-language, standardised scaffold
GPQA ◇ SR
90.1%
Graduate-level Google-proof science Q&A
MMLU-P SR
87.5%
Hard knowledge reasoning, 12K questions
LiveCode SR
93.5%
Competitive programming, continuously updated
Terminal SR
67.9%
Agentic Linux terminal task completion
ARC-2 C
46.0%
Novel visual reasoning, no memorisation
HLE SR
37.7%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
52.0 pts
Artificial Analysis composite score (independent)

DeepSeek V4-Pro vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkDeepSeek V4-ProClaude Opus 4.8Claude Opus 4.7
SWE-V80.6%88.6%87.6%
SWE-Pro55.4%69.2%64.3%
GPQA ◇90.1%93.6%94.2%
MMLU-P87.5%
LiveCode93.5%
Terminal67.9%74.6%66.1%
ARC-246.0%
HLE37.7%
AA Idx52.0 pts61.4 pts57.3 pts

About DeepSeek

DeepSeek Founded 2023 · Hangzhou, China
Website →

DeepSeek es un laboratorio de investigación de IA chino fundado en 2023 como subsidiaria de High-Flyer, uno de los mayores fondos de cobertura cuantitativos de China. El laboratorio se hizo ampliamente conocido a principios de 2025 cuando el lanzamiento de DeepSeek V3 y R1 provocó la mayor caída en un solo día en la capitalización de mercado de NVIDIA hasta esa fecha, mientras los inversores reevaluaban la intensidad de capital del desarrollo de modelos frontera a la luz de los menores costos de entrenamiento reportados por DeepSeek. DeepSeek es inusual entre los laboratorios frontera por su compromiso de lanzar modelos de pesos abiertos junto con su investigación propietaria, y por mantener una presencia activa en redes sociales que critica los precios de los modelos cerrados. Sus modelos de la serie V (V3 a V4-Pro) son ampliamente utilizados como modelos de codificación y razonamiento autoalojables en Occidente, a pesar del escrutinio regulatorio y de seguridad en curso sobre los modelos de IA de origen chino en varias jurisdicciones.

Casos de Uso

Para qué usar DeepSeek V4-Pro

Ingeniería de Software
Razonamiento Científico y Técnico
Automatización CLI Agéntica
Implementaciones Auto-Alojadas y Privadas
Análisis de Documentos Extensos y Código Fuente
Programación Competitiva

Strengths & Limitations

Strengths

  • Sólida ingeniería de software — 80% SWE-bench Verified
  • Razonamiento científico de posgrado — 90% GPQA Diamond
  • Programación competitiva — 93% LiveCodeBench
  • Inteligencia compuesta — 52 pts AA Intelligence Index (independiente)
  • Implementaciones auto-alojadas y con privacidad de datos (pesos abiertos)
  • Documentos muy extensos y repositorios de código grandes (contexto de 1M)

Explora el FlowHunt AI Model Leaderboard Completo

Preguntas frecuentes

Saber más