
DeepSeek V4-Flash — Puntos de Referencia, Capacidades y Casos de Uso
DeepSeek V4-Flash es un modelo de IA de pesos abiertos de DeepSeek (13B/284B MoE), clasificado en el nivel Avanzado con una ventana de contexto de 1M de tokens....
DeepSeek V4-Pro es un modelo de IA frontier de primer nivel, desarrollado por DeepSeek y lanzado en abril de 2026. Como modelo de pesos abiertos, sus pesos entrenados están disponibles públicamente — puedes auto-alojarlo, ajustarlo con datos propietarios o ejecutarlo localmente sin depender de APIs. La ventana de contexto de 1 millón de tokens es lo suficientemente grande como para contener repositorios de código completos, documentos técnicos extensos o sesiones agénticas prolongadas sin truncamiento.
En el FlowHunt AI Leaderboard es uno de los 24 modelos registrados, evaluado en 9 puntos de referencia. Puntuaciones destacadas: 93.5% en LiveCodeBench (#1 de 5); 87.5% en MMLU-Pro (#2 de 8); 46.0% en ARC-AGI-2 (#3 de 3).
DeepSeek V4-Pro fue lanzado el 24 de abril de 2026 como el buque insignia de la cuarta generación de la serie V de DeepSeek. Obtuvo un 93.5% en LiveCodeBench en su lanzamiento — la puntuación más alta en programación competitiva de cualquier modelo medido — y registró la puntuación más alta auto-reportada en SWE-bench Verified fuera de Claude Fable 5, con un 80.6%. El lanzamiento generó un debate significativo cuando CAISI midió de forma independiente la puntuación de V4-Pro en SWE-bench en un 74.0% en lugar del 80.6% que DeepSeek había reportado — una diferencia de 6.6 puntos que DeepSeek atribuyó a diferencias en el andamiaje (scaffolding) y el presupuesto de tokens en la configuración de evaluación. Como modelo de pesos abiertos con una ventana de contexto de 1M y arquitectura MoE de 49B/1.6T, V4-Pro se convirtió en la opción líder auto-alojable para equipos que priorizan el rendimiento en codificación con control total de datos.
Nota: Discrepancia en SWE-bench: SR 80.6% vs CAISI 74%. LiveCodeBench 93.5% es la puntuación más alta reportada.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeek es un laboratorio de investigación de IA chino fundado en 2023 como subsidiaria de High-Flyer, uno de los mayores fondos de cobertura cuantitativos de China. El laboratorio se hizo ampliamente conocido a principios de 2025 cuando el lanzamiento de DeepSeek V3 y R1 provocó la mayor caída en un solo día en la capitalización de mercado de NVIDIA hasta esa fecha, mientras los inversores reevaluaban la intensidad de capital del desarrollo de modelos frontera a la luz de los menores costos de entrenamiento reportados por DeepSeek. DeepSeek es inusual entre los laboratorios frontera por su compromiso de lanzar modelos de pesos abiertos junto con su investigación propietaria, y por mantener una presencia activa en redes sociales que critica los precios de los modelos cerrados. Sus modelos de la serie V (V3 a V4-Pro) son ampliamente utilizados como modelos de codificación y razonamiento autoalojables en Occidente, a pesar del escrutinio regulatorio y de seguridad en curso sobre los modelos de IA de origen chino en varias jurisdicciones.
Casos de Uso
DeepSeek V4-Pro obtiene un 80% en SWE-bench Verified — clasificado #6 de 13 modelos aquí registrados. Resuelve issues reales de GitHub, escribe código de calidad de producción en múltiples lenguajes y maneja flujos de trabajo de codificación agénticos de múltiples pasos — una opción sólida para equipos de desarrollo de software asistido por IA.
Con un 90% en GPQA Diamond (#6 de 14 modelos), DeepSeek V4-Pro supera el ~65% de referencia de expertos humanos con doctorado en preguntas de biología, química y física de nivel de posgrado. Úsalo para síntesis de literatura científica, evaluación de hipótesis, preguntas y respuestas médicas y legales, y tareas de investigación multidisciplinaria donde el conocimiento profundo del dominio sea importante.
DeepSeek V4-Pro alcanza un 67% en Terminal-Bench (#4 de 8 modelos), lo que lo hace competente para tareas comunes de shell scripting, flujos de trabajo de línea de comandos y tareas ligeras de administración de sistemas dentro de tuberías agénticas.
DeepSeek V4-Pro es de pesos abiertos (parámetros 49B/1.6T MoE) — sus pesos entrenados están disponibles públicamente para descarga e implementación propia. Ejecútalo en tu propio hardware GPU o nube privada para garantizar que los datos nunca salgan de tu entorno, elimina los costos de API por token a escala, o ajusta el modelo con conjuntos de datos propietarios.
Con una ventana de contexto de 1 millón de tokens, DeepSeek V4-Pro puede procesar repositorios de software completos, contratos legales extensos, informes de investigación del tamaño de un libro o historiales de conversación extensos en una sola solicitud — permitiendo preguntas y respuestas profundas sobre documentos, razonamiento entre archivos de código y resúmenes completos sin heurísticas de fragmentación ni tuberías RAG.
DeepSeek V4-Pro obtiene un 93% en LiveCodeBench (#1 de 5 modelos), un punto de referencia resistente a la contaminación que se actualiza continuamente con nuevos problemas de programación competitiva. A este nivel maneja estructuras de datos avanzadas, algoritmos de grafos y desafíos de nivel de entrevista con alta fiabilidad.
Más para Comparar
Compara los 24 modelos en 11 puntos de referencia — ordenable, con fuentes y actualizado a junio de 2026.

DeepSeek V4-Flash es un modelo de IA de pesos abiertos de DeepSeek (13B/284B MoE), clasificado en el nivel Avanzado con una ventana de contexto de 1M de tokens....

Llama 4 Scout es un modelo de IA de código abierto de Meta (17B/109B MoE (16 expertos)), clasificado en el nivel Establecido con una ventana de contexto de 10M ...

Claude Opus 4.7 es un modelo de IA propietario de Anthropic, clasificado como nivel Frontier con una ventana de contexto de 1M de tokens. Explora sus puntuacion...
Consentimiento de Cookies
Usamos cookies para mejorar tu experiencia de navegación y analizar nuestro tráfico. See our privacy policy.