DeepSeek logo

DeepSeek

DeepSeek V4-Pro

FrontierOpen-weightAvailable in FlowHunt

O DeepSeek V4-Pro é um modelo de IA frontier de alto nível, desenvolvido pela DeepSeek e lançado em abril de 2026. Como um modelo de peso aberto, seus pesos treinados estão disponíveis publicamente — você pode auto-hospedá-lo, fazer fine-tuning com dados proprietários ou executá-lo on-premise sem dependências de API. A janela de contexto de 1 milhão de tokens é grande o suficiente para conter bases de código inteiras, documentos técnicos extensos ou sessões agênticas prolongadas sem truncamento.

No FlowHunt AI Leaderboard, é um dos 24 modelos monitorados, avaliado em 9 benchmarks. Pontuações de destaque: 93,5% no LiveCodeBench (#1 de 5); 87,5% no MMLU-Pro (#2 de 8); 46,0% no ARC-AGI-2 (#3 de 3).

O DeepSeek V4-Pro foi lançado em 24 de abril de 2026 como o carro-chefe da quarta geração da série V da DeepSeek. Alcançou 93,5% no LiveCodeBench no lançamento — a maior pontuação em programação competitiva de qualquer modelo medido — e registrou a maior pontuação auto-reportada no SWE-bench Verified fora do Claude Fable 5, com 80,6%. O lançamento gerou discussões significativas quando a CAISI mediu de forma independente a pontuação do V4-Pro no SWE-bench em 74,0%, em vez dos 80,6% que a DeepSeek havia reportado — uma diferença de 6,6 pontos que a DeepSeek atribuiu a diferenças de scaffolding e orçamento de tokens na configuração de avaliação. Como um modelo de peso aberto com janela de contexto de 1M e arquitetura MoE de 49B/1,6T, o V4-Pro tornou-se a principal opção auto-hospedável para equipes que priorizam desempenho em codificação com controle total dos dados.

Nota: Discrepância no SWE-bench: SR 80,6% vs CAISI 74%. LiveCodeBench 93,5% é o maior reportado.

Lançamento
Abril 2026
Parâmetros
49B/1,6T MoE
Contexto
1M tokens
Pesos
Abertos
Nível
Frontier
Provedor
DeepSeek

DeepSeek V4-Pro Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.6%6 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro55.4%9 of 9SRMulti-language, standardised scaffold
GPQA Diamond90.1%6 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro87.5%2 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench93.5%1 of 5SRCompetitive programming, continuously updated
Terminal-Bench67.9%4 of 8SRAgentic Linux terminal task completion
ARC-AGI-246.0%3 of 3CNovel visual reasoning, no memorisation
HLE37.7%4 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index52.0 pts6 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.6%
Real GitHub issue resolution (500 verified issues)
Independent: 74.0% (CAISI independent)
SWE-Pro SR
55.4%
Multi-language, standardised scaffold
GPQA ◇ SR
90.1%
Graduate-level Google-proof science Q&A
MMLU-P SR
87.5%
Hard knowledge reasoning, 12K questions
LiveCode SR
93.5%
Competitive programming, continuously updated
Terminal SR
67.9%
Agentic Linux terminal task completion
ARC-2 C
46.0%
Novel visual reasoning, no memorisation
HLE SR
37.7%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
52.0 pts
Artificial Analysis composite score (independent)

DeepSeek V4-Pro vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkDeepSeek V4-ProClaude Opus 4.8Claude Opus 4.7
SWE-V80.6%88.6%87.6%
SWE-Pro55.4%69.2%64.3%
GPQA ◇90.1%93.6%94.2%
MMLU-P87.5%
LiveCode93.5%
Terminal67.9%74.6%66.1%
ARC-246.0%
HLE37.7%
AA Idx52.0 pts61.4 pts57.3 pts

About DeepSeek

DeepSeek Founded 2023 · Hangzhou, China
Website →

A DeepSeek é um laboratório chinês de investigação em IA fundado em 2023 como subsidiária da High-Flyer, um dos maiores fundos de hedge quantitativos da China. O laboratório tornou-se amplamente conhecido no início de 2025, quando o lançamento do DeepSeek V3 e R1 provocou a maior queda num só dia na capitalização de mercado da NVIDIA até à data, à medida que os investidores reavaliavam a intensidade de capital do desenvolvimento de modelos de fronteira face aos custos de treino mais baixos reportados pela DeepSeek. A DeepSeek é invulgar entre os laboratórios de fronteira pelo seu compromisso de lançar modelos de pesos abertos juntamente com a sua investigação proprietária, e por manter uma presença ativa nas redes sociais que crítica os preços dos modelos fechados. Os seus modelos da série V (V3 a V4-Pro) são amplamente utilizados como modelos de programação e raciocínio auto-hospedáveis no Ocidente, apesar do escrutínio regulatório e de segurança em curso sobre modelos de IA de origem chinesa em várias jurisdições.

Casos de Uso

Para Que Usar o DeepSeek V4-Pro

Engenharia de Software
Raciocínio Científico e Técnico
Automação Agêntica de CLI
Implantações Auto-Hospedadas e Privadas
Análise de Documentos Longos e Bases de Código
Programação Competitiva

Strengths & Limitations

Strengths

  • Forte engenharia de software — 80% SWE-bench Verified
  • Raciocínio científico de nível de pós-graduação — 90% GPQA Diamond
  • Programação competitiva — 93% LiveCodeBench
  • Inteligência composta — 52 pts AA Intelligence Index (independente)
  • Implantações auto-hospedadas e com privacidade de dados (pesos abertos)
  • Documentos muito longos e bases de código grandes (contexto de 1M)

Explore o Painel Completo de Modelos de IA

Perguntas frequentes

Saiba mais

DeepSeek V4-Flash — Benchmarks, Capacidades e Casos de Uso
DeepSeek V4-Flash — Benchmarks, Capacidades e Casos de Uso

DeepSeek V4-Flash — Benchmarks, Capacidades e Casos de Uso

DeepSeek V4-Flash é um modelo de IA de pesos abertos da DeepSeek (13B/284B MoE), classificado como nível Avançado com janela de contexto de 1 milhão de tokens. ...

5 min de leitura
Llama 4 Scout — Benchmarks, Capacidades e Casos de Uso
Llama 4 Scout — Benchmarks, Capacidades e Casos de Uso

Llama 4 Scout — Benchmarks, Capacidades e Casos de Uso

Llama 4 Scout é um modelo de IA de pesos abertos da Meta (17B/109B MoE (16 especialistas)), classificado como Nível Estabelecido (Established) com uma janela de...

5 min de leitura
Claude Opus 4.7 — Benchmarks, Capacidades e Casos de Uso
Claude Opus 4.7 — Benchmarks, Capacidades e Casos de Uso

Claude Opus 4.7 — Benchmarks, Capacidades e Casos de Uso

Claude Opus 4.7 é um modelo de IA proprietário da Anthropic, classificado como nível Frontier com janela de contexto de 1M de tokens. Explore pontuações de benc...

5 min de leitura