
DeepSeek V4-Flash — Benchmarks, Capacidades e Casos de Uso
DeepSeek V4-Flash é um modelo de IA de pesos abertos da DeepSeek (13B/284B MoE), classificado como nível Avançado com janela de contexto de 1 milhão de tokens. ...
O DeepSeek V4-Pro é um modelo de IA frontier de alto nível, desenvolvido pela DeepSeek e lançado em abril de 2026. Como um modelo de peso aberto, seus pesos treinados estão disponíveis publicamente — você pode auto-hospedá-lo, fazer fine-tuning com dados proprietários ou executá-lo on-premise sem dependências de API. A janela de contexto de 1 milhão de tokens é grande o suficiente para conter bases de código inteiras, documentos técnicos extensos ou sessões agênticas prolongadas sem truncamento.
No FlowHunt AI Leaderboard, é um dos 24 modelos monitorados, avaliado em 9 benchmarks. Pontuações de destaque: 93,5% no LiveCodeBench (#1 de 5); 87,5% no MMLU-Pro (#2 de 8); 46,0% no ARC-AGI-2 (#3 de 3).
O DeepSeek V4-Pro foi lançado em 24 de abril de 2026 como o carro-chefe da quarta geração da série V da DeepSeek. Alcançou 93,5% no LiveCodeBench no lançamento — a maior pontuação em programação competitiva de qualquer modelo medido — e registrou a maior pontuação auto-reportada no SWE-bench Verified fora do Claude Fable 5, com 80,6%. O lançamento gerou discussões significativas quando a CAISI mediu de forma independente a pontuação do V4-Pro no SWE-bench em 74,0%, em vez dos 80,6% que a DeepSeek havia reportado — uma diferença de 6,6 pontos que a DeepSeek atribuiu a diferenças de scaffolding e orçamento de tokens na configuração de avaliação. Como um modelo de peso aberto com janela de contexto de 1M e arquitetura MoE de 49B/1,6T, o V4-Pro tornou-se a principal opção auto-hospedável para equipes que priorizam desempenho em codificação com controle total dos dados.
Nota: Discrepância no SWE-bench: SR 80,6% vs CAISI 74%. LiveCodeBench 93,5% é o maior reportado.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
A DeepSeek é um laboratório chinês de investigação em IA fundado em 2023 como subsidiária da High-Flyer, um dos maiores fundos de hedge quantitativos da China. O laboratório tornou-se amplamente conhecido no início de 2025, quando o lançamento do DeepSeek V3 e R1 provocou a maior queda num só dia na capitalização de mercado da NVIDIA até à data, à medida que os investidores reavaliavam a intensidade de capital do desenvolvimento de modelos de fronteira face aos custos de treino mais baixos reportados pela DeepSeek. A DeepSeek é invulgar entre os laboratórios de fronteira pelo seu compromisso de lançar modelos de pesos abertos juntamente com a sua investigação proprietária, e por manter uma presença ativa nas redes sociais que crítica os preços dos modelos fechados. Os seus modelos da série V (V3 a V4-Pro) são amplamente utilizados como modelos de programação e raciocínio auto-hospedáveis no Ocidente, apesar do escrutínio regulatório e de segurança em curso sobre modelos de IA de origem chinesa em várias jurisdições.
Casos de Uso
O DeepSeek V4-Pro pontua 80% no SWE-bench Verified — classificado em #6 de 13 modelos monitorados aqui. Ele resolve issues reais do GitHub, escreve código de qualidade de produção em múltiplas linguagens e lida com fluxos de trabalho de codificação agênticos de múltiplas etapas — uma escolha forte para equipes de desenvolvimento de software assistidas por IA.
Com 90% no GPQA Diamond (#6 de 14 modelos), o DeepSeek V4-Pro supera a linha de base humana de ~65% de especialistas com PhD em perguntas de biologia, química e física de nível de pós-graduação. Use-o para síntese de literatura científica, avaliação de hipóteses, perguntas e respostas médicas e jurídicas, e tarefas de pesquisa multidisciplinar onde o conhecimento profundo do domínio é importante.
O DeepSeek V4-Pro alcança 67% no Terminal-Bench (#4 de 8 modelos), tornando-o competente para scripts de shell comuns, fluxos de trabalho de linha de comando e tarefas leves de administração de sistemas em pipelines agênticos.
O DeepSeek V4-Pro é de peso aberto (49B/1,6T parâmetros MoE) — seus pesos treinados estão disponíveis publicamente para download e auto-implantação. Execute-o em seu próprio hardware GPU ou nuvem privada para garantir que os dados nunca saiam do seu ambiente, elimine custos de API por token em escala ou faça fine-tuning do modelo em conjuntos de dados proprietários.
Com uma janela de contexto de 1 milhão de tokens, o DeepSeek V4-Pro pode processar repositórios de software inteiros, contratos jurídicos extensos, relatórios de pesquisa do tamanho de livros ou históricos extensos de conversas em um único prompt — permitindo perguntas e respostas profundas sobre documentos, raciocínio entre arquivos de código e sumarização abrangente sem heurísticas de fragmentação ou pipelines de RAG.
O DeepSeek V4-Pro pontua 93% no LiveCodeBench (#1 de 5 modelos), um benchmark resistente à contaminação, constantemente atualizado com novos problemas de programação competitiva. Neste nível, ele lida com estruturas de dados avançadas, algoritmos de grafos e desafios de nível de entrevista com alta confiabilidade.
Mais para Comparar
Compare todos os 24 modelos em 11 benchmarks — classificável, com fontes e atualizado em junho de 2026.

DeepSeek V4-Flash é um modelo de IA de pesos abertos da DeepSeek (13B/284B MoE), classificado como nível Avançado com janela de contexto de 1 milhão de tokens. ...

Llama 4 Scout é um modelo de IA de pesos abertos da Meta (17B/109B MoE (16 especialistas)), classificado como Nível Estabelecido (Established) com uma janela de...

Claude Opus 4.7 é um modelo de IA proprietário da Anthropic, classificado como nível Frontier com janela de contexto de 1M de tokens. Explore pontuações de benc...
Consentimento de Cookies
Usamos cookies para melhorar sua experiência de navegação e analisar nosso tráfego. See our privacy policy.