DeepSeek logo

DeepSeek

DeepSeek V4-Pro

FrontierOpen-weightAvailable in FlowHunt

DeepSeek V4-Pro is een topmodel in de frontier-categorie, ontwikkeld door DeepSeek en uitgebracht in april 2026. Als open-weight model zijn de getrainde gewichten openbaar beschikbaar — u kunt het zelf hosten, fine-tunen op eigen data, of on-premise draaien zonder API-afhankelijkheden. Het contextvenster van 1M tokens is groot genoeg om volledige codebases, lange technische documenten of uitgebreide agent-sessies te verwerken zonder afkapping.

Op het FlowHunt AI Leaderboard is het een van de 24 gevolgde modellen, geëvalueerd op 9 benchmarks. Opvallende scores: 93,5% op LiveCodeBench (#1 van 5); 87,5% op MMLU-Pro (#2 van 8); 46,0% op ARC-AGI-2 (#3 van 3).

DeepSeek V4-Pro werd uitgebracht op 24 april 2026 als het vlaggenschip van DeepSeeks vierde generatie V-serie. Bij lancering behaalde het 93,5% op LiveCodeBench — de hoogste score voor competitief programmeren van alle gemeten modellen — en de hoogste zelfgerapporteerde SWE-bench Verified-score buiten Claude Fable 5 met 80,6%. De release zorgde voor aanzienlijke discussie toen CAISI onafhankelijk de SWE-bench-score van V4-Pro op 74,0% mat in plaats van de 80,6% die DeepSeek had gerapporteerd — een verschil van 6,6 procentpunt dat DeepSeek toeschreef aan verschillen in scaffolding en tokenbudget in de evaluatieopstelling. Als open-weight model met een contextvenster van 1M en een 49B/1,6T MoE-architectuur werd V4-Pro de beste zelf-te-hostern optie voor teams die prestaties op codeergebied prioriteren met volledige gegevenscontrole.

Opmerking: SWE-bench verschil: SR 80,6% vs CAISI 74%. LiveCodeBench 93,5% hoogst gerapporteerd.

Uitgebracht
April 2026
Parameters
49B/1,6T MoE
Context
1M tokens
Gewichten
Open
Niveau
Frontier
Aanbieder
DeepSeek

DeepSeek V4-Pro Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.6%6 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro55.4%9 of 9SRMulti-language, standardised scaffold
GPQA Diamond90.1%6 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro87.5%2 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench93.5%1 of 5SRCompetitive programming, continuously updated
Terminal-Bench67.9%4 of 8SRAgentic Linux terminal task completion
ARC-AGI-246.0%3 of 3CNovel visual reasoning, no memorisation
HLE37.7%4 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index52.0 pts6 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.6%
Real GitHub issue resolution (500 verified issues)
Independent: 74.0% (CAISI independent)
SWE-Pro SR
55.4%
Multi-language, standardised scaffold
GPQA ◇ SR
90.1%
Graduate-level Google-proof science Q&A
MMLU-P SR
87.5%
Hard knowledge reasoning, 12K questions
LiveCode SR
93.5%
Competitive programming, continuously updated
Terminal SR
67.9%
Agentic Linux terminal task completion
ARC-2 C
46.0%
Novel visual reasoning, no memorisation
HLE SR
37.7%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
52.0 pts
Artificial Analysis composite score (independent)

DeepSeek V4-Pro vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkDeepSeek V4-ProClaude Opus 4.8Claude Opus 4.7
SWE-V80.6%88.6%87.6%
SWE-Pro55.4%69.2%64.3%
GPQA ◇90.1%93.6%94.2%
MMLU-P87.5%
LiveCode93.5%
Terminal67.9%74.6%66.1%
ARC-246.0%
HLE37.7%
AA Idx52.0 pts61.4 pts57.3 pts

About DeepSeek

DeepSeek Founded 2023 · Hangzhou, China
Website →

DeepSeek is een Chinees AI-onderzoekslaboratorium dat in 2023 werd opgericht als dochteronderneming van High-Flyer, een van de grootste kwantitatieve hedgefondsen van China. Het laboratorium werd begin 2025 algemeen bekend toen de release van DeepSeek V3 en R1 de grootste dagelijkse daling in de marktkapitalisatie van NVIDIA tot die datum veroorzaakte, omdat investeerders de kapitaalintensiteit van de ontwikkeling van geavanceerde modellen heroverwogen in het licht van de gerapporteerde lagere trainingskosten van DeepSeek. DeepSeek is ongebruikelijk onder geavanceerde laboratoria vanwege haar toewijding aan het uitbrengen van open-gewicht modellen naast haar eigen onderzoek, en het voeren van een actieve aanwezigheid op sociale media die kritiek levert op de prijsstelling van gesloten modellen. De V-serie modellen (V3 tot en met V4-Pro) worden in het Westen veel gebruikt als zelf-hostbare codeer- en redeneermodellen, ondanks voortdurend regelgevend en beveiligingstoezicht op AI-modellen van Chinese oorsprong in verschillende rechtsgebieden.

Gebruiksscenario's

Waar DeepSeek V4-Pro voor gebruiken

Software-engineering
Wetenschappelijk & Technisch Redeneren
Agentische CLI-automatisering
Zelf gehoste & Privé-implementaties
Lange Document- & Codebase-analyse
Competitief Programmeren

Strengths & Limitations

Strengths

  • Sterke software-engineering — 80% SWE-bench Verified
  • Wetenschappelijk redeneren op afgestudeerd niveau — 90% GPQA Diamond
  • Competitief programmeren — 93% LiveCodeBench
  • Composiet intelligentie — 52 punten AA Intelligence Index (onafhankelijk)
  • Zelf gehoste & data-privé implementaties (open-weight)
  • Zeer lange documenten en grote codebases (1M context)

Bekijk het volledige AI Model Leaderboard

Veelgestelde vragen

Meer informatie