DeepSeek logo

DeepSeek

DeepSeek V4-Pro

FrontierOpen-weightAvailable in FlowHunt

DeepSeek V4-Pro er en topklasses frontier AI-model, udviklet af DeepSeek og udgivet i april 2026. Som en open-weight-model er dens trænede vægte offentligt tilgængelige — du kan selv hoste den, finjustere den på proprietære data eller køre den on-premise uden API-afhængigheder. Kontekstvinduet på 1M tokens er stort nok til at rumme hele kodebaser, længere tekniske dokumenter eller udvidede agent-sessioner uden afkortning.

På FlowHunt AI Leaderboard er den en af 24 sporede modeller, evalueret på tværs af 9 benchmarks. Fremtrædende scores: 93,5 % på LiveCodeBench (#1 af 5); 87,5 % på MMLU-Pro (#2 af 8); 46,0 % på ARC-AGI-2 (#3 af 3).

DeepSeek V4-Pro blev udgivet den 24. april 2026 som flagskibet i DeepSeek’s fjerde generation af V-serien. Den opnåede 93,5 % på LiveCodeBench ved lanceringen — den højeste konkurrenceprogrammeringsscore af nogen målt model — og leverede den højeste selvrapporterede SWE-bench Verified-score uden for Claude Fable 5 med 80,6 %. Udgivelsen skabte betydelig debat, da CAISI uafhængigt målte V4-Pro’s SWE-bench-score til 74,0 % i stedet for de 80,6 %, DeepSeek havde rapporteret — et gap på 6,6 point, som DeepSeek tilskrev forskelle i scaffolding og token-budget i evalueringsopsætningen. Som en open-weight-model med et kontekstvindue på 1M og 49B/1.6T MoE-arkitektur blev V4-Pro den førende selvhostbare mulighed for teams, der prioriterer kodningspræstationer med fuld datakontrol.

Bemærk: SWE-bench uoverensstemmelse: SR 80,6 % vs CAISI 74 %. LiveCodeBench 93,5 % højeste rapporterede.

Udgivet
April 2026
Parametre
49B/1.6T MoE
Kontekst
1M tokens
Vægte
Åbne
Niveau
Frontier
Udbyder
DeepSeek

DeepSeek V4-Pro Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.6%6 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro55.4%9 of 9SRMulti-language, standardised scaffold
GPQA Diamond90.1%6 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro87.5%2 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench93.5%1 of 5SRCompetitive programming, continuously updated
Terminal-Bench67.9%4 of 8SRAgentic Linux terminal task completion
ARC-AGI-246.0%3 of 3CNovel visual reasoning, no memorisation
HLE37.7%4 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index52.0 pts6 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.6%
Real GitHub issue resolution (500 verified issues)
Independent: 74.0% (CAISI independent)
SWE-Pro SR
55.4%
Multi-language, standardised scaffold
GPQA ◇ SR
90.1%
Graduate-level Google-proof science Q&A
MMLU-P SR
87.5%
Hard knowledge reasoning, 12K questions
LiveCode SR
93.5%
Competitive programming, continuously updated
Terminal SR
67.9%
Agentic Linux terminal task completion
ARC-2 C
46.0%
Novel visual reasoning, no memorisation
HLE SR
37.7%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
52.0 pts
Artificial Analysis composite score (independent)

DeepSeek V4-Pro vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkDeepSeek V4-ProClaude Opus 4.8Claude Opus 4.7
SWE-V80.6%88.6%87.6%
SWE-Pro55.4%69.2%64.3%
GPQA ◇90.1%93.6%94.2%
MMLU-P87.5%
LiveCode93.5%
Terminal67.9%74.6%66.1%
ARC-246.0%
HLE37.7%
AA Idx52.0 pts61.4 pts57.3 pts

About DeepSeek

DeepSeek Founded 2023 · Hangzhou, China
Website →

DeepSeek er et kinesisk AI-forskningslaboratorium grundlagt i 2023 som et datterselskab af High-Flyer, en af Kinas største kvantitative hedgefonde. Laboratoriet blev almindeligt kendt i begyndelsen af 2025, da udgivelsen af DeepSeek V3 og R1 udløste det største endagsfald i NVIDIA's markedsværdi nogensinde, da investorer revurderede kapitalintensiteten af frontlinje-modeludvikling i lyset af DeepSeeks rapporterede lavere træningsomkostninger. DeepSeek er usædvanlig blandt frontlinjelaboratorier i sin forpligtelse til at udgive åbne vægtmodeller sammen med sin proprietære forskning og i at opretholde en aktiv tilstedeværelse på sociale medier, der kritiserer prissætningen af lukkede modeller. Dets V-serie-modeller (V3 til V4-Pro) er bredt anvendte som selv-hostbare kodnings- og ræsonneringsmodeller i Vesten på trods af løbende regulatorisk og sikkerhedsmæssig granskning af kinesisk-udviklede AI-modeller i flere jurisdiktioner.

Anvendelsesmuligheder

Hvad DeepSeek V4-Pro skal bruges til

Softwareudvikling
Videnskabelig & teknisk ræsonnering
Agentisk CLI-automatisering
Selvhostede & private installationer
Analyse af lange dokumenter & kodebaser
Konkurrenceprogrammering

Strengths & Limitations

Strengths

  • Stærk softwareudvikling — 80 % SWE-bench Verified
  • Videnskabelig ræsonnering på kandidatniveau — 90 % GPQA Diamond
  • Konkurrenceprogrammering — 93 % LiveCodeBench
  • Sammensat intelligens — 52 pts AA Intelligence Index (uafhængig)
  • Selvhostede & dataprivate installationer (open-weight)
  • Meget lange dokumenter og store kodebaser (1M kontekst)

Se hele AI Model Leaderboard

Ofte stillede spørgsmål

Lær mere