
DeepSeek V4-Flash — Benchmarks, kapabiliteter og anvendelsesmuligheder
DeepSeek V4-Flash er en open-weight AI-model fra DeepSeek (13B/284B MoE), klassificeret som Advanced-niveau med et 1M tokens kontekstvindue. Den er direkte tilg...
DeepSeek V4-Pro er en topklasses frontier AI-model, udviklet af DeepSeek og udgivet i april 2026. Som en open-weight-model er dens trænede vægte offentligt tilgængelige — du kan selv hoste den, finjustere den på proprietære data eller køre den on-premise uden API-afhængigheder. Kontekstvinduet på 1M tokens er stort nok til at rumme hele kodebaser, længere tekniske dokumenter eller udvidede agent-sessioner uden afkortning.
På FlowHunt AI Leaderboard er den en af 24 sporede modeller, evalueret på tværs af 9 benchmarks. Fremtrædende scores: 93,5 % på LiveCodeBench (#1 af 5); 87,5 % på MMLU-Pro (#2 af 8); 46,0 % på ARC-AGI-2 (#3 af 3).
DeepSeek V4-Pro blev udgivet den 24. april 2026 som flagskibet i DeepSeek’s fjerde generation af V-serien. Den opnåede 93,5 % på LiveCodeBench ved lanceringen — den højeste konkurrenceprogrammeringsscore af nogen målt model — og leverede den højeste selvrapporterede SWE-bench Verified-score uden for Claude Fable 5 med 80,6 %. Udgivelsen skabte betydelig debat, da CAISI uafhængigt målte V4-Pro’s SWE-bench-score til 74,0 % i stedet for de 80,6 %, DeepSeek havde rapporteret — et gap på 6,6 point, som DeepSeek tilskrev forskelle i scaffolding og token-budget i evalueringsopsætningen. Som en open-weight-model med et kontekstvindue på 1M og 49B/1.6T MoE-arkitektur blev V4-Pro den førende selvhostbare mulighed for teams, der prioriterer kodningspræstationer med fuld datakontrol.
Bemærk: SWE-bench uoverensstemmelse: SR 80,6 % vs CAISI 74 %. LiveCodeBench 93,5 % højeste rapporterede.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeek er et kinesisk AI-forskningslaboratorium grundlagt i 2023 som et datterselskab af High-Flyer, en af Kinas største kvantitative hedgefonde. Laboratoriet blev almindeligt kendt i begyndelsen af 2025, da udgivelsen af DeepSeek V3 og R1 udløste det største endagsfald i NVIDIA's markedsværdi nogensinde, da investorer revurderede kapitalintensiteten af frontlinje-modeludvikling i lyset af DeepSeeks rapporterede lavere træningsomkostninger. DeepSeek er usædvanlig blandt frontlinjelaboratorier i sin forpligtelse til at udgive åbne vægtmodeller sammen med sin proprietære forskning og i at opretholde en aktiv tilstedeværelse på sociale medier, der kritiserer prissætningen af lukkede modeller. Dets V-serie-modeller (V3 til V4-Pro) er bredt anvendte som selv-hostbare kodnings- og ræsonneringsmodeller i Vesten på trods af løbende regulatorisk og sikkerhedsmæssig granskning af kinesisk-udviklede AI-modeller i flere jurisdiktioner.
Anvendelsesmuligheder
DeepSeek V4-Pro scorer 80 % på SWE-bench Verified — rangeret #6 af 13 modeller, der spores her. Den løser rigtige GitHub-problemer, skriver produktionsklar kode på tværs af flere sprog og håndterer flertrins agentiske kodningsworkflows — et stærkt valg for AI-assisterede softwareudviklingsteams.
Med 90 % på GPQA Diamond (#6 af 14 modeller) overgår DeepSeek V4-Pro den ~65 % humane ph.d.-ekspert baseline på biologi-, kemi- og fysikspørgsmål på kandidatniveau. Brug den til syntese af videnskabelig litteratur, hypotetisk evaluering, medicinsk og juridisk spørgsmål/svar samt forskningsopgaver på tværs af discipliner, hvor dyb domæneviden er vigtig.
DeepSeek V4-Pro opnår 67 % på Terminal-Bench (#4 af 8 modeller), hvilket gør den kompetent til almindelig shell-scripting, kommandolinjeworkflows og let systemadministration i agentiske pipelines.
DeepSeek V4-Pro er open-weight (49B/1.6T MoE parametre) — dens trænede vægte er offentligt tilgængelige til download og selvinstallation. Kør den på din egen GPU-hardware eller private cloud for at sikre, at data aldrig forlader dit miljø, eliminer per-token API-omkostninger i stor skala, eller finjuster modellen på proprietære datasæt.
Med et kontekstvindue på 1M tokens kan DeepSeek V4-Pro indlæse hele softwarearkiver, lange juridiske kontrakter, bogstore forskningsrapporter eller omfattende samtalelogfiler i en enkelt prompt — hvilket muliggør dybdegående dokument-spørgsmål/svar, kodebaseræsonnering på tværs af filer og omfattende sammenfatning uden chunking-heuristikker eller RAG-pipelines.
DeepSeek V4-Pro scorer 93 % på LiveCodeBench (#1 af 5 modeller), en kontamineringsresistent benchmark, der løbende opdateres med nye konkurrenceprogrammeringsproblemer. På dette niveau håndterer den avancerede datastrukturer, graf-algoritmer og udfordringer på interviewniveau med høj pålidelighed.
Mere at sammenligne
Sammenlign alle 24 modeller på tværs af 11 benchmarks — sorterbar, kildeangivet og opdateret juni 2026.

DeepSeek V4-Flash er en open-weight AI-model fra DeepSeek (13B/284B MoE), klassificeret som Advanced-niveau med et 1M tokens kontekstvindue. Den er direkte tilg...

Llama 4 Scout er en åben-vægts AI-model fra Meta (17B/109B MoE (16 eksperter)), klassificeret som Etableret niveau med et 10M tokens kontekstvindue. Den er tilg...

Claude Opus 4.6 er en proprietær AI-model fra Anthropic, klassificeret som Frontier-niveau med en kontekstvindue på 1M tokens. Den er direkte tilgængelig i Flow...
Cookie Samtykke
Vi bruger cookies til at forbedre din browsingoplevelse og analysere vores trafik. See our privacy policy.