
DeepSeek V4-Flash — Benchmarks, mogelijkheden en gebruiksscenario's
DeepSeek V4-Flash is een open-weight AI-model van DeepSeek (13B/284B MoE), geclassificeerd als Advanced-niveau met een contextvenster van 1M tokens. Het is dire...
DeepSeek V4-Pro is een topmodel in de frontier-categorie, ontwikkeld door DeepSeek en uitgebracht in april 2026. Als open-weight model zijn de getrainde gewichten openbaar beschikbaar — u kunt het zelf hosten, fine-tunen op eigen data, of on-premise draaien zonder API-afhankelijkheden. Het contextvenster van 1M tokens is groot genoeg om volledige codebases, lange technische documenten of uitgebreide agent-sessies te verwerken zonder afkapping.
Op het FlowHunt AI Leaderboard is het een van de 24 gevolgde modellen, geëvalueerd op 9 benchmarks. Opvallende scores: 93,5% op LiveCodeBench (#1 van 5); 87,5% op MMLU-Pro (#2 van 8); 46,0% op ARC-AGI-2 (#3 van 3).
DeepSeek V4-Pro werd uitgebracht op 24 april 2026 als het vlaggenschip van DeepSeeks vierde generatie V-serie. Bij lancering behaalde het 93,5% op LiveCodeBench — de hoogste score voor competitief programmeren van alle gemeten modellen — en de hoogste zelfgerapporteerde SWE-bench Verified-score buiten Claude Fable 5 met 80,6%. De release zorgde voor aanzienlijke discussie toen CAISI onafhankelijk de SWE-bench-score van V4-Pro op 74,0% mat in plaats van de 80,6% die DeepSeek had gerapporteerd — een verschil van 6,6 procentpunt dat DeepSeek toeschreef aan verschillen in scaffolding en tokenbudget in de evaluatieopstelling. Als open-weight model met een contextvenster van 1M en een 49B/1,6T MoE-architectuur werd V4-Pro de beste zelf-te-hostern optie voor teams die prestaties op codeergebied prioriteren met volledige gegevenscontrole.
Opmerking: SWE-bench verschil: SR 80,6% vs CAISI 74%. LiveCodeBench 93,5% hoogst gerapporteerd.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeek is een Chinees AI-onderzoekslaboratorium dat in 2023 werd opgericht als dochteronderneming van High-Flyer, een van de grootste kwantitatieve hedgefondsen van China. Het laboratorium werd begin 2025 algemeen bekend toen de release van DeepSeek V3 en R1 de grootste dagelijkse daling in de marktkapitalisatie van NVIDIA tot die datum veroorzaakte, omdat investeerders de kapitaalintensiteit van de ontwikkeling van geavanceerde modellen heroverwogen in het licht van de gerapporteerde lagere trainingskosten van DeepSeek. DeepSeek is ongebruikelijk onder geavanceerde laboratoria vanwege haar toewijding aan het uitbrengen van open-gewicht modellen naast haar eigen onderzoek, en het voeren van een actieve aanwezigheid op sociale media die kritiek levert op de prijsstelling van gesloten modellen. De V-serie modellen (V3 tot en met V4-Pro) worden in het Westen veel gebruikt als zelf-hostbare codeer- en redeneermodellen, ondanks voortdurend regelgevend en beveiligingstoezicht op AI-modellen van Chinese oorsprong in verschillende rechtsgebieden.
Gebruiksscenario's
DeepSeek V4-Pro scoort 80% op SWE-bench Verified — gerangschikt #6 van 13 hier gevolgde modellen. Het lost echte GitHub-problemen op, schrijft productiekwaliteit-code in meerdere talen en verwerkt meerstaps agentische codeerworkflows — een sterke keuze voor AI-ondersteunde softwareontwikkelingsteams.
Met 90% op GPQA Diamond (#6 van 14 modellen) overtreft DeepSeek V4-Pro de ~65% menselijke PhD-expertbaseline op afgestudeerd niveau voor biologie-, scheikunde- en natuurkundevragen. Gebruik het voor wetenschappelijke literatuursynthese, hypotheseevaluatie, medische en juridische Q&A en multidisciplinaire onderzoekstaken waar diepgaande domeinkennis van belang is.
DeepSeek V4-Pro behaalt 67% op Terminal-Bench (#4 van 8 modellen), waarmee het bekwaam is voor veelvoorkomende shell-scripts, command-line-workflows en lichte systeembeheertaken in agentische pijplijnen.
DeepSeek V4-Pro is open-weight (49B/1,6T MoE-parameters) — de getrainde gewichten zijn openbaar beschikbaar om te downloaden en zelf te implementeren. Draai het op uw eigen GPU-hardware of privécloud om te zorgen dat gegevens uw omgeving nooit verlaten, elimineer per-token API-kosten op schaal, of fine-tune het model op eigen datasets.
Met een contextvenster van 1M tokens kan DeepSeek V4-Pro volledige softwarerepositories, lange juridische contracten, boeklange onderzoeksrapporten of uitgebreide gespreksgeschiedenissen in één prompt verwerken — wat diepgaande document-Q&A, cross-bestand codebase-redeenering en uitgebreide samenvatting mogelijk maakt zonder chunking-heuristieken of RAG-pijplijnen.
DeepSeek V4-Pro scoort 93% op LiveCodeBench (#1 van 5 modellen), een contaminatiebestendige benchmark die continu wordt ververst met nieuwe competitieve programmeerproblemen. Op dit niveau verwerkt het geavanceerde datastructuren, grafiekalgoritmen en uitdagingen op sollicitatieniveau met hoge betrouwbaarheid.
Meer om te vergelijken
Vergelijk alle 24 modellen op 11 benchmarks — sorteerbaar, met bronnen en bijgewerkt juni 2026.

DeepSeek V4-Flash is een open-weight AI-model van DeepSeek (13B/284B MoE), geclassificeerd als Advanced-niveau met een contextvenster van 1M tokens. Het is dire...

Llama 4 Scout is een open-weight AI-model van Meta (17B/109B MoE (16 experts)), geclassificeerd als Established-tier met een contextvenster van 10M tokens. Het ...

Claude Opus 4.6 is een eigen AI-model van Anthropic, geclassificeerd als Frontier-tier met een contextvenster van 1M tokens. Het is direct beschikbaar in FlowHu...
Cookie Toestemming
We gebruiken cookies om uw browse-ervaring te verbeteren en ons verkeer te analyseren. See our privacy policy.