
DeepSeek V4-Flash — Benchmarks, Fähigkeiten und Anwendungsfälle
DeepSeek V4-Flash ist ein Open-Weight-KI-Modell von DeepSeek (13B/284B MoE), eingestuft in die Kategorie Advanced mit einem Kontextfenster von 1 Mio. Token. Es ...
DeepSeek V4-Pro ist ein erstklassiges Frontier-KI-Modell, entwickelt von DeepSeek und veröffentlicht im April 2026. Als Open-Weight-Modell sind seine trainierten Gewichte öffentlich verfügbar – Sie können es selbst hosten, mit eigenen Daten feintunen oder auf eigener Infrastruktur ohne API-Abhängigkeiten betreiben. Das Kontextfenster von 1 Mio. Token ist groß genug, um ganze Codebasen, umfangreiche technische Dokumente oder ausgedehnte agentische Sitzungen ohne Kürzung zu erfassen.
Im FlowHunt AI Leaderboard ist es eines von 24 erfassten Modellen, bewertet in 9 Benchmarks. Hervorragende Ergebnisse: 93,5 % bei LiveCodeBench (#1 von 5); 87,5 % bei MMLU-Pro (#2 von 8); 46,0 % bei ARC-AGI-2 (#3 von 3).
DeepSeek V4-Pro wurde am 24. April 2026 als Flaggschiff der vierten Generation der V-Serie von DeepSeek veröffentlicht. Es erreichte bei der Veröffentlichung 93,5 % bei LiveCodeBench – die höchste jemals gemessene Punktzahl im Bereich Competitive Programming – und erzielte mit 80,6 % die höchste selbst gemeldete SWE-bench-Verified-Punktzahl außerhalb von Claude Fable 5. Die Veröffentlichung sorgte für erhebliche Diskussionen, als CAISI unabhängig eine SWE-bench-Punktzahl von 74,0 % für V4-Pro maß, statt der von DeepSeek gemeldeten 80,6 % – eine Differenz von 6,6 Punkten, die DeepSeek auf Unterschiede in der Evaluierungsumgebung (Scaffolding und Token-Budget) zurückführte. Als Open-Weight-Modell mit einem 1-Mio.-Token-Kontextfenster und einer 49B/1,6T-MoE-Architektur wurde V4-Pro zur führenden selbst hostbaren Option für Teams, die Programmierleistung mit vollständiger Datenkontrolle priorisieren.
Anmerkung: SWE-bench-Diskrepanz: SR 80,6 % vs. CAISI 74 %. LiveCodeBench 93,5 % der höchste gemeldete Wert.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeek ist ein chinesisches KI-Forschungslabor, das 2023 als Tochtergesellschaft von High-Flyer, einem der größten quantitativen Hedgefonds Chinas, gegründet wurde. Das Labor wurde Anfang 2025 weithin bekannt, als die Veröffentlichung von DeepSeek V3 und R1 den damals größten eintägigen Kursverlust der NVIDIA-Marktkapitalisierung auslöste, da Investoren die Kapitalintensität der Entwicklung von Spitzenmodellen angesichts der berichteten niedrigeren Trainingskosten von DeepSeek neu bewerteten. DeepSeek ist unter den Spitzenlaboren ungewöhnlich in seinem Engagement, Open-Weight-Modelle neben seiner proprietären Forschung zu veröffentlichen, und in seiner aktiven Präsenz in sozialen Medien, die die Preisgestaltung geschlossener Modelle kritisiert. Die V-Serien-Modelle (V3 bis V4-Pro) werden im Westen trotz anhaltender regulatorischer und sicherheitsbezogener Prüfung von KI-Modellen chinesischen Ursprungs in mehreren Jurisdiktionen weit verbreitet als selbst hostbare Codierungs- und Reasoning-Modelle eingesetzt.
Anwendungsfälle
DeepSeek V4-Pro erreicht 80 % bei SWE-bench Verified – Rang #6 von 13 hier erfassten Modellen. Es löst reale GitHub-Issues, schreibt produktionsreifen Code in mehreren Sprachen und bewältigt mehrstufige agentische Programmier-Workflows – eine gute Wahl für KI-gestützte Softwareentwicklungsteams.
Mit 90 % bei GPQA Diamond (#6 von 14 Modellen) übertrifft DeepSeek V4-Pro die ~65 %-Basislinie menschlicher PhD-Experten bei Biologie-, Chemie- und Physikfragen auf Graduiertenniveau. Nutzen Sie es für die Synthese wissenschaftlicher Literatur, Hypothesenbewertung, medizinische und juristische Frage-Antwort-Stellungen sowie interdisziplinäre Forschungsaufgaben, bei denen tiefes Fachwissen erforderlich ist.
DeepSeek V4-Pro erreicht 67 % bei Terminal-Bench (#4 von 8 Modellen) und eignet sich damit für gängige Shell-Scripting-Aufgaben, Kommandozeilen-Workflows und leichte Systemadministrationsaufgaben in agentischen Pipelines.
DeepSeek V4-Pro ist Open-Weight (49B/1,6T MoE-Parameter) – seine trainierten Gewichte sind öffentlich zum Herunterladen und zur Selbstbereitstellung verfügbar. Betreiben Sie es auf Ihrer eigenen GPU-Hardware oder privaten Cloud, um sicherzustellen, dass Daten Ihre Umgebung nie verlassen, um Pro-Token-API-Kosten im großen Maßstab zu vermeiden oder das Modell mit proprietären Datensätzen zu feintunen.
Mit einem Kontextfenster von 1 Mio. Token kann DeepSeek V4-Pro vollständige Software-Repositories, lange Rechtsverträge, buchlange Forschungsberichte oder umfangreiche Gesprächsverläufe in einer einzigen Anfrage verarbeiten – und ermöglicht so tiefgehende Dokumenten-Frage-Antwort, codebase-übergreifende Analysen und umfassende Zusammenfassungen ohne Chunking-Heuristiken oder RAG-Pipelines.
DeepSeek V4-Pro erreicht 93 % bei LiveCodeBench (#1 von 5 Modellen), einem kontaminationsresistenten Benchmark, der kontinuierlich mit neuen Competitive-Programming-Aufgaben aktualisiert wird. Auf diesem Niveau bewältigt es fortgeschrittene Datenstrukturen, Graphenalgorithmen und herausfordernde Aufgaben auf Bewerbungsniveau mit hoher Zuverlässigkeit.
Weitere Vergleiche
Vergleichen Sie alle 24 Modelle in 11 Benchmarks – sortierbar, mit Quellenangabe und aktualisiert Juni 2026.

DeepSeek V4-Flash ist ein Open-Weight-KI-Modell von DeepSeek (13B/284B MoE), eingestuft in die Kategorie Advanced mit einem Kontextfenster von 1 Mio. Token. Es ...

Llama 4 Scout ist ein Open-Weight-KI-Modell von Meta (17B/109B MoE (16 Experten)), eingestuft als Established-Tier mit einem Kontextfenster von 10 Millionen Tok...

Integrieren Sie FlowHunt mit dem DeepSeek MCP Server, um fortschrittliche Sprachmodelle in Ihre KI-Workflows zu bringen. Leiten Sie DeepSeek API-Aufrufe sicher ...
Cookie-Zustimmung
Wir verwenden Cookies, um Ihr Surferlebnis zu verbessern und unseren Datenverkehr zu analysieren. See our privacy policy.