DeepSeek logo

DeepSeek

DeepSeek V4-Pro

FrontierOpen-weightAvailable in FlowHunt

DeepSeek V4-Pro è un modello AI frontier di alto livello, sviluppato da DeepSeek e rilasciato ad aprile 2026. Come modello open-weight, i suoi pesi addestrati sono disponibili pubblicamente — puoi ospitarlo autonomamente, metterlo a punto su dati proprietari o eseguirlo on-premise senza dipendenze API. La finestra di contesto di 1 milione di token è sufficientemente ampia da contenere interi codebase, lunghi documenti tecnici o sessioni agentiche estese senza troncamenti.

Nella Classifica AI di FlowHunt è uno dei 24 modelli monitorati, valutato su 9 benchmark. Punteggi di rilievo: 93,5% su LiveCodeBench (#1 su 5); 87,5% su MMLU-Pro (#2 su 8); 46,0% su ARC-AGI-2 (#3 su 3).

DeepSeek V4-Pro è stato rilasciato il 24 aprile 2026 come modello di punta della quarta generazione della serie V di DeepSeek. Al momento del lancio ha raggiunto il 93,5% su LiveCodeBench — il punteggio più alto mai registrato nella programmazione competitiva tra tutti i modelli misurati — e ha ottenuto il punteggio SWE-bench Verified auto-dichiarato più alto al di fuori di Claude Fable 5, con l'80,6%. Il rilascio ha generato notevole discussione quando CAISI ha misurato indipendentemente il punteggio SWE-bench di V4-Pro al 74,0% invece dell'80,6% riportato da DeepSeek — un divario di 6,6 punti che DeepSeek ha attribuito a differenze nello scaffolding e nel budget di token nella configurazione di valutazione. Come modello open-weight con una finestra di contesto di 1 milione di token e architettura MoE 49B/1.6T, V4-Pro è diventato l’opzione auto-ospitabile leader per i team che privilegiano le prestazioni di coding con il pieno controllo dei dati.

Nota: Discrepanza SWE-bench: SR 80,6% vs CAISI 74%. LiveCodeBench 93,5% valore più alto riportato.

Rilasciato
Aprile 2026
Parametri
49B/1.6T MoE
Contesto
1 milione di token
Pesi
Aperti
Livello
Frontier
Fornitore
DeepSeek

DeepSeek V4-Pro Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.6%6 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro55.4%9 of 9SRMulti-language, standardised scaffold
GPQA Diamond90.1%6 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro87.5%2 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench93.5%1 of 5SRCompetitive programming, continuously updated
Terminal-Bench67.9%4 of 8SRAgentic Linux terminal task completion
ARC-AGI-246.0%3 of 3CNovel visual reasoning, no memorisation
HLE37.7%4 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index52.0 pts6 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.6%
Real GitHub issue resolution (500 verified issues)
Independent: 74.0% (CAISI independent)
SWE-Pro SR
55.4%
Multi-language, standardised scaffold
GPQA ◇ SR
90.1%
Graduate-level Google-proof science Q&A
MMLU-P SR
87.5%
Hard knowledge reasoning, 12K questions
LiveCode SR
93.5%
Competitive programming, continuously updated
Terminal SR
67.9%
Agentic Linux terminal task completion
ARC-2 C
46.0%
Novel visual reasoning, no memorisation
HLE SR
37.7%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
52.0 pts
Artificial Analysis composite score (independent)

DeepSeek V4-Pro vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkDeepSeek V4-ProClaude Opus 4.8Claude Opus 4.7
SWE-V80.6%88.6%87.6%
SWE-Pro55.4%69.2%64.3%
GPQA ◇90.1%93.6%94.2%
MMLU-P87.5%
LiveCode93.5%
Terminal67.9%74.6%66.1%
ARC-246.0%
HLE37.7%
AA Idx52.0 pts61.4 pts57.3 pts

About DeepSeek

DeepSeek Founded 2023 · Hangzhou, China
Website →

DeepSeek è un laboratorio di ricerca cinese sull'IA fondato nel 2023 come sussidiaria di High-Flyer, uno dei più grandi hedge fund quantitativi della Cina. Il laboratorio è diventato ampiamente noto all'inizio del 2025 quando il rilascio di DeepSeek V3 e R1 ha innescato il più grande calo giornaliero della capitalizzazione di mercato di NVIDIA fino a quella data, poiché gli investitori hanno rivalutato l'intensità di capitale dello sviluppo di modelli frontier alla luce dei costi di addestramento inferiori riportati da DeepSeek. DeepSeek è insolito tra i laboratori frontier per il suo impegno nel rilasciare modelli a pesi aperti insieme alla sua ricerca proprietaria, e per mantenere una presenza attiva sui social media che critica i prezzi dei modelli chiusi. I suoi modelli della serie V (da V3 a V4-Pro) sono ampiamente utilizzati come modelli di codifica e ragionamento auto-ospitabili in Occidente, nonostante il continuo scrutinio normativo e di sicurezza dei modelli di IA di origine cinese in diverse giurisdizioni.

Casi d'Uso

Per Cosa Usare DeepSeek V4-Pro

Ingegneria del Software
Ragionamento Scientifico e Tecnico
Automazione CLI Agentica
Distribuzioni Auto-Ospitate e Private
Analisi di Documenti Lunghi e Codebase
Programmazione Competitiva

Strengths & Limitations

Strengths

  • Forte ingegneria del software — 80% SWE-bench Verified
  • Ragionamento scientifico a livello universitario — 90% GPQA Diamond
  • Programmazione competitiva — 93% LiveCodeBench
  • Intelligenza composita — 52 pts AA Intelligence Index (indipendente)
  • Distribuzioni auto-ospitate e dati privati (open-weight)
  • Documenti molto lunghi e codebase di grandi dimensioni (contesto 1 milione)

Esplora la Classifica Completa dei Modelli AI

Domande frequenti

Scopri di più

DeepSeek V4-Flash — Benchmark, Capacità e Casi d'Uso
DeepSeek V4-Flash — Benchmark, Capacità e Casi d'Uso

DeepSeek V4-Flash — Benchmark, Capacità e Casi d'Uso

DeepSeek V4-Flash è un modello AI open-weight di DeepSeek (13B/284B MoE), classificato come livello Advanced con una finestra di contesto di 1 milione di token....

5 min di lettura
Llama 4 Scout — Benchmark, Capacità e Casi d'Uso
Llama 4 Scout — Benchmark, Capacità e Casi d'Uso

Llama 4 Scout — Benchmark, Capacità e Casi d'Uso

Llama 4 Scout è un modello AI open-weight di Meta (17B/109B MoE (16 esperti)), classificato come Established con una finestra di contesto di 10 milioni di token...

4 min di lettura
Claude Opus 4.7 — Benchmark, Capacità e Casi d'Uso
Claude Opus 4.7 — Benchmark, Capacità e Casi d'Uso

Claude Opus 4.7 — Benchmark, Capacità e Casi d'Uso

Claude Opus 4.7 è un modello AI proprietario di Anthropic, classificato come livello Frontier con una finestra di contesto di 1 milione di token. Esplora punteg...

5 min di lettura