DeepSeek logo

DeepSeek

DeepSeek V4-Pro

FrontierOpen-weightAvailable in FlowHunt

DeepSeek V4-Pro 是一款顶级前沿 AI 模型,由 DeepSeek 开发并于 2026 年 4 月发布。作为开放权重模型,其训练权重公开可用——您可以在自有 GPU 硬件或私有云上自托管、基于专有数据进行微调,或在本地运行而无需依赖 API。100 万 token 的上下文窗口足够容纳整个代码库、长篇技术文档或长时间的智能体会话而无需截断。

在 FlowHunt AI 排行榜上,它是 24 个跟踪模型之一,在 9 项基准测试上进行了评估。突出评分:LiveCodeBench 93.5%(5 个模型中排名第 1);MMLU-Pro 87.5%(8 个模型中排名第 2);ARC-AGI-2 46.0%(3 个模型中排名第 3)。

DeepSeek V4-Pro 于 2026 年 4 月 24 日发布,是 DeepSeek 第四代 V 系列的旗舰模型。发布时在 LiveCodeBench 上取得了 93.5% 的成绩——是所有已评测模型中最高的竞赛编程得分——并以 80.6% 的 SWE-bench Verified 评分创下了 Claude Fable 5 之外最高的自行报告评分。此次发布引发了广泛讨论,因为 CAISI 独立测得的 V4-Pro SWE-bench 评分为 74.0%,而非 DeepSeek 报告的 80.6%——两者相差 6.6 个百分点,DeepSeek 将其归因于评估设置中的脚手架和 token 预算差异。作为一款拥有 100 万上下文窗口和 49B/1.6T MoE 架构的开放权重模型,V4-Pro 成为那些注重编码性能并希望完全掌控数据的团队的首选自托管选项。

注:SWE-bench 差异:自行报告 80.6% 对比 CAISI 74%。LiveCodeBench 93.5% 为最高报告值。

发布时间
2026 年 4 月
参数规模
49B/1.6T MoE
上下文窗口
100 万 token
权重
开放
级别
前沿
提供商
DeepSeek

DeepSeek V4-Pro Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.6%6 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro55.4%9 of 9SRMulti-language, standardised scaffold
GPQA Diamond90.1%6 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro87.5%2 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench93.5%1 of 5SRCompetitive programming, continuously updated
Terminal-Bench67.9%4 of 8SRAgentic Linux terminal task completion
ARC-AGI-246.0%3 of 3CNovel visual reasoning, no memorisation
HLE37.7%4 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index52.0 pts6 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.6%
Real GitHub issue resolution (500 verified issues)
Independent: 74.0% (CAISI independent)
SWE-Pro SR
55.4%
Multi-language, standardised scaffold
GPQA ◇ SR
90.1%
Graduate-level Google-proof science Q&A
MMLU-P SR
87.5%
Hard knowledge reasoning, 12K questions
LiveCode SR
93.5%
Competitive programming, continuously updated
Terminal SR
67.9%
Agentic Linux terminal task completion
ARC-2 C
46.0%
Novel visual reasoning, no memorisation
HLE SR
37.7%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
52.0 pts
Artificial Analysis composite score (independent)

DeepSeek V4-Pro vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkDeepSeek V4-ProClaude Opus 4.8Claude Opus 4.7
SWE-V80.6%88.6%87.6%
SWE-Pro55.4%69.2%64.3%
GPQA ◇90.1%93.6%94.2%
MMLU-P87.5%
LiveCode93.5%
Terminal67.9%74.6%66.1%
ARC-246.0%
HLE37.7%
AA Idx52.0 pts61.4 pts57.3 pts

About DeepSeek

DeepSeek Founded 2023 · Hangzhou, China
Website →

DeepSeek是一家中国AI研究实验室,成立于2023年,作为中国最大量化对冲基金之一High-Flyer的子公司。该实验室于2025年初因DeepSeek V3和R1的发布而广为人知,当时这些模型的发布引发了NVIDIA市值迄今为止最大的单日跌幅,原因在于投资者在了解到DeepSeek报告的较低训练成本后,重新评估了前沿模型开发的资本密集度。DeepSeek在前沿实验室中独树一帜,承诺在发布专有研究的同时发布开放权重模型,并通过活跃的社交媒体平台批评闭源模型的定价策略。尽管多个司法管辖区对中国来源AI模型的监管和安全审查仍在持续,其V系列模型(V3至V4-Pro)在西方仍被广泛用作可自行部署的编码和推理模型。

使用场景

DeepSeek V4-Pro 的适用场景

软件工程
科学与技术推理
智能体命令行自动化
自托管与私有化部署
长文档与代码库分析
竞赛编程

Strengths & Limitations

Strengths

  • 强大的软件工程能力——SWE-bench Verified 80%
  • 研究生级别的科学推理——GPQA Diamond 90%
  • 竞赛编程能力——LiveCodeBench 93%
  • 综合智能——AA Intelligence Index 52 分(独立评测)
  • 自托管与数据私有化部署(开放权重)
  • 超长文档与大型代码库处理(100 万上下文)

浏览完整 AI 模型排行榜

常见问题

了解更多

DeepSeek V4-Flash — 基准测试、能力与用例
DeepSeek V4-Flash — 基准测试、能力与用例

DeepSeek V4-Flash — 基准测试、能力与用例

DeepSeek V4-Flash 是 DeepSeek 推出的开放权重 AI 模型(13B/284B MoE),归类为高级(Advanced)层级,支持 100 万 token 上下文窗口。可在 FlowHunt 中直接使用。探索基准评分、优势及推荐用例。...

2 分钟阅读
Llama 4 Scout — 基准测试、能力与用例
Llama 4 Scout — 基准测试、能力与用例

Llama 4 Scout — 基准测试、能力与用例

Llama 4 Scout 是 Meta 推出的开放权重 AI 模型(17B/109B MoE(16个专家)),归类为成熟层级,拥有 1000 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐用例。...

2 分钟阅读
DeepSeek MCP 服务器集成
DeepSeek MCP 服务器集成

DeepSeek MCP 服务器集成

将 FlowHunt 与 DeepSeek MCP 服务器集成,将先进的语言模型引入您的 AI 工作流。安全代理 DeepSeek API 调用,支持匿名使用,并解锁智能模型选择、故障切换、动态配置和多轮、富上下文对话等功能。...

1 分钟阅读
AI DeepSeek +5