
DeepSeek V4-Flash — 基准测试、能力与用例
DeepSeek V4-Flash 是 DeepSeek 推出的开放权重 AI 模型(13B/284B MoE),归类为高级(Advanced)层级,支持 100 万 token 上下文窗口。可在 FlowHunt 中直接使用。探索基准评分、优势及推荐用例。...
DeepSeek V4-Pro 是一款顶级前沿 AI 模型,由 DeepSeek 开发并于 2026 年 4 月发布。作为开放权重模型,其训练权重公开可用——您可以在自有 GPU 硬件或私有云上自托管、基于专有数据进行微调,或在本地运行而无需依赖 API。100 万 token 的上下文窗口足够容纳整个代码库、长篇技术文档或长时间的智能体会话而无需截断。
在 FlowHunt AI 排行榜上,它是 24 个跟踪模型之一,在 9 项基准测试上进行了评估。突出评分:LiveCodeBench 93.5%(5 个模型中排名第 1);MMLU-Pro 87.5%(8 个模型中排名第 2);ARC-AGI-2 46.0%(3 个模型中排名第 3)。
DeepSeek V4-Pro 于 2026 年 4 月 24 日发布,是 DeepSeek 第四代 V 系列的旗舰模型。发布时在 LiveCodeBench 上取得了 93.5% 的成绩——是所有已评测模型中最高的竞赛编程得分——并以 80.6% 的 SWE-bench Verified 评分创下了 Claude Fable 5 之外最高的自行报告评分。此次发布引发了广泛讨论,因为 CAISI 独立测得的 V4-Pro SWE-bench 评分为 74.0%,而非 DeepSeek 报告的 80.6%——两者相差 6.6 个百分点,DeepSeek 将其归因于评估设置中的脚手架和 token 预算差异。作为一款拥有 100 万上下文窗口和 49B/1.6T MoE 架构的开放权重模型,V4-Pro 成为那些注重编码性能并希望完全掌控数据的团队的首选自托管选项。
注:SWE-bench 差异:自行报告 80.6% 对比 CAISI 74%。LiveCodeBench 93.5% 为最高报告值。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeek是一家中国AI研究实验室,成立于2023年,作为中国最大量化对冲基金之一High-Flyer的子公司。该实验室于2025年初因DeepSeek V3和R1的发布而广为人知,当时这些模型的发布引发了NVIDIA市值迄今为止最大的单日跌幅,原因在于投资者在了解到DeepSeek报告的较低训练成本后,重新评估了前沿模型开发的资本密集度。DeepSeek在前沿实验室中独树一帜,承诺在发布专有研究的同时发布开放权重模型,并通过活跃的社交媒体平台批评闭源模型的定价策略。尽管多个司法管辖区对中国来源AI模型的监管和安全审查仍在持续,其V系列模型(V3至V4-Pro)在西方仍被广泛用作可自行部署的编码和推理模型。
使用场景
DeepSeek V4-Pro 在 SWE-bench Verified 上取得 80% 评分——在此处跟踪的 13 个模型中排名第 6。它能解决真实的 GitHub Issue,编写跨多种语言的生产级代码,并处理多步骤智能体编码工作流,是 AI 辅助软件开发团队的强有力选择。
在 GPQA Diamond 上达到 90%(14 个模型中排名第 6),DeepSeek V4-Pro 在研究生级别的生物学、化学和物理学问题上超过了约 65% 的人类博士专家基线。适用于科学文献综合、假设评估、医疗和法律问答,以及需要深度领域知识的跨学科研究任务。
DeepSeek V4-Pro 在 Terminal-Bench 上取得 67% 评分(8 个模型中排名第 4),使其能够胜任智能体管道中的常见 Shell 脚本编写、命令行工作流和轻量级系统管理任务。
DeepSeek V4-Pro 是开放权重模型(49B/1.6T MoE 参数)——其训练权重可公开下载并自行部署。在自有 GPU 硬件或私有云上运行,确保数据永不离开您的环境,消除大规模按 token 计费的 API 成本,或基于专有数据集对模型进行微调。
凭借 100 万 token 的上下文窗口,DeepSeek V4-Pro 可一次性处理整个软件仓库、长篇幅法律合同、书籍长度的研究报告或大量对话历史——实现深度文档问答、跨文件代码库推理和全面摘要,无需分块策略或 RAG 管道。
DeepSeek V4-Pro 在 LiveCodeBench 上取得 93% 评分(5 个模型中排名第 1),这是一个具有抗污染能力的基准测试,不断更新新的竞赛编程题目。在此水平上,它能高可靠地处理高级数据结构、图算法和面试级挑战题。
更多对比

DeepSeek V4-Flash 是 DeepSeek 推出的开放权重 AI 模型(13B/284B MoE),归类为高级(Advanced)层级,支持 100 万 token 上下文窗口。可在 FlowHunt 中直接使用。探索基准评分、优势及推荐用例。...

Llama 4 Scout 是 Meta 推出的开放权重 AI 模型(17B/109B MoE(16个专家)),归类为成熟层级,拥有 1000 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐用例。...

将 FlowHunt 与 DeepSeek MCP 服务器集成,将先进的语言模型引入您的 AI 工作流。安全代理 DeepSeek API 调用,支持匿名使用,并解锁智能模型选择、故障切换、动态配置和多轮、富上下文对话等功能。...
Cookie 同意
我们使用 cookie 来增强您的浏览体验并分析我们的流量。 See our privacy policy.