
DeepSeek V4-Pro — 基准测试、能力与使用场景
DeepSeek V4-Pro 是 DeepSeek 推出的开放权重 AI 模型(49B/1.6T MoE),属于前沿级别,拥有 100 万 token 的上下文窗口。该模型可直接在 FlowHunt 中使用。深入了解其基准评分、优势及推荐使用场景。...
DeepSeek V4-Flash 是 DeepSeek 于 2026 年 4 月发布的一款先进 AI 模型,适用于要求严苛的生产工作负载。作为开放权重模型,其训练权重可公开获取——您可以自行托管、使用专有数据微调,或在本地部署运行,无需依赖 API。100 万 token 的上下文窗口足以容纳整个代码库、长篇技术文档或长时间的智能体会话,无需截断。
在 FlowHunt AI 排行榜上,它是 24 个追踪模型之一,在 5 项基准测试中进行了评估。突出得分:MMLU-Pro 86.2%(8 个模型中排名第 3);LiveCodeBench 91.6%(5 个模型中排名第 3);HLE 34.8%(6 个模型中排名第 5)。
DeepSeek V4-Flash 于 2026 年 4 月 24 日与 V4-Pro 一同发布,是第四代 V 系列的轻量级低延迟变体。它使用 13B 活跃参数(来自 284B MoE 总参数池),在 LiveCodeBench 上达到 91.6%——仅比 V4-Pro 低 1.9 个百分点——而每次 token 推理成本显著降低。Flash 与 Pro 在竞技编程上的这种近乎持平的表现,体现了 DeepSeek 标志性的设计理念:通过将 token 路由到专门的专家网络,用较少的活跃参数实现接近旗舰的性能。V4-Flash 瞄准高吞吐量场景,适用于需要接近前沿的编码能力且 API 响应时间以毫秒计量的开发者。
注:接近 Pro 的质量,成本仅为几分之一。支持约 2,500 个并发请求。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 79.0% | 9 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| GPQA Diamond | 88.1% | 8 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 86.2% | 3 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 3 of 5 | SR | Competitive programming, continuously updated |
| HLE | 34.8% | 5 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Advanced-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Flash | Claude Sonnet 4.6 | GPT-4.1 |
|---|---|---|---|
| SWE-V | 79.0% | 79.6% | 54.6% |
| GPQA ◇ | 88.1% | — | — |
| MMLU-P | 86.2% | — | — |
| LiveCode | 91.6% | — | — |
| HLE | 34.8% | — | — |
DeepSeek是一家中国AI研究实验室,成立于2023年,作为中国最大量化对冲基金之一High-Flyer的子公司。该实验室于2025年初因DeepSeek V3和R1的发布而广为人知,当时这些模型的发布引发了NVIDIA市值迄今为止最大的单日跌幅,原因在于投资者在了解到DeepSeek报告的较低训练成本后,重新评估了前沿模型开发的资本密集度。DeepSeek在前沿实验室中独树一帜,承诺在发布专有研究的同时发布开放权重模型,并通过活跃的社交媒体平台批评闭源模型的定价策略。尽管多个司法管辖区对中国来源AI模型的监管和安全审查仍在持续,其V系列模型(V3至V4-Pro)在西方仍被广泛用作可自行部署的编码和推理模型。
用例
DeepSeek V4-Flash 在 SWE-bench Verified 上获得 79% 的分数——在此追踪的 13 个模型中排名第 9。它能解决真实的 GitHub 问题,用多种编程语言编写生产级代码,并处理多步骤的智能体编码工作流——是 AI 辅助软件开发团队的强力选择。
DeepSeek V4-Flash 在 GPQA Diamond 上获得 88% 的分数(14 个模型中排名第 8),达到或超过人类博士专家基线水平。它能处理严苛的科学推理、研究文献总结以及 STEM 学科中的知识密集型任务。
DeepSeek V4-Flash 为开放权重模型(13B/284B MoE 参数)——其训练权重可公开下载和自行部署。在自有 GPU 硬件或私有云上运行,确保数据永不离开您的环境,大规模消除按 token 计费的 API 成本,或使用专有数据集对模型进行微调。
凭借 100 万 token 的上下文窗口,DeepSeek V4-Flash 可以在单次提示中处理整个软件仓库、长篇法律合同、书籍长度的研究报告或大量对话历史——实现深度文档问答、跨文件代码库推理和全面总结,无需分块策略或 RAG 管道。
DeepSeek V4-Flash 在 LiveCodeBench 上获得 91% 的分数(5 个模型中排名第 3),这是一个通过不断更新新的竞技编程题目来抵抗数据污染的基准测试。在此水平下,它能高度可靠地处理高级数据结构、图算法和面试级挑战。
更多对比

DeepSeek V4-Pro 是 DeepSeek 推出的开放权重 AI 模型(49B/1.6T MoE),属于前沿级别,拥有 100 万 token 的上下文窗口。该模型可直接在 FlowHunt 中使用。深入了解其基准评分、优势及推荐使用场景。...

将 FlowHunt 与 DeepSeek MCP 服务器集成,将先进的语言模型引入您的 AI 工作流。安全代理 DeepSeek API 调用,支持匿名使用,并解锁智能模型选择、故障切换、动态配置和多轮、富上下文对话等功能。...

Llama 4 Scout 是 Meta 推出的开放权重 AI 模型(17B/109B MoE(16个专家)),归类为成熟层级,拥有 1000 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐用例。...
Cookie 同意
我们使用 cookie 来增强您的浏览体验并分析我们的流量。 See our privacy policy.