
Qwen 3.7-Plus — 基准测试、能力与用例
Qwen 3.7-Plus 是阿里巴巴推出的一款专有AI模型,属于高级(Advanced)级别,拥有100万tokens的上下文窗口,可在 FlowHunt 中直接使用。了解其基准测试得分、优势与推荐用例。...
Qwen 3.7-Max 是一款顶级前沿 AI 模型,由阿里巴巴开发,于 2026 年 5 月发布。它是一款专有封闭权重模型,可通过阿里巴巴 API 使用。100 万 Token 的上下文窗口足以容纳整个代码库、长篇技术文档或长时间的智能代理会话而无需截断。
在 FlowHunt AI 排行榜上,它是追踪的 24 个模型之一,在 8 项基准测试上被评估。突出得分:MMLU-Pro 89.6%(8 个模型中排名第 1);LiveCodeBench 91.6%(5 个模型中排名第 2);HLE 41.4%(6 个模型中排名第 2)。
Qwen 3.7-Max 于 2026 年 5 月 20 日发布,是阿里巴巴 Qwen 3 系列中的顶级模型,引入了阿里巴巴称之为"思考模式"的功能——一种可针对每次查询切换的扩展链式推理能力。在思考模式下,模型在生成最终答案之前会进行内部推理步骤,从而显著提升多步推理任务的表现。发布时,Qwen 3.7-Max 在 GPQA Diamond 上得分为 92.4%(全球第三),在 LiveCodeBench 上得分为 91.6%,在 SWE-bench Pro 上得分为 60.6%——这是该基准测试中开放 API 的最高得分。结合 100 万 Token 上下文窗口和具有竞争力的 API 定价,它成为注重成本的企业团队的首要前沿层级替代方案。
注:GPQA Diamond 领先者(92.4%)。SWE-Pro 领先者(60.6%)。AA 指数 56.6。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
阿里巴巴集团是中国最大、最多元化的科技企业集团之一,由马云于1999年创立,总部位于杭州。通过其达摩院和通义实验室,阿里巴巴凭借Qwen(通义千问)系列成为大语言模型开发的重要力量。2026年中期发布的Qwen 3.7版本标志着阿里巴巴从国内部署转向国际基准竞争,Qwen 3.7-Max在GPQA Diamond上获得92.4%的分数,在LiveCodeBench上获得91.6%的分数。阿里巴巴的AI战略以开放权重发布作为对抗美国仅限API模型的制衡手段,将生成式AI整合到其云和电子商务业务中,并对其阿里云部门的AI基础设施进行大规模投资。
使用场景
Qwen 3.7-Max 在 SWE-bench Verified 上得分为 80%——在此处追踪的 13 个模型中排名第 7。它可以解决真实的 GitHub 问题,用多种语言编写生产级代码,并处理多步骤的智能代理编程工作流程——是 AI 辅助软件开发团队的强力选择。
Qwen 3.7-Max 在 GPQA Diamond 上得分为 92%(14 个模型中排名第 4),在研究生级别的生物学、化学和物理问题上超过了约 65% 的人类博士专家基准。适用于科学文献综述、假设评估、医学和法律问答,以及需要深厚领域知识的跨学科研究任务。
Qwen 3.7-Max 在 Terminal-Bench 上得分为 69%(8 个模型中排名第 3),使其能够胜任智能代理流程中的常见 shell 脚本编写、命令行工作流和轻量级系统管理任务。
凭借 100 万 Token 的上下文窗口,Qwen 3.7-Max 可以在单次提示中处理整个软件仓库、长篇法律合同、书籍长度的研究报告或大量对话历史——实现深度文档问答、跨文件代码库推理以及全面的摘要生成,无需分块启发式方法或 RAG 流程。
Qwen 3.7-Max 在 LiveCodeBench 上得分为 91%(5 个模型中排名第 2),这是一项持续更新全新竞赛编程问题、具有抗污染能力的基准测试。在此水平上,它能够高可靠性地处理高级数据结构、图算法和面试级挑战。
更多对比

Qwen 3.7-Plus 是阿里巴巴推出的一款专有AI模型,属于高级(Advanced)级别,拥有100万tokens的上下文窗口,可在 FlowHunt 中直接使用。了解其基准测试得分、优势与推荐用例。...

MiniMax M3 是 MiniMax 推出的开放权重 AI 模型(MoE,未公开参数),属于前沿层级,拥有 100 万 token 的上下文窗口。该模型已在 FlowHunt 中直接可用。探索其基准测试分数、优势及推荐使用场景。...

将 FlowHunt 与 Qwen Max 集成,通过智能 AI 驱动的工作流,实现服务器操作自动化、系统健康监控,并大幅提升生产力,助力可扩展且可靠的基础设施管理。...
Cookie 同意
我们使用 cookie 来增强您的浏览体验并分析我们的流量。 See our privacy policy.