
Mistral Medium 3 — 基准测试、能力与用例
Mistral Medium 3 是 Mistral 推出的专有 AI 模型,属于高级层级,上下文窗口为 128K tokens。探索其基准测试分数、优势及推荐用例。...
Mistral Large 3 是 Mistral 开发的一款先进 AI 模型,于 2025 年 12 月发布,适用于要求严苛的生产工作负载。作为一款开放权重模型,其训练权重可公开获取——您可以自行托管、在专有数据上进行微调,或在本地部署运行而无需依赖 API。它支持 256K token 的上下文窗口,足以应对大多数文档和多轮交互应用。
在 FlowHunt AI 排行榜上,它是 24 个被追踪模型之一,在 3 项基准测试上进行了评估。突出得分:MATH-500 得分 93.6%(4 个模型中排名第 1);MMLU-Pro 得分 73.1%(8 个模型中排名第 5);GPQA Diamond 得分 43.9%(14 个模型中排名第 14)。
Mistral Large 3 于 2025 年 12 月 2 日发布,是 Mistral 能力最强的商业模型,并且关键的是,它采用 Apache 2.0 许可证作为开放权重发布。在 675B 总 MoE 架构中拥有 41B 活跃参数,是现有最大且能力最强、完全采用 Apache 许可的前沿邻近模型。Mistral 设计 Large 3 时专门针对欧洲企业的需求:可在欧盟数据中心部署,通过架构设计符合 GDPR 合规要求(数据永不离开部署区域),并且可用于商业应用而无需受限于许多开放权重模型的限制性许可条款。其 MMLU-Pro 得分 84.2% 以及扎实的科学推理能力,使其成为欧洲受监管行业——金融、医疗和法律——在需要强大 AI 能力且无需将数据发送至美国 API 提供商时的默认选择。
注:企业级通用模型,Apache 2.0 许可证。硬推理能力偏弱(GPQA 43.9%)。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| GPQA Diamond | 43.9% | 14 of 14 | 3P | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 73.1% | 5 of 8 | 3P | Hard knowledge reasoning, 12K questions |
| MATH-500 | 93.6% | 1 of 4 | 3P | Hendrycks math (500 problems) |
Head-to-head benchmark comparison with other Advanced-tier models. Higher is better for all metrics.
| Benchmark | Mistral Large 3 | Claude Sonnet 4.6 | GPT-4.1 |
|---|---|---|---|
| GPQA ◇ | 43.9% | — | — |
| MMLU-P | 73.1% | — | — |
| MATH | 93.6% | 89.0% | — |
Mistral AI是一家法国AI公司,由Arthur Mensch(前Google DeepMind)、Guillaume Lample和Timothée Lacroix(均前Meta AI Research)于2023年4月共同创立。该公司将自己定位为生成式AI领域的欧洲领军者,将商业API业务与战略性开放权重发布相结合。Mistral的旗舰Large系列和Apache 2.0许可模型使其成为大多数AI排行榜上最突出的非美国、非中国供应商。该公司在巴黎设有欧盟总部,强调GDPR和欧盟法规合规性,并提出了独特的监管理念,呼吁对开放权重模型采取比封闭API系统更宽松的监管。
应用场景
Mistral Large 3 在 GPQA Diamond 上获得 43%(14 个模型中排名第 14)。它在通用科学问答方面表现扎实,不过前沿模型在最难的研究级问题上得分高出 25 个百分点以上。
Mistral Large 3 是开放权重模型(41B/675B MoE 参数)——其训练权重可公开下载和自行部署。您可以在自己的 GPU 硬件或私有云上运行它,确保数据永不离开您的环境,大规模使用时消除按 token 的 API 成本,或在专有数据集上对模型进行微调。
更多对比

Mistral Medium 3 是 Mistral 推出的专有 AI 模型,属于高级层级,上下文窗口为 128K tokens。探索其基准测试分数、优势及推荐用例。...

Mixtral 8x7B 是 Mistral 推出的开放权重 AI 模型(12.9B/46.7B MoE),属于 Legacy(经典)层级,支持 32K token 上下文窗口。它可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐用例。...

MiniMax M3 是 MiniMax 推出的开放权重 AI 模型(MoE,未公开参数),属于前沿层级,拥有 100 万 token 的上下文窗口。该模型已在 FlowHunt 中直接可用。探索其基准测试分数、优势及推荐使用场景。...