Mistral logo

Mistral

Mistral Large 3

AdvancedOpen-weightAvailable in FlowHunt

Mistral Large 3 是 Mistral 开发的一款先进 AI 模型,于 2025 年 12 月发布,适用于要求严苛的生产工作负载。作为一款开放权重模型,其训练权重可公开获取——您可以自行托管、在专有数据上进行微调,或在本地部署运行而无需依赖 API。它支持 256K token 的上下文窗口,足以应对大多数文档和多轮交互应用。

在 FlowHunt AI 排行榜上,它是 24 个被追踪模型之一,在 3 项基准测试上进行了评估。突出得分:MATH-500 得分 93.6%(4 个模型中排名第 1);MMLU-Pro 得分 73.1%(8 个模型中排名第 5);GPQA Diamond 得分 43.9%(14 个模型中排名第 14)。

Mistral Large 3 于 2025 年 12 月 2 日发布,是 Mistral 能力最强的商业模型,并且关键的是,它采用 Apache 2.0 许可证作为开放权重发布。在 675B 总 MoE 架构中拥有 41B 活跃参数,是现有最大且能力最强、完全采用 Apache 许可的前沿邻近模型。Mistral 设计 Large 3 时专门针对欧洲企业的需求:可在欧盟数据中心部署,通过架构设计符合 GDPR 合规要求(数据永不离开部署区域),并且可用于商业应用而无需受限于许多开放权重模型的限制性许可条款。其 MMLU-Pro 得分 84.2% 以及扎实的科学推理能力,使其成为欧洲受监管行业——金融、医疗和法律——在需要强大 AI 能力且无需将数据发送至美国 API 提供商时的默认选择。

注:企业级通用模型,Apache 2.0 许可证。硬推理能力偏弱(GPQA 43.9%)。

发布时间
2025 年 12 月
参数量
41B/675B MoE
上下文窗口
256K tokens
权重
开放
层级
进阶
提供商
Mistral

Mistral Large 3 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
GPQA Diamond43.9%14 of 143PGraduate-level Google-proof science Q&A
MMLU-Pro73.1%5 of 83PHard knowledge reasoning, 12K questions
MATH-50093.6%1 of 43PHendrycks math (500 problems)

Detailed Benchmark Scores

GPQA ◇ 3P
43.9%
Graduate-level Google-proof science Q&A
MMLU-P 3P
73.1%
Hard knowledge reasoning, 12K questions
MATH 3P
93.6%
Hendrycks math (500 problems)

Mistral Large 3 vs. Advanced Peers

Head-to-head benchmark comparison with other Advanced-tier models. Higher is better for all metrics.

BenchmarkMistral Large 3Claude Sonnet 4.6GPT-4.1
GPQA ◇43.9%
MMLU-P73.1%
MATH93.6%89.0%

About Mistral

Mistral Founded 2023 · Paris, France
Website →

Mistral AI是一家法国AI公司,由Arthur Mensch(前Google DeepMind)、Guillaume Lample和Timothée Lacroix(均前Meta AI Research)于2023年4月共同创立。该公司将自己定位为生成式AI领域的欧洲领军者,将商业API业务与战略性开放权重发布相结合。Mistral的旗舰Large系列和Apache 2.0许可模型使其成为大多数AI排行榜上最突出的非美国、非中国供应商。该公司在巴黎设有欧盟总部,强调GDPR和欧盟法规合规性,并提出了独特的监管理念,呼吁对开放权重模型采取比封闭API系统更宽松的监管。

应用场景

Mistral Large 3 的适用场景

科学与技术推理
自行托管与私有部署

Strengths & Limitations

Strengths

  • 高级数学能力——MATH-500 得分 93%
  • 自行托管与数据私有部署(开放权重)
  • 长上下文任务(256K 上下文窗口)

Limitations

  • 前沿级硬科学推理能力偏弱(GPQA 得分 43%——前沿模型为 90%+)

浏览完整 AI 模型排行榜

常见问题

了解更多

Mistral Medium 3 — 基准测试、能力与用例
Mistral Medium 3 — 基准测试、能力与用例

Mistral Medium 3 — 基准测试、能力与用例

Mistral Medium 3 是 Mistral 推出的专有 AI 模型,属于高级层级,上下文窗口为 128K tokens。探索其基准测试分数、优势及推荐用例。...

1 分钟阅读
Mixtral 8x7B — 基准测试、能力与应用场景
Mixtral 8x7B — 基准测试、能力与应用场景

Mixtral 8x7B — 基准测试、能力与应用场景

Mixtral 8x7B 是 Mistral 推出的开放权重 AI 模型(12.9B/46.7B MoE),属于 Legacy(经典)层级,支持 32K token 上下文窗口。它可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐用例。...

2 分钟阅读
MiniMax M3 — 基准测试、能力与使用场景
MiniMax M3 — 基准测试、能力与使用场景

MiniMax M3 — 基准测试、能力与使用场景

MiniMax M3 是 MiniMax 推出的开放权重 AI 模型(MoE,未公开参数),属于前沿层级,拥有 100 万 token 的上下文窗口。该模型已在 FlowHunt 中直接可用。探索其基准测试分数、优势及推荐使用场景。...

2 分钟阅读