Meta logo

Meta

Llama 4 Maverick

EstablishedOpen-weight

Llama 4 Maverick 是一款经过验证的 AI 模型,仍广泛部署于生产系统,由 Meta 开发并于2025年4月发布。作为开源权重模型,其训练权重可公开获取——您可以自托管、使用专有数据微调,或在本地运行而无需依赖 API。100万 Token 的上下文窗口足以容纳整个代码库、长篇技术文档或扩展的智能体会话而无需截断。

在 FlowHunt AI 排行榜上,它是24个跟踪模型之一,在3项基准测试上接受了评估。突出得分:MMLU-Pro 80.5%(8个模型中排名第4);LiveCodeBench 43.4%(5个模型中排名第4);GPQA Diamond 69.8%(14个模型中排名第11)。

Llama 4 Maverick 于2025年4月5日发布,是 Meta 的旗舰 Llama 4 模型。Maverick 引入了原生多模态混合专家架构——这是首个能够在推理层面处理图像的 Llama 模型——使用来自400B参数池中17B活跃参数,包含128个专家。发布时,它在视觉理解任务上是能力最强的开源权重模型,催生了第一代具备视觉能力的开源权重智能体。其100万 Token 上下文窗口和多模态能力使其在2025年上半年成为开源权重智能体应用开发的参考模型,直至 Frontier 层级的闭源模型拉大了领先优势。

注:发布时同类别中最佳的多模态开源权重模型。可在单台 H100 主机上运行。

发布时间
2025年4月
参数量
17B/400B MoE(128专家)
上下文窗口
100万 Token
权重
开放
层级
成熟
提供商
Meta

Llama 4 Maverick Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
GPQA Diamond69.8%11 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro80.5%4 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench43.4%4 of 5SRCompetitive programming, continuously updated

Detailed Benchmark Scores

GPQA ◇ SR
69.8%
Graduate-level Google-proof science Q&A
MMLU-P SR
80.5%
Hard knowledge reasoning, 12K questions
LiveCode SR
43.4%
Competitive programming, continuously updated

Llama 4 Maverick vs. Established Peers

Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.

BenchmarkLlama 4 MaverickGPT-4oLlama 4 Scout
GPQA ◇69.8%53.6%
MMLU-P80.5%72.6%52.2%
LiveCode43.4%32.8%

About Meta

Meta Founded 2004 · Menlo Park, CA
Website →

Meta Platforms(前身为Facebook)是全球最大的科技公司之一,总部位于加利福尼亚州门洛帕克,以Facebook、Instagram、WhatsApp和Threads最为著名。通过Meta AI(前身为FAIR),该公司凭借Llama系列成为开放权重大语言模型最多产的发布者。Llama 4系列——Maverick、Scout和Behemoth——在宽松的社区许可下发布,至今仍是Hugging Face等平台上下载量最多的开放权重模型。Meta的AI战略在各大实验室中独树一帜:它不运营商业API,而是开放发布模型供研究和商业使用,将生成式AI功能整合到自身应用中,并公开倡导开放权重发布是AI发展最民主的方式。

使用场景

Llama 4 Maverick 适合做什么

科学与技术推理
自托管与私有部署
长文档与代码库分析

Strengths & Limitations

Strengths

  • 高级科学问答——GPQA Diamond 69%
  • 自托管且数据私有的部署(开源权重)
  • 超长文档和大型代码库(100万上下文)

Limitations

  • 在智能体编码和复杂推理方面明显落后于2026年前沿模型

浏览完整 AI 模型排行榜

常见问题

了解更多

Llama 4 Scout — 基准测试、能力与用例
Llama 4 Scout — 基准测试、能力与用例

Llama 4 Scout — 基准测试、能力与用例

Llama 4 Scout 是 Meta 推出的开放权重 AI 模型(17B/109B MoE(16个专家)),归类为成熟层级,拥有 1000 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐用例。...

2 分钟阅读
Llama 3.3 70B — 基准测试、能力与使用场景
Llama 3.3 70B — 基准测试、能力与使用场景

Llama 3.3 70B — 基准测试、能力与使用场景

Llama 3.3 70B 是 Meta 推出的开放权重 AI 模型(70B 密集型),被归类为成熟层级,拥有 128K token 上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐使用场景。...

2 分钟阅读
MiniMax M3 — 基准测试、能力与使用场景
MiniMax M3 — 基准测试、能力与使用场景

MiniMax M3 — 基准测试、能力与使用场景

MiniMax M3 是 MiniMax 推出的开放权重 AI 模型(MoE,未公开参数),属于前沿层级,拥有 100 万 token 的上下文窗口。该模型已在 FlowHunt 中直接可用。探索其基准测试分数、优势及推荐使用场景。...

2 分钟阅读