Meta logo

Meta

Llama 3.3 70B

EstablishedOpen-weightAvailable in FlowHunt

Llama 3.3 70B 是一款久经考验的 AI 模型,仍广泛部署于生产系统中,由 Meta 开发并于 2024 年 12 月发布。作为一款开放权重模型,其训练权重可公开获取 — 您可以自行托管、在专有数据上微调,或在本地部署而不依赖 API。它支持 128K token 的上下文窗口,足以处理大多数文档和多轮对话应用。

在 FlowHunt AI 排行榜上,它是 24 个被追踪模型之一,在 4 项基准测试上接受评估。突出成绩:HumanEval 88.4%(#1/2);MATH-500 77.0%(#3/4);MMLU-Pro 68.9%(#7/8)。

Llama 3.3 70B 于 2024 年 12 月 6 日发布,是 Meta 在架构过渡至 Llama 4 之前推出的 Llama 3 系列最后一批模型之一。作为一个密集(非 MoE)70B 参数模型,它体现了 Llama 3 世代简单可扩展架构的理念:更多参数、更好效果、透明结构。其 128K 上下文窗口以及优异的 MMLU-Pro 和 SWE-bench 分数使其成为拥有充足 GPU 资源(可运行密集 70B 推理但不足以运行 MoE 系统)团队的领先自托管模型。它在医疗、金融、法律等受监管行业中仍然广受欢迎 — 在这些行业中,密集架构的透明性和可审计性,加上开放权重的可获取性,与原始能力同样重要。

注:以 70B 成本达到接近 405B 的质量。纯文本。IFEval 92.1%。

发布时间
2024 年 12 月
参数规模
70B 密集型
上下文窗口
128K token
权重
开放
层级
成熟
提供商
Meta

Llama 3.3 70B Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
GPQA Diamond50.5%13 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro68.9%7 of 8SRHard knowledge reasoning, 12K questions
MATH-50077.0%3 of 4SRHendrycks math (500 problems)
HumanEval pass@188.4%1 of 2SRPython code generation (saturated at frontier)

Detailed Benchmark Scores

GPQA ◇ SR
50.5%
Graduate-level Google-proof science Q&A
MMLU-P SR
68.9%
Hard knowledge reasoning, 12K questions
MATH SR
77.0%
Hendrycks math (500 problems)
HumEval SR
88.4%
Python code generation (saturated at frontier)

Llama 3.3 70B vs. Established Peers

Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.

BenchmarkLlama 3.3 70BGPT-4oLlama 4 Maverick
GPQA ◇50.5%53.6%69.8%
MMLU-P68.9%72.6%80.5%
MATH77.0%
HumEval88.4%

About Meta

Meta Founded 2004 · Menlo Park, CA
Website →

Meta Platforms(前身为Facebook)是全球最大的科技公司之一,总部位于加利福尼亚州门洛帕克,以Facebook、Instagram、WhatsApp和Threads最为著名。通过Meta AI(前身为FAIR),该公司凭借Llama系列成为开放权重大语言模型最多产的发布者。Llama 4系列——Maverick、Scout和Behemoth——在宽松的社区许可下发布,至今仍是Hugging Face等平台上下载量最多的开放权重模型。Meta的AI战略在各大实验室中独树一帜:它不运营商业API,而是开放发布模型供研究和商业使用,将生成式AI功能整合到自身应用中,并公开倡导开放权重发布是AI发展最民主的方式。

使用场景

Llama 3.3 70B 适合用于什么

科学与技术推理
自托管与私有化部署

Strengths & Limitations

Strengths

  • 自托管与数据私有化部署(开放权重)
  • 长上下文任务(128K 上下文窗口)

Limitations

  • 硬科学推理低于前沿水平(GPQA 50% — 前沿达 90%+)
  • 在智能体编程和复杂推理方面明显落后于 2026 年前沿模型

浏览完整 AI 模型排行榜

常见问题

了解更多

Llama 4 Maverick — 基准测试、能力与使用场景
Llama 4 Maverick — 基准测试、能力与使用场景

Llama 4 Maverick — 基准测试、能力与使用场景

Llama 4 Maverick 是 Meta 推出的开源权重 AI 模型(17B/400B MoE(128专家)),属于成熟层级,支持100万Token上下文窗口。了解其基准测试得分、优势与推荐使用场景。...

2 分钟阅读
Llama 4 Scout — 基准测试、能力与用例
Llama 4 Scout — 基准测试、能力与用例

Llama 4 Scout — 基准测试、能力与用例

Llama 4 Scout 是 Meta 推出的开放权重 AI 模型(17B/109B MoE(16个专家)),归类为成熟层级,拥有 1000 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐用例。...

2 分钟阅读
大型语言模型Meta AI(LLaMA)
大型语言模型Meta AI(LLaMA)

大型语言模型Meta AI(LLaMA)

大型语言模型Meta AI(LLaMA)是Meta开发的前沿自然语言处理模型。拥有高达650亿个参数,LLaMA在理解和生成类人文本方面表现卓越,适用于翻译、摘要和聊天机器人等任务。...

1 分钟阅读
AI Language Model +6