Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 是由 Anthropic 开发并于 2026 年 2 月发布的一流前沿 AI 模型。它是一个专有封闭权重模型,可通过 Anthropic API 使用。100 万 token 的上下文窗口足以容纳整个代码库、长篇技术文档或扩展的智能体会话而无需截断。

在 FlowHunt AI 排行榜上,它是 24 个受追踪模型之一,在 6 项基准测试上接受了评估。突出分数:ARC-AGI-2 上 69.2%(3 个模型中排名第 1);HLE 上 53.0%(6 个模型中排名第 1);SWE-bench Verified 上 80.8%(13 个模型中排名第 5)。

Claude Opus 4.6 于 2026 年 2 月 5 日发布,因其在新颖视觉推理任务上的表现而备受关注。它在 ARC-AGI-2 上以 69.17% 的成绩持有最高的公开验证分数——这是一项由 ARC Prize Foundation 独立验证的抽象视觉模式识别基准测试,专门设计用于防止记忆化。这一成绩使 Opus 4.6 超越了约 60% 的人类基线水平,而此前的前沿模型难以突破这一门槛。它还在 GPQA Diamond 上取得 91.3%,在 Humanity’s Last Exam 上取得 53.0%,使其成为 2026 年上半年硬推理任务的领先模型。

注:SOTA ARC-AGI-2 69.17%(第三方 ARC Prize 验证)。ASL-3 安全等级。

发布时间
2026 年 2 月
上下文窗口
100 万 token
权重
封闭
层级
Frontier
提供商
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic 是一家AI安全公司,由前OpenAI研究员Dario Amodei和Daniela Amodei,以及一群曾领导OpenAI安全和政策团队的同事于2021年共同创立。该公司的既定使命是负责任地开发AI,以实现人类长期利益,其研究议程也围绕这一承诺展开:宪政AI(CAI)——一种通过自我批判训练模型成为有用、无害且诚实的模型的技术;机械可解释性——旨在逆向工程大型网络中单个神经元和电路实际计算的内容;以及规模化科学——试图预测模型行为如何随算力和数据变化而变化。Anthropic公开了这些研究成果,并已成为学术文献中被引用最多的AI安全实验室之一。Claude是Anthropic的公开模型系列——以信息论创始人Claude Shannon命名——涵盖四代(1至4.x/Fable 5)。Anthropic运营商业API和面向消费者的Claude.ai产品,并与AWS(Amazon Bedrock)和Google Cloud(Vertex AI)保持着深度云合作伙伴关系。

使用场景

Claude Opus 4.6 适合做什么

软件工程
科学与技术推理
智能体 CLI 自动化
长文档与代码库分析

Strengths & Limitations

Strengths

  • 强大的软件工程能力——SWE-bench Verified 80%
  • 研究生级别的科学推理——GPQA Diamond 91%
  • 新颖的视觉推理——ARC-AGI-2 69%(独立验证)
  • 超长文档与大型代码库(100 万上下文)

Limitations

  • 封闭权重——无法自托管或在私有数据上进行微调

浏览完整 AI 模型排行榜

常见问题

了解更多

Claude Opus 4.7 — 基准测试、能力与应用场景
Claude Opus 4.7 — 基准测试、能力与应用场景

Claude Opus 4.7 — 基准测试、能力与应用场景

Claude Opus 4.7 是 Anthropic 开发的专有 AI 模型,属于 Frontier 级别,拥有 100 万 token 的上下文窗口。了解其基准测试分数、优势及推荐应用场景。...

2 分钟阅读
Claude Opus 4.8 — 基准测试、能力与用例
Claude Opus 4.8 — 基准测试、能力与用例

Claude Opus 4.8 — 基准测试、能力与用例

Claude Opus 4.8 是 Anthropic 专有 AI 模型,属于 Frontier 层级,拥有 100 万 token 上下文窗口。探索其基准分数、优势及推荐用例。...

3 分钟阅读
Claude Sonnet 4.6 — 基准测试、能力与应用场景
Claude Sonnet 4.6 — 基准测试、能力与应用场景

Claude Sonnet 4.6 — 基准测试、能力与应用场景

Claude Sonnet 4.6 是 Anthropic 开发的专有 AI 模型,属于高级别类别,拥有 100 万 token 的上下文窗口。它可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐使用场景。...

2 分钟阅读