Anthropic logo

Anthropic

Claude Sonnet 4.6

AdvancedAvailable in FlowHunt

Claude Sonnet 4.6 是一款适合高要求生产工作负载的高级 AI 模型,由 Anthropic 开发并于 2026 年 2 月发布。它是一个专有关闭权重模型,可通过 Anthropic API 使用。100 万 token 的上下文窗口足够容纳整个代码库、长篇技术文档或扩展的智能体会话而无需截断。

在 FlowHunt AI 排行榜上,它是 24 个追踪模型之一,在 4 项基准测试上进行了评估。突出成绩:MATH-500 89.0%(4 个模型中排名第 2);ARC-AGI-2 58.3%(3 个模型中排名第 2);SWE-bench Verified 79.6%(13 个模型中排名第 8)。

Claude Sonnet 4.6 于 2026 年 2 月 17 日发布,是 Claude 4 代产品中的中端模型,在能力和价格上均位于 Opus 系列与 Haiku 系列之间。Sonnet 级别历来在 Anthropic 产品线中提供最佳的性价比——足以胜任绝大多数编程和推理任务,而价格约为 Opus 的五分之一。Sonnet 4.6 在 ARC-AGI-2 上获得 58.3% 的分数(由 ARC Prize Foundation 独立验证),发布时在该基准测试中位居全球第二高分。它支持与 Opus 模型相同的 100 万 token 上下文窗口。

注:同类最佳金融智能体(63.3%)和 MCP-Atlas(61.3%)。自适应思维。

发布时间
2026 年 2 月
上下文窗口
100 万 token
权重
关闭
级别
高级
提供商
Anthropic

Claude Sonnet 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified79.6%8 of 13SRReal GitHub issue resolution (500 verified issues)
Terminal-Bench59.1%8 of 8SRAgentic Linux terminal task completion
MATH-50089.0%2 of 4SRHendrycks math (500 problems)
ARC-AGI-258.3%2 of 33PNovel visual reasoning, no memorisation

Detailed Benchmark Scores

SWE-V SR
79.6%
Real GitHub issue resolution (500 verified issues)
Terminal SR
59.1%
Agentic Linux terminal task completion
MATH SR
89.0%
Hendrycks math (500 problems)
ARC-2 3P
58.3%
Novel visual reasoning, no memorisation

Claude Sonnet 4.6 vs. Advanced Peers

Head-to-head benchmark comparison with other Advanced-tier models. Higher is better for all metrics.

BenchmarkClaude Sonnet 4.6GPT-4.1DeepSeek V4-Flash
SWE-V79.6%54.6%79.0%
Terminal59.1%
MATH89.0%
ARC-258.3%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic 是一家AI安全公司,由前OpenAI研究员Dario Amodei和Daniela Amodei,以及一群曾领导OpenAI安全和政策团队的同事于2021年共同创立。该公司的既定使命是负责任地开发AI,以实现人类长期利益,其研究议程也围绕这一承诺展开:宪政AI(CAI)——一种通过自我批判训练模型成为有用、无害且诚实的模型的技术;机械可解释性——旨在逆向工程大型网络中单个神经元和电路实际计算的内容;以及规模化科学——试图预测模型行为如何随算力和数据变化而变化。Anthropic公开了这些研究成果,并已成为学术文献中被引用最多的AI安全实验室之一。Claude是Anthropic的公开模型系列——以信息论创始人Claude Shannon命名——涵盖四代(1至4.x/Fable 5)。Anthropic运营商业API和面向消费者的Claude.ai产品,并与AWS(Amazon Bedrock)和Google Cloud(Vertex AI)保持着深度云合作伙伴关系。

使用场景

Claude Sonnet 4.6 适合做什么

软件工程
智能体 CLI 自动化
长文档与代码库分析

Strengths & Limitations

Strengths

  • 强大的软件工程能力——SWE-bench Verified 79%
  • 新颖的视觉推理能力——ARC-AGI-2 58%(独立验证)
  • 高级数学能力——MATH-500 89%
  • 超长文档与大型代码库处理(100 万上下文)

Limitations

  • 权重关闭——无法自托管或在私有数据上进行微调

浏览完整的 AI 模型排行榜

常见问题

了解更多

Claude Opus 4.6 — 基准测试、能力与使用场景
Claude Opus 4.6 — 基准测试、能力与使用场景

Claude Opus 4.6 — 基准测试、能力与使用场景

Claude Opus 4.6 是 Anthropic 开发的专有 AI 模型,属于 Frontier 层级,拥有 100 万 token 的上下文窗口。该模型可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐使用场景。...

3 分钟阅读
Claude 3.5 Sonnet
Claude 3.5 Sonnet

Claude 3.5 Sonnet

了解更多关于Anthropic的Claude 3.5 Sonnet模型:其与其他模型的对比、优势、劣势,以及在推理、编程和视觉等领域的应用。

1 分钟阅读
AI Anthropic +6
Claude Opus 4.8 — 基准测试、能力与用例
Claude Opus 4.8 — 基准测试、能力与用例

Claude Opus 4.8 — 基准测试、能力与用例

Claude Opus 4.8 是 Anthropic 专有 AI 模型,属于 Frontier 层级,拥有 100 万 token 上下文窗口。探索其基准分数、优势及推荐用例。...

3 分钟阅读