Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6は、Anthropicによって開発され2026年2月にリリースされたトップクラスのフロンティアAIモデルです。これはプロプライエタリなクローズドウェイトモデルであり、Anthropic APIを通じて利用可能です。100万トークンのコンテキストウィンドウは、コードベース全体、長大な技術文書、または拡張されたエージェントセッションを切り詰めることなく保持できる十分な大きさです。

FlowHunt AIリーダーボードでは、6つのベンチマークで評価された24の追跡モデルの1つです。注目スコア:ARC-AGI-2で69.2%(3モデル中1位)、HLEで53.0%(6モデル中1位)、SWE-bench Verifiedで80.8%(13モデル中5位)。

Claude Opus 4.6は2026年2月5日にリリースされ、特に新しい視覚的推論タスクにおける性能で注目を集めました。ARC-AGI-2で69.17%という公に検証された最高スコアを保持しています。これは、ARC Prize Foundationによって独立して検証され、記憶を防ぐために特別に設計された抽象的な視覚パターン認識のベンチマークです。この結果により、Opus 4.6は、従来のフロンティアモデルが超えるのに苦戦していたテストで、約60%の人間ベースラインを上回りました。また、GPQA Diamondで91.3%、Humanity’s Last Examで53.0%を達成し、2026年前半においてハードな推論タスクでトップのモデルとなりました。

注記:SOTA ARC-AGI-2 69.17%(3P ARC Prize)。ASL-3安全性分類。

リリース日
2026年2月
コンテキスト
100万トークン
重み
クローズド
ティア
フロンティア
提供元
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropicは、2021年にOpenAIの元研究者であるDario Amodei氏とDaniela Amodei氏、ならびにOpenAIの安全性およびポリシーチームを率いていた同僚らのグループによって設立されたAI安全企業です。同社の掲げる使命は、人類の長期的利益のために責任あるAIを開発することであり、その研究課題は以下の取り組みによって定義されています:自己批判を通じてモデルが有用で無害かつ正直であるよう訓練する手法であるConstitutional AI(CAI);大規模ネットワーク内の個々のニューロンや回路が実際に何を計算しているかをリバースエンジニアリングすることを目的とするメカニズム的解釈可能性;そして、計算量やデータによってモデルの振る舞いがどのように変化するかを予測しようとするスケーリング科学です。Anthropicはこれらの研究をオープンに公開しており、学術文献において最も引用されるAI安全研究所の一つとなっています。ClaudeはAnthropicの公開モデルファミリーであり、情報理論の創始者であるClaude Shannonにちなんで名付けられ、第1世代から第4世代/Fable 5までの4世代にわたります。Anthropicは商用APIと消費者向けClaude.ai製品を運営し、AWS(Amazon Bedrock)およびGoogle Cloud(Vertex AI)との強固なクラウドパートナーシップを維持しています。

ユースケース

Claude Opus 4.6の活用シーン

ソフトウェアエンジニアリング
科学的・技術的推論
エージェンティックCLI自動化
長文書・コードベース分析

Strengths & Limitations

Strengths

  • 強力なソフトウェアエンジニアリング — SWE-bench Verified 80%
  • 大学院レベルの科学推論 — GPQA Diamond 91%
  • 新しい視覚的推論 — ARC-AGI-2 69%(独立検証済み)
  • 非常に長い文書と大規模コードベース(100万コンテキスト)

Limitations

  • クローズドウェイト — セルフホスティングやプライベートデータでのファインチューニングは不可

AIモデルリーダーボードのすべてを見る

よくある質問

詳しく見る

Claude Opus 4.8 — ベンチマーク、機能、ユースケース
Claude Opus 4.8 — ベンチマーク、機能、ユースケース

Claude Opus 4.8 — ベンチマーク、機能、ユースケース

Claude Opus 4.8 は、Anthropicが開発したプロプライエタリなAIモデルで、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...

2 分で読める
Claude Opus 4.7 — ベンチマーク、機能、ユースケース
Claude Opus 4.7 — ベンチマーク、機能、ユースケース

Claude Opus 4.7 — ベンチマーク、機能、ユースケース

Claude Opus 4.7はAnthropicが開発したプロプライエタリAIモデルで、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。ベンチマークスコア、強み、推奨ユースケースをご覧ください。...

2 分で読める
Claude Sonnet 4.6 — ベンチマーク、機能、ユースケース
Claude Sonnet 4.6 — ベンチマーク、機能、ユースケース

Claude Sonnet 4.6 — ベンチマーク、機能、ユースケース

Claude Sonnet 4.6 は、Anthropic 社のプロプライエタリAIモデルで、Advanced ティアに分類され、100万トークンのコンテキストウィンドウを備えています。FlowHunt で直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...

2 分で読める