Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6, Anthropic tarafından geliştirilen ve Şubat 2026’da yayınlanan üst düzey bir öncü (frontier) AI modelidir. Anthropic API’si aracılığıyla kullanılabilen tescilli, kapalı ağırlıklı bir modeldir. 1M-token bağlam penceresi, tüm kod tabanlarını, uzun teknik belgeleri veya genişletilmiş ajanlık oturumlarını kesintiye uğramadan tutacak kadar büyüktür.

FlowHunt AI Liderlik Tablosu’nda 6 kıyaslamada değerlendirilen 24 takip edilen modelden biridir. Öne çıkan puanlar: ARC-AGI-2’de %69,2 (3 model arasında #1); HLE’de %53,0 (6 model arasında #1); SWE-bench Verified’da %80,8 (13 model arasında #5).

Claude Opus 4.6, 5 Şubat 2026’da yayınlanmış ve özellikle yeni görsel akıl yürütme görevlerindeki performansıyla dikkat çekmiştir. ARC-AGI-2’de %69,17 ile halka açık en yüksek doğrulanmış puana sahiptir — bu, ARC Ödül Vakfı tarafından bağımsız olarak doğrulanan ve özellikle ezberlemeyi önlemek için tasarlanmış soyut görsel desen tanıma kıyaslamasıdır. Bu sonuç, Opus 4.6’yı, önceki öncü modellerin aşmakta zorlandığı bir testte yaklaşık %60’lık insan taban çizgisinin üzerine yerleştirmiştir. Ayrıca GPQA Diamond’da %91,3 ve Humanity’s Last Exam’de %53,0 elde ederek 2026’nın ilk yarısında zorlu akıl yürütme görevlerinde lider model olmuştur.

Not: SOTA ARC-AGI-2 %69,17 (3P ARC Ödülü). ASL-3 güvenlik sınıflandırması.

Yayın Tarihi
Şubat 2026
Bağlam
1M token
Ağırlıklar
Kapalı
Seviye
Frontier
Sağlayıcı
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic, 2021 yılında eski OpenAI araştırmacıları Dario Amodei ve Daniela Amodei ile OpenAI'in güvenlik ve politika ekiplerine liderlik etmiş bir grup meslektaşı tarafından kurulmuş bir yapay zeka güvenlik şirketidir. Şirketin beyan edilen misyonu, yapay zekanın insanlığın uzun vadeli yararına sorumlu bir şekilde geliştirilmesidir ve araştırma gündemi bu taahhütle tanımlanır: Anayasal YZ (CAI), modelleri öz-eleştiri yoluyla yardımsever, zararsız ve dürüst olacak şekilde eğitmek için bir teknik; mekanistik yorumlanabilirlik, büyük ağlar içindeki bireysel nöronların ve devrelerin gerçekte ne hesapladığını tersine mühendislikle anlamayı amaçlayan bir alan; ve ölçekleme bilimi, model davranışının hesaplama ve veriyle nasıl değiştiğini tahmin etmeye çalışan bir alan. Anthropic bu araştırmaları açıkça yayımlar ve akademik literatürde en çok atıf alan yapay zeka güvenlik laboratuvarlarından biri haline gelmiştir. Claude, Anthropic'in kamuya açık model ailesidir — adını bilgi teorisinin kurucusu Claude Shannon'dan alır — ve dört nesli kapsar (1'den 4.x/Fable 5'e). Anthropic, ticari bir API ve tüketiciye yönelik Claude.ai ürünü işletmekte olup AWS (Amazon Bedrock) ve Google Cloud (Vertex AI) ile derin bulut ortaklıkları sürdürmektedir.

Kullanım Alanları

Claude Opus 4.6 Hangi Amaçla Kullanılır

Yazılım Mühendisliği
Bilimsel ve Teknik Akıl Yürütme
Ajanlık CLI Otomasyonu
Uzun Belge ve Kod Tabanı Analizi

Strengths & Limitations

Strengths

  • Güçlü yazılım mühendisliği — SWE-bench Verified'da %80
  • Yüksek lisans seviyesinde bilim akıl yürütme — GPQA Diamond'da %91
  • Yeni görsel akıl yürütme — ARC-AGI-2'de %69 (bağımsız olarak doğrulandı)
  • Çok uzun belgeler ve büyük kod tabanları (1M bağlam)

Limitations

  • Kapalı ağırlık — özel verilerle kendi sunucunuzda barındırılamaz veya ince ayar yapılamaz

Tüm AI Model Liderlik Tablosuna Göz Atın

Sıkça sorulan sorular

Daha fazla bilgi