Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6 là mô hình AI frontier hàng đầu, được phát triển bởi Anthropic và phát hành vào tháng 2 năm 2026. Đây là mô hình trọng số đóng độc quyền, có sẵn thông qua API của Anthropic. Cửa sổ ngữ cảnh 1 triệu token đủ lớn để chứa toàn bộ mã nguồn, tài liệu kỹ thuật dài hoặc các phiên tác tử mở rộng mà không bị cắt bớt.

Trên Bảng xếp hạng AI FlowHunt, đây là một trong 24 mô hình được theo dõi, đánh giá qua 6 điểm chuẩn. Các điểm số nổi bật: 69,2% trên ARC-AGI-2 (#1 trên 3); 53,0% trên HLE (#1 trên 6); 80,8% trên SWE-bench Verified (#5 trên 13).

Claude Opus 4.6 được phát hành vào ngày 5 tháng 2 năm 2026 và đặc biệt thu hút sự chú ý nhờ hiệu suất trong các tác vụ suy luận thị giác mới lạ. Mô hình nắm giữ điểm số được xác minh công khai cao nhất trên ARC-AGI-2 ở mức 69,17% — một điểm chuẩn về nhận dạng mẫu hình trực quan trừu tượng được xác minh độc lập bởi ARC Prize Foundation và được thiết kế đặc biệt để ngăn chặn việc ghi nhớ. Kết quả này đã đưa Opus 4.6 vượt lên trên mức cơ sở khoảng 60% của con người trong một bài kiểm tra mà các mô hình frontier trước đây đã gặp khó khăn để vượt qua. Mô hình cũng đạt 91,3% trên GPQA Diamond và 53,0% trên Humanity’s Last Exam, trở thành mô hình dẫn đầu cho các tác vụ suy luận khó trong nửa đầu năm 2026.

Lưu ý: ARC-AGI-2 SOTA 69,17% (3P ARC Prize). Phân loại an toàn ASL-3.

Phát hành
Tháng 2 năm 2026
Ngữ cảnh
1 triệu token
Trọng số
Đóng
Phân hạng
Frontier
Nhà cung cấp
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic là một công ty an toàn AI được thành lập vào năm 2021 bởi các cựu nhà nghiên cứu OpenAI Dario Amodei và Daniela Amodei, cùng với một nhóm đồng nghiệp từng dẫn dắt các nhóm an toàn và chính sách của OpenAI. Sứ mệnh đã nêu của công ty là phát triển AI một cách có trách nhiệm vì lợi ích lâu dài của nhân loại, và chương trình nghiên cứu của công ty được xác định bởi cam kết đó: Constitutional AI (CAI), một kỹ thuật huấn luyện mô hình trở nên hữu ích, vô hại và trung thực thông qua tự phê bình; khả năng giải thích cơ học (mechanistic interpretability), nhằm mục đích dịch ngược những gì các nơ-ron và mạch riêng lẻ bên trong các mạng lớn thực sự tính toán; và khoa học mở rộng quy mô (scaling science), cố gắng dự đoán hành vi của mô hình thay đổi như thế nào với sức mạnh tính toán và dữ liệu. Anthropic công bố nghiên cứu này một cách công khai và đã trở thành một trong những phòng thí nghiệm an toàn AI được trích dẫn nhiều nhất trong tài liệu học thuật. Claude là dòng mô hình công khai của Anthropic — được đặt theo tên Claude Shannon, người sáng lập lý thuyết thông tin — và trải qua bốn thế hệ (1 đến 4.x/Fable 5). Anthropic vận hành một API thương mại và sản phẩm Claude.ai hướng đến người tiêu dùng, đồng thời duy trì quan hệ đối tác đám mây sâu rộng với AWS (Amazon Bedrock) và Google Cloud (Vertex AI).

Trường hợp Sử dụng

Nên Dùng Claude Opus 4.6 Cho Việc Gì

Kỹ thuật Phần mềm
Suy luận Khoa học & Kỹ thuật
Tự động hóa CLI Tác tử
Phân tích Tài liệu Dài & Kho Mã nguồn

Strengths & Limitations

Strengths

  • Kỹ thuật phần mềm mạnh mẽ — 80% SWE-bench Verified
  • Suy luận khoa học trình độ sau đại học — 91% GPQA Diamond
  • Suy luận thị giác mới lạ — 69% ARC-AGI-2 (được xác minh độc lập)
  • Tài liệu rất dài và kho mã nguồn lớn (1 triệu ngữ cảnh)

Limitations

  • Trọng số đóng — không thể tự lưu trữ hoặc tinh chỉnh trên dữ liệu riêng tư

Khám phá Toàn bộ Bảng xếp hạng Mô hình AI

Câu hỏi thường gặp

Tìm hiểu thêm