Anthropic logo

Anthropic

Claude Opus 4.6

FrontierAvailable in FlowHunt

Claude Opus 4.6은 Anthropic이 개발하여 2026년 2월에 출시된 최상위 프론티어 AI 모델입니다. 독점적인 폐쇄형 가중치 모델로, Anthropic API를 통해 사용할 수 있습니다. 100만 토큰 컨텍스트 윈도우는 전체 코드베이스, 방대한 기술 문서 또는 긴 에이전트 세션을 자르지 않고 처리할 수 있을 만큼 큽니다.

FlowHunt AI 리더보드에서 6개 벤치마크에서 평가된 24개 추적 모델 중 하나입니다. 주요 점수: ARC-AGI-2 69.2%(3개 중 1위), HLE 53.0%(6개 중 1위), SWE-bench Verified 80.8%(13개 중 5위).

Claude Opus 4.6은 2026년 2월 5일에 출시되었으며, 특히 새로운 시각적 추론 작업에서의 성능으로 주목을 받았습니다. ARC-AGI-2(ARC Prize Foundation이 독립적으로 검증하고 암기 학습을 방지하도록 설계된 추상적 시각 패턴 인식 벤치마크)에서 69.17%로 가장 높은 공개 검증 점수를 보유하고 있습니다. 이 결과는 이전 프론티어 모델들이 넘기 어려워했던 테스트에서 Opus 4.6을 약 60%의 인간 기준선 위에 올려놓았습니다. 또한 GPQA Diamond에서 91.3%, Humanity’s Last Exam에서 53.0%를 달성하여 2026년 상반기 어려운 추론 작업에서 선도적인 모델이 되었습니다.

참고: SOTA ARC-AGI-2 69.17%(3P ARC Prize). ASL-3 안전 분류.

출시일
2026년 2월
컨텍스트
100만 토큰
가중치
폐쇄형
등급
프론티어
제공업체
Anthropic

Claude Opus 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.8%5 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro57.3%8 of 9SRMulti-language, standardised scaffold
GPQA Diamond91.3%5 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench65.4%7 of 8SRAgentic Linux terminal task completion
ARC-AGI-269.2%1 of 33PNovel visual reasoning, no memorisation
HLE53.0%1 of 6SRHumanity's Last Exam (50+ STEM disciplines)

Detailed Benchmark Scores

SWE-V SR
80.8%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
57.3%
Multi-language, standardised scaffold
GPQA ◇ SR
91.3%
Graduate-level Google-proof science Q&A
Terminal SR
65.4%
Agentic Linux terminal task completion
ARC-2 3P
69.2%
Novel visual reasoning, no memorisation
HLE SR
53.0%
Humanity's Last Exam (50+ STEM disciplines)

Claude Opus 4.6 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkClaude Opus 4.6GPT-5.5GPT-5.4
SWE-V80.8%88.7%
SWE-Pro57.3%58.6%59.1%
GPQA ◇91.3%93.6%
Terminal65.4%82.7%
ARC-269.2%
HLE53.0%41.4%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic은 2021년 OpenAI 출신 연구원인 Dario Amodei와 Daniela Amodei가 OpenAI의 안전 및 정책 팀을 이끌었던 동료들과 함께 설립한 AI 안전 회사입니다. 이 회사의 명시된 사명은 인류의 장기적인 이익을 위한 책임 있는 AI 개발이며, 그 연구 의제는 다음과 같은 약속에 의해 정의됩니다: 모델이 자기 비판을 통해 유용하고 해롭지 않으며 정직하도록 훈련하는 기술인 헌법적 AI(CAI); 대규모 네트워크 내 개별 뉴런과 회로가 실제로 계산하는 것을 역설계하는 것을 목표로 하는 메커니즘적 해석 가능성; 그리고 연산과 데이터에 따라 모델 행동이 어떻게 변화하는지 예측하려는 스케일링 과학입니다. Anthropic은 이 연구를 공개적으로 발표하며 학술 문헌에서 가장 많이 인용된 AI 안전 연구소 중 하나가 되었습니다. Claude는 정보 이론의 창시자인 Claude Shannon의 이름을 딴 Anthropic의 공개 모델 제품군으로, 4세대(1세대부터 4.x/Fable 5)에 걸쳐 있습니다. Anthropic은 상업용 API와 소비자용 Claude.ai 제품을 운영하며, AWS(Amazon Bedrock) 및 Google Cloud(Vertex AI)와 깊은 클라우드 파트너십을 유지하고 있습니다.

사용 사례

Claude Opus 4.6을 사용해야 하는 이유

소프트웨어 엔지니어링
과학 및 기술 추론
에이전트 CLI 자동화
장문 문서 및 코드베이스 분석

Strengths & Limitations

Strengths

  • 강력한 소프트웨어 엔지니어링 — SWE-bench Verified 80%
  • 대학원 수준의 과학 추론 — GPQA Diamond 91%
  • 새로운 시각적 추론 — ARC-AGI-2 69%(독립 검증 완료)
  • 매우 긴 문서 및 대규모 코드베이스 처리(100만 컨텍스트)

Limitations

  • 폐쇄형 가중치 — 자체 호스팅 또는 비공개 데이터로 파인튜닝 불가

전체 AI 모델 리더보드 보기

자주 묻는 질문

더 알아보기

Claude Opus 4.8 — 벤치마크, 성능 및 사용 사례
Claude Opus 4.8 — 벤치마크, 성능 및 사용 사례

Claude Opus 4.8 — 벤치마크, 성능 및 사용 사례

Claude Opus 4.8은 Anthropic이 개발한 독점 AI 모델로, Frontier 등급에 속하며 100만 토큰의 컨텍스트 윈도우를 제공합니다. 벤치마크 점수, 강점 및 권장 사용 사례를 알아보세요....

4 분 읽기
클로드 오퍼스 4.7 — 벤치마크, 성능 및 사용 사례
클로드 오퍼스 4.7 — 벤치마크, 성능 및 사용 사례

클로드 오퍼스 4.7 — 벤치마크, 성능 및 사용 사례

클로드 오퍼스 4.7은 Anthropic이 개발한 독점 AI 모델로, 100만 토큰 컨텍스트 윈도우를 갖춘 Frontier 등급으로 분류됩니다. 벤치마크 점수, 강점 및 권장 사용 사례를 알아보세요....

4 분 읽기
Claude Sonnet 4.6 — 벤치마크, 성능 및 사용 사례
Claude Sonnet 4.6 — 벤치마크, 성능 및 사용 사례

Claude Sonnet 4.6 — 벤치마크, 성능 및 사용 사례

Claude Sonnet 4.6은 Anthropic의 독점 AI 모델로, Advanced 등급에 속하며 100만 토큰 컨텍스트 윈도우를 지원합니다. FlowHunt에서 바로 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 알아보세요....

4 분 읽기