AI Model Leaderboard

How the best models actually compare

Benchmark scores across coding, reasoning, and mathematics for the top AI models available in FlowHunt. Sourced from official model cards and independent evaluations.

24
Models
11
Benchmarks
8
Providers
Jun 2026
Last updated

Real-world GitHub issue resolution

Benchmark:
Showing key benchmarks · scroll table to see all
Data note: DeepSeek V4-Pro SWE-bench is 80.6% self-reported vs 74.0% independently measured — both shown. Scores tagged SR or 3P.
SR Self-reported by provider
3P Third-party / independent
Not evaluated
Last updated: June 11, 2026

2026년 올바른 AI 모델 선택 방법

단일 AI 모델이 모든 벤치마크에서 선두를 차지하지는 않습니다. 올바른 선택은 사용자의 작업 부하에 따라 달라지며, 이 가이드는 여기에서 추적하는 24개 모델에 대한 검증된 벤치마크 데이터를 기반으로 작업 유형을 모델 성능에 매칭합니다.

소프트웨어 엔지니어링에 가장 적합한 AI 모델 (2026)

실제 GitHub 이슈에서 측정된 작업의 경우 SWE-bench Verified가 가장 관련성 높은 벤치마크입니다. 2026년 6월 기준:

Claude Fable 5 — 95.0% SWE-bench Verified.
GPT-5.5 — 88.7% SWE-bench Verified.
Claude Opus 4.8 — 88.6% SWE-bench Verified.
DeepSeek V4-Pro — 80.6% SWE-bench Verified.

경쟁 프로그래밍(LiveCodeBench, 지속적으로 업데이트되어 오염 방지)의 경우: DeepSeek V4-Pro 93.5% → DeepSeek V4-Flash 91.6% → Qwen 3.7-Max 91.6%.

과학적 추론에 가장 적합한 AI 모델 (2026)

GPQA Diamond는 Google이 답할 수 없는 대학원 수준의 과학 지식을 테스트합니다. 프론티어 선두:

Claude Opus 4.8 — 93.6% GPQA Diamond.
GPT-5.5 — 93.6% GPQA Diamond.
Qwen 3.7-Max — 92.4% GPQA Diamond.
Claude Opus 4.6 — 91.3% GPQA Diamond.

**휴먼리티 라스트 엑스켐(HLE)**은 더욱 어려워 — 프론티어 모델 중 55% 미만의 질문에만 답할 수 있습니다. Claude Opus 4.6이 53.0%로 선두입니다.

최고의 오픈 웨이트 AI 모델 (2026)

자체 호스팅, 데이터 프라이버시 또는 API 비용 절감을 위해, 다음 오픈 웨이트 모델은 프론티어에 준하는 성능을 제공합니다:

DeepSeek V4-Pro.
MiniMax M3.
Nemotron 3 Ultra.
Mistral Large 3.
Llama 4 Maverick.

2026년 AI 모델을 실제로 차별화하는 벤치마크는 무엇인가요?

많은 클래식 벤치마크는 이제 포화 상태입니다 — 거의 모든 프론티어 모델이 85~95%를 기록하여 차이가 노이즈 범위 내에 있습니다:

프론티어 비교에 피할 것대신 사용할 것
MMLU 기본MMLU-Pro
HumanEvalSWE-bench Verified / LiveCodeBench
GSM8K, HellaSwag, ARC-ChallengeGPQA Diamond, MATH-500
일반 채팅 승률AA 인텔리전스 지수 (독립)

위의 리더보드는 11개 벤치마크 중 하나로 정렬할 수 있습니다. 벤치마크 카드를 클릭하여 해당 지표로 모든 모델의 순위를 확인하세요.

FlowHunt에서 사용 가능한 AI 모델

FlowHunt에서 사용 가능으로 표시된 모델은 FlowHunt AI 에이전트, 플로우, FlowHunt 데스크톱 앱에서 직접 사용할 수 있습니다. 여기에는 전체 GPT-5 시리즈, Claude 4.x 시리즈, DeepSeek V4, Qwen 3.7 및 Llama 4 제품군이 포함됩니다. 각 모델의 페이지에서 벤치마크 분석, 컨텍스트 창 및 권장 사용 사례를 확인하세요.

자주 묻는 질문

더 알아보기

GPT-5.5 — 벤치마크, 성능 및 사용 사례
GPT-5.5 — 벤치마크, 성능 및 사용 사례

GPT-5.5 — 벤치마크, 성능 및 사용 사례

GPT-5.5는 OpenAI의 독점 AI 모델로, Frontier 등급으로 분류되며 100만 토큰 컨텍스트 윈도우를 제공합니다. FlowHunt에서 바로 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 알아보세요....

4 분 읽기
클로드 페이블 5 — 벤치마크, 성능 및 사용 사례
클로드 페이블 5 — 벤치마크, 성능 및 사용 사례

클로드 페이블 5 — 벤치마크, 성능 및 사용 사례

클로드 페이블 5는 Anthropic의 독점 AI 모델로, 100만 토큰 컨텍스트 윈도우를 갖춘 Super-Frontier 등급으로 분류됩니다. 벤치마크 점수, 강점 및 권장 사용 사례를 살펴보세요....

3 분 읽기
Claude Opus 4.6 — 벤치마크, 기능 및 사용 사례
Claude Opus 4.6 — 벤치마크, 기능 및 사용 사례

Claude Opus 4.6 — 벤치마크, 기능 및 사용 사례

Claude Opus 4.6은 Anthropic의 독점 AI 모델로, 100만 토큰 컨텍스트 윈도우를 갖춘 Frontier 등급으로 분류됩니다. FlowHunt에서 직접 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 살펴보세요....

4 분 읽기