AI Model Leaderboard

How the best models actually compare

Benchmark scores across coding, reasoning, and mathematics for the top AI models available in FlowHunt. Sourced from official model cards and independent evaluations.

24
Models
11
Benchmarks
8
Providers
Jun 2026
Last updated

Real-world GitHub issue resolution

Benchmark:
Showing key benchmarks · scroll table to see all
Data note: DeepSeek V4-Pro SWE-bench is 80.6% self-reported vs 74.0% independently measured — both shown. Scores tagged SR or 3P.
SR Self-reported by provider
3P Third-party / independent
Not evaluated
Last updated: June 11, 2026

2026年に適切なAIモデルを選ぶ方法

単一のAIモデルがあらゆるベンチマークでトップになるわけではありません。適切な選択はワークロードに依存します。このガイドでは、ここで追跡している24モデルの検証済みベンチマークデータに基づいて、タスクタイプとモデル性能をマッピングします。

ソフトウェアエンジニアリングに最適なAIモデル(2026)

実際のGitHub課題で測定されるタスクには、SWE-bench Verifiedが最も関連性の高いベンチマークです。2026年6月現在:

Claude Fable 5 — 95.0% SWE-bench Verified.
GPT-5.5 — 88.7% SWE-bench Verified.
Claude Opus 4.8 — 88.6% SWE-bench Verified.
DeepSeek V4-Pro — 80.6% SWE-bench Verified.

競技プログラミング(LiveCodeBench、継続的に更新され汚染防止):DeepSeek V4-Pro 93.5% → DeepSeek V4-Flash 91.6% → Qwen 3.7-Max 91.6%。

科学的推論に最適なAIモデル(2026)

GPQA Diamondは、Googleでは答えられない大学院レベルの科学知識をテストします。フロンティアリーダー:

Claude Opus 4.8 — 93.6% GPQA Diamond.
GPT-5.5 — 93.6% GPQA Diamond.
Qwen 3.7-Max — 92.4% GPQA Diamond.
Claude Opus 4.6 — 91.3% GPQA Diamond.

**Humanity’s Last Exam(HLE)**はさらに難易度が高く、フロンティアモデルでも回答できる質問は55%未満です。Claude Opus 4.6が53.0%でトップです。

最適なオープンウェイトAIモデル(2026)

自己ホスティング、データプライバシー、またはAPIコスト回避のために、これらのオープンウェイトモデルはフロンティアに近い性能を提供します:

DeepSeek V4-Pro.
MiniMax M3.
Nemotron 3 Ultra.
Mistral Large 3.
Llama 4 Maverick.

2026年にAIモデルを実際に差別化するベンチマークとは?

多くの古典的なベンチマークは現在飽和状態にあり、ほぼすべてのフロンティアモデルが85〜95%のスコアを記録しているため、差異はノイズの範囲内です:

フロンティア比較には避けるべき代わりに使用すべき
MMLUベースMMLU-Pro
HumanEvalSWE-bench Verified / LiveCodeBench
GSM8K、HellaSwag、ARC-ChallengeGPQA Diamond、MATH-500
汎用チャット勝利率AAインテリジェンス指数(独立)

上のリーダーボードは、11のベンチマークのいずれでも並べ替え可能です。ベンチマークカードをクリックすると、その指標ですべてのモデルがランク付けされます。

FlowHuntで利用可能なAIモデル

FlowHuntで利用可能と表示されているモデルは、FlowHunt AIエージェントフロー、およびFlowHuntデスクトップアプリで直接使用できます。これには、GPT-5シリーズ全体、Claude 4.xシリーズ、DeepSeek V4、Qwen 3.7、Llama 4ファミリーが含まれます。各モデルのページで、ベンチマークの内訳、コンテキストウィンドウ、推奨ユースケースをご確認ください。

よくある質問

詳しく見る

GPT-5.5 — ベンチマーク、機能、活用事例
GPT-5.5 — ベンチマーク、機能、活用事例

GPT-5.5 — ベンチマーク、機能、活用事例

GPT-5.5はOpenAIが開発したプロプライエタリなAIモデルで、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...

2 分で読める
Claude Opus 4.6 — ベンチマーク、機能、およびユースケース
Claude Opus 4.6 — ベンチマーク、機能、およびユースケース

Claude Opus 4.6 — ベンチマーク、機能、およびユースケース

Claude Opus 4.6は、Anthropicが開発したプロプライエタリAIモデルで、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...

2 分で読める
Claude Opus 4.7 — ベンチマーク、機能、ユースケース
Claude Opus 4.7 — ベンチマーク、機能、ユースケース

Claude Opus 4.7 — ベンチマーク、機能、ユースケース

Claude Opus 4.7はAnthropicが開発したプロプライエタリAIモデルで、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。ベンチマークスコア、強み、推奨ユースケースをご覧ください。...

2 分で読める