Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Maxは、Alibabaが開発し2026年5月にリリースされたトップティアのフロンティアAIモデルです。これはプロプライエタリなクローズドウェイトモデルであり、Alibaba APIを通じて利用可能です。100万トークンのコンテキストウィンドウは、コードベース全体、長大な技術文書、または拡張されたエージェントセッションを切り詰めることなく保持できる十分な大きさです。

FlowHunt AIリーダーボードでは、8つのベンチマークで評価された24の追跡モデルの1つです。注目スコア:MMLU-Proで89.6%(8モデル中1位)、LiveCodeBenchで91.6%(5モデル中2位)、HLEで41.4%(6モデル中2位)。

Qwen 3.7-Maxは2026年5月20日に、AlibabaのQwen 3世代のトップモデルとしてリリースされ、Alibabaが「思考モード」と呼ぶ機能 — クエリごとに切り替え可能な拡張連鎖思考(chain-of-thought)推論能力 — を導入しました。思考モードでは、モデルは最終回答を生成する前に内部検討ステップを実行し、多段階推論タスクのパフォーマンスを大幅に向上させます。ローンチ時点で、Qwen 3.7-MaxはGPQA Diamondで92.4%(世界第3位)、LiveCodeBenchで91.6%、SWE-bench Proで60.6%を記録し、同ベンチマークで最高のオープンAPIスコアを達成しました。100万のコンテキストウィンドウと競争力のあるAPI価格設定を組み合わせ、コスト意識の高いエンタープライズチームにとって主要なフロンティア層の代替手段として確立されました。

注記:GPQA Diamondリーダー(92.4%)。SWE-Proリーダー(60.6%)。AA Index 56.6。

リリース日
2026年5月
コンテキスト
100万トークン
重み
クローズド
ティア
フロンティア
プロバイダー
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Groupは、1999年にJack Ma氏によって設立され、本社を杭州に置く中国最大かつ最も多様なテクノロジーコングロマリットの一つです。AlibabaはDAMOアカデミーおよびTongyi Labを通じて、Qwen(通義千問)ファミリーを擁する大規模言語モデル開発の主要勢力となっています。2026年半ばにリリースされたQwen 3.7世代は、Alibabaの国内導入から国際ベンチマークでの競争力への移行を示し、Qwen 3.7-MaxはGPQA Diamondで92.4%、LiveCodeBenchで91.6%を記録しました。AlibabaのAI戦略は、米国のAPI専用モデルへの対抗手段としてのオープンウェイト公開、クラウドおよびEコマース事業全体への生成AIの統合、そしてAlibaba Cloud部門全体へのAIインフラへの巨額投資によって定義されています。

ユースケース

Qwen 3.7-Maxの活用シーン

ソフトウェアエンジニアリング
科学・技術的推論
エージェント的CLI自動化
長文書・コードベース分析
競技プログラミング

Strengths & Limitations

Strengths

  • 強力なソフトウェアエンジニアリング — SWE-bench Verified 80%
  • 大学院レベルの科学推論 — GPQA Diamond 92%
  • 競技プログラミング — LiveCodeBench 91%
  • 複合知能 — AA Intelligence Index 56 pts(独立評価)
  • 非常に長い文書と大規模コードベース(100万コンテキスト)

Limitations

  • クローズドウェイト — セルフホスティングやプライベートデータでのファインチューニングは不可

AIモデルリーダーボードのすべてを見る

よくある質問

詳しく見る

Qwen 3.7-Plus — ベンチマーク、機能、ユースケース
Qwen 3.7-Plus — ベンチマーク、機能、ユースケース

Qwen 3.7-Plus — ベンチマーク、機能、ユースケース

Qwen 3.7-Plusは、Alibabaが開発したプロプライエタリなAIモデルで、Advanced層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨されるユースケースをご確認ください。...

1 分で読める
MiniMax M3 — ベンチマーク、機能、ユースケース
MiniMax M3 — ベンチマーク、機能、ユースケース

MiniMax M3 — ベンチマーク、機能、ユースケース

MiniMax M3は、MiniMaxが開発したオープンウェイトのAIモデル(MoE(非公開))で、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご紹介します。...

1 分で読める
Qwen3-Max、OpenAIの再編、Claudeのアップデート
Qwen3-Max、OpenAIの再編、Claudeのアップデート

Qwen3-Max、OpenAIの再編、Claudeのアップデート

アリババのQwen3-Max、OpenAIの営利化問題、新たな画像生成モデル、そして競争がAI業界をどう変革しているかを詳しく解説します。...

1 分で読める
AI Machine Learning +3