
Qwen 3.7-Plus — ベンチマーク、機能、ユースケース
Qwen 3.7-Plusは、Alibabaが開発したプロプライエタリなAIモデルで、Advanced層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨されるユースケースをご確認ください。...
Qwen 3.7-Maxは、Alibabaが開発し2026年5月にリリースされたトップティアのフロンティアAIモデルです。これはプロプライエタリなクローズドウェイトモデルであり、Alibaba APIを通じて利用可能です。100万トークンのコンテキストウィンドウは、コードベース全体、長大な技術文書、または拡張されたエージェントセッションを切り詰めることなく保持できる十分な大きさです。
FlowHunt AIリーダーボードでは、8つのベンチマークで評価された24の追跡モデルの1つです。注目スコア:MMLU-Proで89.6%(8モデル中1位)、LiveCodeBenchで91.6%(5モデル中2位)、HLEで41.4%(6モデル中2位)。
Qwen 3.7-Maxは2026年5月20日に、AlibabaのQwen 3世代のトップモデルとしてリリースされ、Alibabaが「思考モード」と呼ぶ機能 — クエリごとに切り替え可能な拡張連鎖思考(chain-of-thought)推論能力 — を導入しました。思考モードでは、モデルは最終回答を生成する前に内部検討ステップを実行し、多段階推論タスクのパフォーマンスを大幅に向上させます。ローンチ時点で、Qwen 3.7-MaxはGPQA Diamondで92.4%(世界第3位)、LiveCodeBenchで91.6%、SWE-bench Proで60.6%を記録し、同ベンチマークで最高のオープンAPIスコアを達成しました。100万のコンテキストウィンドウと競争力のあるAPI価格設定を組み合わせ、コスト意識の高いエンタープライズチームにとって主要なフロンティア層の代替手段として確立されました。
注記:GPQA Diamondリーダー(92.4%)。SWE-Proリーダー(60.6%)。AA Index 56.6。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
Alibaba Groupは、1999年にJack Ma氏によって設立され、本社を杭州に置く中国最大かつ最も多様なテクノロジーコングロマリットの一つです。AlibabaはDAMOアカデミーおよびTongyi Labを通じて、Qwen(通義千問)ファミリーを擁する大規模言語モデル開発の主要勢力となっています。2026年半ばにリリースされたQwen 3.7世代は、Alibabaの国内導入から国際ベンチマークでの競争力への移行を示し、Qwen 3.7-MaxはGPQA Diamondで92.4%、LiveCodeBenchで91.6%を記録しました。AlibabaのAI戦略は、米国のAPI専用モデルへの対抗手段としてのオープンウェイト公開、クラウドおよびEコマース事業全体への生成AIの統合、そしてAlibaba Cloud部門全体へのAIインフラへの巨額投資によって定義されています。
ユースケース
Qwen 3.7-MaxはSWE-bench Verifiedで80%を記録 — ここで追跡されている13モデル中7位。実際のGitHub issueを解決し、複数言語にわたるプロダクション品質のコードを記述し、多段階のエージェント的コーディングワークフローを処理します — AI支援によるソフトウェア開発チームにとって強力な選択肢です。
GPQA Diamondで92%(14モデル中4位)を記録したQwen 3.7-Maxは、大学院レベルの生物学、化学、物理学の質問において、人間の博士号専門家ベースライン(約65%)を上回ります。科学的文献の統合、仮説評価、医療・法律Q&A、深いドメイン知識が求められる多分野の研究タスクに活用できます。
Qwen 3.7-MaxはTerminal-Benchで69%(8モデル中3位)を達成し、一般的なシェルスクリプト、コマンドラインワークフロー、エージェントパイプライン内の軽量システム管理タスクに適しています。
100万トークンのコンテキストウィンドウにより、Qwen 3.7-Maxはソフトウェアリポジトリ全体、長期契約書、書籍規模の調査レポート、広範な会話履歴を単一のプロンプトで取り込むことができます — チャンク分割ヒューリスティックやRAGパイプラインなしで、深い文書Q&A、ファイル横断的なコードベース推論、包括的な要約を実現します。
Qwen 3.7-MaxはLiveCodeBenchで91%(5モデル中2位)を記録。これは新しい競技プログラミング問題で継続的に更新される、汚染耐性のあるベンチマークです。このレベルでは、高度なデータ構造、グラフアルゴリズム、面接レベルの課題を高い信頼性で処理します。
さらに比較

Qwen 3.7-Plusは、Alibabaが開発したプロプライエタリなAIモデルで、Advanced層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨されるユースケースをご確認ください。...

MiniMax M3は、MiniMaxが開発したオープンウェイトのAIモデル(MoE(非公開))で、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご紹介します。...

アリババのQwen3-Max、OpenAIの営利化問題、新たな画像生成モデル、そして競争がAI業界をどう変革しているかを詳しく解説します。...