Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max est un modèle d’IA frontalier de premier plan, développé par Alibaba et publié en mai 2026. Il s’agit d’un modèle propriétaire à poids fermés, disponible via l’API Alibaba. La fenêtre de contexte de 1 million de tokens est suffisamment grande pour contenir des bases de code entières, de longs documents techniques ou des sessions agentiques étendues sans troncature.

Sur le FlowHunt AI Leaderboard, il fait partie des 24 modèles suivis, évalués sur 8 benchmarks. Scores remarquables : 89,6 % sur MMLU-Pro (#1 sur 8) ; 91,6 % sur LiveCodeBench (#2 sur 5) ; 41,4 % sur HLE (#2 sur 6).

Qwen 3.7-Max a été publié le 20 mai 2026 en tant que modèle phare de la génération Qwen 3 d’Alibaba, introduisant ce qu’Alibaba a appelé un « mode de réflexion » — une capacité de raisonnement par chaîne de pensée étendue pouvant être activée par requête. En mode réflexion, le modèle effectue une étape de délibération interne avant de produire sa réponse finale, améliorant considérablement les performances sur les tâches de raisonnement en plusieurs étapes. Lors de son lancement, Qwen 3.7-Max a obtenu 92,4 % sur GPQA Diamond (troisième mondial), 91,6 % sur LiveCodeBench et 60,6 % sur SWE-bench Pro — le meilleur score open-API sur ce benchmark. Combiné à une fenêtre de contexte de 1 million de tokens et à une tarification API compétitive, il s’est imposé comme la principale alternative de niveau Frontier pour les équipes d’entreprise soucieuses de leur budget.

Note : Leader GPQA Diamond (92,4 %). Leader SWE-Pro (60,6 %). AA Index 56,6.

Date de sortie
Mai 2026
Contexte
1M tokens
Poids
Fermés
Niveau
Frontier
Fournisseur
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Group est l'un des plus grands et des plus diversifiés conglomérats technologiques de Chine, fondé en 1999 par Jack Ma et dont le siège est à Hangzhou. À travers sa DAMO Academy et son Tongyi Lab, Alibaba est devenu une force majeure dans le développement de grands modèles de langage avec la famille Qwen (Tongyi Qianwen). La génération Qwen 3.7, publiée à la mi-2026, a marqué la transition d'Alibaba des déploiements nationaux à la compétitivité sur les références internationales, avec Qwen 3.7-Max obtenant 92,4 % sur GPQA Diamond et 91,6 % sur LiveCodeBench. La stratégie IA d'Alibaba est définie par des publications à poids ouverts comme contrepoids aux modèles américains exclusivement via API, l'intégration de l'IA générative dans ses activités cloud et de commerce électronique, et un investissement massif dans les infrastructures d'IA au sein de sa division Alibaba Cloud.

Cas d'Usage

Pour quoi utiliser Qwen 3.7-Max

Génie Logiciel
Raisonnement Scientifique et Technique
Automatisation Agentique en Ligne de Commande
Analyse de Documents Longs et de Bases de Code
Programmation Compétitive

Strengths & Limitations

Strengths

  • Solide en génie logiciel — 80 % SWE-bench Verified
  • Raisonnement scientifique niveau graduate — 92 % GPQA Diamond
  • Programmation compétitive — 91 % LiveCodeBench
  • Intelligence composite — 56 pts AA Intelligence Index (indépendant)
  • Très longs documents et grandes bases de code (1M de contexte)

Limitations

  • Poids fermés — impossible à héberger soi-même ou à affiner sur des données privées

Parcourez le Classement Complet des Modèles d'IA

Questions fréquemment posées

En savoir plus

Qwen 3.7-Plus — Benchmarks, capacités et cas d'utilisation
Qwen 3.7-Plus — Benchmarks, capacités et cas d'utilisation

Qwen 3.7-Plus — Benchmarks, capacités et cas d'utilisation

Qwen 3.7-Plus est un modèle d'IA propriétaire d'Alibaba, classé au niveau Avancé avec une fenêtre de contexte de 1 million de tokens. Il est disponible directem...

4 min de lecture
MiniMax M3 — Benchmarks, capacités et cas d'utilisation
MiniMax M3 — Benchmarks, capacités et cas d'utilisation

MiniMax M3 — Benchmarks, capacités et cas d'utilisation

MiniMax M3 est un modèle d'IA à poids ouverts de MiniMax (MoE (non divulgué)), classé dans la catégorie Frontier avec une fenêtre de contexte de 1 million de to...

4 min de lecture
Nemotron 3 Ultra — Benchmarks, capacités et cas d'utilisation
Nemotron 3 Ultra — Benchmarks, capacités et cas d'utilisation

Nemotron 3 Ultra — Benchmarks, capacités et cas d'utilisation

Nemotron 3 Ultra est un modèle d'IA open-weight de NVIDIA (55B/550B MoE), classé au niveau Frontier avec une fenêtre de contexte de 262 000 tokens. Il est dispo...

4 min de lecture