
Qwen 3.7-Plus — Benchmarks, capacités et cas d'utilisation
Qwen 3.7-Plus est un modèle d'IA propriétaire d'Alibaba, classé au niveau Avancé avec une fenêtre de contexte de 1 million de tokens. Il est disponible directem...
Qwen 3.7-Max est un modèle d’IA frontalier de premier plan, développé par Alibaba et publié en mai 2026. Il s’agit d’un modèle propriétaire à poids fermés, disponible via l’API Alibaba. La fenêtre de contexte de 1 million de tokens est suffisamment grande pour contenir des bases de code entières, de longs documents techniques ou des sessions agentiques étendues sans troncature.
Sur le FlowHunt AI Leaderboard, il fait partie des 24 modèles suivis, évalués sur 8 benchmarks. Scores remarquables : 89,6 % sur MMLU-Pro (#1 sur 8) ; 91,6 % sur LiveCodeBench (#2 sur 5) ; 41,4 % sur HLE (#2 sur 6).
Qwen 3.7-Max a été publié le 20 mai 2026 en tant que modèle phare de la génération Qwen 3 d’Alibaba, introduisant ce qu’Alibaba a appelé un « mode de réflexion » — une capacité de raisonnement par chaîne de pensée étendue pouvant être activée par requête. En mode réflexion, le modèle effectue une étape de délibération interne avant de produire sa réponse finale, améliorant considérablement les performances sur les tâches de raisonnement en plusieurs étapes. Lors de son lancement, Qwen 3.7-Max a obtenu 92,4 % sur GPQA Diamond (troisième mondial), 91,6 % sur LiveCodeBench et 60,6 % sur SWE-bench Pro — le meilleur score open-API sur ce benchmark. Combiné à une fenêtre de contexte de 1 million de tokens et à une tarification API compétitive, il s’est imposé comme la principale alternative de niveau Frontier pour les équipes d’entreprise soucieuses de leur budget.
Note : Leader GPQA Diamond (92,4 %). Leader SWE-Pro (60,6 %). AA Index 56,6.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
Alibaba Group est l'un des plus grands et des plus diversifiés conglomérats technologiques de Chine, fondé en 1999 par Jack Ma et dont le siège est à Hangzhou. À travers sa DAMO Academy et son Tongyi Lab, Alibaba est devenu une force majeure dans le développement de grands modèles de langage avec la famille Qwen (Tongyi Qianwen). La génération Qwen 3.7, publiée à la mi-2026, a marqué la transition d'Alibaba des déploiements nationaux à la compétitivité sur les références internationales, avec Qwen 3.7-Max obtenant 92,4 % sur GPQA Diamond et 91,6 % sur LiveCodeBench. La stratégie IA d'Alibaba est définie par des publications à poids ouverts comme contrepoids aux modèles américains exclusivement via API, l'intégration de l'IA générative dans ses activités cloud et de commerce électronique, et un investissement massif dans les infrastructures d'IA au sein de sa division Alibaba Cloud.
Cas d'Usage
Qwen 3.7-Max obtient un score de 80 % sur SWE-bench Verified — classé #7 sur 13 modèles suivis ici. Il résout de véritables problèmes GitHub, écrit du code de qualité production dans plusieurs langages et gère des workflows de codage agentiques en plusieurs étapes — un choix solide pour les équipes de développement logiciel assisté par IA.
Avec 92 % sur GPQA Diamond (#4 sur 14 modèles), Qwen 3.7-Max dépasse le seuil de référence humain d'environ 65 % pour les doctorants sur des questions de biologie, chimie et physique de niveau graduate. Utilisez-le pour la synthèse de littérature scientifique, l'évaluation d'hypothèses, les Q&R médicales et juridiques, et les tâches de recherche pluridisciplinaires où une connaissance approfondie du domaine est essentielle.
Qwen 3.7-Max atteint 69 % sur Terminal-Bench (#3 sur 8 modèles), ce qui le rend compétent pour les scripts shell courants, les workflows en ligne de commande et les tâches légères d'administration système dans des pipelines agentiques.
Avec une fenêtre de contexte de 1 million de tokens, Qwen 3.7-Max peut ingérer des dépôts logiciels entiers, de longs contrats juridiques, des rapports de recherche de la longueur d'un livre ou de vastes historiques de conversation en une seule requête — permettant une Q&R approfondie sur les documents, un raisonnement inter-fichiers sur les bases de code et une synthèse étendue sans heuristiques de découpage ni pipelines RAG.
Qwen 3.7-Max obtient 91 % sur LiveCodeBench (#2 sur 5 modèles), un benchmark résistant à la contamination, continuellement actualisé avec de nouveaux problèmes de programmation compétitive. À ce niveau, il traite des structures de données avancées, des algorithmes de graphe et des défis de niveau entretien avec une grande fiabilité.
Plus à Comparer
Comparez les 24 modèles sur 11 benchmarks — triable, sourcé et mis à jour en juin 2026.

Qwen 3.7-Plus est un modèle d'IA propriétaire d'Alibaba, classé au niveau Avancé avec une fenêtre de contexte de 1 million de tokens. Il est disponible directem...

MiniMax M3 est un modèle d'IA à poids ouverts de MiniMax (MoE (non divulgué)), classé dans la catégorie Frontier avec une fenêtre de contexte de 1 million de to...

Nemotron 3 Ultra est un modèle d'IA open-weight de NVIDIA (55B/550B MoE), classé au niveau Frontier avec une fenêtre de contexte de 262 000 tokens. Il est dispo...
Consentement aux Cookies
Nous utilisons des cookies pour améliorer votre expérience de navigation et analyser notre trafic. See our privacy policy.