Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max is een top-tier frontier AI-model, ontwikkeld door Alibaba en uitgebracht in mei 2026. Het is een propriëtair closed-weight-model, beschikbaar via de Alibaba API. Het contextvenster van 1M tokens is groot genoeg om volledige codebases, omvangrijke technische documenten of uitgebreide agentische sessies zonder afkapping te verwerken.

Op de FlowHunt AI Leaderboard is het een van de 24 bijgehouden modellen, geëvalueerd op 8 benchmarks. Opvallende scores: 89,6% op MMLU-Pro (#1 van 8); 91,6% op LiveCodeBench (#2 van 5); 41,4% op HLE (#2 van 6).

Qwen 3.7-Max werd uitgebracht op 20 mei 2026 als het topmodel in Alibaba’s Qwen 3-generatie. Het introduceerde wat Alibaba een ‘denkmodus’ noemde — een uitgebreide chain-of-thought-redeneringscapaciteit die per query kan worden in- of uitgeschakeld. In de denkmodus voert het model een interne afweging uit voordat het zijn definitieve antwoord produceert, wat de prestaties op meerstapsredeneringstaken aanzienlijk verbetert. Bij de lancering scoorde Qwen 3.7-Max 92,4% op GPQA Diamond (derde wereldwijd), 91,6% op LiveCodeBench en 60,6% op SWE-bench Pro — de hoogste open-API-score op die benchmark. In combinatie met een contextvenster van 1M tokens en concurrerende API-prijzen vestigde het zich als het belangrijkste Frontier-tier-alternatief voor kostenbewuste bedrijfsteams.

Let op: GPQA Diamond-leider (92,4%). SWE-Pro-leider (60,6%). AA Index 56,6.

Uitgebracht
Mei 2026
Context
1M tokens
Gewichten
Gesloten
Tier
Frontier
Aanbieder
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Group is een van de grootste en meest diverse technologieconglomeraten van China, opgericht in 1999 door Jack Ma en gevestigd in Hangzhou. Via haar DAMO Academy en Tongyi Lab is Alibaba een belangrijke kracht geworden in de ontwikkeling van grote taalmodellen met de Qwen (Tongyi Qianwen)-familie. De Qwen 3.7-generatie, uitgebracht medio 2026, markeerde de overgang van Alibaba van binnenlandse implementaties naar internationale benchmarkconcurrentie, waarbij Qwen 3.7-Max 92,4% scoorde op GPQA Diamond en 91,6% op LiveCodeBench. De AI-strategie van Alibaba wordt gekenmerkt door open-gewicht releases als tegenwicht voor Amerikaanse API-only modellen, integratie van generatieve AI in haar cloud- en e-commerce-activiteiten, en zware investeringen in AI-infrastructuur binnen haar Alibaba Cloud-divisie.

Gebruiksscenario's

Waar Qwen 3.7-Max voor gebruiken

Software-engineering
Wetenschappelijk & Technisch Redeneren
Agentische CLI-automatisering
Lange Documenten & Codebase-analyse
Competitief Programmeren

Strengths & Limitations

Strengths

  • Sterk in software-engineering — 80% SWE-bench Verified
  • Wetenschappelijk redeneren op masterniveau — 92% GPQA Diamond
  • Competitief programmeren — 91% LiveCodeBench
  • Samengestelde intelligentie — 56 punten AA Intelligence Index (onafhankelijk)
  • Zeer lange documenten en grote codebases (1M context)

Limitations

  • Gesloten gewichten — kan niet zelf worden gehost of worden verfijnd op privégegevens

Bekijk het volledige AI-model Leaderboard

Veelgestelde vragen

Meer informatie

MiniMax M3 — Benchmarks, Capabilities en Gebruiksscenario's
MiniMax M3 — Benchmarks, Capabilities en Gebruiksscenario's

MiniMax M3 — Benchmarks, Capabilities en Gebruiksscenario's

MiniMax M3 is een open-weight AI-model van MiniMax (MoE (niet bekendgemaakt)), geclassificeerd als Frontier-tier met een contextvenster van 1M tokens. Het is di...

4 min lezen
Qwen3-Max, OpenAI-herstructurering, Claude-updates
Qwen3-Max, OpenAI-herstructurering, Claude-updates

Qwen3-Max, OpenAI-herstructurering, Claude-updates

Ontdek de nieuwste AI-ontwikkelingen zoals Alibaba's Qwen3-Max, de uitdagingen bij de for-profit-conversie van OpenAI, nieuwe imagemodellen en hoe concurrentie ...

17 min lezen
AI Machine Learning +3