
Qwen 3.7-Plus — Benchmarks, Mogelijkheden en Gebruiksscenario's
Qwen 3.7-Plus is een eigen AI-model van Alibaba, geclassificeerd als Advanced-tier met een contextvenster van 1M tokens. Het is direct beschikbaar in FlowHunt. ...
Qwen 3.7-Max is een top-tier frontier AI-model, ontwikkeld door Alibaba en uitgebracht in mei 2026. Het is een propriëtair closed-weight-model, beschikbaar via de Alibaba API. Het contextvenster van 1M tokens is groot genoeg om volledige codebases, omvangrijke technische documenten of uitgebreide agentische sessies zonder afkapping te verwerken.
Op de FlowHunt AI Leaderboard is het een van de 24 bijgehouden modellen, geëvalueerd op 8 benchmarks. Opvallende scores: 89,6% op MMLU-Pro (#1 van 8); 91,6% op LiveCodeBench (#2 van 5); 41,4% op HLE (#2 van 6).
Qwen 3.7-Max werd uitgebracht op 20 mei 2026 als het topmodel in Alibaba’s Qwen 3-generatie. Het introduceerde wat Alibaba een ‘denkmodus’ noemde — een uitgebreide chain-of-thought-redeneringscapaciteit die per query kan worden in- of uitgeschakeld. In de denkmodus voert het model een interne afweging uit voordat het zijn definitieve antwoord produceert, wat de prestaties op meerstapsredeneringstaken aanzienlijk verbetert. Bij de lancering scoorde Qwen 3.7-Max 92,4% op GPQA Diamond (derde wereldwijd), 91,6% op LiveCodeBench en 60,6% op SWE-bench Pro — de hoogste open-API-score op die benchmark. In combinatie met een contextvenster van 1M tokens en concurrerende API-prijzen vestigde het zich als het belangrijkste Frontier-tier-alternatief voor kostenbewuste bedrijfsteams.
Let op: GPQA Diamond-leider (92,4%). SWE-Pro-leider (60,6%). AA Index 56,6.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
Alibaba Group is een van de grootste en meest diverse technologieconglomeraten van China, opgericht in 1999 door Jack Ma en gevestigd in Hangzhou. Via haar DAMO Academy en Tongyi Lab is Alibaba een belangrijke kracht geworden in de ontwikkeling van grote taalmodellen met de Qwen (Tongyi Qianwen)-familie. De Qwen 3.7-generatie, uitgebracht medio 2026, markeerde de overgang van Alibaba van binnenlandse implementaties naar internationale benchmarkconcurrentie, waarbij Qwen 3.7-Max 92,4% scoorde op GPQA Diamond en 91,6% op LiveCodeBench. De AI-strategie van Alibaba wordt gekenmerkt door open-gewicht releases als tegenwicht voor Amerikaanse API-only modellen, integratie van generatieve AI in haar cloud- en e-commerce-activiteiten, en zware investeringen in AI-infrastructuur binnen haar Alibaba Cloud-divisie.
Gebruiksscenario's
Qwen 3.7-Max scoort 80% op SWE-bench Verified — gerangschikt op #7 van 13 hier bijgehouden modellen. Het lost echte GitHub-problemen op, schrijft productiekwaliteitcode in meerdere talen en verwerkt meerstaps agentische codeworkflows — een sterke keuze voor AI-ondersteunde softwareontwikkelingsteams.
Met 92% op GPQA Diamond (#4 van 14 modellen) overtreft Qwen 3.7-Max de ~65% menselijke PhD-expertbaseline op vraagstukken op masterniveau in biologie, scheikunde en natuurkunde. Gebruik het voor het synthetiseren van wetenschappelijke literatuur, het evalueren van hypothesen, medische en juridische Q&A, en onderzoeksvragen op meerdere disciplines waar diepgaande domeinkennis van belang is.
Qwen 3.7-Max behaalt 69% op Terminal-Bench (#3 van 8 modellen), wat het geschikt maakt voor algemene shell-scripting, command-line-workflows en lichte systeembeheertaken binnen agentische pijplijnen.
Met een contextvenster van 1M tokens kan Qwen 3.7-Max volledige softwarerepository's, lange juridische contracten, boeklange onderzoeksrapporten of uitgebreide gespreksgeschiedenissen in één enkele prompt verwerken — wat diepgaande document-Q&A, cross-bestand codebase-redenering en uitgebreide analyses mogelijk maakt zonder chunking-heuristieken of RAG-pijplijnen.
Qwen 3.7-Max scoort 91% op LiveCodeBench (#2 van 5 modellen), een contaminatiebestendige benchmark die continu wordt ververst met nieuwe competitieve programmeerproblemen. Op dit niveau verwerkt het geavanceerde datastructuren, graafalgoritmen en uitdagingen op sollicitatieniveau met hoge betrouwbaarheid.
Meer om te vergelijken
Vergelijk alle 24 modellen op 11 benchmarks — sorteerbaar, met bronvermelding en bijgewerkt juni 2026.

Qwen 3.7-Plus is een eigen AI-model van Alibaba, geclassificeerd als Advanced-tier met een contextvenster van 1M tokens. Het is direct beschikbaar in FlowHunt. ...

MiniMax M3 is een open-weight AI-model van MiniMax (MoE (niet bekendgemaakt)), geclassificeerd als Frontier-tier met een contextvenster van 1M tokens. Het is di...

Ontdek de nieuwste AI-ontwikkelingen zoals Alibaba's Qwen3-Max, de uitdagingen bij de for-profit-conversie van OpenAI, nieuwe imagemodellen en hoe concurrentie ...
Cookie Toestemming
We gebruiken cookies om uw browse-ervaring te verbeteren en ons verkeer te analyseren. See our privacy policy.