
Qwen 3.7-Plus — Benchmarks, kapaciteter og anvendelsesmuligheder
Qwen 3.7-Plus er en proprietær AI-model fra Alibaba, klassificeret som Advanced-niveau med en kontekstvindue på 1M tokens. Den er direkte tilgængelig i FlowHunt...
Qwen 3.7-Max er en topklasses frontier-AI-model udviklet af Alibaba og udgivet i maj 2026. Det er en proprietær lukket-vægt-model, tilgængelig via Alibaba API. Kontekstvinduet på 1M tokens er stort nok til at rumme hele kodebaser, lange tekniske dokumenter eller længere agentiske sessioner uden afkortning.
På FlowHunt AI Leaderboard er den en af 24 sporede modeller, evalueret på tværs af 8 benchmarks. Fremtrædende scores: 89,6% på MMLU-Pro (#1 af 8); 91,6% på LiveCodeBench (#2 af 5); 41,4% på HLE (#2 af 6).
Qwen 3.7-Max blev udgivet den 20. maj 2026 som topmodellen i Alibabas Qwen 3-generation og introducerede det, Alibaba kaldte en “thinking mode” – en udvidet kæde-af-tankegang-resonnering, der kan aktiveres pr. forespørgsel. I thinking mode gennemgår modellen et internt overvejelsestrin, før den producerer sit endelige svar, hvilket forbedrer præstationen betydeligt på flertrins-resonneringsopgaver. Ved lanceringen opnåede Qwen 3.7-Max 92,4% på GPQA Diamond (tredje globalt), 91,6% på LiveCodeBench og 60,6% på SWE-bench Pro – den højeste åbne-API-score på det benchmark. Kombineret med et 1M kontekstvindue og konkurrencedygtig API-prissætning etablerede den sig som det primære Frontier-niveau-alternativ for omkostningsbevidste virksomhedsteams.
Bemærk: GPQA Diamond-leder (92,4%). SWE-Pro-leder (60,6%). AA Index 56,6.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
Alibaba Group er en af Kinas største og mest diverse teknologikonglomerater, grundlagt i 1999 af Jack Ma med hovedkvarter i Hangzhou. Gennem sin DAMO Academy og Tongyi Lab er Alibaba blevet en stor kraft inden for udvikling af store sprogmodeller med Qwen-familien (Tongyi Qianwen). Qwen 3.7-generationen, udgivet i midten af 2026, markerede Alibabas overgang fra indenlandske implementeringer til international benchmark-konkurrenceevne, med Qwen 3.7-Max, der opnåede 92,4 % på GPQA Diamond og 91,6 % på LiveCodeBench. Alibabas AI-strategi er defineret af åbne vægtudgivelser som en modvægt til amerikanske API-only-modeller, integration af generativ AI på tværs af dets cloud- og e-handelsforretninger og kraftige investeringer i AI-infrastruktur på tværs af dets Alibaba Cloud-afdeling.
Anvendelsesmuligheder
Qwen 3.7-Max opnår 80% på SWE-bench Verified – rangeret #7 af 13 modeller her. Den løser reelle GitHub-problemer, skriver produktionsklar kode på tværs af flere sprog og håndterer flertrins agentiske kodningsarbejdsgange – et stærkt valg til AI-assisterede softwareudviklingsteams.
Med 92% på GPQA Diamond (#4 af 14 modeller) overgår Qwen 3.7-Max den ~65% humane ph.d.-ekspertbaseline på kandidatniveau inden for biologi, kemi og fysik. Brug den til syntese af videnskabelig litteratur, hypotesevurdering, medicinsk og juridisk Q&A samt flerdisciplinære forskningsopgaver, hvor dyb domæneviden er vigtig.
Qwen 3.7-Max opnår 69% på Terminal-Bench (#3 af 8 modeller), hvilket gør den kompetent til almindelig shell-scripting, kommandolinjearbejdsgange og lette systemadministrationsopgaver i agentiske pipelinger.
Med et kontekstvindue på 1M tokens kan Qwen 3.7-Max indlæse hele softwarearkiver, lange juridiske kontrakter, boglange forskningsrapporter eller omfattende samtalehistorikker i en enkelt prompt – hvilket muliggør dybdegående dokument-Q&A, kodebasetværgående resonnering og omfattende sammenfatning uden chunking-heuristikker eller RAG-pipelinger.
Qwen 3.7-Max opnår 91% på LiveCodeBench (#2 af 5 modeller), en forureningsresistent benchmark, der løbende opdateres med nye konkurrenceprogrammeringsproblemer. På dette niveau håndterer den avancerede datastrukturer, grafalgoritmer og udfordringer på interviewniveau med høj pålidelighed.
Mere at sammenligne
Sammenlign alle 24 modeller på tværs af 11 benchmarks – sorterbare, kildeangivne og opdateret juni 2026.

Qwen 3.7-Plus er en proprietær AI-model fra Alibaba, klassificeret som Advanced-niveau med en kontekstvindue på 1M tokens. Den er direkte tilgængelig i FlowHunt...

MiniMax M3 er en open-weight AI-model fra MiniMax (MoE (ikke oplyst)), klassificeret som Frontier-niveau med en kontekstvindue på 1M tokens. Den er tilgængelig ...

Integrer FlowHunt med Qwen Max for at automatisere serverdrift, overvåge systemets sundhed og øge produktiviteten med intelligente, AI-drevne arbejdsgange til s...
Cookie Samtykke
Vi bruger cookies til at forbedre din browsingoplevelse og analysere vores trafik. See our privacy policy.