Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max er en topklasses frontier-AI-model udviklet af Alibaba og udgivet i maj 2026. Det er en proprietær lukket-vægt-model, tilgængelig via Alibaba API. Kontekstvinduet på 1M tokens er stort nok til at rumme hele kodebaser, lange tekniske dokumenter eller længere agentiske sessioner uden afkortning.

På FlowHunt AI Leaderboard er den en af 24 sporede modeller, evalueret på tværs af 8 benchmarks. Fremtrædende scores: 89,6% på MMLU-Pro (#1 af 8); 91,6% på LiveCodeBench (#2 af 5); 41,4% på HLE (#2 af 6).

Qwen 3.7-Max blev udgivet den 20. maj 2026 som topmodellen i Alibabas Qwen 3-generation og introducerede det, Alibaba kaldte en “thinking mode” – en udvidet kæde-af-tankegang-resonnering, der kan aktiveres pr. forespørgsel. I thinking mode gennemgår modellen et internt overvejelsestrin, før den producerer sit endelige svar, hvilket forbedrer præstationen betydeligt på flertrins-resonneringsopgaver. Ved lanceringen opnåede Qwen 3.7-Max 92,4% på GPQA Diamond (tredje globalt), 91,6% på LiveCodeBench og 60,6% på SWE-bench Pro – den højeste åbne-API-score på det benchmark. Kombineret med et 1M kontekstvindue og konkurrencedygtig API-prissætning etablerede den sig som det primære Frontier-niveau-alternativ for omkostningsbevidste virksomhedsteams.

Bemærk: GPQA Diamond-leder (92,4%). SWE-Pro-leder (60,6%). AA Index 56,6.

Udgivet
Maj 2026
Kontekst
1M tokens
Vægte
Lukkede
Niveau
Frontier
Udbyder
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Group er en af Kinas største og mest diverse teknologikonglomerater, grundlagt i 1999 af Jack Ma med hovedkvarter i Hangzhou. Gennem sin DAMO Academy og Tongyi Lab er Alibaba blevet en stor kraft inden for udvikling af store sprogmodeller med Qwen-familien (Tongyi Qianwen). Qwen 3.7-generationen, udgivet i midten af 2026, markerede Alibabas overgang fra indenlandske implementeringer til international benchmark-konkurrenceevne, med Qwen 3.7-Max, der opnåede 92,4 % på GPQA Diamond og 91,6 % på LiveCodeBench. Alibabas AI-strategi er defineret af åbne vægtudgivelser som en modvægt til amerikanske API-only-modeller, integration af generativ AI på tværs af dets cloud- og e-handelsforretninger og kraftige investeringer i AI-infrastruktur på tværs af dets Alibaba Cloud-afdeling.

Anvendelsesmuligheder

Hvad du skal bruge Qwen 3.7-Max til

Softwareudvikling
Videnskabelig & teknisk resonnering
Agentisk CLI-automatisering
Analyse af lange dokumenter & kodebaser
Konkurrenceprogrammering

Strengths & Limitations

Strengths

  • Stærk softwareudvikling – 80% SWE-bench Verified
  • Videnskabelig resonnering på kandidatniveau – 92% GPQA Diamond
  • Konkurrenceprogrammering – 91% LiveCodeBench
  • Sammensat intelligens – 56 point AA Intelligence Index (uafhængig)
  • Meget lange dokumenter og store kodebaser (1M kontekst)

Limitations

  • Lukkede vægte – kan ikke selv-hostes eller finjusteres på private data

Se hele AI Model Leaderboard

Ofte stillede spørgsmål

Lær mere

MiniMax M3 — Benchmarks, funktioner og anvendelsesmuligheder
MiniMax M3 — Benchmarks, funktioner og anvendelsesmuligheder

MiniMax M3 — Benchmarks, funktioner og anvendelsesmuligheder

MiniMax M3 er en open-weight AI-model fra MiniMax (MoE (ikke oplyst)), klassificeret som Frontier-niveau med en kontekstvindue på 1M tokens. Den er tilgængelig ...

3 min læsning
Qwen Max
Qwen Max

Qwen Max

Integrer FlowHunt med Qwen Max for at automatisere serverdrift, overvåge systemets sundhed og øge produktiviteten med intelligente, AI-drevne arbejdsgange til s...

3 min læsning
AI Qwen Max +3