Alibaba-logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max er en topprangert frontier-AI-modell, utviklet av Alibaba og lansert i mai 2026. Det er en proprietær modell med lukkede vekter, tilgjengelig via Alibabas API. Kontekstvinduet på 1M tokens er stort nok til å romme hele kodebaser, lange tekniske dokumenter eller utvidede agentiske økter uten avkorting.

På FlowHunt AI Leaderboard er den en av 24 sporede modeller, evaluert på tvers av 8 referansetester. Fremtredende poengsummer: 89,6 % på MMLU-Pro (#1 av 8); 91,6 % på LiveCodeBench (#2 av 5); 41,4 % på HLE (#2 av 6).

Qwen 3.7-Max ble lansert 20. mai 2026 som toppmodellen i Alibabas Qwen 3-generasjon, og introduserte det Alibaba kalte en «tenkemodus» — en utvidet kjede-av-tankegang-resonneringsevne som kan slås av og på per spørring. I tenkemodus kjører modellen et internt overveielsessteg før den produserer sitt endelige svar, noe som forbedrer ytelsen betydelig på flertrinns resonneringsoppgaver. Ved lansering oppnådde Qwen 3.7-Max 92,4 % på GPQA Diamond (tredje globalt), 91,6 % på LiveCodeBench og 60,6 % på SWE-bench Pro — den høyeste åpne API-poengsummen på den referansetesten. Kombinert med et 1M kontekstvindu og konkurransedyktig API-prising, etablerte den seg som det fremste Frontier-nivå-alternativet for kostnadsbevisste bedriftsteam.

Merk: GPQA Diamond-leder (92,4 %). SWE-Pro-leder (60,6 %). AA-indeks 56,6.

Lansert
Mai 2026
Kontekst
1M tokens
Vekter
Lukkede
Nivå
Frontier
Leverandør
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Group er et av Kinas største og mest mangfoldige teknologikonglomerater, grunnlagt i 1999 av Jack Ma med hovedkontor i Hangzhou. Gjennom DAMO Academy og Tongyi Lab har Alibaba blitt en betydelig kraft innen utvikling av store språkmodeller med Qwen-familien (Tongyi Qianwen). Qwen 3.7-generasjonen, lansert midt i 2026, markerte Alibabas overgang fra innenlandske utrullinger til internasjonal benchmark-konkurranseevne, med Qwen 3.7-Max som oppnådde 92,4 % på GPQA Diamond og 91,6 % på LiveCodeBench. Alibabas KI-strategi er definert av utgivelse av åpne vektmodeller som en motvekt til amerikanske API-only-modeller, integrering av generativ KI på tvers av deres sky- og e-handelsvirksomheter, og tung investering i KI-infrastruktur i Alibaba Cloud-divisjonen.

Bruksområder

Hva du bør bruke Qwen 3.7-Max til

Programvareutvikling
Vitenskapelig & Teknisk Resonnering
Agentisk CLI-automatisering
Langdokument- & Kodebaseanalyse
Konkurranseprogrammering

Strengths & Limitations

Strengths

  • Sterk programvareutvikling — 80 % SWE-bench Verified
  • Avansert vitenskapelig resonnering — 92 % GPQA Diamond
  • Konkurranseprogrammering — 91 % LiveCodeBench
  • Sammensatt intelligens — 56 poeng AA Intelligence Index (uavhengig)
  • Svært lange dokumenter og store kodebaser (1M kontekst)

Limitations

  • Lukkede vekter — kan ikke selvhostes eller finjusteres på private data

Se hele AI-modellrangeringen

Vanlige spørsmål

Lær mer

Qwen 3.7-Plus — Referansetester, Egenskaper og Bruksområder
Qwen 3.7-Plus — Referansetester, Egenskaper og Bruksområder

Qwen 3.7-Plus — Referansetester, Egenskaper og Bruksområder

Qwen 3.7-Plus er en proprietær AI-modell fra Alibaba, klassifisert som Avansert-nivå med et kontekstvindu på 1M tokens. Den er tilgjengelig direkte i FlowHunt. ...

3 min lesing
MiniMax M3 — Referansetester, Egenskaper og Bruksområder
MiniMax M3 — Referansetester, Egenskaper og Bruksområder

MiniMax M3 — Referansetester, Egenskaper og Bruksområder

MiniMax M3 er en åpen-vekt AI-modell fra MiniMax (MoE (ikke offentliggjort)), klassifisert som Frontier-nivå med et kontekstvindu på 1M tokens. Den er tilgjenge...

3 min lesing
Qwen Max
Qwen Max

Qwen Max

Integrer FlowHunt med Qwen Max for å automatisere serveroperasjoner, overvåke systemhelse og øke produktiviteten med intelligente AI-drevne arbeidsflyter for sk...

3 min lesing
AI Qwen Max +3