Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max on huippuluokan Frontier-tekoälymalli, jonka on kehittänyt Alibaba ja joka julkaistiin toukokuussa 2026. Se on suljettu malli, joka on saatavilla Alibaban API:n kautta. 1 miljoonan tokenin konteksti-ikkuna on riittävän suuri käsittelemään kokonaisia koodikantoja, laajoja teknisiä dokumentteja tai pitkiä agenttisessioita ilman katkaisua.

FlowHuntin AI Leaderboardissa se on yksi 24 seuratusta mallista, ja se on arvioitu 8 vertailuarvossa. Huomattavia tuloksia: 89,6 % MMLU-Prossa (#1/8); 91,6 % LiveCodeBenchissa (#2/5); 41,4 % HLE:ssä (#2/6).

Qwen 3.7-Max julkaistiin 20. toukokuuta 2026 Alibaban Qwen 3 -sukupolven huippumallina, ja se toi mukanaan Alibaban kutsuman ‘ajattelutilan’ — laajennetun päättelyketjun, joka voidaan ottaa käyttöön kyselykohtaisesti. Ajattelutilassa malli suorittaa sisäisen harkintavaiheen ennen lopullisen vastauksen tuottamista, mikä parantaa suorituskykyä huomattavasti monivaiheisissa päättelytehtävissä. Julkaisuhetkellä Qwen 3.7-Max saavutti 92,4 % GPQA Diamondissa (kolmanneksi paras maailmassa), 91,6 % LiveCodeBenchissa ja 60,6 % SWE-bench Prossa — korkein avoimen API:n pistemäärä kyseisessä vertailuarvossa. Yhdistettynä 1 miljoonan tokenin konteksti-ikkunaan ja kilpailukykyiseen API-hinnoitteluun se vakiinnutti asemansa ensisijaisena Frontier-tason vaihtoehtona kustannustietoisille yritystiimeille.

Huomio: GPQA Diamond -johtaja (92,4 %). SWE-Pro -johtaja (60,6 %). AA-indeksi 56,6.

Julkaistu
Toukokuu 2026
Konteksti
1M tokenia
Painot
Suljettu
Taso
Frontier
Tarjoaja
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Group on yksi Kiinan suurimmista ja monipuolisimmista teknologiakonserneista, jonka Jack Ma perusti vuonna 1999 ja jonka pääkonttori sijaitsee Hangzhoussa. DAMO Academyn ja Tongyi Labin kautta Alibabasta on tullut merkittävä voima suurten kielimallien kehityksessä Qwen (Tongyi Qianwen) -malliperheen myötä. Vuoden 2026 puolivälissä julkaistu Qwen 3.7 -sukupolvi merkitsi Alibaban siirtymää kotimaisista käyttöönotoista kansainväliseen vertailukelpoisuuteen, ja Qwen 3.7-Max saavutti 92,4 % GPQA Diamondissa ja 91,6 % LiveCodeBenchissa. Alibaban tekoälystrategia määräytyy avointen painojen julkaisujen kautta vastapainona yhdysvaltalaisille API-vain -malleille, generatiivisen tekoälyn integroinnista sen pilvi- ja verkkokauppaliiketoimintoihin sekä mittavista investoinneista tekoälyinfrastruktuuriin Alibaba Cloud -divisioonassaan.

Käyttötapaukset

Mihin Qwen 3.7-Maxia Kannattaa Käyttää

Ohjelmistokehitys
Tieteellinen & Tekninen Päättely
Agenttinen CLI-automaatio
Pitkien Dokumenttien & Koodikantojen Analyysi
Kilpailullinen Ohjelmointi

Strengths & Limitations

Strengths

  • Vahva ohjelmistokehitys — 80 % SWE-bench Verified
  • Tieteellinen päättely tohtoritasolla — 92 % GPQA Diamond
  • Kilpailullinen ohjelmointi — 91 % LiveCodeBench
  • Yhdistetty älykkyys — 56 pistettä AA Intelligence Index (riippumaton)
  • Erittäin pitkät dokumentit ja suuret koodikannat (1M konteksti)

Limitations

  • Suljetut painot — ei voida isännöidä itse tai hienosäätää yksityisellä datalla

Selaa Koko Tekoälymallien Vertailutaulukkoa

Usein kysytyt kysymykset

Lue lisää

MiniMax M3 — Vertailuarvot, Ominaisuudet ja Käyttötapaukset
MiniMax M3 — Vertailuarvot, Ominaisuudet ja Käyttötapaukset

MiniMax M3 — Vertailuarvot, Ominaisuudet ja Käyttötapaukset

MiniMax M3 on avoimen painoarvon tekoälymalli MiniMaxilta (MoE (julkaisematon)), luokiteltuna Frontier-tasolle, 1 miljoonan tokenin konteksti-ikkunalla. Se on s...

3 min lukuaika
Qwen3-Max, OpenAI:n uudelleenjärjestelyt, Claude-päivitykset
Qwen3-Max, OpenAI:n uudelleenjärjestelyt, Claude-päivitykset

Qwen3-Max, OpenAI:n uudelleenjärjestelyt, Claude-päivitykset

Tutustu tekoälyn viimeisimpiin kehitysaskeleisiin, kuten Alibaban Qwen3-Max-malliin, OpenAI:n for-profit-muutoshaasteisiin, uusiin kuvamalleihin sekä siihen, mi...

13 min lukuaika
AI Machine Learning +3