Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max je špičkový frontier AI model vyvinutý společností Alibaba, vydaný v květnu 2026. Jedná se o proprietární model s uzavřenými váhami, dostupný přes API Alibaba. Kontextové okno o velikosti 1M tokenů je dostatečně velké pro celé kódové základny, rozsáhlé technické dokumenty nebo dlouhé agentní relace bez nutnosti zkracování.

Na FlowHunt AI Leaderboard je jedním z 24 sledovaných modelů, hodnocených napříč 8 benchmarky. Výrazná skóre: 89,6 % na MMLU-Pro (#1 z 8); 91,6 % na LiveCodeBench (#2 z 5); 41,4 % na HLE (#2 ze 6).

Qwen 3.7-Max byl vydán 20. května 2026 jako nejlepší model v generaci Alibaba Qwen 3, přičemž přinesl to, co Alibaba nazvala „režim přemýšlení“ — rozšířenou schopnost řetězového uvažování (chain-of-thought), kterou lze přepínat pro jednotlivé dotazy. V režimu přemýšlení model provede vnitřní rozvahu před tím, než vydá konečnou odpověď, což výrazně zlepšuje výkon u úloh vyžadujících vícestupňové uvažování. Při uvedení dosáhl Qwen 3.7-Max skóre 92,4 % na GPQA Diamond (třetí na světě), 91,6 % na LiveCodeBench a 60,6 % na SWE-bench Pro — nejvyšší skóre mezi modely s otevřeným API na tomto benchmarku. V kombinaci s 1M kontextovým oknem a konkurenceschopnými cenami API se etabloval jako primární alternativa na úrovni Frontier pro nákladově citlivé podnikové týmy.

Poznámka: GPQA Diamond lídr (92,4 %). SWE-Pro lídr (60,6 %). AA Index 56,6.

Vydáno
Květen 2026
Kontext
1M tokenů
Váhy
Uzavřené
Úroveň
Frontier
Poskytovatel
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Group je jedním z největších a nejrozmanitějších technologických konglomerátů v Číně, založený v roce 1999 Jackem Ma a sídlící v Chang-čou. Prostřednictvím své akademie DAMO a laboratoře Tongyi se Alibaba stala významnou silou ve vývoji velkých jazykových modelů s rodinou Qwen (Tongyi Qianwen). Generace Qwen 3.7, vydaná v polovině roku 2026, znamenala přechod Alibaba z domácího nasazení na mezinárodní benchmarkovou konkurenceschopnost – Qwen 3.7‑Max dosáhl 92,4 % na GPQA Diamond a 91,6 % na LiveCodeBench. AI strategii Alibaba definuje uvolňování modelů s otevřenými váhami jako protiváha k americkým modelům pouze s API, integrace generativní AI napříč jejími cloudovými a e‑commerce službami a masivní investice do AI infrastruktury v rámci divize Alibaba Cloud.

Případy použití

K čemu Qwen 3.7-Max používat

Softwarové inženýrství
Vědecké a technické uvažování
Agentní automatizace CLI
Analýza dlouhých dokumentů a kódových základen
Soutěžní programování

Strengths & Limitations

Strengths

  • Silné softwarové inženýrství — 80 % SWE-bench Verified
  • Vědecké uvažování na úrovni postgraduálního studia — 92 % GPQA Diamond
  • Soutěžní programování — 91 % LiveCodeBench
  • Kompozitní inteligence — 56 b. AA Intelligence Index (nezávislý)
  • Velmi dlouhé dokumenty a rozsáhlé kódové základny (1M kontext)

Limitations

  • Uzavřené váhy — nelze hostovat ani dolaďovat na soukromých datech

Prohlédněte si celý AI Model Leaderboard

Často kladené otázky

Zjistit více

Qwen 3.7-Plus — benchmarky, schopnosti a případy použití
Qwen 3.7-Plus — benchmarky, schopnosti a případy použití

Qwen 3.7-Plus — benchmarky, schopnosti a případy použití

Qwen 3.7-Plus je proprietární model umělé inteligence od společnosti Alibaba, klasifikovaný jako pokročilá úroveň s kontextovým oknem 1 milion tokenů. Je dostup...

3 min čtení
MiniMax M3 — benchmarky, schopnosti a případy použití
MiniMax M3 — benchmarky, schopnosti a případy použití

MiniMax M3 — benchmarky, schopnosti a případy použití

MiniMax M3 je open-weight model AI od společnosti MiniMax (MoE (nezveřejněno)), klasifikovaný jako Frontier s kontextovým oknem 1M tokenů. Je k dispozici přímo ...

4 min čtení
Nemotron 3 Ultra — Benchmarky, schopnosti a případy použití
Nemotron 3 Ultra — Benchmarky, schopnosti a případy použití

Nemotron 3 Ultra — Benchmarky, schopnosti a případy použití

Nemotron 3 Ultra je otevřený model AI od NVIDIA (55B/550B MoE), klasifikovaný jako Frontier s kontextovým oknem 262 000 tokenů. Je k dispozici přímo v FlowHunt....

4 min čtení