Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max ist ein erstklassiges Frontier-KI-Modell, entwickelt von Alibaba und veröffentlicht im Mai 2026. Es ist ein proprietäres Closed-Weight-Modell, verfügbar über die Alibaba-API. Das Kontextfenster von 1 Mio. Tokens ist groß genug, um vollständige Codebasen, umfangreiche technische Dokumente oder ausgedehnte Agentensitzungen ohne Kürzung zu verarbeiten.

Im FlowHunt KI-Ranking ist es eines von 24 verfolgten Modellen, evaluiert in 8 Benchmarks. Herausragende Ergebnisse: 89,6 % auf MMLU-Pro (#1 von 8); 91,6 % auf LiveCodeBench (#2 von 5); 41,4 % auf HLE (#2 von 6).

Qwen 3.7-Max wurde am 20. Mai 2026 als Spitzenmodell der Qwen-3-Generation von Alibaba veröffentlicht und führte das von Alibaba sogenannte „Thinking Mode“ ein — eine erweiterte Chain-of-Thought-Argumentationsfähigkeit, die pro Abfrage ein- und ausgeschaltet werden kann. Im Thinking-Mode führt das Modell einen internen Abwägungsschritt durch, bevor es seine endgültige Antwort erstellt, was die Leistung bei mehrstufigen Denkaufgaben erheblich verbessert. Zum Start erreichte Qwen 3.7-Max 92,4 % auf GPQA Diamond (weltweit Dritter), 91,6 % auf LiveCodeBench und 60,6 % auf SWE-bench Pro — die höchste Open-API-Punktzahl in diesem Benchmark. Zusammen mit einem 1-Mio.-Token-Kontextfenster und wettbewerbsfähigen API-Preisen hat es sich als wichtigste Frontier-Tier-Alternative für kostenbewusste Unternehmens-Teams etabliert.

Hinweis: GPQA Diamond Spitzenreiter (92,4 %). SWE-Pro Spitzenreiter (60,6 %). AA Index 56,6.

Veröffentlicht
Mai 2026
Kontext
1 Mio. Tokens
Gewichte
Geschlossen
Stufe
Frontier
Anbieter
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Die Alibaba Group ist einer der größten und vielfältigsten Technologiekonzerne Chinas, gegründet 1999 von Jack Ma mit Hauptsitz in Hangzhou. Über ihre DAMO Academy und das Tongyi Lab ist Alibaba mit der Qwen-Familie (Tongyi Qianwen) zu einer treibenden Kraft in der Entwicklung großer Sprachmodelle geworden. Die Generation Qwen 3.7, die Mitte 2026 veröffentlicht wurde, markierte Alibabas Übergang von rein inländischen Einsätzen zur internationalen Wettbewerbsfähigkeit, wobei Qwen 3.7-Max 92,4 % auf GPQA Diamond und 91,6 % auf LiveCodeBench erreichte. Alibabas KI-Strategie ist geprägt von Open-Weight-Veröffentlichungen als Gegengewicht zu reinen US-API-Modellen, der Integration generativer KI in seine Cloud- und E-Commerce-Geschäfte sowie hohen Investitionen in die KI-Infrastruktur innerhalb der Alibaba-Cloud-Sparte.

Anwendungsfälle

Wofür Sie Qwen 3.7-Max einsetzen können

Softwareentwicklung
Wissenschaftliches & technisches Denken
Agentische CLI-Automatisierung
Analyse langer Dokumente & Codebasen
Wettbewerbsprogrammierung

Strengths & Limitations

Strengths

  • Starke Softwareentwicklung — 80 % SWE-bench Verified
  • Wissenschaftliches Denken auf Graduiertenniveau — 92 % GPQA Diamond
  • Wettbewerbsprogrammierung — 91 % LiveCodeBench
  • Verbundintelligenz — 56 Pkt. AA Intelligence Index (unabhängig)
  • Sehr lange Dokumente und große Codebasen (1 Mio. Kontext)

Limitations

  • Geschlossene Gewichte — kann nicht selbst gehostet oder auf privaten Daten feinabgestimmt werden

Das vollständige KI-Modell-Ranking durchsuchen

Häufig gestellte Fragen

Mehr erfahren

Qwen 3.7-Plus — Benchmarks, Fähigkeiten und Anwendungsfälle
Qwen 3.7-Plus — Benchmarks, Fähigkeiten und Anwendungsfälle

Qwen 3.7-Plus — Benchmarks, Fähigkeiten und Anwendungsfälle

Qwen 3.7-Plus ist ein proprietäres KI-Modell von Alibaba, eingestuft in die Kategorie Advanced mit einem Kontextfenster von 1 Mio. Token. Es ist direkt in FlowH...

3 Min. Lesezeit
MiniMax M3 — Benchmarks, Fähigkeiten und Anwendungsfälle
MiniMax M3 — Benchmarks, Fähigkeiten und Anwendungsfälle

MiniMax M3 — Benchmarks, Fähigkeiten und Anwendungsfälle

MiniMax M3 ist ein Open-Weight-KI-Modell von MiniMax (MoE (nicht offengelegt)), das als Frontier-Stufe eingestuft wird und über ein Kontextfenster von 1 Million...

4 Min. Lesezeit