
Qwen 3.7-Plus — Benchmarks, Fähigkeiten und Anwendungsfälle
Qwen 3.7-Plus ist ein proprietäres KI-Modell von Alibaba, eingestuft in die Kategorie Advanced mit einem Kontextfenster von 1 Mio. Token. Es ist direkt in FlowH...
Qwen 3.7-Max ist ein erstklassiges Frontier-KI-Modell, entwickelt von Alibaba und veröffentlicht im Mai 2026. Es ist ein proprietäres Closed-Weight-Modell, verfügbar über die Alibaba-API. Das Kontextfenster von 1 Mio. Tokens ist groß genug, um vollständige Codebasen, umfangreiche technische Dokumente oder ausgedehnte Agentensitzungen ohne Kürzung zu verarbeiten.
Im FlowHunt KI-Ranking ist es eines von 24 verfolgten Modellen, evaluiert in 8 Benchmarks. Herausragende Ergebnisse: 89,6 % auf MMLU-Pro (#1 von 8); 91,6 % auf LiveCodeBench (#2 von 5); 41,4 % auf HLE (#2 von 6).
Qwen 3.7-Max wurde am 20. Mai 2026 als Spitzenmodell der Qwen-3-Generation von Alibaba veröffentlicht und führte das von Alibaba sogenannte „Thinking Mode“ ein — eine erweiterte Chain-of-Thought-Argumentationsfähigkeit, die pro Abfrage ein- und ausgeschaltet werden kann. Im Thinking-Mode führt das Modell einen internen Abwägungsschritt durch, bevor es seine endgültige Antwort erstellt, was die Leistung bei mehrstufigen Denkaufgaben erheblich verbessert. Zum Start erreichte Qwen 3.7-Max 92,4 % auf GPQA Diamond (weltweit Dritter), 91,6 % auf LiveCodeBench und 60,6 % auf SWE-bench Pro — die höchste Open-API-Punktzahl in diesem Benchmark. Zusammen mit einem 1-Mio.-Token-Kontextfenster und wettbewerbsfähigen API-Preisen hat es sich als wichtigste Frontier-Tier-Alternative für kostenbewusste Unternehmens-Teams etabliert.
Hinweis: GPQA Diamond Spitzenreiter (92,4 %). SWE-Pro Spitzenreiter (60,6 %). AA Index 56,6.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
Die Alibaba Group ist einer der größten und vielfältigsten Technologiekonzerne Chinas, gegründet 1999 von Jack Ma mit Hauptsitz in Hangzhou. Über ihre DAMO Academy und das Tongyi Lab ist Alibaba mit der Qwen-Familie (Tongyi Qianwen) zu einer treibenden Kraft in der Entwicklung großer Sprachmodelle geworden. Die Generation Qwen 3.7, die Mitte 2026 veröffentlicht wurde, markierte Alibabas Übergang von rein inländischen Einsätzen zur internationalen Wettbewerbsfähigkeit, wobei Qwen 3.7-Max 92,4 % auf GPQA Diamond und 91,6 % auf LiveCodeBench erreichte. Alibabas KI-Strategie ist geprägt von Open-Weight-Veröffentlichungen als Gegengewicht zu reinen US-API-Modellen, der Integration generativer KI in seine Cloud- und E-Commerce-Geschäfte sowie hohen Investitionen in die KI-Infrastruktur innerhalb der Alibaba-Cloud-Sparte.
Anwendungsfälle
Qwen 3.7-Max erreicht 80 % auf SWE-bench Verified — Rang #7 von 13 hier verfolgten Modellen. Es löst reale GitHub-Issues, schreibt produktionsreifen Code in mehreren Sprachen und bewältigt mehrstufige agentische Codierungs-Workflows — eine starke Wahl für KI-gestützte Softwareentwicklungsteams.
Mit 92 % auf GPQA Diamond (#4 von 14 Modellen) übertrifft Qwen 3.7-Max die Basislinie menschlicher PhD-Experten von ca. 65 % bei Biologie-, Chemie- und Physikfragen auf Graduiertenniveau. Nutzen Sie es für die Synthese wissenschaftlicher Literatur, Hypothesenbewertung, medizinische und juristische Frage-Antwort-Systeme sowie fachübergreifende Forschungsaufgaben, bei denen tiefes Fachwissen gefragt ist.
Qwen 3.7-Max erreicht 69 % auf Terminal-Bench (#3 von 8 Modellen) und ist damit kompetent für gängige Shell-Skripterstellung, Befehlszeilen-Workflows und leichte Systemverwaltungsaufgaben in agentischen Pipelines.
Mit einem Kontextfenster von 1 Mio. Tokens kann Qwen 3.7-Max vollständige Software-Repositories, lange juristische Verträge, buchlange Forschungsberichte oder umfangreiche Gesprächsverläufe in einer einzigen Abfrage aufnehmen — was tiefgehende Dokumenten-Frage-Antwort, codebasenübergreifende Analyse und umfassende Zusammenfassungen ohne Chunking-Heuristiken oder RAG-Pipelines ermöglicht.
Qwen 3.7-Max erreicht 91 % auf LiveCodeBench (#2 von 5 Modellen), einem kontaminationsresistenten Benchmark, der kontinuierlich mit neuen Wettbewerbsprogrammierungsaufgaben aktualisiert wird. Auf diesem Niveau bewältigt es fortgeschrittene Datenstrukturen, Graphenalgorithmen und anspruchsvolle Interviewaufgaben mit hoher Zuverlässigkeit.
Mehr zum Vergleichen
Vergleichen Sie alle 24 Modelle in 11 Benchmarks — sortierbar, bequellt und aktualisiert Juni 2026.

Qwen 3.7-Plus ist ein proprietäres KI-Modell von Alibaba, eingestuft in die Kategorie Advanced mit einem Kontextfenster von 1 Mio. Token. Es ist direkt in FlowH...

MiniMax M3 ist ein Open-Weight-KI-Modell von MiniMax (MoE (nicht offengelegt)), das als Frontier-Stufe eingestuft wird und über ein Kontextfenster von 1 Million...

Nemotron 3 Ultra ist ein Open-Weight-KI-Modell von NVIDIA (55B/550B MoE), das als Frontier-Stufe mit einem Kontextfenster von 262.000 Tokens eingestuft wird. Es...
Cookie-Zustimmung
Wir verwenden Cookies, um Ihr Surferlebnis zu verbessern und unseren Datenverkehr zu analysieren. See our privacy policy.