Logo Alibaba

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max to najwyższej klasy model AI typu frontier, stworzony przez Alibabę i wydany w maju 2026 roku. Jest to zastrzeżony model o zamkniętych wagach, dostępny przez API Alibaby. Okno kontekstowe o wielkości 1 miliona tokenów jest wystarczająco duże, aby pomieścić całe bazy kodu, obszerne dokumenty techniczne lub rozbudowane sesje agentowe bez obcinania.

Na tablicy liderów AI FlowHunt jest jednym z 24 śledzonych modeli, ocenianych w 8 benchmarkach. Wyróżniające się wyniki: 89,6% w MMLU-Pro (#1 z 8); 91,6% w LiveCodeBench (#2 z 5); 41,4% w HLE (#2 z 6).

Qwen 3.7-Max został wydany 20 maja 2026 roku jako najwyższy model w generacji Qwen 3 Alibaby, wprowadzając to, co Alibaba nazwała „trybem myślenia" — rozszerzoną zdolność wnioskowania z łańcuchem myśli, którą można włączać dla każdego zapytania. W trybie myślenia model przeprowadza wewnętrzny krok deliberacji przed wygenerowaniem ostatecznej odpowiedzi, znacząco poprawiając wydajność w zadaniach wymagających wieloetapowego wnioskowania. W momencie premiery Qwen 3.7-Max uzyskał 92,4% w GPQA Diamond (trzecie miejsce globalnie), 91,6% w LiveCodeBench i 60,6% w SWE-bench Pro — najwyższy wynik wśród modeli z otwartym API w tym benchmarku. W połączeniu z oknem kontekstowym 1M i konkurencyjnymi cenami API, ugruntował swoją pozycję jako główna alternatywa na poziomie Frontier dla świadomych kosztów zespołów enterprise.

Uwaga: Lider GPQA Diamond (92,4%). Lider SWE-Pro (60,6%). AA Index 56,6.

Data wydania
Maj 2026
Kontekst
1M tokenów
Wagi
Zamknięte
Poziom
Frontier
Dostawca
Alibaba

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

Alibaba Group to jeden z największych i najbardziej zróżnicowanych konglomeratów technologicznych w Chinach, założony w 1999 roku przez Jacka Ma z siedzibą w Hangzhou. Dzięki Akademii DAMO i Laboratorium Tongyi Alibaba stał się znaczącą siłą w rozwoju dużych modeli językowych za sprawą rodziny Qwen (Tongyi Qianwen). Generacja Qwen 3.7, wydana w połowie 2026 roku, oznaczała przejście Alibaba od wdrożeń krajowych do międzynarodowej konkurencyjności w benchmarkach – Qwen 3.7-Max osiągnął 92,4% w GPQA Diamond i 91,6% w LiveCodeBench. Strategia AI Alibaba opiera się na udostępnianiu otwartych wag jako przeciwwagi dla amerykańskich modeli dostępnych wyłącznie przez API, integracji generatywnej AI w całej swojej chmurze i biznesie e-commerce oraz dużych inwestycjach w infrastrukturę AI w ramach Alibaba Cloud.

Zastosowania

Do Czego Używać Qwen 3.7-Max

Inżynieria Oprogramowania
Wnioskowanie Naukowe i Techniczne
Agentowa Automatyzacja CLI
Analiza Długich Dokumentów i Baz Kodu
Programowanie Konkursowe

Strengths & Limitations

Strengths

  • Silna inżynieria oprogramowania — 80% SWE-bench Verified
  • Naukowe wnioskowanie na poziomie zaawansowanym — 92% GPQA Diamond
  • Programowanie konkursowe — 91% LiveCodeBench
  • Inteligencja złożona — 56 pkt AA Intelligence Index (niezależny)
  • Bardzo długie dokumenty i duże bazy kodu (kontekst 1M)

Limitations

  • Zamknięte wagi — brak możliwości samodzielnego hostowania lub dostrajania na prywatnych danych

Przeglądaj Pełną Tablicę Liderów Modeli AI

Najczęściej zadawane pytania

Dowiedz się więcej

Qwen 3.7-Plus — Benchmarki, Możliwości i Zastosowania
Qwen 3.7-Plus — Benchmarki, Możliwości i Zastosowania

Qwen 3.7-Plus — Benchmarki, Możliwości i Zastosowania

Qwen 3.7-Plus to autorski model AI od Alibaby, sklasyfikowany jako zaawansowany, z oknem kontekstowym 1 miliona tokenów. Jest dostępny bezpośrednio w FlowHunt. ...

3 min czytania
MiniMax M3 — Benchmarki, Możliwości i Zastosowania
MiniMax M3 — Benchmarki, Możliwości i Zastosowania

MiniMax M3 — Benchmarki, Możliwości i Zastosowania

MiniMax M3 to model AI o otwartych wagach od firmy MiniMax (MoE (nieujawnione)), sklasyfikowany jako poziom Frontier z oknem kontekstowym 1 miliona tokenów. Jes...

4 min czytania
Nemotron 3 Super — Benchmarki, Możliwości i Zastosowania
Nemotron 3 Super — Benchmarki, Możliwości i Zastosowania

Nemotron 3 Super — Benchmarki, Możliwości i Zastosowania

Nemotron 3 Super to otwarty model AI od NVIDIA (12B/120B MoE), sklasyfikowany jako zaawansowany, z oknem kontekstowym 1 miliona tokenów. Jest dostępny bezpośred...

4 min czytania