
Qwen 3.7-Plus — Benchmarki, Możliwości i Zastosowania
Qwen 3.7-Plus to autorski model AI od Alibaby, sklasyfikowany jako zaawansowany, z oknem kontekstowym 1 miliona tokenów. Jest dostępny bezpośrednio w FlowHunt. ...
Qwen 3.7-Max to najwyższej klasy model AI typu frontier, stworzony przez Alibabę i wydany w maju 2026 roku. Jest to zastrzeżony model o zamkniętych wagach, dostępny przez API Alibaby. Okno kontekstowe o wielkości 1 miliona tokenów jest wystarczająco duże, aby pomieścić całe bazy kodu, obszerne dokumenty techniczne lub rozbudowane sesje agentowe bez obcinania.
Na tablicy liderów AI FlowHunt jest jednym z 24 śledzonych modeli, ocenianych w 8 benchmarkach. Wyróżniające się wyniki: 89,6% w MMLU-Pro (#1 z 8); 91,6% w LiveCodeBench (#2 z 5); 41,4% w HLE (#2 z 6).
Qwen 3.7-Max został wydany 20 maja 2026 roku jako najwyższy model w generacji Qwen 3 Alibaby, wprowadzając to, co Alibaba nazwała „trybem myślenia" — rozszerzoną zdolność wnioskowania z łańcuchem myśli, którą można włączać dla każdego zapytania. W trybie myślenia model przeprowadza wewnętrzny krok deliberacji przed wygenerowaniem ostatecznej odpowiedzi, znacząco poprawiając wydajność w zadaniach wymagających wieloetapowego wnioskowania. W momencie premiery Qwen 3.7-Max uzyskał 92,4% w GPQA Diamond (trzecie miejsce globalnie), 91,6% w LiveCodeBench i 60,6% w SWE-bench Pro — najwyższy wynik wśród modeli z otwartym API w tym benchmarku. W połączeniu z oknem kontekstowym 1M i konkurencyjnymi cenami API, ugruntował swoją pozycję jako główna alternatywa na poziomie Frontier dla świadomych kosztów zespołów enterprise.
Uwaga: Lider GPQA Diamond (92,4%). Lider SWE-Pro (60,6%). AA Index 56,6.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
Alibaba Group to jeden z największych i najbardziej zróżnicowanych konglomeratów technologicznych w Chinach, założony w 1999 roku przez Jacka Ma z siedzibą w Hangzhou. Dzięki Akademii DAMO i Laboratorium Tongyi Alibaba stał się znaczącą siłą w rozwoju dużych modeli językowych za sprawą rodziny Qwen (Tongyi Qianwen). Generacja Qwen 3.7, wydana w połowie 2026 roku, oznaczała przejście Alibaba od wdrożeń krajowych do międzynarodowej konkurencyjności w benchmarkach – Qwen 3.7-Max osiągnął 92,4% w GPQA Diamond i 91,6% w LiveCodeBench. Strategia AI Alibaba opiera się na udostępnianiu otwartych wag jako przeciwwagi dla amerykańskich modeli dostępnych wyłącznie przez API, integracji generatywnej AI w całej swojej chmurze i biznesie e-commerce oraz dużych inwestycjach w infrastrukturę AI w ramach Alibaba Cloud.
Zastosowania
Qwen 3.7-Max osiąga 80% w SWE-bench Verified — zajmując #7 z 13 modeli śledzonych tutaj. Rozwiązuje rzeczywiste problemy z GitHub, pisze kod klasy produkcyjnej w wielu językach i obsługuje wieloetapowe agentowe przepływy pracy w programowaniu — to solidny wybór dla zespołów tworzących oprogramowanie wspomagane AI.
Przy wyniku 92% w GPQA Diamond (#4 z 14 modeli), Qwen 3.7-Max przekracza bazowy poziom ~65% doktorantów-ekspertów w pytaniach z biologii, chemii i fizyki na poziomie zaawansowanym. Używaj go do syntezy literatury naukowej, oceny hipotez, medycznych i prawniczych Q&A oraz interdyscyplinarnych zadań badawczych, gdzie liczy się głęboka wiedza dziedzinowa.
Qwen 3.7-Max osiąga 69% w Terminal-Bench (#3 z 8 modeli), dzięki czemu radzi sobie z typowymi skryptami powłoki, zadaniami w wierszu poleceń i lekką administracją systemu w potokach agentowych.
Dzięki oknu kontekstowemu o wielkości 1 miliona tokenów Qwen 3.7-Max może przetworzyć całe repozytoria oprogramowania, długie umowy prawne, raporty badawcze wielkości książki lub obszerne historie rozmów w pojedynczym zapytaniu — umożliwiając dogłębne Q&A na dokumentach, analizę kodu w wielu plikach i kompleksowe podsumowywanie bez heurystyk dzielenia czy potoków RAG.
Qwen 3.7-Max osiąga 91% w LiveCodeBench (#2 z 5 modeli), benchmarku odpornym na kontaminację, stale aktualizowanym o nowe zadania z programowania konkursowego. Na tym poziomie radzi sobie z zaawansowanymi strukturami danych, algorytmami grafowymi i wyzwaniami na poziomie rozmów kwalifikacyjnych z wysoką niezawodnością.
Więcej do Porównania
Porównaj wszystkie 24 modele w 11 benchmarkach — sortowalne, z podaniem źródeł, aktualizowane w czerwcu 2026.

Qwen 3.7-Plus to autorski model AI od Alibaby, sklasyfikowany jako zaawansowany, z oknem kontekstowym 1 miliona tokenów. Jest dostępny bezpośrednio w FlowHunt. ...

MiniMax M3 to model AI o otwartych wagach od firmy MiniMax (MoE (nieujawnione)), sklasyfikowany jako poziom Frontier z oknem kontekstowym 1 miliona tokenów. Jes...

Nemotron 3 Super to otwarty model AI od NVIDIA (12B/120B MoE), sklasyfikowany jako zaawansowany, z oknem kontekstowym 1 miliona tokenów. Jest dostępny bezpośred...
Zgoda na Pliki Cookie
Używamy plików cookie, aby poprawić jakość przeglądania i analizować nasz ruch. See our privacy policy.