
Qwen 3.7-Plus — Referansetester, Egenskaper og Bruksområder
Qwen 3.7-Plus er en proprietær AI-modell fra Alibaba, klassifisert som Avansert-nivå med et kontekstvindu på 1M tokens. Den er tilgjengelig direkte i FlowHunt. ...
Qwen 3.7-Max er en topprangert frontier-AI-modell, utviklet av Alibaba og lansert i mai 2026. Det er en proprietær modell med lukkede vekter, tilgjengelig via Alibabas API. Kontekstvinduet på 1M tokens er stort nok til å romme hele kodebaser, lange tekniske dokumenter eller utvidede agentiske økter uten avkorting.
På FlowHunt AI Leaderboard er den en av 24 sporede modeller, evaluert på tvers av 8 referansetester. Fremtredende poengsummer: 89,6 % på MMLU-Pro (#1 av 8); 91,6 % på LiveCodeBench (#2 av 5); 41,4 % på HLE (#2 av 6).
Qwen 3.7-Max ble lansert 20. mai 2026 som toppmodellen i Alibabas Qwen 3-generasjon, og introduserte det Alibaba kalte en «tenkemodus» — en utvidet kjede-av-tankegang-resonneringsevne som kan slås av og på per spørring. I tenkemodus kjører modellen et internt overveielsessteg før den produserer sitt endelige svar, noe som forbedrer ytelsen betydelig på flertrinns resonneringsoppgaver. Ved lansering oppnådde Qwen 3.7-Max 92,4 % på GPQA Diamond (tredje globalt), 91,6 % på LiveCodeBench og 60,6 % på SWE-bench Pro — den høyeste åpne API-poengsummen på den referansetesten. Kombinert med et 1M kontekstvindu og konkurransedyktig API-prising, etablerte den seg som det fremste Frontier-nivå-alternativet for kostnadsbevisste bedriftsteam.
Merk: GPQA Diamond-leder (92,4 %). SWE-Pro-leder (60,6 %). AA-indeks 56,6.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
Alibaba Group er et av Kinas største og mest mangfoldige teknologikonglomerater, grunnlagt i 1999 av Jack Ma med hovedkontor i Hangzhou. Gjennom DAMO Academy og Tongyi Lab har Alibaba blitt en betydelig kraft innen utvikling av store språkmodeller med Qwen-familien (Tongyi Qianwen). Qwen 3.7-generasjonen, lansert midt i 2026, markerte Alibabas overgang fra innenlandske utrullinger til internasjonal benchmark-konkurranseevne, med Qwen 3.7-Max som oppnådde 92,4 % på GPQA Diamond og 91,6 % på LiveCodeBench. Alibabas KI-strategi er definert av utgivelse av åpne vektmodeller som en motvekt til amerikanske API-only-modeller, integrering av generativ KI på tvers av deres sky- og e-handelsvirksomheter, og tung investering i KI-infrastruktur i Alibaba Cloud-divisjonen.
Bruksområder
Qwen 3.7-Max oppnår 80 % på SWE-bench Verified — rangert #7 av 13 modeller sporet her. Den løser ekte GitHub-problemer, skriver produksjonsklar kode på tvers av flere språk, og håndterer flertrinns agentiske kodearbeidsflyter — et sterkt valg for AI-assisterte programvareutviklingsteam.
Med 92 % på GPQA Diamond (#4 av 14 modeller) overgår Qwen 3.7-Max den omtrentlige ~65 % menneskelige PhD-ekspertbaseline på avanserte biologi-, kjemi- og fysikkspørsmål. Bruk den til syntese av vitenskapelig litteratur, hypoteseevaluering, medisinsk og juridisk spørsmål og svar, og flerfaglige forskningsoppgaver hvor dyp domenekunnskap er viktig.
Qwen 3.7-Max oppnår 69 % på Terminal-Bench (#3 av 8 modeller), noe som gjør den kompetent for vanlige shell-skript, kommandolinjearbeidsflyter og lette systemadministrasjonsoppgaver innenfor agentiske pipeliner.
Med et kontekstvindu på 1M tokens kan Qwen 3.7-Max innta hele programvarerepositorier, lange juridiske kontrakter, boklange forskningsrapporter eller omfattende samtalelogger i én enkelt forespørsel — noe som muliggjør dyp dokument-Q&A, kodebase-resonnering på tvers av filer og omfattende oppsummering uten oppdelingsheuristikker eller RAG-pipelines.
Qwen 3.7-Max oppnår 91 % på LiveCodeBench (#2 av 5 modeller), en kontamineringsresistent referansetest som kontinuerlig oppdateres med nye konkurranseprogrammeringsproblemer. På dette nivået håndterer den avanserte datastrukturer, grafalgoritmer og intervjunivå-utfordringer med høy pålitelighet.
Mer å sammenligne
Sammenlign alle 24 modeller på tvers av 11 referansetester — sorterbar, kildebasert og oppdatert juni 2026.

Qwen 3.7-Plus er en proprietær AI-modell fra Alibaba, klassifisert som Avansert-nivå med et kontekstvindu på 1M tokens. Den er tilgjengelig direkte i FlowHunt. ...

MiniMax M3 er en åpen-vekt AI-modell fra MiniMax (MoE (ikke offentliggjort)), klassifisert som Frontier-nivå med et kontekstvindu på 1M tokens. Den er tilgjenge...

Integrer FlowHunt med Qwen Max for å automatisere serveroperasjoner, overvåke systemhelse og øke produktiviteten med intelligente AI-drevne arbeidsflyter for sk...
Informasjonskapselsamtykke
Vi bruker informasjonskapsler for å forbedre din surfeopplevelse og analysere vår trafikk. See our privacy policy.