Alibaba logo

Alibaba

Qwen 3.7-Max

FrontierAvailable in FlowHunt

Qwen 3.7-Max는 알리바바가 개발하여 2026년 5월에 출시한 최상위 Frontier AI 모델입니다. 독점 클로즈드 가중치 모델로, 알리바바 API를 통해 사용할 수 있습니다. 100만 토큰 컨텍스트 창은 전체 코드베이스, 방대한 기술 문서, 또는 긴 에이전트 세션도 자르지 않고 처리할 수 있을 정도로 큽니다.

FlowHunt AI 리더보드에서는 8개 벤치마크에서 평가된 24개 추적 모델 중 하나입니다. 주요 점수: MMLU-Pro 89.6%(8개 중 1위), LiveCodeBench 91.6%(5개 중 2위), HLE 41.4%(6개 중 2위).

Qwen 3.7-Max는 2026년 5월 20일에 알리바바 Qwen 3 세대의 최상위 모델로 출시되었으며, 알리바바가 ‘사고 모드(thinking mode)‘라고 부르는 기능을 도입했습니다. 이는 쿼리별로 전환할 수 있는 확장된 사고 사슬 추론 기능입니다. 사고 모드에서는 최종 답변을 생성하기 전에 내부 숙고 단계를 거치므로, 다단계 추론 작업에서 성능이 크게 향상됩니다. 출시 당시 Qwen 3.7-Max는 GPQA Diamond에서 92.4%(전 세계 3위), LiveCodeBench에서 91.6%, SWE-bench Pro에서 60.6%를 기록하여 해당 벤치마크에서 오픈 API 최고 점수를 달성했습니다. 100만 컨텍스트 창과 경쟁력 있는 API 가격을 갖춘 이 모델은 비용에 민감한 기업 팀을 위한 주요 Frontier 등급 대안으로 자리 잡았습니다.

참고: GPQA Diamond 리더(92.4%). SWE-Pro 리더(60.6%). AA Index 56.6.

출시일
2026년 5월
컨텍스트
100만 토큰
가중치
비공개
등급
Frontier
제공사
알리바바

Qwen 3.7-Max Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified80.4%7 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro60.6%4 of 9SRMulti-language, standardised scaffold
GPQA Diamond92.4%4 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro89.6%1 of 8SRHard knowledge reasoning, 12K questions
LiveCodeBench91.6%2 of 5SRCompetitive programming, continuously updated
Terminal-Bench69.7%3 of 8SRAgentic Linux terminal task completion
HLE41.4%2 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index56.6 pts4 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
80.4%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
60.6%
Multi-language, standardised scaffold
GPQA ◇ SR
92.4%
Graduate-level Google-proof science Q&A
MMLU-P SR
89.6%
Hard knowledge reasoning, 12K questions
LiveCode SR
91.6%
Competitive programming, continuously updated
Terminal SR
69.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
56.6 pts
Artificial Analysis composite score (independent)

Qwen 3.7-Max vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkQwen 3.7-MaxClaude Opus 4.8Claude Opus 4.7
SWE-V80.4%88.6%87.6%
SWE-Pro60.6%69.2%64.3%
GPQA ◇92.4%93.6%94.2%
MMLU-P89.6%
LiveCode91.6%
Terminal69.7%74.6%66.1%
HLE41.4%
AA Idx56.6 pts61.4 pts57.3 pts

About Alibaba

Alibaba Founded 1999 · Hangzhou, China
Website →

알리바바 그룹은 1999년 Jack Ma가 설립하고 항저우에 본사를 둔 중국 최대이자 가장 다양한 기술 대기업 중 하나입니다. 알리바바는 DAMO 아카데미와 Tongyi Lab을 통해 Qwen(Tongyi Qianwen) 제품군으로 대규모 언어 모델 개발의 주요 세력이 되었습니다. 2026년 중반에 출시된 Qwen 3.7 세대는 알리바바의 국내 배포에서 국제 벤치마크 경쟁력으로의 전환을 의미하며, Qwen 3.7-Max는 GPQA Diamond에서 92.4%, LiveCodeBench에서 91.6%를 기록했습니다. 알리바바의 AI 전략은 미국 API 전용 모델에 대한 균형추로서의 오픈웨이트 모델 공개, 클라우드 및 전자상거래 사업 전반에 걸친 생성형 AI 통합, 알리바바 클라우드 부문의 AI 인프라에 대한 대규모 투자로 정의됩니다.

사용 사례

Qwen 3.7-Max를 활용하는 방법

소프트웨어 엔지니어링
과학 및 기술 추론
에이전트 CLI 자동화
장문 문서 및 코드베이스 분석
경쟁 프로그래밍

Strengths & Limitations

Strengths

  • 강력한 소프트웨어 엔지니어링 — SWE-bench Verified 80%
  • 대학원 수준 과학 추론 — GPQA Diamond 92%
  • 경쟁 프로그래밍 — LiveCodeBench 91%
  • 복합 지능 — AA Intelligence Index 56점 (독립 검증)
  • 매우 긴 문서 및 대규모 코드베이스 처리 (100만 컨텍스트)

Limitations

  • 클로즈드 가중치 — 자체 호스팅 또는 개인 데이터로 파인튜닝 불가

전체 AI 모델 리더보드 살펴보기

자주 묻는 질문

더 알아보기

Qwen 3.7-Plus — 벤치마크, 기능 및 사용 사례
Qwen 3.7-Plus — 벤치마크, 기능 및 사용 사례

Qwen 3.7-Plus — 벤치마크, 기능 및 사용 사례

Qwen 3.7-Plus는 알리바바의 독점 AI 모델로, Advanced 등급에 속하며 100만 토큰 컨텍스트 윈도우를 제공합니다. FlowHunt에서 직접 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 확인해 보세요....

3 분 읽기
Qwen3-Max, OpenAI 구조조정, Claude 업데이트
Qwen3-Max, OpenAI 구조조정, Claude 업데이트

Qwen3-Max, OpenAI 구조조정, Claude 업데이트

알리바바의 Qwen3-Max, OpenAI의 영리 전환 난항, 새로운 이미지 모델, 그리고 인공지능 산업의 경쟁 구도가 어떻게 변화하고 있는지 등 최신 AI 동향을 살펴보세요....

11 분 읽기
AI Machine Learning +3
MiniMax M3 — 벤치마크, 기능 및 사용 사례
MiniMax M3 — 벤치마크, 기능 및 사용 사례

MiniMax M3 — 벤치마크, 기능 및 사용 사례

MiniMax M3는 MiniMax의 오픈 웨이트 AI 모델(MoE(비공개))로, 100만 토큰 컨텍스트 윈도우를 갖춘 Frontier 등급으로 분류됩니다. FlowHunt에서 바로 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 살펴보세요....

3 분 읽기