
Qwen 3.7-Plus — 벤치마크, 기능 및 사용 사례
Qwen 3.7-Plus는 알리바바의 독점 AI 모델로, Advanced 등급에 속하며 100만 토큰 컨텍스트 윈도우를 제공합니다. FlowHunt에서 직접 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 확인해 보세요....
Qwen 3.7-Max는 알리바바가 개발하여 2026년 5월에 출시한 최상위 Frontier AI 모델입니다. 독점 클로즈드 가중치 모델로, 알리바바 API를 통해 사용할 수 있습니다. 100만 토큰 컨텍스트 창은 전체 코드베이스, 방대한 기술 문서, 또는 긴 에이전트 세션도 자르지 않고 처리할 수 있을 정도로 큽니다.
FlowHunt AI 리더보드에서는 8개 벤치마크에서 평가된 24개 추적 모델 중 하나입니다. 주요 점수: MMLU-Pro 89.6%(8개 중 1위), LiveCodeBench 91.6%(5개 중 2위), HLE 41.4%(6개 중 2위).
Qwen 3.7-Max는 2026년 5월 20일에 알리바바 Qwen 3 세대의 최상위 모델로 출시되었으며, 알리바바가 ‘사고 모드(thinking mode)‘라고 부르는 기능을 도입했습니다. 이는 쿼리별로 전환할 수 있는 확장된 사고 사슬 추론 기능입니다. 사고 모드에서는 최종 답변을 생성하기 전에 내부 숙고 단계를 거치므로, 다단계 추론 작업에서 성능이 크게 향상됩니다. 출시 당시 Qwen 3.7-Max는 GPQA Diamond에서 92.4%(전 세계 3위), LiveCodeBench에서 91.6%, SWE-bench Pro에서 60.6%를 기록하여 해당 벤치마크에서 오픈 API 최고 점수를 달성했습니다. 100만 컨텍스트 창과 경쟁력 있는 API 가격을 갖춘 이 모델은 비용에 민감한 기업 팀을 위한 주요 Frontier 등급 대안으로 자리 잡았습니다.
참고: GPQA Diamond 리더(92.4%). SWE-Pro 리더(60.6%). AA Index 56.6.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.4% | 7 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 60.6% | 4 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 92.4% | 4 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 89.6% | 1 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 91.6% | 2 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 69.7% | 3 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 2 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 56.6 pts | 4 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | Qwen 3.7-Max | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.4% | 88.6% | 87.6% |
| SWE-Pro | 60.6% | 69.2% | 64.3% |
| GPQA ◇ | 92.4% | 93.6% | 94.2% |
| MMLU-P | 89.6% | — | — |
| LiveCode | 91.6% | — | — |
| Terminal | 69.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 56.6 pts | 61.4 pts | 57.3 pts |
알리바바 그룹은 1999년 Jack Ma가 설립하고 항저우에 본사를 둔 중국 최대이자 가장 다양한 기술 대기업 중 하나입니다. 알리바바는 DAMO 아카데미와 Tongyi Lab을 통해 Qwen(Tongyi Qianwen) 제품군으로 대규모 언어 모델 개발의 주요 세력이 되었습니다. 2026년 중반에 출시된 Qwen 3.7 세대는 알리바바의 국내 배포에서 국제 벤치마크 경쟁력으로의 전환을 의미하며, Qwen 3.7-Max는 GPQA Diamond에서 92.4%, LiveCodeBench에서 91.6%를 기록했습니다. 알리바바의 AI 전략은 미국 API 전용 모델에 대한 균형추로서의 오픈웨이트 모델 공개, 클라우드 및 전자상거래 사업 전반에 걸친 생성형 AI 통합, 알리바바 클라우드 부문의 AI 인프라에 대한 대규모 투자로 정의됩니다.
사용 사례
Qwen 3.7-Max는 SWE-bench Verified에서 80%를 기록하여 여기에 추적된 13개 모델 중 7위입니다. 실제 GitHub 이슈를 해결하고, 여러 언어로 프로덕션 수준의 코드를 작성하며, 다단계 에이전트 코딩 워크플로우를 처리합니다. AI 지원 소프트웨어 개발 팀에 강력한 선택입니다.
GPQA Diamond에서 92%를 기록한(14개 모델 중 4위) Qwen 3.7-Max는 대학원 수준의 생물학, 화학, 물리학 문제에서 인간 박사급 전문가 기준(~65%)을 초과합니다. 과학 문헌 종합, 가설 평가, 의료 및 법률 Q&A, 깊은 도메인 지식이 필요한 다분야 연구 작업에 활용할 수 있습니다.
Qwen 3.7-Max는 Terminal-Bench에서 69%를 기록하여(8개 모델 중 3위), 일반적인 셸 스크립팅, 명령줄 워크플로우, 에이전트 파이프라인 내 경량 시스템 관리 작업에 적합합니다.
100만 토큰 컨텍스트 창을 갖춘 Qwen 3.7-Max는 단일 프롬프트로 전체 소프트웨어 저장소, 긴 법률 계약서, 책 분량의 연구 보고서 또는 방대한 대화 기록을 처리할 수 있어, 청킹 기법이나 RAG 파이프라인 없이도 심층 문서 Q&A, 파일 간 코드베이스 추론, 포괄적인 요약이 가능합니다.
Qwen 3.7-Max는 LiveCodeBench에서 91%를 기록했습니다(5개 모델 중 2위). 이 벤치마크는 새로운 경쟁 프로그래밍 문제로 지속적으로 갱신되어 오염에 강합니다. 이 수준에서 고급 데이터 구조, 그래프 알고리즘 및 면접 수준의 과제를 높은 신뢰도로 처리합니다.
더 비교해보기
11개 벤치마크에서 24개 모델을 비교 — 정렬 가능, 출처 명시, 2026년 6월 업데이트.

Qwen 3.7-Plus는 알리바바의 독점 AI 모델로, Advanced 등급에 속하며 100만 토큰 컨텍스트 윈도우를 제공합니다. FlowHunt에서 직접 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 확인해 보세요....

알리바바의 Qwen3-Max, OpenAI의 영리 전환 난항, 새로운 이미지 모델, 그리고 인공지능 산업의 경쟁 구도가 어떻게 변화하고 있는지 등 최신 AI 동향을 살펴보세요....

MiniMax M3는 MiniMax의 오픈 웨이트 AI 모델(MoE(비공개))로, 100만 토큰 컨텍스트 윈도우를 갖춘 Frontier 등급으로 분류됩니다. FlowHunt에서 바로 사용할 수 있습니다. 벤치마크 점수, 강점 및 권장 사용 사례를 살펴보세요....
쿠키 동의
당사는 귀하의 브라우징 경험을 향상시키고 트래픽을 분석하기 위해 쿠키를 사용합니다. See our privacy policy.