
DeepSeek V4-Flash — Điểm chuẩn, Khả năng và Trường hợp Sử dụng
DeepSeek V4-Flash là mô hình AI trọng số mở từ DeepSeek (13B/284B MoE), được xếp hạng Bậc Cao cấp với khung ngữ cảnh 1 triệu token. Mô hình có sẵn trực tiếp tro...
DeepSeek V4-Pro là mô hình AI frontier hàng đầu, được phát triển bởi DeepSeek và phát hành vào tháng 4 năm 2026. Là một mô hình trọng số mở, các trọng số đã huấn luyện của nó được công bố công khai — bạn có thể tự lưu trữ, tinh chỉnh trên dữ liệu độc quyền hoặc chạy tại chỗ mà không phụ thuộc vào API. Cửa sổ ngữ cảnh 1 triệu token đủ lớn để chứa toàn bộ kho mã nguồn, tài liệu kỹ thuật dài hoặc các phiên tác tử kéo dài mà không bị cắt bớt.
Trên Bảng xếp hạng AI FlowHunt, đây là một trong 24 mô hình được theo dõi, được đánh giá trên 9 điểm chuẩn. Điểm nổi bật: 93,5% trên LiveCodeBench (#1/5); 87,5% trên MMLU-Pro (#2/8); 46,0% trên ARC-AGI-2 (#3/3).
DeepSeek V4-Pro được phát hành vào ngày 24 tháng 4 năm 2026 với tư cách là mô hình chủ lực của dòng V thế hệ thứ tư của DeepSeek. Mô hình đạt 93,5% trên LiveCodeBench khi ra mắt — điểm lập trình cạnh tranh cao nhất trong số các mô hình được đo — và đạt điểm SWE-bench Verified tự báo cáo cao nhất bên ngoài Claude Fable 5 ở mức 80,6%. Bản phát hành đã tạo ra cuộc thảo luận đáng kể khi CAISI đo độc lập điểm SWE-bench của V4-Pro ở mức 74,0% thay vì 80,6% mà DeepSeek đã báo cáo — khoảng cách 6,6 điểm mà DeepSeek cho là do sự khác biệt về giàn giáo và ngân sách token trong thiết lập đánh giá. Là một mô hình trọng số mở với cửa sổ ngữ cảnh 1 triệu token và kiến trúc MoE 49B/1,6T, V4-Pro đã trở thành lựa chọn tự lưu trữ hàng đầu cho các nhóm ưu tiên hiệu suất lập trình với toàn quyền kiểm soát dữ liệu.
Lưu ý: Chênh lệch SWE-bench: SR 80,6% so với CAISI 74%. LiveCodeBench 93,5% là mức cao nhất được báo cáo.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeek là một phòng thí nghiệm nghiên cứu AI của Trung Quốc được thành lập vào năm 2023 với tư cách là công ty con của High-Flyer, một trong những quỹ phòng hộ định lượng lớn nhất Trung Quốc. Phòng thí nghiệm này trở nên nổi tiếng rộng rãi vào đầu năm 2025 khi việc phát hành DeepSeek V3 và R1 gây ra đợt giảm vốn hóa thị trường lớn nhất trong một ngày của NVIDIA tính đến thời điểm đó, khi các nhà đầu tư đánh giá lại cường độ vốn của việc phát triển mô hình tiên tiến dựa trên chi phí huấn luyện thấp hơn được báo cáo của DeepSeek. DeepSeek khác biệt so với các phòng thí nghiệm tiên tiến khác ở cam kết phát hành mô hình trọng số mở (open-weight) cùng với nghiên cứu độc quyền và vận hành một kênh truyền thông xã hội tích cực phê phán định giá mô hình đóng. Các mô hình dòng V (V3 đến V4-Pro) được sử dụng rộng rãi làm mô hình lập trình và suy luận có thể tự lưu trữ ở phương Tây, bất chấp sự giám sát về quy định và an ninh đang diễn ra đối với các mô hình AI có nguồn gốc từ Trung Quốc tại một số khu vực pháp lý.
Trường hợp sử dụng
DeepSeek V4-Pro đạt 80% trên SWE-bench Verified — xếp hạng #6 trong số 13 mô hình được theo dõi tại đây. Mô hình giải quyết các vấn đề GitHub thực tế, viết mã chất lượng sản xuất bằng nhiều ngôn ngữ và xử lý các quy trình lập trình tác tử đa bước — một lựa chọn mạnh mẽ cho các nhóm phát triển phần mềm hỗ trợ AI.
Với 90% trên GPQA Diamond (#6/14 mô hình), DeepSeek V4-Pro vượt qua mức cơ bản ~65% của chuyên gia PhD về các câu hỏi sinh học, hóa học và vật lý ở cấp độ sau đại học. Sử dụng cho tổng hợp tài liệu khoa học, đánh giá giả thuyết, hỏi đáp y tế và pháp lý, và các nhiệm vụ nghiên cứu đa ngành đòi hỏi kiến thức chuyên sâu.
DeepSeek V4-Pro đạt 67% trên Terminal-Bench (#4/8 mô hình), đủ năng lực cho các tác vụ viết kịch bản shell thông thường, quy trình dòng lệnh và quản trị hệ thống nhẹ trong các pipeline tác tử.
DeepSeek V4-Pro là mô hình trọng số mở (49B/1,6T tham số MoE) — các trọng số đã huấn luyện của nó được công bố công khai để tải xuống và tự triển khai. Chạy trên phần cứng GPU của riêng bạn hoặc đám mây riêng để đảm bảo dữ liệu không bao giờ rời khỏi môi trường của bạn, loại bỏ chi phí API theo token ở quy mô lớn hoặc tinh chỉnh mô hình trên các tập dữ liệu độc quyền.
Với cửa sổ ngữ cảnh 1 triệu token, DeepSeek V4-Pro có thể tiếp nhận toàn bộ kho lưu trữ phần mềm, hợp đồng pháp lý dài, báo cáo nghiên cứu dài như sách hoặc lịch sử hội thoại mở rộng trong một lời nhắc duy nhất — cho phép hỏi đáp tài liệu chuyên sâu, lập luận xuyên tệp mã nguồn và tóm tắt toàn diện mà không cần heuristic phân khúc hoặc pipeline RAG.
DeepSeek V4-Pro đạt 93% trên LiveCodeBench (#1/5 mô hình), một điểm chuẩn chống nhiễu được làm mới liên tục với các bài toán lập trình cạnh tranh mới. Ở cấp độ này, mô hình xử lý các cấu trúc dữ liệu nâng cao, thuật toán đồ thị và thử thách cấp phỏng vấn với độ tin cậy cao.
Thêm để So sánh
So sánh tất cả 24 mô hình trên 11 điểm chuẩn — có thể sắp xếp, có nguồn gốc và được cập nhật tháng 6 năm 2026.

DeepSeek V4-Flash là mô hình AI trọng số mở từ DeepSeek (13B/284B MoE), được xếp hạng Bậc Cao cấp với khung ngữ cảnh 1 triệu token. Mô hình có sẵn trực tiếp tro...

Llama 4 Scout là mô hình AI trọng số mở từ Meta (17B/109B MoE (16 chuyên gia)), được xếp hạng Established với cửa sổ ngữ cảnh 10 triệu token. Mô hình có sẵn trự...

Claude Opus 4.7 là mô hình AI độc quyền từ Anthropic, được xếp hạng Frontier với ngữ cảnh 1 triệu token. Khám phá điểm chuẩn, điểm mạnh và các trường hợp sử dụn...
Đồng Ý Cookie
Chúng tôi sử dụng cookie để cải thiện trải nghiệm duyệt web của bạn và phân tích lưu lượng truy cập của mình. See our privacy policy.