
DeepSeek V4-Flash — ベンチマーク、性能、ユースケース
DeepSeek V4-Flash は、DeepSeek が開発したオープンウェイトのAIモデル(13B/284B MoE)で、Advanced ティアに分類され、100万トークンのコンテキストウィンドウを備えています。FlowHunt で直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご紹介します。...
DeepSeek V4-Proは、DeepSeekが開発し2026年4月にリリースされたトップクラスのフロンティアAIモデルです。オープンウェイトモデルとして、学習済みの重みが公開されており、セルフホスティング、プロプライエタリデータでのファインチューニング、またはAPI依存なしでのオンプレミス実行が可能です。100万トークンのコンテキストウィンドウは、コードベース全体、長大な技術文書、または長時間のエージェントセッションを切り詰めることなく保持するのに十分な大きさです。
FlowHunt AIリーダーボードでは、9つのベンチマークで評価された24の追跡モデルのうちの1つです。注目スコア:LiveCodeBenchで93.5%(5モデル中1位)、MMLU-Proで87.5%(8モデル中2位)、ARC-AGI-2で46.0%(3モデル中3位)。
DeepSeek V4-Proは、DeepSeekの第4世代Vシリーズのフラッグシップモデルとして2026年4月24日にリリースされました。リリース時にLiveCodeBenchで93.5%を達成 — これは測定された全モデルの中で最高の競技プログラミングスコアであり、Claude Fable 5を除く中で最高の自己報告SWE-bench Verifiedスコア80.6%を記録しました。このリリースは、CAISIがV4-ProのSWE-benchスコアをDeepSeekが報告した80.6%ではなく74.0%と独自に測定した際に大きな議論を引き起こしました — DeepSeekが評価設定のスキャフォールディングとトークンバジェットの違いに起因するとした6.6ポイントの差です。100万トークンのコンテキストウィンドウと49B/1.6T MoEアーキテクチャを備えたオープンウェイトモデルとして、V4-Proは完全なデータ管理を備えたコーディング性能を優先するチームにとって、セルフホスティング可能な主要な選択肢となりました。
※注:SWE-benchの差異:自己報告80.6% vs CAISI 74%。LiveCodeBench 93.5%は報告された中で最高。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 6 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 55.4% | 9 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 90.1% | 6 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 87.5% | 2 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 93.5% | 1 of 5 | SR | Competitive programming, continuously updated |
| Terminal-Bench | 67.9% | 4 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 46.0% | 3 of 3 | C | Novel visual reasoning, no memorisation |
| HLE | 37.7% | 4 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 52.0 pts | 6 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | DeepSeek V4-Pro | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 80.6% | 88.6% | 87.6% |
| SWE-Pro | 55.4% | 69.2% | 64.3% |
| GPQA ◇ | 90.1% | 93.6% | 94.2% |
| MMLU-P | 87.5% | — | — |
| LiveCode | 93.5% | — | — |
| Terminal | 67.9% | 74.6% | 66.1% |
| ARC-2 | 46.0% | — | — |
| HLE | 37.7% | — | — |
| AA Idx | 52.0 pts | 61.4 pts | 57.3 pts |
DeepSeekは、中国最大の量的ヘッジファンドの一つであるHigh-Flyerの子会社として2023年に設立された中国のAI研究所です。同研究所は2025年初頭、DeepSeek V3およびR1のリリースが、DeepSeekの報告された低いトレーニングコストを受けて投資家がフロンティアモデル開発の資本集約性を再評価したことにより、NVIDIAの時価総額にその時点で最大の一日下落をもたらしたことで広く知られるようになりました。DeepSeekは、フロンティア研究所の中でも、独自研究と並行してオープンウェイトモデルを公開する姿勢と、クローズドモデルの価格設定を批判する活発なソーシャルメディアでの活動において異例の存在です。そのVシリーズモデル(V3からV4-Pro)は、中国発のAIモデルに対する複数の法域での規制およびセキュリティ上の監視が続いているにもかかわらず、欧米でセルフホスト可能なコーディングおよび推論モデルとして広く使用されています。
ユースケース
DeepSeek V4-ProはSWE-bench Verifiedで80%をスコア — ここで追跡されている13モデル中6位。実際のGitHub課題を解決し、複数言語でプロダクション品質のコードを作成し、マルチステップのエージェント的コーディングワークフローを処理します — AI支援ソフトウェア開発チームにとって有力な選択肢です。
GPQA Diamondで90%(14モデル中6位)を記録するDeepSeek V4-Proは、大学院レベルの生物学、化学、物理学の質問において、約65%の人間博士レベルのベースラインを超えています。科学文献の統合、仮説評価、医療・法律Q&A、深いドメイン知識が求められる多分野の研究タスクにご利用ください。
DeepSeek V4-ProはTerminal-Benchで67%(8モデル中4位)を達成しており、一般的なシェルスクリプト、コマンドライン操作、エージェント的パイプライン内の軽いシステム管理タスクに適しています。
DeepSeek V4-Proはオープンウェイト(49B/1.6T MoEパラメータ)です — 学習済みの重みが公開されており、ダウンロードとセルフデプロイが可能です。自身のGPUハードウェアまたはプライベートクラウドで実行することで、データを環境外に出さず、大規模なトークン単位のAPIコストを排除し、プロプライエタリデータセットでのモデルのファインチューニングが可能です。
100万トークンのコンテキストウィンドウにより、DeepSeek V4-Proはソフトウェアリポジトリ全体、長大な法的契約書、書籍相当の調査レポート、または広範な会話履歴を単一のプロンプトで取り込むことができます — チャンク分割ヒューリスティックやRAGパイプラインなしで、深いドキュメントQ&A、ファイル横断的なコードベース推論、包括的な要約を実現します。
DeepSeek V4-ProはLiveCodeBenchで93%(5モデル中1位)をスコア。これは新しい競技プログラミング問題で継続的に更新される汚染耐性のあるベンチマークです。このレベルでは、高度なデータ構造、グラフアルゴリズム、面接レベルの課題を高い信頼性で処理します。
さらに比較する

DeepSeek V4-Flash は、DeepSeek が開発したオープンウェイトのAIモデル(13B/284B MoE)で、Advanced ティアに分類され、100万トークンのコンテキストウィンドウを備えています。FlowHunt で直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご紹介します。...

Llama 4 ScoutはMetaによるオープンウェイトAIモデル(17B/109B MoE(16エキスパート))で、Established層に分類され、1000万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...

FlowHuntをDeepSeek MCPサーバーと連携し、高度な言語モデルをAIワークフローに導入します。DeepSeek APIコールを安全にプロキシし、匿名利用を可能に。スマートなモデル選択・フォールバック・動的設定・コンテキストを保持したマルチターン会話などの機能も利用できます。...