
Llama 4 Maverick — ベンチマーク、機能、およびユースケース
Llama 4 Maverickは、Metaが開発したオープンウェイトAIモデル(17B/400B MoE(128エキスパート))で、Established層に分類され、100万トークンのコンテキストウィンドウを備えています。ベンチマークスコア、強み、および推奨ユースケースをご確認ください。...
Llama 3.3 70Bは、Meta社が開発し2024年12月にリリースされた、実績があり現在も多くの本番システムで広く運用されているAIモデルです。オープンウェイトモデルとして、その学習済み重みは公開されています — セルフホスティング、プロプライエタリデータでのファインチューニング、またはAPI依存なしでのオンプレミス実行が可能です。128Kトークンのコンテキストウィンドウをサポートしており、ほとんどのドキュメントやマルチターンアプリケーションに十分対応できます。
FlowHunt AIリーダーボードでは、4つのベンチマークで評価された24の追跡モデルのうちの1つです。注目スコア:HumanEval 88.4%(2モデル中1位)、MATH-500 77.0%(4モデル中3位)、MMLU-Pro 68.9%(8モデル中7位)。
Llama 3.3 70Bは、Llama 4へのアーキテクチャ移行前のMetaによる最終Llama 3シリーズモデルの1つとして、2024年12月6日にリリースされました。Dense(非MoE)70Bパラメータモデルとして、Llama 3世代の哲学である「より多くのパラメータ、より良い結果、透明性のある構造」というストレートフォワードなスケーラブルアーキテクチャを反映しています。128Kのコンテキストウィンドウと強力なMMLU-ProおよびSWE-benchスコアにより、Dense 70B推論に十分なGPUリソースを持ちながらMoEシステムまでは必要としないチームにとって、主要なセルフホスト型モデルとなりました。現在も、ヘルスケア、金融、法務といった規制産業で人気があります。これらの業界では、Denseアーキテクチャの透明性と監査可能性、そしてオープンウェイトでの利用可能性が、生の性能と同様に重要視されています。
注記:70Bのコストで405Bに迫る品質。テキストのみ。IFEval 92.1%。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| GPQA Diamond | 50.5% | 13 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 68.9% | 7 of 8 | SR | Hard knowledge reasoning, 12K questions |
| MATH-500 | 77.0% | 3 of 4 | SR | Hendrycks math (500 problems) |
| HumanEval pass@1 | 88.4% | 1 of 2 | SR | Python code generation (saturated at frontier) |
Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.
| Benchmark | Llama 3.3 70B | GPT-4o | Llama 4 Maverick |
|---|---|---|---|
| GPQA ◇ | 50.5% | 53.6% | 69.8% |
| MMLU-P | 68.9% | 72.6% | 80.5% |
| MATH | 77.0% | — | — |
| HumEval | 88.4% | — | — |
Meta Platforms(旧Facebook)は、カリフォルニア州メンロパークに本社を置く世界最大のテクノロジー企業の一つであり、Facebook、Instagram、WhatsApp、Threadsで最もよく知られています。Meta AI(旧FAIR)を通じて、同社はLlamaファミリーを介したオープンウェイト大規模言語モデルの最も多産な公開元となっています。Llama 4シリーズ(Maverick、Scout、Behemoth)は寛容なコミュニティライセンスのもとで公開され、Hugging Faceなどのプラットフォームで最もダウンロードされているオープンウェイトモデルであり続けています。MetaのAI戦略は主要研究所の中でも異色で、商用APIを運営するのではなく、研究および商用利用のためにモデルをオープンに公開し、自社アプリケーション全体に生成AI機能を統合し、オープンウェイト公開をAI開発への最も民主的なアプローチとして公に提唱しています。
ユースケース
Llama 3.3 70BはGPQA Diamondで50%(14モデル中13位)を達成しています。一般的な科学的Q&Aをしっかりと処理できますが、最先端モデルは最も難しい大学院レベルの問題で25パーセントポイント以上高いスコアを記録しています。
Llama 3.3 70Bはオープンウェイト(70B Denseパラメータ)です。学習済み重みは公開されており、ダウンロードとセルフデプロイが可能です。独自のGPUハードウェアまたはプライベートクラウドで実行することで、データが自社環境外に出ることを防ぎ、スケール時のトークン単位のAPIコストを排除し、プロプライエタリデータセットでのモデルのファインチューニングが可能です。
比較するなら

Llama 4 Maverickは、Metaが開発したオープンウェイトAIモデル(17B/400B MoE(128エキスパート))で、Established層に分類され、100万トークンのコンテキストウィンドウを備えています。ベンチマークスコア、強み、および推奨ユースケースをご確認ください。...

Llama 4 ScoutはMetaによるオープンウェイトAIモデル(17B/109B MoE(16エキスパート))で、Established層に分類され、1000万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...

Mistral Large 3は、Mistral社によるオープンウェイトのAIモデル(41B/675B MoE)で、Advanced層に分類され、256Kトークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご覧ください。...