
Llama 4 Maverick — Benchmarks, Fähigkeiten und Anwendungsfälle
Llama 4 Maverick ist ein Open-Weight-KI-Modell von Meta (17B/400B MoE (128 Experten)), eingestuft in die Kategorie Established mit einem Kontextfenster von 1 Mi...
Llama 3.3 70B ist ein bewährtes KI-Modell, das noch immer weit verbreitet in Produktionssystemen eingesetzt wird. Es wurde von Meta entwickelt und im Dezember 2024 veröffentlicht. Als Open-Weight-Modell sind seine trainierten Gewichte öffentlich verfügbar – Sie können es selbst hosten, mit proprietären Daten feinabstimmen oder ohne API-Abhängigkeiten vor Ort ausführen. Es unterstützt ein Kontextfenster von 128K Token, ausreichend für die meisten Dokumente und Multi-Turn-Anwendungen.
Auf der FlowHunt KI-Rangliste ist es eines von 24 verfolgten Modellen, evaluiert in 4 Benchmarks. Herausragende Ergebnisse: 88,4 % bei HumanEval (#1 von 2); 77,0 % bei MATH-500 (#3 von 4); 68,9 % bei MMLU-Pro (#7 von 8).
Llama 3.3 70B wurde am 6. Dezember 2024 als eines der letzten Modelle der Llama-3-Serie von Meta veröffentlicht, vor dem architektonischen Übergang zu Llama 4. Als dichtes (nicht-MoE) Modell mit 70B Parametern spiegelte es die Philosophie der Llama-3-Generation wider – eine unkomplizierte, skalierbare Architektur: mehr Parameter, bessere Ergebnisse, transparente Struktur. Sein 128K-Kontextfenster und die starken Ergebnisse in MMLU-Pro und SWE-bench machten es zum führenden selbst gehosteten Modell für Teams mit GPU-Ressourcen, die für dichte 70B-Inferenz ausreichen, aber nicht für ein MoE-System. Es bleibt beliebt in regulierten Branchen – Gesundheitswesen, Finanzen, Recht – wo die Transparenz und Prüfbarkeit einer dichten Architektur, kombiniert mit Open-Weight-Verfügbarkeit, genauso wichtig sind wie die rohe Leistungsfähigkeit.
Hinweis: Nahezu 405B-Qualität zu 70B-Kosten. Nur Text. IFEval 92,1 %.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| GPQA Diamond | 50.5% | 13 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 68.9% | 7 of 8 | SR | Hard knowledge reasoning, 12K questions |
| MATH-500 | 77.0% | 3 of 4 | SR | Hendrycks math (500 problems) |
| HumanEval pass@1 | 88.4% | 1 of 2 | SR | Python code generation (saturated at frontier) |
Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.
| Benchmark | Llama 3.3 70B | GPT-4o | Llama 4 Maverick |
|---|---|---|---|
| GPQA ◇ | 50.5% | 53.6% | 69.8% |
| MMLU-P | 68.9% | 72.6% | 80.5% |
| MATH | 77.0% | — | — |
| HumEval | 88.4% | — | — |
Meta Platforms (ehemals Facebook) ist eines der größten Technologieunternehmen der Welt mit Hauptsitz in Menlo Park, Kalifornien, und bekannt für Facebook, Instagram, WhatsApp und Threads. Über Meta AI (ehemals FAIR) ist das Unternehmen mit der Llama-Familie zum produktivsten Herausgeber von Open-Weight-Sprachmodellen geworden. Die Llama-4-Serie – Maverick, Scout und Behemoth – wurde unter großzügigen Community-Lizenzen veröffentlicht und sind die am meisten heruntergeladenen Open-Weight-Modelle auf Plattformen wie Hugging Face. Metas KI-Strategie unterscheidet sich von anderen großen Laboren: Anstatt eine kommerzielle API zu betreiben, veröffentlicht Meta Modelle offen für Forschung und kommerzielle Nutzung, integriert generative KI-Funktionen in seine eigenen Anwendungen und hat sich öffentlich für Open-Weight-Veröffentlichungen als demokratischsten Ansatz der KI-Entwicklung ausgesprochen.
Anwendungsfälle
Llama 3.3 70B erreicht 50 % bei GPQA Diamond (#13 von 14 Modellen). Es bewältigt allgemeine wissenschaftliche Fragen und Antworten auf solidem Niveau, wobei Spitzenmodelle bei den schwierigsten Problemen auf Graduiertenniveau 25+ Prozentpunkte höher erzielen.
Llama 3.3 70B ist Open-Weight (70B dichte Parameter) – seine trainierten Gewichte sind öffentlich zum Herunterladen und zur Selbstbereitstellung verfügbar. Führen Sie es auf Ihrer eigenen GPU-Hardware oder privaten Cloud aus, um sicherzustellen, dass Daten Ihre Umgebung nie verlassen, eliminieren Sie API-Kosten pro Token im großen Maßstab oder stimmen Sie das Modell mit proprietären Datensätzen fein.
Mehr zum Vergleichen
Vergleichen Sie alle 24 Modelle in 11 Benchmarks – sortierbar, mit Quellenangaben und aktualisiert Juni 2026.

Llama 4 Maverick ist ein Open-Weight-KI-Modell von Meta (17B/400B MoE (128 Experten)), eingestuft in die Kategorie Established mit einem Kontextfenster von 1 Mi...

Llama 4 Scout ist ein Open-Weight-KI-Modell von Meta (17B/109B MoE (16 Experten)), eingestuft als Established-Tier mit einem Kontextfenster von 10 Millionen Tok...

Large Language Model Meta AI (LLaMA) ist ein hochmodernes Modell zur Verarbeitung natürlicher Sprache, entwickelt von Meta. Mit bis zu 65 Milliarden Parametern ...
Cookie-Zustimmung
Wir verwenden Cookies, um Ihr Surferlebnis zu verbessern und unseren Datenverkehr zu analysieren. See our privacy policy.