
Llama 4 Maverick — Benchmarks, Fähigkeiten und Anwendungsfälle
Llama 4 Maverick ist ein Open-Weight-KI-Modell von Meta (17B/400B MoE (128 Experten)), eingestuft in die Kategorie Established mit einem Kontextfenster von 1 Mi...
Llama 4 Scout ist ein bewährtes KI-Modell, das noch immer weit verbreitet in Produktionssystemen eingesetzt wird. Es wurde von Meta entwickelt und im April 2025 veröffentlicht. Als Open-Weight-Modell sind seine trainierten Gewichte öffentlich verfügbar – Sie können es selbst hosten, mit proprietären Daten feintunen oder ohne API-Abhängigkeiten vor Ort betreiben. Sein Kontextfenster von 10 Millionen Token ist eines der größten verfügbaren – es kann buchlange Dokumente, gesamte Code-Repositorys oder sehr lange Gesprächsverläufe in einem einzigen Prompt verarbeiten.
Im FlowHunt KI-Leaderboard ist es eines von 24 verfolgten Modellen, evaluiert an 4 Benchmarks. Herausragende Ergebnisse: 50,3 % bei MATH-500 (#4 von 4); 32,8 % bei LiveCodeBench (#5 von 5); 52,2 % bei MMLU-Pro (#8 von 8).
Llama 4 Scout wurde zusammen mit Maverick am 5. April 2025 als kleinere, gut zugängliche Variante der Llama-4-Generation veröffentlicht – und erregte sofort Aufmerksamkeit durch sein Kontextfenster: 10 Millionen Token, das größte aller Modelle in diesem Leaderboard. Das 10-Millionen-Token-Fenster wurde durch Modifikationen am Aufmerksamkeitsmechanismus und der Positionskodierung erreicht, die es dem Modell ermöglichen, Kohärenz über Dokumente hinweg zu bewahren, die weitaus länger sind als jedes frühere Open-Weight-Modell verarbeiten konnte. Scout (17B aktiv / 109B gesamt, 16 Experten) wurde zum Standardmodell für Retrieval-Augmented-Generation-Pipelines, die über sehr große Dokumentsammlungen ohne Chunking operieren mussten – es verarbeitet gesamte Rechtsfallhistorien, Codebasen oder wissenschaftliche Literatursammlungen in einem einzigen Prompt.
Hinweis: Architektonischer Kontext von 10M Token. Einzelne H100 (Int4). DocVQA 94,4%.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| MMLU-Pro | 52.2% | 8 of 8 | SR | Hard knowledge reasoning, 12K questions |
| LiveCodeBench | 32.8% | 5 of 5 | SR | Competitive programming, continuously updated |
| MATH-500 | 50.3% | 4 of 4 | SR | Hendrycks math (500 problems) |
| AA Intelligence Index | 14.0 pts | 9 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.
| Benchmark | Llama 4 Scout | GPT-4o | Llama 4 Maverick |
|---|---|---|---|
| MMLU-P | 52.2% | 72.6% | 80.5% |
| LiveCode | 32.8% | — | 43.4% |
| MATH | 50.3% | — | — |
| AA Idx | 14.0 pts | — | — |
Meta Platforms (ehemals Facebook) ist eines der größten Technologieunternehmen der Welt mit Hauptsitz in Menlo Park, Kalifornien, und bekannt für Facebook, Instagram, WhatsApp und Threads. Über Meta AI (ehemals FAIR) ist das Unternehmen mit der Llama-Familie zum produktivsten Herausgeber von Open-Weight-Sprachmodellen geworden. Die Llama-4-Serie – Maverick, Scout und Behemoth – wurde unter großzügigen Community-Lizenzen veröffentlicht und sind die am meisten heruntergeladenen Open-Weight-Modelle auf Plattformen wie Hugging Face. Metas KI-Strategie unterscheidet sich von anderen großen Laboren: Anstatt eine kommerzielle API zu betreiben, veröffentlicht Meta Modelle offen für Forschung und kommerzielle Nutzung, integriert generative KI-Funktionen in seine eigenen Anwendungen und hat sich öffentlich für Open-Weight-Veröffentlichungen als demokratischsten Ansatz der KI-Entwicklung ausgesprochen.
Anwendungsfälle
Llama 4 Scout ist ein Open-Weight-Modell (17B/109B MoE (16 Experten) Parameter) – seine trainierten Gewichte sind öffentlich zum Herunterladen und zur Selbstbereitstellung verfügbar. Betreiben Sie es auf Ihrer eigenen GPU-Hardware oder privaten Cloud, um sicherzustellen, dass Daten Ihre Umgebung nie verlassen, vermeiden Sie tokenbasierte API-Kosten im großen Maßstab oder feintunen Sie das Modell mit proprietären Datensätzen.
Mit einem Kontextfenster von 10 Millionen Token kann Llama 4 Scout gesamte Software-Repositorys, lange Rechtsverträge, buchlange Forschungsberichte oder umfangreiche Gesprächsverläufe in einem einzigen Prompt aufnehmen – und ermöglicht tiefgehende Dokumenten-Q&A, codebasenübergreifendes Reasoning und umfassende Zusammenfassungen ohne Chunking-Heuristiken oder RAG-Pipelines.
Mehr zum Vergleichen
Vergleichen Sie alle 24 Modelle anhand von 11 Benchmarks – sortierbar, quellenbasiert und aktualisiert Juni 2026.

Llama 4 Maverick ist ein Open-Weight-KI-Modell von Meta (17B/400B MoE (128 Experten)), eingestuft in die Kategorie Established mit einem Kontextfenster von 1 Mi...

Llama 3.3 70B ist ein Open-Weight-KI-Modell von Meta (70B dicht), eingestuft als etablierte Stufe mit einem Kontextfenster von 128K Token. Es ist direkt in Flow...

Eine ausführliche Analyse der Leistungsfähigkeit von Metas Llama 4 Scout AI-Modell über fünf unterschiedliche Aufgabenbereiche hinweg. Die Analyse zeigt beeindr...
Cookie-Zustimmung
Wir verwenden Cookies, um Ihr Surferlebnis zu verbessern und unseren Datenverkehr zu analysieren. See our privacy policy.