
Llama 4 Maverick — Benchmarks, mogelijkheden en gebruiksscenario's
Llama 4 Maverick is een AI-model met open gewichten van Meta (17B/400B MoE (128 experts)), geclassificeerd als 'Established'-niveau met een contextvenster van 1...
Llama 3.3 70B is een bewezen AI-model dat nog steeds breed wordt ingezet in productiesystemen, ontwikkeld door Meta en uitgebracht in december 2024. Als open-weight model zijn de getrainde gewichten openbaar beschikbaar — je kunt het zelf hosten, finetunen op eigen data, of on-premise draaien zonder API-afhankelijkheden. Het ondersteunt een contextvenster van 128K tokens, voldoende voor de meeste documenten en meerstaps-toepassingen.
Op het FlowHunt AI Leaderboard is het een van de 24 bijgehouden modellen, geëvalueerd op 4 benchmarks. Opvallende scores: 88,4% op HumanEval (#1 van 2); 77,0% op MATH-500 (#3 van 4); 68,9% op MMLU-Pro (#7 van 8).
Llama 3.3 70B werd uitgebracht op 6 december 2024 als een van Meta’s laatste modellen uit de Llama 3-serie, vóór de architectuurovergang naar Llama 4. Als een dense (niet-MoE) model met 70B parameters weerspiegelde het de filosofie van de Llama 3-generatie van een eenvoudige, schaalbare architectuur: meer parameters, betere resultaten, transparante structuur. Het contextvenster van 128K en de sterke scores op MMLU-Pro en SWE-bench maakten het toonaangevende zelfgehoste model voor teams met voldoende GPU-bronnen voor dense 70B-inferentie, maar zonder MoE-systeem. Het blijft populair in gereguleerde sectoren — gezondheidszorg, financiën, juridisch — waar de transparantie en auditbaarheid van een dense architectuur, gecombineerd met de beschikbaarheid van open gewichten, net zo belangrijk zijn als ruwe capaciteit.
Let op: bijna 405B-kwaliteit tegen 70B-kosten. Alleen tekst. IFEval 92,1%.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| GPQA Diamond | 50.5% | 13 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 68.9% | 7 of 8 | SR | Hard knowledge reasoning, 12K questions |
| MATH-500 | 77.0% | 3 of 4 | SR | Hendrycks math (500 problems) |
| HumanEval pass@1 | 88.4% | 1 of 2 | SR | Python code generation (saturated at frontier) |
Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.
| Benchmark | Llama 3.3 70B | GPT-4o | Llama 4 Maverick |
|---|---|---|---|
| GPQA ◇ | 50.5% | 53.6% | 69.8% |
| MMLU-P | 68.9% | 72.6% | 80.5% |
| MATH | 77.0% | — | — |
| HumEval | 88.4% | — | — |
Meta Platforms (voorheen Facebook) is een van de grootste technologiebedrijven ter wereld, gevestigd in Menlo Park, Californië, en vooral bekend van Facebook, Instagram, WhatsApp en Threads. Via Meta AI (voorheen FAIR) is het bedrijf de meest productieve uitgever geworden van open-gewicht grote taalmodellen via de Llama-familie. De Llama 4-serie — Maverick, Scout en Behemoth — werden uitgebracht onder permissieve gemeenschapslicenties en blijven de meest gedownloade open-gewicht modellen op platforms zoals Hugging Face. De AI-strategie van Meta is onderscheidend onder de grote laboratoria: in plaats van een commerciële API te exploiteren, brengt Meta modellen openlijk uit voor onderzoek en commercieel gebruik, integreert het generatieve AI-functies in haar eigen toepassingen, en heeft het publiekelijk gepleit voor open-gewicht releases als de meest democratische benadering van AI-ontwikkeling.
Gebruiksscenario's
Llama 3.3 70B behaalt 50% op GPQA Diamond (#13 van 14 modellen). Het verwerkt algemene wetenschappelijke vraagbeantwoording op een solide niveau, hoewel toonaangevende modellen 25+ procentpunten hoger scoren op de moeilijkste problemen op masterniveau.
Llama 3.3 70B is open-weight (70B dense parameters) — de getrainde gewichten zijn openbaar beschikbaar om te downloaden en zelf te implementeren. Draai het op je eigen GPU-hardware of private cloud om te zorgen dat data nooit je omgeving verlaat, elimineer API-kosten per token op schaal, of finetune het model op eigen datasets.
Meer om te vergelijken
Vergelijk alle 24 modellen op 11 benchmarks — sorteerbaar, met bronvermelding, bijgewerkt in juni 2026.

Llama 4 Maverick is een AI-model met open gewichten van Meta (17B/400B MoE (128 experts)), geclassificeerd als 'Established'-niveau met een contextvenster van 1...

Llama 4 Scout is een open-weight AI-model van Meta (17B/109B MoE (16 experts)), geclassificeerd als Established-tier met een contextvenster van 10M tokens. Het ...

Mistral Large 3 is een open-weight AI-model van Mistral (41B/675B MoE), geclassificeerd als Advanced-niveau met een contextvenster van 256K tokens. Het is direc...
Cookie Toestemming
We gebruiken cookies om uw browse-ervaring te verbeteren en ons verkeer te analyseren. See our privacy policy.