Meta logo

Meta

Llama 3.3 70B

EstablishedOpen-weightAvailable in FlowHunt

Llama 3.3 70B is een bewezen AI-model dat nog steeds breed wordt ingezet in productiesystemen, ontwikkeld door Meta en uitgebracht in december 2024. Als open-weight model zijn de getrainde gewichten openbaar beschikbaar — je kunt het zelf hosten, finetunen op eigen data, of on-premise draaien zonder API-afhankelijkheden. Het ondersteunt een contextvenster van 128K tokens, voldoende voor de meeste documenten en meerstaps-toepassingen.

Op het FlowHunt AI Leaderboard is het een van de 24 bijgehouden modellen, geëvalueerd op 4 benchmarks. Opvallende scores: 88,4% op HumanEval (#1 van 2); 77,0% op MATH-500 (#3 van 4); 68,9% op MMLU-Pro (#7 van 8).

Llama 3.3 70B werd uitgebracht op 6 december 2024 als een van Meta’s laatste modellen uit de Llama 3-serie, vóór de architectuurovergang naar Llama 4. Als een dense (niet-MoE) model met 70B parameters weerspiegelde het de filosofie van de Llama 3-generatie van een eenvoudige, schaalbare architectuur: meer parameters, betere resultaten, transparante structuur. Het contextvenster van 128K en de sterke scores op MMLU-Pro en SWE-bench maakten het toonaangevende zelfgehoste model voor teams met voldoende GPU-bronnen voor dense 70B-inferentie, maar zonder MoE-systeem. Het blijft populair in gereguleerde sectoren — gezondheidszorg, financiën, juridisch — waar de transparantie en auditbaarheid van een dense architectuur, gecombineerd met de beschikbaarheid van open gewichten, net zo belangrijk zijn als ruwe capaciteit.

Let op: bijna 405B-kwaliteit tegen 70B-kosten. Alleen tekst. IFEval 92,1%.

Uitgebracht
December 2024
Parameters
70B dense
Context
128K tokens
Gewichten
Open
Tier
Established
Aanbieder
Meta

Llama 3.3 70B Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
GPQA Diamond50.5%13 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro68.9%7 of 8SRHard knowledge reasoning, 12K questions
MATH-50077.0%3 of 4SRHendrycks math (500 problems)
HumanEval pass@188.4%1 of 2SRPython code generation (saturated at frontier)

Detailed Benchmark Scores

GPQA ◇ SR
50.5%
Graduate-level Google-proof science Q&A
MMLU-P SR
68.9%
Hard knowledge reasoning, 12K questions
MATH SR
77.0%
Hendrycks math (500 problems)
HumEval SR
88.4%
Python code generation (saturated at frontier)

Llama 3.3 70B vs. Established Peers

Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.

BenchmarkLlama 3.3 70BGPT-4oLlama 4 Maverick
GPQA ◇50.5%53.6%69.8%
MMLU-P68.9%72.6%80.5%
MATH77.0%
HumEval88.4%

About Meta

Meta Founded 2004 · Menlo Park, CA
Website →

Meta Platforms (voorheen Facebook) is een van de grootste technologiebedrijven ter wereld, gevestigd in Menlo Park, Californië, en vooral bekend van Facebook, Instagram, WhatsApp en Threads. Via Meta AI (voorheen FAIR) is het bedrijf de meest productieve uitgever geworden van open-gewicht grote taalmodellen via de Llama-familie. De Llama 4-serie — Maverick, Scout en Behemoth — werden uitgebracht onder permissieve gemeenschapslicenties en blijven de meest gedownloade open-gewicht modellen op platforms zoals Hugging Face. De AI-strategie van Meta is onderscheidend onder de grote laboratoria: in plaats van een commerciële API te exploiteren, brengt Meta modellen openlijk uit voor onderzoek en commercieel gebruik, integreert het generatieve AI-functies in haar eigen toepassingen, en heeft het publiekelijk gepleit voor open-gewicht releases als de meest democratische benadering van AI-ontwikkeling.

Gebruiksscenario's

Waar Llama 3.3 70B voor te gebruiken

Wetenschappelijk & technisch redeneren
Zelfgehoste & privé-implementaties

Strengths & Limitations

Strengths

  • Zelfgehoste & data-privé-implementaties (open-weight)
  • Taken met lange context (128K contextvenster)

Limitations

  • Onder toonaangevend niveau qua harde wetenschappelijke redenering (50% GPQA — topniveau is 90%+)
  • Aanzienlijk achter op toonaangevende modellen van 2026 op het gebied van agentisch programmeren en complex redeneren

Bekijk het volledige AI Model Leaderboard

Veelgestelde vragen

Meer informatie