
Llama 4 Scout — Benchmarks, Capacidades e Casos de Uso
Llama 4 Scout é um modelo de IA de pesos abertos da Meta (17B/109B MoE (16 especialistas)), classificado como Nível Estabelecido (Established) com uma janela de...
O Llama 3.3 70B é um modelo de IA consolidado, ainda amplamente implantado em sistemas de produção, desenvolvido pela Meta e lançado em dezembro de 2024. Como um modelo open-weight, seus pesos treinados estão disponíveis publicamente — você pode auto-hospedá-lo, ajustá-lo com dados proprietários ou executá-lo localmente sem dependências de API. Ele suporta uma janela de contexto de 128K tokens, adequada para a maioria dos documentos e aplicações de múltiplas interações.
No Ranking de IA do FlowHunt, é um dos 24 modelos monitorados, avaliado em 4 benchmarks. Pontuações de destaque: 88,4% no HumanEval (#1 de 2); 77,0% no MATH-500 (#3 de 4); 68,9% no MMLU-Pro (#7 de 8).
O Llama 3.3 70B foi lançado em 6 de dezembro de 2024 como um dos últimos modelos da série Llama 3 da Meta antes da transição arquitetural para o Llama 4. Como um modelo denso (não-MoE) de 70B parâmetros, ele refletia a filosofia da geração Llama 3 de arquitetura escalável e direta: mais parâmetros, melhores resultados, estrutura transparente. Sua janela de contexto de 128K e fortes pontuações em MMLU-Pro e SWE-bench o tornaram o principal modelo auto-hospedado para equipes com recursos de GPU adequados para inferência densa de 70B, mas não para um sistema MoE. Ele continua popular em setores regulamentados — saúde, finanças, direito — onde a transparência e auditabilidade de uma arquitetura densa, combinadas com a disponibilidade de pesos abertos, são tão importantes quanto a capacidade bruta.
Nota: Qualidade próxima a 405B a custo de 70B. Apenas texto. IFEval 92,1%.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| GPQA Diamond | 50.5% | 13 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 68.9% | 7 of 8 | SR | Hard knowledge reasoning, 12K questions |
| MATH-500 | 77.0% | 3 of 4 | SR | Hendrycks math (500 problems) |
| HumanEval pass@1 | 88.4% | 1 of 2 | SR | Python code generation (saturated at frontier) |
Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.
| Benchmark | Llama 3.3 70B | GPT-4o | Llama 4 Maverick |
|---|---|---|---|
| GPQA ◇ | 50.5% | 53.6% | 69.8% |
| MMLU-P | 68.9% | 72.6% | 80.5% |
| MATH | 77.0% | — | — |
| HumEval | 88.4% | — | — |
A Meta Platforms (anteriormente Facebook) é uma das maiores empresas tecnológicas do mundo, com sede em Menlo Park, Califórnia, e mais conhecida pelo Facebook, Instagram, WhatsApp e Threads. Através da Meta AI (anteriormente FAIR), a empresa tornou-se a publicadora mais prolífica de modelos de linguagem de grande escala de pesos abertos através da família Llama. A série Llama 4 — Maverick, Scout e Behemoth — foi lançada sob licenças comunitárias permissivas e continua a ser os modelos de pesos abertos mais descarregados em plataformas como o Hugging Face. A estratégia de IA da Meta é distinta entre os grandes laboratórios: em vez de operar uma API comercial, a Meta lança modelos abertamente para investigação e uso comercial, integra funcionalidades de IA generativa nas suas próprias aplicações e defende publicamente os lançamentos de pesos abertos como a abordagem mais democrática para o desenvolvimento de IA.
Casos de Uso
O Llama 3.3 70B alcança 50% no GPQA Diamond (#13 de 14 modelos). Ele lida com perguntas e respostas científicas gerais em um nível sólido, embora modelos de fronteira obtenham 25+ pontos percentuais a mais nos problemas mais difíceis de nível de pós-graduação.
O Llama 3.3 70B é open-weight (70B parâmetros densos) — seus pesos treinados estão disponíveis publicamente para download e auto-implantação. Execute-o em seu próprio hardware GPU ou nuvem privada para garantir que os dados nunca saiam do seu ambiente, elimine custos de API por token em escala ou ajuste o modelo em conjuntos de dados proprietários.
Mais para Comparar
Compare todos os 24 modelos em 11 benchmarks — classificável, com fontes e atualizado em junho de 2026.

Llama 4 Scout é um modelo de IA de pesos abertos da Meta (17B/109B MoE (16 especialistas)), classificado como Nível Estabelecido (Established) com uma janela de...

Llama 4 Maverick é um modelo de IA de pesos abertos da Meta (17B/400B MoE (128 especialistas)), classificado como nível Established (Estabelecido) com janela de...

Large Language Model Meta AI (LLaMA) é um modelo de processamento de linguagem natural de ponta desenvolvido pela Meta. Com até 65 bilhões de parâmetros, o LLaM...
Consentimento de Cookies
Usamos cookies para melhorar sua experiência de navegação e analisar nosso tráfego. See our privacy policy.