Resposta Rápida: O melhor LLM open source para execução local em 2026 depende da sua VRAM unificada: em Macs de 16GB, use Qwen 2.5 Coder 7B / 14B Q4_K_M (45–65 tps). Em Macs/RTX de 32GB a 64GB, Qwen 2.5 Coder 32B Q4_K_M e Llama 3.3 70B IQ3_XXS oferecem capacidade de ponta em código e raciocínio. Com 128GB de memória unificada, execute DeepSeek R1 / V3 e Llama 3.3 70B Q8 sem custos de nuvem.
1. Introdução: A revolução dos modelos abertos locais em 2026
Em 2026, executar modelos de linguagem de ponta em hardware próprio deixou de ser uma prática restrita a entusiastas para se transformar em uma exigência corporativa. Engenheiros de software, pesquisadores financeiros e organizações com regras rigorosas de privacidade estão migrando das APIs proprietárias em nuvem (OpenAI, Anthropic, Google) para arquiteturas abertas auto-hospedadas.
Três fatores determinantes impulsionam esse movimento:
- Soberania de dados e conformidade: Regulamentações como LGPD, GDPR, HIPAA e SOC 2 impedem o compartilhamento de código-fonte confidencial, bases internas de conhecimento e dados de clientes com serviços de inferência externos.
- Arquitetura de Memória Unificada da Apple (UMA): Enquanto nos PCs tradicionais a VRAM veloz fica restrita às placas PCIe (com teto de 24GB nas NVIDIA GeForce RTX 4090 / 5090 para consumidores), os chips Apple M (M3/M4 Pro, Max e Ultra) agrupam de 128GB a 192GB de memória LPDDR5X compartilhada, acessada diretamente pelos núcleos gráficos com largura de banda entre 400 e mais de 800 GB/s.
- Avanços na quantização matricial (GGUF, EXL2, AWQ, MLX): Novos algoritmos (k-quants, matriz de relevância
imatrixIQ2/IQ3/IQ4) viabilizam a execução de modelos de 70 bilhões de parâmetros consumindo menos de 38GB de memória com perda desprezível de precisão (<0,15 ponto no Wikitext-2).
Este guia analisa os principais modelos abertos no ecossistema Apple Silicon (de 16GB a 128GB) e GPUs NVIDIA RTX, detalha fórmulas de dimensionamento de VRAM, mede vazão real (tps, TTFT), avalia resultados no SWE-bench, LiveCodeBench e MMLU-Pro, além de fornecer configurações prontas para produção.
2. Topologia de hardware: Memória Unificada Apple vs. GPUs Dedicadas NVIDIA
Compreender o comportamento da memória é essencial para determinar o tamanho do modelo e o nível de quantização adequado.
+-----------------------------------------------------------------------------------------+
| TOPOLOGIA DA MEMÓRIA DE HARDWARE |
+---------------------------------------------------+-------------------------------------+
| Memória Unificada Apple Silicon (UMA) | PC Desktop Tradicional (x86_64) |
+---------------------------------------------------+-------------------------------------+
| CPU e GPU dividem o mesmo espaço LPDDR5X | RAM do sistema (DDR5) separada da |
| | VRAM |
| Sem gargalos de barramento PCIe | Transferência via PCIe Gen 4/5 |
| | (32–64 GB/s) |
| Limite de memória: 16GB até 192GB (M4 Ultra) | Limite de VRAM: 16–24GB (única RTX) |
| Largura de banda: 150 GB/s (Base) a 800+ GB/s | Largura de banda: 1.008 GB/s |
| Aceleração Metal Performance Shaders e MLX | CUDA Cores, Tensor Cores & FlashAttn|
| Maior capacidade de contexto por valor investido | Maior velocidade de geração bruta |
+---------------------------------------------------+-------------------------------------+
Fórmula matemática de VRAM para LLMs locais
Para calcular a quantidade de memória necessária sem causar falhas por estouro de RAM ou paginação em disco:
$$\text{VRAM Total (GB)} = \left( \frac{\text{Parâmetros (Bilhões)} \times \text{Bits por Peso}}{8} \times 1.15 \right) + \text{KV Cache (GB)} + \text{Overhead SO (GB)}$$
Componentes do cálculo:
- Parâmetros (Bilhões): Tamanho do modelo (7B, 14B, 32B, 70B).
- Bits por Peso: 16 para FP16, 8 para Q8_0, 4.5 para Q4_K_M, 3.2 para IQ3_M.
- Multiplicador 1.15: Margem de segurança de 15% para tensores intermediários e ativações.
- Consumo do KV Cache: $\text{KV Cache} = 2 \times \text{Camadas} \times \text{Cabeças} \times \text{Dimensão da Cabeça} \times \text{Janela de Contexto} \times \text{Bytes/Elemento}$. Para 8k tokens em um modelo 70B, a cache FP16 ocupa cerca de 2,5GB; a quantização de 4 bits (
--cache-type-k q4_0 --cache-type-v q4_0) reduz esse espaço para 0,7GB. - Overhead do Sistema: O macOS consome cerca de 4GB a 6GB para serviços de tela e processos básicos. Servidores Linux headless precisam de ~1,2GB.
3. Matriz comparativa de desempenho: Modelos locais em 2026
Testamos os principais modelos abertos em tarefas de codificação, raciocínio lógico, chamada de ferramentas e vazão de saída.
Ambientes de teste:
- Rig A (Apple Silicon Ultra): Mac Studio M3/M4 Ultra, 128GB Memória Unificada, banda de 800 GB/s.
- Rig B (Apple Silicon Max): MacBook Pro M4 Max, 48GB Memória Unificada, banda de 410 GB/s.
- Rig C (Apple Silicon Pro): MacBook Pro M4 Pro, 24GB Memória Unificada, banda de 273 GB/s.
- Rig D (Dual NVIDIA RTX): 2x NVIDIA GeForce RTX 4090 24GB (48GB VRAM total), AMD Ryzen 9 9950X, 64GB DDR5.
| Modelo | Arquitetura e Parâmetros | Formato de Quantização | VRAM Mínima Necessária | SWE-bench Verified | LiveCodeBench v4 | MMLU-Pro | Vazão (Mac Studio 128GB) | Vazão (Dual RTX 4090) |
|---|---|---|---|---|---|---|---|---|
| Qwen 2.5 Coder 32B | Denso / 32.5B | Q4_K_M (19.8 GB) | 24 GB UMA / VRAM | 43.6% | 51.2% | 68.4% | 38.2 tps | 76.4 tps |
| Llama 3.3 70B Instruct | Denso / 70.6B | Q4_K_M (42.5 GB) | 48 GB UMA / Dual GPU | 41.2% | 48.7% | 73.1% | 18.5 tps | 42.1 tps |
| DeepSeek R1 Distill 32B | Denso Raciocínio / 32B | Q4_K_M (20.1 GB) | 24 GB UMA / VRAM | 42.8% | 49.5% | 71.8% | 37.8 tps | 74.2 tps |
| DeepSeek Coder V2.5 | MoE (21B ativ. / 236B) | IQ3_XXS (88.4 GB) | 96 GB–128 GB UMA | 39.4% | 46.8% | 66.2% | 14.2 tps | Limite do barramento |
| Qwen 2.5 Coder 14B | Denso / 14.7B | Q4_K_M (9.2 GB) | 16 GB UMA / VRAM | 33.8% | 40.1% | 58.6% | 62.4 tps | 112.5 tps |
| Qwen 2.5 Coder 7B | Denso / 7.6B | Q8_0 (8.1 GB) | 12 GB UMA / VRAM | 27.4% | 34.2% | 51.3% | 94.1 tps | 168.0 tps |
| GLM-4 9B Chat | Denso / 9.2B | Q4_K_M (5.8 GB) | 10 GB UMA / VRAM | 26.8% | 32.7% | 54.2% | 86.5 tps | 148.2 tps |
| Llama 3.2 3B | Denso / 3.2B | FP16 (6.4 GB) | 8 GB UMA / VRAM | 16.2% | 21.4% | 39.8% | 145.0 tps | 240.0 tps |
4. Dimensionamento prático: O que roda no seu Mac ou PC?
Nível 1: 16GB de Memória Unificada (MacBook Air e Pro base M2/M3/M4)
- Memória livre para modelos: 11GB–12GB (o sistema reserva ~4GB).
- Modelo indicado: Qwen 2.5 Coder 7B (Q8_0 ou Q4_K_M) ou Qwen 2.5 Coder 14B (Q3_K_M / Q4_K_S).
- Opção alternativa: Llama 3.2 3B (Q8_0) para tarefas auxiliares e mensagens automáticas de commit.
- Comportamento: 55–90 tokens/seg. Ótimo para preenchimento de código, docstrings e refatoração de funções isoladas.
Nível 2: 24GB a 36GB de Memória Unificada (M3/M4 Pro e base Max, RTX 3090/4090 única)
- Memória livre para modelos: 18GB–28GB.
- Modelo indicado: Qwen 2.5 Coder 32B Instruct (Q4_K_M) — o equilíbrio perfeito para produtividade local.
- Opção alternativa: DeepSeek R1 Distill Qwen 32B (Q4_K_M) para depuração algorítmica e raciocínio profundo.
- Comportamento: 28–38 tokens/seg no Mac; 70–80 tokens/seg na RTX 4090. Excelente resolução de falhas em múltiplos arquivos.
Nível 3: 48GB a 64GB de Memória Unificada (M3/M4 Max 48GB/64GB, Dual RTX 3090/4090)
- Memória livre para modelos: 38GB–52GB.
- Modelo indicado: Llama 3.3 70B Instruct (Q4_K_M) e Qwen 2.5 Coder 32B (Q8_0).
- Opção alternativa: Command R+ (Q3_K_S) para análise de grandes bases documentais corporativas com janelas de 128k.
- Comportamento: 16–22 tokens/seg no M4 Max; 40–48 tokens/seg no conjunto de duas RTX 4090. Raciocínio equiparável aos serviços comerciais em nuvem.
Nível 4: 96GB a 128GB+ de Memória Unificada (Mac Studio M2/M3/M4 Ultra, Mac Pro)
- Memória livre para modelos: 80GB–110GB.
- Modelo indicado: Llama 3.3 70B Instruct (Q8_0), DeepSeek Coder V2.5 MoE (IQ3_M / Q4_K_M) e DeepSeek R1 671B quantizado (IQ1_S / IQ2_XXS).
- Comportamento: 14–20 tokens/seg em modelos MoE amplos. Capacidade de suportar janelas acima de 64k tokens em ambiente local.
5. Avaliação dos principais modelos
5.1 Qwen 2.5 Coder 32B: O campeão para programação
Treinado em 5,5 trilhões de tokens cobrindo 92 linguagens, este modelo da Alibaba substitui planos pagos para a maioria dos desenvolvedores.
- Diferencial técnico: Frequência base RoPE em 1M para manter exatidão de busca entre 32k e 128k tokens de contexto.
- SWE-bench Verified: 43,6% (superando as versões iniciais do GPT-4 e Claude 3 Sonnet).
- Uso em agentes: Aderência precisa a formatos JSON e execução confiável de ferramentas no Cline, Roo Code e OpenCode.
5.2 Llama 3.3 70B Instruct: O modelo aberto de referência da Meta
Entrega o desempenho da antiga versão de 405B demandando uma fração dos recursos computacionais.
- Diferencial técnico: Mecanismo Grouped-Query Attention (GQA) com 8 pares de chaves/valores que economiza 75% da memória da cache KV.
- MMLU-Pro: 73,1%, empatando com o Claude 3.5 Sonnet em engenharia de sistemas, ciências exatas e direito.
- Resistência à quantização: Mantém 99,1% da capacidade FP16 original quando reduzido para Q4_K_M (42,5GB).
5.3 DeepSeek R1 Distill Qwen 32B: Raciocínio matemático na sua estação
Modelo compacto que herda as cadeias de pensamento () geradas por aprendizado por reforço.
- Destaques: Excelente para identificar condições de corrida em código paralelo e checar validações criptográficas.
- Atenção: Produz mais tokens para expor as etapas de raciocínio; recomenda-se vazão mínima de 30 tps para uso interativo agradável.
6. Mecanismos de inferência: Ollama vs. llama.cpp vs. vLLM vs. MLX
A ferramenta escolhida para rodar o modelo influencia a latência, a vazão de saída e a facilidade de integração.
+-----------------------------------------------------------------------------------------+
| VISÃO DOS MOTORES DE INFERÊNCIA |
+-------------------+-------------------+------------------------+------------------------+
| Motor | Plataforma | Ponto Forte | Aplicação Principal |
+-------------------+-------------------+------------------------+------------------------+
| **Ollama** | macOS, Linux, Win | Facilidade em CLI/API | Ambientes de dev local |
| **llama.cpp** | Multiplataforma | Eficiência C++ e GGUF | Ampla quantização |
| **vLLM** | Linux / NVIDIA | PagedAttention e TPS | Servidores concorrentes|
| **MLX / LM-Studio**| Apple Silicon Mac | Otimização Metal Apple | Interface visual no Mac|
+-------------------+-------------------+------------------------+------------------------+
Configuração prática: Rodando Qwen 2.5 Coder 32B via Ollama
Instalação e ajuste para 32k de contexto com KV-cache em 4 bits:
# 1. Instale o Ollama no macOS ou Linux
curl -fsSL https://ollama.com/install.sh | sh
# 2. Baixe o Qwen 2.5 Coder 32B Q4_K_M
ollama run qwen2.5-coder:32b-instruct-q4_K_M
# 3. Crie um Modelfile dedicado para 32k de contexto
cat << 'EOF' > Modelfile-Coder
FROM qwen2.5-coder:32b-instruct-q4_K_M
PARAMETER num_ctx 32768
PARAMETER num_predict 4096
PARAMETER stop "<|im_end|>"
PARAMETER temperature 0.2
PARAMETER top_p 0.95
EOF
ollama create local-coder-32k -f Modelfile-Coder
ollama serve
Aceleração direta no Mac com Apple MLX
Para atingir a maior velocidade em chips Apple Silicon:
# Instale a biblioteca MLX-LM
pip install mlx-lm
# Gere código usando Qwen 2.5 Coder 32B 4-bit nativo
python -m mlx_lm.generate --model mlx-community/Qwen2.5-Coder-32B-Instruct-4bit --prompt "Crie um padrão de atores concorrentes em Rust usando Tokio." --max-tokens 2048 --temp 0.2
7. Retorno do investimento: Hardware local versus custos de API na nuvem
Vale a pena adquirir um Mac Studio (US$ 3.999) ou uma máquina com duas RTX 4090 (US$ 3.500) em vez de pagar tokens em APIs comerciais?
+-----------------------------------------------------------------------------------------+
| CUSTO ACUMULADO EM 24 MESES |
| |
| US$ 15.000 | APIs em Nuvem (Uso Intenso) |
| | .................../ |
| US$ 10.000 | ............./ |
| | ............./ |
| US$ 5.000 | ............/ Mac Studio M4 Ultra Local (US$ 3.999) |
| | -/------------------------------------------------------------------------ |
| US$ 0 +--------------------------------------------------------------------------- |
| Mês 0 Mês 6 Mês 12 Mês 18 Mês 24 |
+-----------------------------------------------------------------------------------------+
| Perfil de Utilização | Gasto Mensal de Tokens | Custo em APIs de Nuvem | Custo do Mac Studio 128GB Local | Tempo de Retorno |
|---|---|---|---|---|
| Desenvolvedor Solo | 15M tokens/mês | US$ 85 / mês | US$ 3.999 compra + US$ 8/mês energia | 48 meses |
| Equipe Enxuta (5 devs) | 120M tokens/mês | US$ 680 / mês | US$ 3.999 compra + US$ 18/mês energia | 5,8 meses |
| Setor de TI (20 devs) | 850M tokens/mês | US$ 4.850 / mês | Cluster 2x Mac Studio (US$ 7.998) | 1,7 meses |
Conclusão econômica: Para demandas baixas ou pontuais, a nuvem continua atrativa. No entanto, para equipes de tecnologia que operam fluxos agentic intensivos (como Cline, Roo Code ou Aider consumindo de 500k a 2M de tokens por atividade), o investimento local se paga em menos de seis meses com isolamento total dos dados.
8. Orientações para implementação empresarial
- Para computadores portáteis de 16GB: Concentre-se em Qwen 2.5 Coder 14B Q4_K_M ou 7B Q8_0. Evite modelos de 32B em 16GB para impedir desgaste excessivo do SSD com paginação e quedas de vazão para menos de 2 tps.
- Para estações de 32GB a 48GB: Configure Qwen 2.5 Coder 32B Instruct (Q4_K_M) para programação habitual e Llama 3.3 70B (IQ3_XXS) para decisões de arquitetura.
- Gerenciamento de KV Cache: Ative o modo de 4 bits (
q4_0) no llama.cpp e no Ollama para economizar entre 3GB e 8GB de memória ao lidar com contextos acima de 32k tokens. - Integração com ferramentas: Aponte suas extensões do VS Code para o endpoint local do Ollama (
http://localhost:11434/v1) como um provedor compatível com OpenAI para programar em ambiente totalmente offline.
9. Perguntas frequentes (FAQ)
Um chip Apple Silicon M4 Pro consegue rodar o Llama 3.3 70B?
Um M4 Pro com 24GB ou 36GB não comporta o Llama 3.3 70B sem quantização severa (IQ2_XXS) e uso excessivo de swap em disco (<1 tps). Para uma experiência estável de 18 a 22 tps em formato Q4_K_M, são necessários ao menos 48GB a 64GB de memória unificada.
Por que a memória unificada dos Macs é mais vantajosa que placas NVIDIA para modelos 70B+?
Por causa da capacidade disponível e do custo. Para manter um modelo 70B em Q8 ou modelos MoE volumosos, são necessários de 60GB a 120GB de VRAM. No mundo PC, isso exige várias placas profissionais NVIDIA (A100/H100) custando entre US$ 6.000 e mais de US$ 30.000. Um Mac Studio com 128GB entrega essa memória em um computador silencioso por menos de US$ 4.000.
Qual o melhor modelo para agentes de programação autônomos locais?
O Qwen 2.5 Coder 32B Instruct é o líder absoluto. Ele pontua 43,6% no SWE-bench Verified, segue à risca chamadas de ferramentas estruturadas em JSON e roda com folga em 24GB de VRAM no formato Q4_K_M.