A XDA executou o mesmo modelo 8B em um laptop RTX 5070 e em uma máquina com gráficos integrados e relatou que a diferença de tokens por segundo é menor do que a maioria das pessoas imagina. Essa é a história dos LLMs locais em 2026: quantização, backends Vulkan e Metal da Apple levaram muitas cargas de trabalho para uma faixa em que um iGPU ou um pequeno dGPU é suficiente. Você não precisa de uma plataforma de $2.000 para executar modelos úteis localmente.
Este guia cobre oito aplicativos para executar LLMs locais em gráficos integrados, testados em um Intel Core Ultra 5 com Arc iGPU, um AMD Ryzen 7 com Radeon 780M e um Apple M2. Todos os oito executam modelos na faixa de 7B a 14B em velocidades úteis (10 tokens por segundo ou melhor) com a quantização correta. Priorizamos facilidade de configuração, compatibilidade de modelos e desempenho honesto em hardware classe iGPU.
O que procurar em um executor LLM local para iGPU
- Múltiplos backends. Vulkan é o grande equalizador no Windows e Linux; permite que os iGPUs AMD Radeon e Intel Arc usem aceleração de hardware sem kits de ferramentas bloqueados por fornecedor. Metal é o equivalente no Apple silicon.
- Suporte GGUF. GGUF é o formato de quantização de facto atual. Q4_K_M ou Q5_K_M oferece o melhor equilíbrio velocidade-qualidade para orçamentos de VRAM classe iGPU.
- Um catálogo de modelos que você não precisa procurar. Os melhores aplicativos incluem downloads de modelos com um clique do Hugging Face, então você não está perseguindo torrents.
- Padrões sensatos. Usuários de iGPU se beneficiam de aplicativos que pré-configuram comprimento do contexto, número de threads e porcentagem de descarga de GPU em vez de fazer você ajustá-los manualmente.
- Chat UI mais API. Os melhores executores funcionam como servidores de API compatíveis com OpenAI para que você possa apontar outras ferramentas para eles.
- Pequeno uso de memória. O iGPU compartilha RAM com o SO. Prefira aplicativos que permitam limitar o comprimento do contexto e descarregar modelos quando ociosos.
Comparação rápida
| Aplicativo | Melhor para | Plano gratuito | Preço inicial | Estilo UI |
|---|---|---|---|---|
| Ollama | CLI + API para modelos locais | Sim | Grátis (open source) | Terminal ou clientes de terceiros |
| LM Studio | UI de desktop polido | Sim | Grátis | Desktop nativo |
| GPT4All | Desktop amigável para iniciantes | Sim | Grátis | Desktop nativo |
| Jan | Clone ChatGPT totalmente open source | Sim | Grátis | Desktop nativo (Electron) |
| Msty | Tudo em um com RAG | Sim | Base gratuita | Desktop nativo |
| KoboldCpp | Jogo de rol e escrita criativa | Sim | Grátis (open source) | Web UI |
| Text Generation WebUI | Experimentação de usuário avançado | Sim | Grátis (open source) | Web UI |
| AnythingLLM | RAG local sobre documentos | Sim | Grátis (open source) | Desktop nativo |
Os aplicativos
1. Ollama, melhor executor CLI e API
Ollama é o mais próximo de um padrão para LLMs locais. Instale, execute ollama run llama3.2:3b, e você terá um modelo funcionando em menos de um minuto. Nos bastidores, usa llama.cpp com uma biblioteca de modelos curada, uma API compatível com OpenAI em localhost:11434 e gerenciamento de memória por modelo.
Onde fica aquém: Sem UI de chat incorporada; você usa ollama run em um terminal ou emparelha com um cliente (Open WebUI, Msty ou Enchanted no Mac). A biblioteca de modelos em ollama.com é curada, mas limitada comparada ao acesso Hugging Face puro.
Preços:
- Grátis, open source (MIT).
Plataformas: Windows, macOS (Apple silicon e Intel), Linux.
Download: ollama.com/download ou via Homebrew / apt.
Conclusão: O melhor backend, pronto. Instale mesmo se planejar usar uma interface diferente em cima.
2. LM Studio, melhor UI de desktop polido
LM Studio encapsula llama.cpp em um aplicativo de desktop nativo com navegador de modelos Hugging Face incorporado, downloads com um clique, benchmarks de desempenho por modelo e servidor de API compatível com OpenAI. Configurações de descarga de GPU são expostas com padrões sensatos para Intel Arc, AMD e Apple silicon.
Onde fica aquém: Código fechado (embora grátis). Alguns usuários relatam que a GUI consome mais RAM do que o modelo em si em iGPUs de gama baixa.
Preços:
- Grátis para uso pessoal, uso comercial requer licença.
Plataformas: Windows, macOS, Linux (beta).
Download: lmstudio.ai
Conclusão: O melhor ponto de partida para usuários de iGPU que preferem GUI. Acompanha os padrões corretos para hardware de consumidor.
3. GPT4All, melhor desktop amigável para iniciantes
GPT4All do Nomic é o mais acessível do pacote. Instale, escolha um modelo da barra lateral e ele baixa e executa. O painel LocalDocs adiciona RAG simples sobre uma pasta de arquivos sem configuração.
Onde fica aquém: Catálogo de modelos menor que LM Studio. Mais lento no Windows que Ollama ou LM Studio em nossos testes.
Preços:
- Grátis.
Plataformas: Windows, macOS, Linux.
Download: nomic.ai/gpt4all
Conclusão: A escolha para o membro menos técnico da sua família. Os coloca executando um modelo local sem tocar em um terminal.
4. Jan, melhor clone ChatGPT totalmente open source
Jan é um aplicativo de desktop totalmente open source que imita a interface do ChatGPT. Executa modelos locais via llama.cpp incluído, conecta-se a APIs remotas (OpenAI, Anthropic, Groq, Mistral) como opção e armazena cada conversa localmente.
Onde fica aquém: Baseado em Electron, então o uso de RAM é mais pesado que aplicativos nativos. Conversas multi-turno ocasionalmente perdem contexto no iGPU devido ao truncamento agressivo de contexto.
Preços:
- Grátis, open source (AGPL).
Plataformas: Windows, macOS, Linux.
Download: jan.ai
Conclusão: O mais semelhante ao ChatGPT aberto. Melhor se você quer um único aplicativo para local mais remoto opcional.
5. Msty, melhor tudo em um com RAG
Msty combina modelos locais, APIs remotas, RAG sobre documentos e conversas de visualização dividida em um aplicativo. Seu recurso “Knowledge Stacks” indexa pastas de PDFs, documentos Word e arquivos de texto para que você possa conversar com eles sem configurar um banco de dados vetorial.
Onde fica aquém: Código fechado. O plano gratuito limita alguns recursos RAG avançados.
Preços:
- Base gratuita.
- Pro adiciona sincronização em nuvem, RAG avançado e suporte prioritário (preços no site deles).
Plataformas: Windows, macOS, Linux.
Download: msty.app
Conclusão: A escolha se você quer chat de documentos sem configurar um armazenamento vetorial separado.
6. KoboldCpp, melhor para jogo de rol e escrita criativa
KoboldCpp começou como um fork do llama.cpp voltado para escrita de longa forma e jogo de rol. Tem uma UI web com informações mundiais, memória de personagem e livros de tradição que outros executores não expõem. Backend suporta Vulkan para iGPU.
Onde fica aquém: A UI é densa com sliders que significam algo apenas para usuários avançados. Não é realmente projetada para fluxos de trabalho de assistente de chat.
Preços:
- Grátis, open source (AGPL).
Plataformas: Windows, macOS, Linux.
Download: KoboldCpp GitHub releases.
Conclusão: Escolha de nicho para escritores e jogadores de rol que querem personagens persistentes.
7. Text Generation WebUI, melhor experimentação de usuário avançado
Text Generation WebUI (oobabooga) é o playground do experimentador. Suporta llama.cpp, ExLlama, Transformers e mais backends, expõe cada parâmetro de geração e se integra com LoRA e fine-tuning.
Onde fica aquém: Configuração não é para iniciantes; espere uma instalação de 30 minutos com Python venv. A UI web é funcional mas não é projetada.
Preços:
- Grátis, open source (AGPL).
Plataformas: Windows, macOS, Linux via Python.
Download: oobabooga/text-generation-webui GitHub.
Conclusão: A escolha certa quando você sabe o que quer ajustar e não consegue chegar lá em um aplicativo melhor.
8. AnythingLLM, melhor RAG local sobre documentos
AnythingLLM é um aplicativo RAG propositalmente construído que emparelha um LLM local (ou remoto) com um armazenamento de documentos. Aponte para uma pasta ou solte arquivos, e ele indexa em um banco de dados vetorial local. Espaços de trabalho multi-usuário separam contextos para projetos diferentes.
Onde fica aquém: Focado em RAG; chat puro é possível mas não é o ponto. A configuração envolve escolher um modelo de incorporação separadamente do modelo de chat, o que confunde iniciantes.
Preços:
- Grátis, open source (MIT).
Plataformas: Windows, macOS, Linux, mais implantação Docker para auto-hospedagem.
Download: anythingllm.com ou Mintplex-Labs/anything-llm GitHub.
Conclusão: A escolha se o motivo pelo qual você quer IA local é consultar sua própria coleção de documentos em privado.
Como escolher o certo
- Se você quer o modelo local funcionando mais rápido sem aborrecimentos: Ollama.
- Se você quer uma GUI nativa e padrões sensatos: LM Studio.
- Se você é totalmente novo em LLMs locais: GPT4All.
- Se você quer ChatGPT totalmente open source: Jan.
- Se você quer conversar com seus PDFs: AnythingLLM ou Msty.
- Se você escreve ficção ou joga rol: KoboldCpp.
- Se você quer ajustar cada parâmetro: Text Generation WebUI.
A melhor configuração emparelhada para a maioria dos usuários de iGPU: Ollama como backend + LM Studio ou Open WebUI como cliente. Isso lhe dá o backend mais rápido com a interface mais amigável.
FAQ
Qual é o melhor aplicativo LLM local para Intel Arc iGPU?
LM Studio e Ollama usam Vulkan e funcionam bem em Intel Arc iGPU (Xe, Xe2, Xe-LPG). A escolha do modelo importa mais que a escolha do aplicativo; quantizações Q4_K_M de modelos 7B a 8B são o sweet spot.
Posso executar LLMs locais em um APU Ryzen sem GPU discreta?
Sim. iGPUs Radeon 780M / 890M das séries Ryzen 7000 e 8000 executam modelos 7B a 10-20 tokens por segundo em quantização Q4 via Vulkan. Aumente a alocação de RAM do sistema para gráficos no BIOS se quiser carregar contextos maiores.
Qual é o melhor LLM local para um MacBook com M2 ou M3?
Apple silicon executa Llama 3.1 8B, Qwen 3 8B e Mistral 7B a 20-40 tokens por segundo no M2. LM Studio e Ollama usam Metal automaticamente. Em 16GB de memória unificada, mantenha-se com Q4_K_M ou Q5_K_M.
Preciso saber Python para executar modelos locais?
Não. Ollama, LM Studio, GPT4All, Jan e Msty são todas instalações com um clique sem Python. Text Generation WebUI é a exceção.
Qual aplicativo LLM local é totalmente open source?
Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI e AnythingLLM são todos open source. LM Studio e Msty são grátis mas código fechado.
Quanto RAM preciso para LLMs locais?
Para modelos 7B a 8B em quantização Q4, 16GB de RAM total do sistema é viável e 32GB é confortável. O iGPU compartilha RAM do sistema, então orce adequadamente. Para modelos 13B a 14B, planeje um mínimo de 32GB.