Ollama

A XDA executou o mesmo modelo 8B em um laptop RTX 5070 e em uma máquina com gráficos integrados e relatou que a diferença de tokens por segundo é menor do que a maioria das pessoas imagina. Essa é a história dos LLMs locais em 2026: quantização, backends Vulkan e Metal da Apple levaram muitas cargas de trabalho para uma faixa em que um iGPU ou um pequeno dGPU é suficiente. Você não precisa de uma plataforma de $2.000 para executar modelos úteis localmente.

Este guia cobre oito aplicativos para executar LLMs locais em gráficos integrados, testados em um Intel Core Ultra 5 com Arc iGPU, um AMD Ryzen 7 com Radeon 780M e um Apple M2. Todos os oito executam modelos na faixa de 7B a 14B em velocidades úteis (10 tokens por segundo ou melhor) com a quantização correta. Priorizamos facilidade de configuração, compatibilidade de modelos e desempenho honesto em hardware classe iGPU.

O que procurar em um executor LLM local para iGPU

Comparação rápida

Aplicativo Melhor para Plano gratuito Preço inicial Estilo UI
Ollama CLI + API para modelos locais Sim Grátis (open source) Terminal ou clientes de terceiros
LM Studio UI de desktop polido Sim Grátis Desktop nativo
GPT4All Desktop amigável para iniciantes Sim Grátis Desktop nativo
Jan Clone ChatGPT totalmente open source Sim Grátis Desktop nativo (Electron)
Msty Tudo em um com RAG Sim Base gratuita Desktop nativo
KoboldCpp Jogo de rol e escrita criativa Sim Grátis (open source) Web UI
Text Generation WebUI Experimentação de usuário avançado Sim Grátis (open source) Web UI
AnythingLLM RAG local sobre documentos Sim Grátis (open source) Desktop nativo

Os aplicativos

1. Ollama, melhor executor CLI e API

Ollama é o mais próximo de um padrão para LLMs locais. Instale, execute ollama run llama3.2:3b, e você terá um modelo funcionando em menos de um minuto. Nos bastidores, usa llama.cpp com uma biblioteca de modelos curada, uma API compatível com OpenAI em localhost:11434 e gerenciamento de memória por modelo.

Onde fica aquém: Sem UI de chat incorporada; você usa ollama run em um terminal ou emparelha com um cliente (Open WebUI, Msty ou Enchanted no Mac). A biblioteca de modelos em ollama.com é curada, mas limitada comparada ao acesso Hugging Face puro.

Preços:

Plataformas: Windows, macOS (Apple silicon e Intel), Linux.

Download: ollama.com/download ou via Homebrew / apt.

Conclusão: O melhor backend, pronto. Instale mesmo se planejar usar uma interface diferente em cima.

2. LM Studio, melhor UI de desktop polido

LM Studio encapsula llama.cpp em um aplicativo de desktop nativo com navegador de modelos Hugging Face incorporado, downloads com um clique, benchmarks de desempenho por modelo e servidor de API compatível com OpenAI. Configurações de descarga de GPU são expostas com padrões sensatos para Intel Arc, AMD e Apple silicon.

Onde fica aquém: Código fechado (embora grátis). Alguns usuários relatam que a GUI consome mais RAM do que o modelo em si em iGPUs de gama baixa.

Preços:

Plataformas: Windows, macOS, Linux (beta).

Download: lmstudio.ai

Conclusão: O melhor ponto de partida para usuários de iGPU que preferem GUI. Acompanha os padrões corretos para hardware de consumidor.

3. GPT4All, melhor desktop amigável para iniciantes

GPT4All do Nomic é o mais acessível do pacote. Instale, escolha um modelo da barra lateral e ele baixa e executa. O painel LocalDocs adiciona RAG simples sobre uma pasta de arquivos sem configuração.

Onde fica aquém: Catálogo de modelos menor que LM Studio. Mais lento no Windows que Ollama ou LM Studio em nossos testes.

Preços:

Plataformas: Windows, macOS, Linux.

Download: nomic.ai/gpt4all

Conclusão: A escolha para o membro menos técnico da sua família. Os coloca executando um modelo local sem tocar em um terminal.

4. Jan, melhor clone ChatGPT totalmente open source

Jan é um aplicativo de desktop totalmente open source que imita a interface do ChatGPT. Executa modelos locais via llama.cpp incluído, conecta-se a APIs remotas (OpenAI, Anthropic, Groq, Mistral) como opção e armazena cada conversa localmente.

Onde fica aquém: Baseado em Electron, então o uso de RAM é mais pesado que aplicativos nativos. Conversas multi-turno ocasionalmente perdem contexto no iGPU devido ao truncamento agressivo de contexto.

Preços:

Plataformas: Windows, macOS, Linux.

Download: jan.ai

Conclusão: O mais semelhante ao ChatGPT aberto. Melhor se você quer um único aplicativo para local mais remoto opcional.

5. Msty, melhor tudo em um com RAG

Msty combina modelos locais, APIs remotas, RAG sobre documentos e conversas de visualização dividida em um aplicativo. Seu recurso “Knowledge Stacks” indexa pastas de PDFs, documentos Word e arquivos de texto para que você possa conversar com eles sem configurar um banco de dados vetorial.

Onde fica aquém: Código fechado. O plano gratuito limita alguns recursos RAG avançados.

Preços:

Plataformas: Windows, macOS, Linux.

Download: msty.app

Conclusão: A escolha se você quer chat de documentos sem configurar um armazenamento vetorial separado.

6. KoboldCpp, melhor para jogo de rol e escrita criativa

KoboldCpp começou como um fork do llama.cpp voltado para escrita de longa forma e jogo de rol. Tem uma UI web com informações mundiais, memória de personagem e livros de tradição que outros executores não expõem. Backend suporta Vulkan para iGPU.

Onde fica aquém: A UI é densa com sliders que significam algo apenas para usuários avançados. Não é realmente projetada para fluxos de trabalho de assistente de chat.

Preços:

Plataformas: Windows, macOS, Linux.

Download: KoboldCpp GitHub releases.

Conclusão: Escolha de nicho para escritores e jogadores de rol que querem personagens persistentes.

7. Text Generation WebUI, melhor experimentação de usuário avançado

Text Generation WebUI (oobabooga) é o playground do experimentador. Suporta llama.cpp, ExLlama, Transformers e mais backends, expõe cada parâmetro de geração e se integra com LoRA e fine-tuning.

Onde fica aquém: Configuração não é para iniciantes; espere uma instalação de 30 minutos com Python venv. A UI web é funcional mas não é projetada.

Preços:

Plataformas: Windows, macOS, Linux via Python.

Download: oobabooga/text-generation-webui GitHub.

Conclusão: A escolha certa quando você sabe o que quer ajustar e não consegue chegar lá em um aplicativo melhor.

8. AnythingLLM, melhor RAG local sobre documentos

AnythingLLM é um aplicativo RAG propositalmente construído que emparelha um LLM local (ou remoto) com um armazenamento de documentos. Aponte para uma pasta ou solte arquivos, e ele indexa em um banco de dados vetorial local. Espaços de trabalho multi-usuário separam contextos para projetos diferentes.

Onde fica aquém: Focado em RAG; chat puro é possível mas não é o ponto. A configuração envolve escolher um modelo de incorporação separadamente do modelo de chat, o que confunde iniciantes.

Preços:

Plataformas: Windows, macOS, Linux, mais implantação Docker para auto-hospedagem.

Download: anythingllm.com ou Mintplex-Labs/anything-llm GitHub.

Conclusão: A escolha se o motivo pelo qual você quer IA local é consultar sua própria coleção de documentos em privado.

Como escolher o certo

A melhor configuração emparelhada para a maioria dos usuários de iGPU: Ollama como backend + LM Studio ou Open WebUI como cliente. Isso lhe dá o backend mais rápido com a interface mais amigável.

FAQ

Qual é o melhor aplicativo LLM local para Intel Arc iGPU?

LM Studio e Ollama usam Vulkan e funcionam bem em Intel Arc iGPU (Xe, Xe2, Xe-LPG). A escolha do modelo importa mais que a escolha do aplicativo; quantizações Q4_K_M de modelos 7B a 8B são o sweet spot.

Posso executar LLMs locais em um APU Ryzen sem GPU discreta?

Sim. iGPUs Radeon 780M / 890M das séries Ryzen 7000 e 8000 executam modelos 7B a 10-20 tokens por segundo em quantização Q4 via Vulkan. Aumente a alocação de RAM do sistema para gráficos no BIOS se quiser carregar contextos maiores.

Qual é o melhor LLM local para um MacBook com M2 ou M3?

Apple silicon executa Llama 3.1 8B, Qwen 3 8B e Mistral 7B a 20-40 tokens por segundo no M2. LM Studio e Ollama usam Metal automaticamente. Em 16GB de memória unificada, mantenha-se com Q4_K_M ou Q5_K_M.

Preciso saber Python para executar modelos locais?

Não. Ollama, LM Studio, GPT4All, Jan e Msty são todas instalações com um clique sem Python. Text Generation WebUI é a exceção.

Qual aplicativo LLM local é totalmente open source?

Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI e AnythingLLM são todos open source. LM Studio e Msty são grátis mas código fechado.

Quanto RAM preciso para LLMs locais?

Para modelos 7B a 8B em quantização Q4, 16GB de RAM total do sistema é viável e 32GB é confortável. O iGPU compartilha RAM do sistema, então orce adequadamente. Para modelos 13B a 14B, planeje um mínimo de 32GB.