A XDA passou uma semana testando todos os pequenos modelos de linguagem que valem a pena executar em um laptop comum e ficou com três vencedores. A história saiu na mesma semana em que Qwen 3, Llama 3.2 e Gemma 3 lançaram quantizações 1B–8B que superam seu peso. Os melhores apps para LLMs locais pequenos no desktop não são mais brinquedos de pesquisa. Eles cabem em 4 GB de RAM, funcionam sem placa gráfica discreta e respondem perguntas do dia a dia rápido o suficiente para substituir a aba ChatGPT que você mantém aberta.
Testamos oito aplicativos em um MacBook Air M2 (16 GB), um laptop Ryzen de faixa média com iGPU apenas e uma estação de trabalho Fedora com placa NVIDIA de 6 GB. Cada um foi julgado pela rapidez com que uma instalação nova conseguia puxar uma quantização 3B, como lidar com uma carga mista de chat, código e resumos breves de documentos, e se continuava utilizável enquanto uma videochamada rodava em segundo plano.
O que procurar em um app de LLM local pequeno
- Catálogo de modelos pequenos. Downloads diretos de Llama 3.2 (1B/3B), Qwen 3 (0.5B–8B), Gemma 3 (2B/4B), Phi-4-mini e SmolLM sem procurar no Hugging Face.
- Presets de quantização. Quantizações GGUF de 4 e 5 bits são o ponto ideal em máquinas com 8–16 GB. O app deveria ter um padrão sensato.
- Fallback apenas CPU. Nem todos têm GPU. O app deveria continuar utilizável em gráficos integrados ou CPU puro.
- Pegada de memória. Quanta RAM o próprio app usa antes de carregar um modelo. Alguns shells Electron consomem 800 MB ociosos.
- API compatível com OpenAI. Para que um editor de código, app de notas ou script shell possam enviar prompts ao mesmo processo.
- Inicialização a frio. O tempo de um clique duplo até um chat funcionando importa quando o motivo de querer local é pular a aba do navegador.
Comparação rápida
| App | Melhor para | Plataformas | Plano grátis | Pago | Avaliação |
|---|---|---|---|---|---|
| Jan | Cliente ChatGPT-like de código aberto | Windows, macOS, Linux | Totalmente grátis | Nenhum | 4.7 |
| Ollama | Runtime CLI + API mais simples | Windows, macOS, Linux | Totalmente grátis | Nenhum | 4.9 |
| LM Studio | Descoberta de modelos com GUI real | Windows, macOS, Linux | Totalmente grátis pessoal | Entre em contato com vendas para trabalho | 4.8 |
| GPT4All | Local + fallback na nuvem opcional | Windows, macOS, Linux | Totalmente grátis | Nenhum | 4.5 |
| Msty | Comparação de chat dividido entre modelos | Windows, macOS, Linux | Totalmente grátis | Aurum $99 vitalício | 4.7 |
| llamafile | Modelo portátil de arquivo único | Windows, macOS, Linux | Totalmente grátis | Nenhum | 4.6 |
| Cortex | Runtime estilo Ollama, pegada menor | Windows, macOS, Linux | Totalmente grátis | Nenhum | 4.4 |
| KoboldCpp | Escrita criativa de contexto longo | Windows, macOS, Linux | Totalmente grátis | Nenhum | 4.5 |
Os apps
1. Jan para LLM local pequeno — Melhor cliente ChatGPT-like de código aberto
Jan oferece um app de desktop estilo ChatGPT que parece familiar assim que você abre, depois silenciosamente puxa Llama 3.2 3B ou Qwen 3 4B em segundo plano. Assistentes, threads, uploads de arquivos e um servidor compatível com OpenAI são integrados. No MacBook Air M2, um primeiro chat com Llama 3.2 3B começou a responder perguntas em três minutos após a instalação.
Onde falha: A inicialização a frio no Windows ainda fica atrás do macOS por alguns segundos. Alguns imports do Hugging Face precisam de um drop GGUF manual.
Preços:
- Grátis: Totalmente grátis, código aberto sob AGPL.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: jan.ai · github.com/janhq/jan
Em resumo: A escolha se você quer a experiência ChatGPT sem inscrição ou conexão com a internet.
2. Ollama para LLM local pequeno — Melhor runtime CLI + API mais simples
Ollama é o runtime em que tudo mais é construído. ollama run llama3.2:3b busca a quantização, carrega-a e inicia o chat. A API compatível com OpenAI na porta 11434 significa que qualquer editor, app de notas ou script que fale OpenAI pode comunicar sem mudanças.
Onde falha: Sem GUI nativa. Você irá pareá-lo com Open WebUI ou Msty para uma janela de chat.
Preços:
- Grátis: Totalmente grátis, licença MIT.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: ollama.com · github.com/ollama/ollama
Em resumo: Comece aqui mesmo se também instalar um cliente de chat. A maioria dos outros apps nesta lista podem apontar para Ollama.
3. LM Studio para LLM local pequeno — Melhor descoberta de modelos com GUI real
LM Studio é o app tudo-em-um para explorar Hugging Face, escolher uma quantização e conversar sem tocar em um terminal. O navegador de modelos filtra por tamanho e licença, o que importa quando você tenta encaixar um modelo em 6 GB de RAM. O servidor API local é um único toggle.
Onde falha: Não é código aberto. O suporte ao Linux fica atrás do Windows e macOS em novos recursos.
Preços:
- Grátis: Totalmente grátis para uso pessoal.
- Pago: Entre em contato com vendas para implementações comerciais.
Plataformas: Windows, macOS, Linux.
Baixar: lmstudio.ai
Em resumo: A GUI mais suave para explorar e testar quantizações pequenas lado a lado.
4. GPT4All para LLM local pequeno — Melhor local mais fallback na nuvem opcional
GPT4All oferece um app de chat nativo que executa quantizações GGUF localmente e também pode rotear para OpenAI ou Groq quando um modelo mais pesado é necessário. LocalDocs permite que você aponte para uma pasta e obtenha respostas fundamentadas sem enviar arquivos para lugar algum.
Onde falha: O catálogo de modelos fica um passo atrás do LM Studio. A descarga de GPU no Windows precisa de alguns ajustes.
Preços:
- Grátis: Totalmente grátis, código aberto.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: gpt4all.io
Em resumo: Escolha este quando você quer um app que comece localmente e possa pedir emprestado a nuvem sob demanda.
5. Msty para LLM local pequeno — Melhor comparação de chat dividido entre modelos
Msty mostra duas ou três respostas de modelos lado a lado. Essa é a forma mais rápida de decidir se Qwen 3 4B ou Gemma 3 4B se adequa ao seu estilo de prompt. Ele fala com Ollama, LM Studio e APIs na nuvem, então a comparação não se limita ao que ele hospeda.
Onde falha: Alguns recursos avançados estão atrás do nível Aurum. Não é código aberto.
Preços:
- Grátis: Chat totalmente grátis e visualização dividida.
- Pago: Aurum $99 vitalício para stacks de conhecimento e extras premium.
Plataformas: Windows, macOS, Linux.
Baixar: msty.app
Em resumo: A escolha se você testa modelos frequentemente e quer vê-los debater.
6. llamafile para LLM local pequeno — Melhor modelo portátil de arquivo único
llamafile envolve um modelo e seu runtime em um executável único. Coloque em um pendrive, clique duas vezes em qualquer máquina Windows, macOS ou Linux, e uma aba do navegador abre com um chat. É a contribuição da Mozilla para Cosmopolitan libc, e remove completamente a etapa de instalação.
Onde falha: Arquivos podem ter 3–5 GB. Primeiro lançamento em máquinas corporativas bloqueadas pode precisar de um clique direito.
Preços:
- Grátis: Totalmente grátis, Apache 2.0.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: github.com/Mozilla-Ocho/llamafile
Em resumo: A escolha certa para portabilidade, para demonstrações ou para uma máquina onde você não pode instalar software.
7. Cortex para LLM local pequeno — Melhor runtime estilo Ollama com pegada menor
Cortex é o runtime que alimenta Jan sob o capô, exposto como um daemon independente. É uma pegada menor que Ollama em repouso e padroniza llama.cpp com uma API compatível com OpenAI. Puxadas de modelos usam o mesmo ecossistema GGUF.
Onde falha: Comunidade menor, então há menos integrações de terceiros. A documentação ainda está acompanhando.
Preços:
- Grátis: Totalmente grátis, código aberto.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: cortex.so · github.com/janhq/cortex.cpp
Em resumo: Escolha isto se Ollama parecer pesado e você quiser um daemon mais enxuto que ainda fale a API OpenAI.
8. KoboldCpp para LLM local pequeno — Melhor para escrita criativa de contexto longo
KoboldCpp é o fork de llama.cpp construído em torno de ficção, RPG e escrita de contexto longo. Memória de personagem persistente, info de mundo e uma UI de navegador focada em rascunho em vez de Q&A a tornam diferente dos outros apps nesta lista, de forma útil. Ela lida com contextos 32K–128K em modelos pequenos melhor que a maioria dos GUIs.
Onde falha: UI densa e abertamente para power-user. Não é o app para entregar a um amigo não técnico.
Preços:
- Grátis: Totalmente grátis, AGPL.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux.
Baixar: github.com/LostRuins/koboldcpp
Em resumo: A escolha se o motivo de querer um modelo local são sessões de escrita que ChatGPT limitaria por taxa.
Como escolher o certo
Se você quer a configuração mais simples que funciona: Ollama mais um cliente de chat. Instale Ollama, depois escolha Jan ou Open WebUI por cima.
Se você quer um app de desktop polido: LM Studio para GUI, ou Jan se código aberto importar.
Se você testa modelos frequentemente: Msty para visualização dividida.
Se você está fazendo demonstração para alguém ou trabalhando em uma máquina bloqueada: llamafile.
Se você quer o daemon mais leve: Cortex.
Se você escreve ficção longa ou executa campanhas de RPG: KoboldCpp.
Se um modelo pequeno não é suficiente para uma tarefa específica, a maioria destes apps também roteia para endpoints na nuvem. Comece localmente, escale apenas quando a resposta local não é boa o suficiente.
Perguntas frequentes
Qual é o melhor app de LLM local pequeno para um laptop sem GPU? Ollama com um modelo 3B ou 4B executa em CPU e gráficos integrados com velocidade aceitável. LM Studio oferece presets apenas CPU em seu seletor de modelos.
Um LLM local pequeno pode substituir o ChatGPT? Para chat diário, resumos e assistência com código curto, sim. Para raciocínio pesado, fluxos de trabalho de agentes e tarefas de pesquisa longas, não. A maioria das pessoas que experimentam ambos acabam usando local para prompts diários e nuvem para os difíceis.
Que tamanho de modelo executa em 8 GB de RAM? Um modelo 3B em quantização Q4 cabe confortavelmente com margem para o próprio app. Uma quantização 4B funciona se você fechar outros apps pesados em memória.
LLMs locais são realmente privados? Os apps nesta lista não enviam prompts por padrão. GPT4All e Msty oferecem roteamento na nuvem opcional, e é opt-in. Se isolamento total importa, desative acesso à rede para o app.
Qual é o melhor app de LLM local pequeno grátis? Ollama para runtime e Jan para GUI. Ambos são grátis, ambos são código aberto, ambos são ativamente mantidos.