XDA publicou um artigo este mês argumentando que uma pilha de IA local menor é uma pilha de IA local mais produtiva. O autor havia acumulado a bagunça usual: dois executores de modelos, três interfaces de usuário, um banco de dados vetorial que ninguém usava e uma pasta de adaptadores que havia esquecido. Reduzir a um conjunto mínimo facilitou a manutenção da configuração e tornou-a mais fácil de usar. Testamos oito dos melhores aplicativos para uma pilha de IA local minimalista no desktop, em um MacBook Pro M3, uma estação de trabalho Windows com RTX 4070 e uma caixa Debian com AMD 7800 XT, focando em como cada um se comporta como a única ferramenta na pilha, em vez de uma entre muitas.
O que procurar em um aplicativo de IA local minimalista
- Instalação binária única ou próxima. Uma ferramenta que seja um
brew installou.msisupera uma ferramenta que precisa de Docker mais Python mais um arquivo de configuração. - Gerenciamento de modelo que não atrapalha. Baixar um GGUF deve ser um comando. Deletar um não deve exigir procurar uma pasta oculta.
- Compatibilidade com API. Um endpoint compatível com OpenAI é o que permite que você aponte qualquer ferramenta existente para seu modelo local sem reescrever ambos os lados.
- Detecção automática de GPU e CPU. A pilha deve determinar se você tem Metal, CUDA, ROCm ou apenas CPU e usar o correto. A seleção manual de backend é a bagunça que essas ferramentas deveriam eliminar.
- Disciplina de RAM. Uma ferramenta que funciona em repouso com 2 GB de RAM para servir um modelo que cabe em 8 GB está fazendo algo errado.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Preço inicial | Recurso destaque |
|---|---|---|---|---|---|
| llama.cpp | O runtime de referência | Windows, macOS, Linux | Gratuito, código aberto | Gratuito | Inferência binária única portátil |
| llamafile | Um arquivo, sem instalação | Windows, macOS, Linux | Gratuito, código aberto | Gratuito | Modelo mais runtime em um executável |
| Ollama | CLI mais simples mais API | Windows, macOS, Linux | Gratuito, código aberto | Gratuito | ollama run e você tem um endpoint OpenAI |
| Jan | Interface de usuário de desktop nativa com API | Windows, macOS, Linux | Gratuito, código aberto | Gratuito | Bate-papo de desktop multiplataforma |
| KoboldCpp | Interface de usuário binária única mais API | Windows, macOS, Linux | Gratuito, código aberto | Gratuito | Executor GGUF com interface web integrada |
| Msty | Interface de usuário comercial polida em modelos locais | Windows, macOS, Linux | Nível gratuito | Assinatura Msty para recursos avançados | Interface de bate-papo multimodelo |
| GPT4All | Bate-papo de desktop mais simples | Windows, macOS, Linux | Gratuito, código aberto | Gratuito | Amigável para iniciantes, sem CLI |
| LM Studio | Executor local com recursos completos | Windows, macOS, Linux | Gratuito para uso pessoal | Licença comercial | Interface de descoberta de modelo, suporte amplo de backend |
Os aplicativos
1. llama.cpp — Melhor para o runtime de referência que todos os outros constroem
llama.cpp é o runtime que a maioria desta lista envolve de uma forma ou outra. É um servidor de inferência C++ portátil e livre de dependências que executa modelos GGUF em CPU, Metal, CUDA e ROCm. Como uma pilha minimalista por si só, llama-server oferece um endpoint compatível com OpenAI, e llama-cli oferece um REPL. Isso é suficiente para a maioria do trabalho de IA local.
Onde falha: Sem interface de usuário polida. Você está compilando ou baixando um binário de versão. O gerenciamento de modelo é manual.
Preço:
- Gratuito: Totalmente código aberto
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: github.com/ggerganov/llama.cpp
Conclusão: llama.cpp é a escolha quando você quer o mínimo de partes móveis e se sente confortável em um terminal.
2. llamafile — Melhor para um runtime e modelo em um executável
llamafile do projeto Mozilla Ocho agrupa um modelo e o runtime de llama.cpp em um único binário Cosmopolitan-libc que é executado em Windows, macOS e Linux sem instalação. Baixe o arquivo, chmod, execute. Ele abre uma interface de usuário do navegador e expõe um endpoint compatível com OpenAI no localhost. É a interpretação mais literal de “IA local minimalista” da lista.
Onde falha: Arquivos binários portáteis únicos podem disparar ferramentas de segurança do host. Baixar um novo modelo significa baixar um novo llamafile.
Preço:
- Gratuito: Totalmente código aberto
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: github.com/Mozilla-Ocho/llamafile
Conclusão: llamafile é a escolha quando a instalação deve ser um arquivo e apenas um.
3. Ollama — Melhor para o fluxo de trabalho CLI mais simples mais API
Ollama envolve llama.cpp com a experiência de instalação e comando mais limpa de qualquer coisa desta lista. ollama pull llama3.2:8b baixa um modelo. ollama run llama3.2:8b abre um bate-papo. ollama serve expõe um endpoint compatível com OpenAI na porta 11434 por padrão. O formato Modelfile permite que você fixe prompts de sistema e parâmetros com um único arquivo de texto.
Onde falha: A instalação padrão executa o servidor como um serviço de fundo que você pode não querer. A quantização manual de modelo é limitada em comparação com llama.cpp bruto.
Preço:
- Gratuito: Totalmente código aberto
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: ollama.com
Conclusão: Ollama é a escolha quando instalação em um comando e executar em um comando é o padrão mínimo.
4. Jan — Melhor para uma interface de usuário de desktop nativa que você possui
Jan é um aplicativo de desktop criado do zero para modelos locais, código aberto, com servidor de API compatível com OpenAI integrado. É o que você instala quando quer uma interface de usuário de bate-papo de desktop real sem a superfície de LM Studio. A equipe envia builds para os três sistemas operacionais e mantém o fluxo de descoberta de modelo simples.
Onde falha: Projeto mais jovem que LM Studio ou Ollama. Alguns recursos avançados (backends especializados, personalização profunda de modelo) ficam para trás.
Preço:
- Gratuito: Totalmente código aberto
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: jan.ai
Conclusão: Jan é a escolha quando uma interface de usuário de desktop apropriada é o fator decisivo.
5. KoboldCpp — Melhor para interface de usuário binária única mais API em um destino portátil
KoboldCpp começou como um fork de llama.cpp direcionado para a comunidade KoboldAI, e cresceu para um executor GGUF binário único com interface de usuário de navegador, endpoint de API, suporte a entrada de imagem e áudio, e sem etapa de instalação. Coloque o binário e um GGUF ao lado, execute um comando e tudo está pronto.
Onde falha: Alguns recursos especializados (integração Horde, prompts específicos do KoboldAI) não importam para um caso de uso geral de bate-papo.
Preço:
- Gratuito: Totalmente código aberto
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: github.com/LostRuins/koboldcpp
Conclusão: KoboldCpp é a escolha quando você quer um único binário que oferece interface de usuário e API sem um aplicativo mais pesado.
6. Msty — Melhor para interface de usuário comercial polida em modelos locais
Msty leva a abordagem LM Studio e produz uma interface de usuário mais limpa. Bate-papo lado a lado com vários modelos, conecte-se a endpoints locais Ollama ou Jan, e organize conversas em pastas. O nível gratuito é generoso; o nível pago é o que desbloqueia recursos multi-usuário e espaço de trabalho.
Onde falha: Código fechado. Não na extremidade minimalista de “instalar um binário de código aberto.” Para um usuário solo que valoriza polimento sobre princípios, isso é bom.
Preço:
- Gratuito: Interface de usuário central completa
- Pago: Assinatura Msty para recursos avançados de espaço de trabalho
Plataformas: Windows, macOS, Linux
Baixar: msty.app
Conclusão: Msty é a escolha quando o polimento da interface de usuário vale a pena trocar a restrição de código aberto.
7. GPT4All — Melhor para bate-papo de desktop amigável para iniciantes
GPT4All da Nomic é a forma mais amigável de executar um LLM local para alguém que não quer tocar em um terminal. Instale o aplicativo, navegue por uma lista de modelo selecionada, escolha um, bate-papo. Também expõe uma API local e se integra com o Nomic Atlas para RAG baseado em documentos se você decidir ir além do bate-papo.
Onde falha: A lista de modelo selecionada é um pequeno subconjunto do que está disponível no Hugging Face. Usuários avançados crescem além disso.
Preço:
- Gratuito: Totalmente código aberto
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: gpt4all.io
Conclusão: GPT4All é a escolha para um usuário de IA local pela primeira vez que quer um aplicativo de desktop que simplesmente funciona.
8. LM Studio — Melhor para um executor local com recursos completos
LM Studio é a extremidade maximalista de “ainda um único aplicativo de desktop.” Descoberta de modelo do Hugging Face, suporte a múltiplos backends (llama.cpp, MLX no Apple Silicon), interface de usuário de bate-papo completa, servidor de API e superfície de configuração de modelo que expõe tudo. É o que as pessoas padrão quando a simplicidade de Ollama é muito limitada.
Onde falha: Não é código aberto. Pegada de instalação maior que as opções acima. A superfície de recurso maximalista é o oposto da pilha minimalista que o artigo de XDA argumentava, mas está incluída aqui como ponto de referência para o que acontece quando você se recusa a cortar.
Preço:
- Gratuito: Uso pessoal
- Pago: Licença comercial para implantações comerciais
Plataformas: Windows, macOS, Linux
Baixar: lmstudio.ai
Conclusão: LM Studio é a escolha quando um executor local com recursos completos vale a pena a instalação maior que qualquer um dos acima.
Como escolher o certo
- A pilha mínima viável: Ollama. Instale, puxe um modelo, pronto. Tudo o mais é opcional.
- Se você prefere um arquivo e sem instalação: llamafile.
- Se você quer o runtime de referência sem wrapper: llama.cpp diretamente.
- Se você quer interface de usuário de bate-papo de desktop e código aberto: Jan.
- Se você quer um único binário que também é uma interface de usuário: KoboldCpp.
- Se o polimento importa mais que código aberto: Msty em cima de um endpoint Ollama.
- Se você nunca instalou um modelo local antes: GPT4All.
- Se você cresceu de Ollama e quer mais controles: LM Studio.
Perguntas frequentes
Qual modelo devo executar em 16 GB de RAM? Uma quantização Q4 de um modelo 7B ou 8B funciona bem nesse intervalo e cobre a maioria dos casos de uso de bate-papo e codificação. A quantização Q4 de 13B é possível mas apertada.
Esses aplicativos funcionam no Apple Silicon? Sim. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio e Msty usam Metal no Apple Silicon e alcançam velocidade quase nativa. llamafile é enviado com binários Apple Silicon.
Posso apontar ferramentas de estilo ChatGPT para um modelo local? Sim. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio e llamafile todos expõem um endpoint compatível com OpenAI no localhost. Aponte qualquer ferramenta que aceite uma URL de base personalizada para http://localhost:<port>/v1.
Como uma pilha minimalista difere de uma pilha maximalista? Menos partes móveis. Um runtime, um gerenciador de modelo, uma interface de usuário. As pilhas maximalistas adicionam bancos de dados vetoriais, camadas de orquestração e frameworks de agentes. A maioria dos usuários solo não precisa de nada disso até um problema específico exigi-lo.
Algum deles é capaz de agente imediatamente? Não. Estes são runtimes de inferência e interfaces de usuário de bate-papo. Para um loop de agente, você adiciona uma ferramenta separada que fala o protocolo OpenAI Chat Completions contra um desses endpoints.
Qual pilha é a menor em disco? llamafile mais um único modelo quantizado é a instalação mais leve possível. Ollama mais sua loja de modelo é um segundo próximo e mais fácil de crescer.