llama.cpp

XDA publicou um artigo este mês argumentando que uma pilha de IA local menor é uma pilha de IA local mais produtiva. O autor havia acumulado a bagunça usual: dois executores de modelos, três interfaces de usuário, um banco de dados vetorial que ninguém usava e uma pasta de adaptadores que havia esquecido. Reduzir a um conjunto mínimo facilitou a manutenção da configuração e tornou-a mais fácil de usar. Testamos oito dos melhores aplicativos para uma pilha de IA local minimalista no desktop, em um MacBook Pro M3, uma estação de trabalho Windows com RTX 4070 e uma caixa Debian com AMD 7800 XT, focando em como cada um se comporta como a única ferramenta na pilha, em vez de uma entre muitas.

O que procurar em um aplicativo de IA local minimalista

Comparação rápida

Aplicativo Melhor para Plataformas Plano gratuito Preço inicial Recurso destaque
llama.cpp O runtime de referência Windows, macOS, Linux Gratuito, código aberto Gratuito Inferência binária única portátil
llamafile Um arquivo, sem instalação Windows, macOS, Linux Gratuito, código aberto Gratuito Modelo mais runtime em um executável
Ollama CLI mais simples mais API Windows, macOS, Linux Gratuito, código aberto Gratuito ollama run e você tem um endpoint OpenAI
Jan Interface de usuário de desktop nativa com API Windows, macOS, Linux Gratuito, código aberto Gratuito Bate-papo de desktop multiplataforma
KoboldCpp Interface de usuário binária única mais API Windows, macOS, Linux Gratuito, código aberto Gratuito Executor GGUF com interface web integrada
Msty Interface de usuário comercial polida em modelos locais Windows, macOS, Linux Nível gratuito Assinatura Msty para recursos avançados Interface de bate-papo multimodelo
GPT4All Bate-papo de desktop mais simples Windows, macOS, Linux Gratuito, código aberto Gratuito Amigável para iniciantes, sem CLI
LM Studio Executor local com recursos completos Windows, macOS, Linux Gratuito para uso pessoal Licença comercial Interface de descoberta de modelo, suporte amplo de backend

Os aplicativos

1. llama.cpp — Melhor para o runtime de referência que todos os outros constroem

llama.cpp é o runtime que a maioria desta lista envolve de uma forma ou outra. É um servidor de inferência C++ portátil e livre de dependências que executa modelos GGUF em CPU, Metal, CUDA e ROCm. Como uma pilha minimalista por si só, llama-server oferece um endpoint compatível com OpenAI, e llama-cli oferece um REPL. Isso é suficiente para a maioria do trabalho de IA local.

Onde falha: Sem interface de usuário polida. Você está compilando ou baixando um binário de versão. O gerenciamento de modelo é manual.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: github.com/ggerganov/llama.cpp

Conclusão: llama.cpp é a escolha quando você quer o mínimo de partes móveis e se sente confortável em um terminal.

2. llamafile — Melhor para um runtime e modelo em um executável

llamafile do projeto Mozilla Ocho agrupa um modelo e o runtime de llama.cpp em um único binário Cosmopolitan-libc que é executado em Windows, macOS e Linux sem instalação. Baixe o arquivo, chmod, execute. Ele abre uma interface de usuário do navegador e expõe um endpoint compatível com OpenAI no localhost. É a interpretação mais literal de “IA local minimalista” da lista.

Onde falha: Arquivos binários portáteis únicos podem disparar ferramentas de segurança do host. Baixar um novo modelo significa baixar um novo llamafile.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: github.com/Mozilla-Ocho/llamafile

Conclusão: llamafile é a escolha quando a instalação deve ser um arquivo e apenas um.

3. Ollama — Melhor para o fluxo de trabalho CLI mais simples mais API

Ollama envolve llama.cpp com a experiência de instalação e comando mais limpa de qualquer coisa desta lista. ollama pull llama3.2:8b baixa um modelo. ollama run llama3.2:8b abre um bate-papo. ollama serve expõe um endpoint compatível com OpenAI na porta 11434 por padrão. O formato Modelfile permite que você fixe prompts de sistema e parâmetros com um único arquivo de texto.

Onde falha: A instalação padrão executa o servidor como um serviço de fundo que você pode não querer. A quantização manual de modelo é limitada em comparação com llama.cpp bruto.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: ollama.com

Conclusão: Ollama é a escolha quando instalação em um comando e executar em um comando é o padrão mínimo.

4. Jan — Melhor para uma interface de usuário de desktop nativa que você possui

Jan é um aplicativo de desktop criado do zero para modelos locais, código aberto, com servidor de API compatível com OpenAI integrado. É o que você instala quando quer uma interface de usuário de bate-papo de desktop real sem a superfície de LM Studio. A equipe envia builds para os três sistemas operacionais e mantém o fluxo de descoberta de modelo simples.

Onde falha: Projeto mais jovem que LM Studio ou Ollama. Alguns recursos avançados (backends especializados, personalização profunda de modelo) ficam para trás.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: jan.ai

Conclusão: Jan é a escolha quando uma interface de usuário de desktop apropriada é o fator decisivo.

5. KoboldCpp — Melhor para interface de usuário binária única mais API em um destino portátil

KoboldCpp começou como um fork de llama.cpp direcionado para a comunidade KoboldAI, e cresceu para um executor GGUF binário único com interface de usuário de navegador, endpoint de API, suporte a entrada de imagem e áudio, e sem etapa de instalação. Coloque o binário e um GGUF ao lado, execute um comando e tudo está pronto.

Onde falha: Alguns recursos especializados (integração Horde, prompts específicos do KoboldAI) não importam para um caso de uso geral de bate-papo.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: github.com/LostRuins/koboldcpp

Conclusão: KoboldCpp é a escolha quando você quer um único binário que oferece interface de usuário e API sem um aplicativo mais pesado.

6. Msty — Melhor para interface de usuário comercial polida em modelos locais

Msty leva a abordagem LM Studio e produz uma interface de usuário mais limpa. Bate-papo lado a lado com vários modelos, conecte-se a endpoints locais Ollama ou Jan, e organize conversas em pastas. O nível gratuito é generoso; o nível pago é o que desbloqueia recursos multi-usuário e espaço de trabalho.

Onde falha: Código fechado. Não na extremidade minimalista de “instalar um binário de código aberto.” Para um usuário solo que valoriza polimento sobre princípios, isso é bom.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: msty.app

Conclusão: Msty é a escolha quando o polimento da interface de usuário vale a pena trocar a restrição de código aberto.

7. GPT4All — Melhor para bate-papo de desktop amigável para iniciantes

GPT4All da Nomic é a forma mais amigável de executar um LLM local para alguém que não quer tocar em um terminal. Instale o aplicativo, navegue por uma lista de modelo selecionada, escolha um, bate-papo. Também expõe uma API local e se integra com o Nomic Atlas para RAG baseado em documentos se você decidir ir além do bate-papo.

Onde falha: A lista de modelo selecionada é um pequeno subconjunto do que está disponível no Hugging Face. Usuários avançados crescem além disso.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: gpt4all.io

Conclusão: GPT4All é a escolha para um usuário de IA local pela primeira vez que quer um aplicativo de desktop que simplesmente funciona.

8. LM Studio — Melhor para um executor local com recursos completos

LM Studio é a extremidade maximalista de “ainda um único aplicativo de desktop.” Descoberta de modelo do Hugging Face, suporte a múltiplos backends (llama.cpp, MLX no Apple Silicon), interface de usuário de bate-papo completa, servidor de API e superfície de configuração de modelo que expõe tudo. É o que as pessoas padrão quando a simplicidade de Ollama é muito limitada.

Onde falha: Não é código aberto. Pegada de instalação maior que as opções acima. A superfície de recurso maximalista é o oposto da pilha minimalista que o artigo de XDA argumentava, mas está incluída aqui como ponto de referência para o que acontece quando você se recusa a cortar.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: lmstudio.ai

Conclusão: LM Studio é a escolha quando um executor local com recursos completos vale a pena a instalação maior que qualquer um dos acima.

Como escolher o certo

Perguntas frequentes

Qual modelo devo executar em 16 GB de RAM? Uma quantização Q4 de um modelo 7B ou 8B funciona bem nesse intervalo e cobre a maioria dos casos de uso de bate-papo e codificação. A quantização Q4 de 13B é possível mas apertada.

Esses aplicativos funcionam no Apple Silicon? Sim. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio e Msty usam Metal no Apple Silicon e alcançam velocidade quase nativa. llamafile é enviado com binários Apple Silicon.

Posso apontar ferramentas de estilo ChatGPT para um modelo local? Sim. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio e llamafile todos expõem um endpoint compatível com OpenAI no localhost. Aponte qualquer ferramenta que aceite uma URL de base personalizada para http://localhost:<port>/v1.

Como uma pilha minimalista difere de uma pilha maximalista? Menos partes móveis. Um runtime, um gerenciador de modelo, uma interface de usuário. As pilhas maximalistas adicionam bancos de dados vetoriais, camadas de orquestração e frameworks de agentes. A maioria dos usuários solo não precisa de nada disso até um problema específico exigi-lo.

Algum deles é capaz de agente imediatamente? Não. Estes são runtimes de inferência e interfaces de usuário de bate-papo. Para um loop de agente, você adiciona uma ferramenta separada que fala o protocolo OpenAI Chat Completions contra um desses endpoints.

Qual pilha é a menor em disco? llamafile mais um único modelo quantizado é a instalação mais leve possível. Ollama mais sua loja de modelo é um segundo próximo e mais fácil de crescer.