Executar múltiplos LLMs locais pequenos em desktop

XDA publicou um artigo este mês argumentando que dois modelos locais de 2 GB executados em paralelo superam um modelo de 8 GB em quase todas as tarefas reais, e o autor estava correto. Um modelo pequeno ajustado para código mais um modelo pequeno ajustado para conversa, executados lado a lado, usam menos VRAM, respondem mais rápido e permitem direcionar a pergunta certa para a ferramenta certa. O atrito está nas ferramentas: a maioria dos aplicativos LLM locais assume um modelo de cada vez e uma janela de conversa. Os oito aplicativos para executar múltiplos LLMs locais simultaneamente em desktop abaixo todos lidam com modelos simultâneos, nativamente ou expondo um endpoint compatível com OpenAI que o segundo aplicativo pode apontar.

O que procurar em um executor LLM multi-modelo

Critérios reais para executar mais de um modelo:

Comparação rápida

Aplicativo Melhor para Multi-modelo Plano gratuito Preço inicial GUI
Ollama CLI-first, endpoint OpenAI Sim (carregamento paralelo) Gratuito Gratuito Não (CLI)
LM Studio Gerenciador de modelo com um clique Sim Gratuito Gratuito Sim
Jan Conversa totalmente offline + backend Sim Gratuito Gratuito Sim
llama.cpp server Controle mais crudo, menor footprint Sim (por processo) Gratuito Gratuito Não
LiteLLM Rotear para 100+ backends Roteador Gratuito Gratuito (nuvem opcional) Interface Web
Open WebUI Frontend de conversa multi-modelo Sim Gratuito Gratuito Sim (web)
vLLM Throughput de nível produção Sim (paralelismo tensorial) Gratuito Gratuito Não
Msty Local + nuvem em um aplicativo Sim (Split Chat) Gratuito 8,99 USD/mês Sim

Os aplicativos

1. Ollama, o runtime padrão

Ollama carrega e descarrega modelos sob demanda e expõe uma API compatível com OpenAI na porta 11434. Defina OLLAMA_NUM_PARALLEL=2 e OLLAMA_MAX_LOADED_MODELS=3 no seu env, reinicie o serviço, e você pode acessar dois modelos em paralelo de qualquer cliente. Em um M2 Pro com 32 GB de memória unificada, executamos Qwen2.5-Coder 3B e Llama 3.2 3B lado a lado com espaço para um pequeno modelo de visão.

Onde fica aquém: Sem GUI nativa. O comprimento de contexto padrão (2048) é pequeno para trabalho real, então ajuste. O processo ollama serve não fixa automaticamente modelos em GPUs específicas em configurações multi-GPU.

Preços:

Plataformas: macOS, Windows, Linux.

Baixar: Ollama | GitHub

Conclusão: A camada base. Quase todas as outras ferramentas nesta lista envolvem Ollama ou compartilham sua arquitetura. Instale primeiro.

2. LM Studio, a GUI polida

LM Studio é o aplicativo que a maioria das pessoas instala primeiro. Ele vem com um navegador de modelo completo, uma interface de conversa e, desde a versão 0.3, um servidor local integrado que executa múltiplos modelos simultaneamente. O catálogo de modelos é extraído diretamente do Hugging Face e filtrado pelo que caberá em sua máquina. O modo Split Chat permite comparar dois modelos no mesmo prompt em tempo real.

Onde fica aquém: Não é de código aberto (gratuito para uso pessoal, entre em contato para uso comercial). A versão llama.cpp incluída pode ficar atrás do upstream.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: LM Studio

Conclusão: O melhor ponto de entrada se você quer uma GUI. Combine com Ollama para scripting.

3. Jan, o LM Studio de código aberto

Jan é a alternativa de código aberto para LM Studio: a mesma ideia, licença MIT e objetivo declarado de funcionar totalmente offline. Threads de conversa multi-modelo permitem que cada thread se fixe a um modelo diferente. Ele executa seu próprio backend llama.cpp e pode fazer proxy para um Ollama remoto ou API compatível com OpenAI quando você quer um modelo maior.

Onde fica aquém: Projeto mais jovem que LM Studio. Menos extensões empacotadas.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: Jan | GitHub

Conclusão: Escolha isto se código aberto importa. Funcionalmente muito similar ao LM Studio.

4. llama.cpp server, a primitiva base

llama.cpp vem com um servidor HTTP sem estado que você inicia por modelo. Dois comandos shell, duas portas, dois modelos. Esta é a forma mais apertada de manter duas quantizações GGUF em RAM: sem wrapper, sem scheduler, sem telemetria e o menor overhead de memória de qualquer coisa aqui.

Onde fica aquém: Você conecta seu próprio roteamento. Sem GUI. Sem gerenciador de modelos. Apenas linha de comando para configurar.

Preços:

Plataformas: Windows, macOS, Linux (também Docker).

Baixar: GitHub

Conclusão: Para pessoas que querem entender o que as camadas de abstração escondem. Perfeito para rigs de scripting.

5. LiteLLM, o roteador

LiteLLM não hospeda modelos; ele os roteia. Aponte para sua instância Ollama, servidor LM Studio, chave API Anthropic e endpoint Azure, depois envie cada solicitação através de uma URL compatível com OpenAI e deixe o roteador decidir. Um arquivo de configuração YAML com fallbacks por modelo e limites de taxa permite que um assistente de codificação volte para um modelo local menor quando o grande está ocupado.

Onde fica aquém: Adiciona um processo extra para gerenciar. Depurar decisões de roteamento requer alguma leitura de log.

Preços:

Plataformas: Windows, macOS, Linux (Python, Docker).

Baixar: GitHub

Conclusão: A cola entre múltiplos runners. Pule se você só executa um backend, obrigatório se você executa três.

6. Open WebUI, o frontend tipo ChatGPT

Open WebUI é a interface de conversa polida para modelos locais. Conecte-a a Ollama (ou qualquer endpoint compatível com OpenAI), e ela oferece autenticação multi-usuário, histórico de conversa, alternância de modelo no meio da conversa e comparação lado a lado de modelos em uma única aba do navegador. Útil para um domicílio onde quatro pessoas compartilham uma máquina.

Onde fica aquém: É executado em Docker para experiência suave; instalação nativa é possível mas mais complicada. Usa cerca de 500 MB de RAM antes de qualquer modelo ser carregado.

Preços:

Plataformas: Windows, macOS, Linux (Docker).

Baixar: GitHub

Conclusão: O melhor frontend se você já tem Ollama executando. O modo Split Chat é a funcionalidade matadora.

7. vLLM, o motor de throughput

vLLM é o que você instala quando as ferramentas de desktop deixam de escalar. Gerenciamento de memória PagedAttention mantém múltiplos modelos com melhor utilização de VRAM do que qualquer runner de modelo único. Paralelismo tensorial divide um modelo entre GPUs; múltiplos deployments no mesmo servidor hospedam diferentes modelos simultaneamente. Excessivo para um laptop, essencial para uma estação de trabalho com dois GPUs.

Onde fica aquém: Linux-first (Windows via WSL2). Requer Python e configuração CUDA. Não direcionado para usuários casuais.

Preços:

Plataformas: Linux, Windows (WSL2), macOS (Apple Silicon parcial).

Baixar: GitHub

Conclusão: Só alcance isto se você tiver uma GPU séria. Em uma única 4090, Ollama é mais fácil e quase tão rápido.

8. Msty, o aplicativo desktop local+cloud

Msty vem como um único binário de desktop que executa modelos locais através de um runtime agrupado e modelos em nuvem através de suas próprias chaves API, lado a lado na mesma janela. Split Chat compara até quatro modelos por prompt. O recurso Knowledge Stacks indexa documentos locais e compartilha o índice entre modelos.

Onde fica aquém: O nível gratuito é generoso mas limita o split chat a dois modelos. O nível pago para split de quatro vias está no lado caro.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: Msty

Conclusão: A forma mais fácil de comparar modelos locais vs. nuvem lado a lado. Pague por ele apenas se precisar de split de quatro vias.

Como escolher o correto

FAQ

Posso executar dois LLMs em uma única GPU?

Sim, se ambas as versões quantizadas cabem em VRAM. Um modelo 3B em Q4_K_M usa cerca de 2 GB; dois desses cabem confortavelmente em um card de 8 GB. Defina OLLAMA_MAX_LOADED_MODELS acima de 1 para mantê-los aquecidos.

LLMs locais pequenos são realmente bons?

Desde Qwen 2.5 e Llama 3.2 na faixa 3B-7B, modelos pequenos lidam com resumo, conclusão de código, extração e conversa breve com qualidade próxima a GPT-3.5. Eles falham em raciocínio de contexto longo e tarefas multi-passos complexas. Contorne isto com um modelo maior para prompts difíceis.

Qual é a diferença entre Ollama e LM Studio?

Ollama é um runtime CLI-first com API HTTP. LM Studio é um aplicativo de desktop GUI-first que executa um servidor llama.cpp agrupado. Eles podem executar em paralelo na mesma máquina.

Preciso de uma GPU para executar LLMs locais?

Não, mas ajuda. Um modelo 3B executa com velocidade legível (10 a 20 tokens/segundo) em um CPU Apple Silicon moderno ou chip Intel/AMD com 16 GB de RAM. GPUs empurram isto para 60 a 200 tokens/segundo.

Qual aplicativo é executado mais rápido?

Por token, vLLM em uma GPU NVIDIA moderna. Por install, llama.cpp com uma boa quantização. Por conveniência, Ollama.