XDA publicou um artigo este mês argumentando que dois modelos locais de 2 GB executados em paralelo superam um modelo de 8 GB em quase todas as tarefas reais, e o autor estava correto. Um modelo pequeno ajustado para código mais um modelo pequeno ajustado para conversa, executados lado a lado, usam menos VRAM, respondem mais rápido e permitem direcionar a pergunta certa para a ferramenta certa. O atrito está nas ferramentas: a maioria dos aplicativos LLM locais assume um modelo de cada vez e uma janela de conversa. Os oito aplicativos para executar múltiplos LLMs locais simultaneamente em desktop abaixo todos lidam com modelos simultâneos, nativamente ou expondo um endpoint compatível com OpenAI que o segundo aplicativo pode apontar.
O que procurar em um executor LLM multi-modelo
Critérios reais para executar mais de um modelo:
- Carregamento nativo de múltiplos modelos. Algumas ferramentas trocam modelos sob demanda; outras realmente mantêm dois carregados em RAM.
- Endpoint compatível com OpenAI. Um servidor em execução na porta 11434 ou 1234 que outras ferramentas podem chamar.
- Roteamento de modelo. Envie prompts de código para Qwen2.5-Coder, conversa para Llama 3.2, com base na solicitação.
- Descarregamento de GPU com divisão de camadas. Carregue dois modelos pequenos no mesmo GPU sem um despencar.
- Fallback de CPU para um segundo modelo. Se a GPU estiver cheia, o segundo modelo é executado em CPU sem falha.
- Isolamento de sessão. Duas conversas não pisam na janela de contexto uma da outra.
Comparação rápida
| Aplicativo | Melhor para | Multi-modelo | Plano gratuito | Preço inicial | GUI |
|---|---|---|---|---|---|
| Ollama | CLI-first, endpoint OpenAI | Sim (carregamento paralelo) | Gratuito | Gratuito | Não (CLI) |
| LM Studio | Gerenciador de modelo com um clique | Sim | Gratuito | Gratuito | Sim |
| Jan | Conversa totalmente offline + backend | Sim | Gratuito | Gratuito | Sim |
| llama.cpp server | Controle mais crudo, menor footprint | Sim (por processo) | Gratuito | Gratuito | Não |
| LiteLLM | Rotear para 100+ backends | Roteador | Gratuito | Gratuito (nuvem opcional) | Interface Web |
| Open WebUI | Frontend de conversa multi-modelo | Sim | Gratuito | Gratuito | Sim (web) |
| vLLM | Throughput de nível produção | Sim (paralelismo tensorial) | Gratuito | Gratuito | Não |
| Msty | Local + nuvem em um aplicativo | Sim (Split Chat) | Gratuito | 8,99 USD/mês | Sim |
Os aplicativos
1. Ollama, o runtime padrão
Ollama carrega e descarrega modelos sob demanda e expõe uma API compatível com OpenAI na porta 11434. Defina OLLAMA_NUM_PARALLEL=2 e OLLAMA_MAX_LOADED_MODELS=3 no seu env, reinicie o serviço, e você pode acessar dois modelos em paralelo de qualquer cliente. Em um M2 Pro com 32 GB de memória unificada, executamos Qwen2.5-Coder 3B e Llama 3.2 3B lado a lado com espaço para um pequeno modelo de visão.
Onde fica aquém: Sem GUI nativa. O comprimento de contexto padrão (2048) é pequeno para trabalho real, então ajuste. O processo ollama serve não fixa automaticamente modelos em GPUs específicas em configurações multi-GPU.
Preços:
- Gratuito: Tudo.
Plataformas: macOS, Windows, Linux.
Conclusão: A camada base. Quase todas as outras ferramentas nesta lista envolvem Ollama ou compartilham sua arquitetura. Instale primeiro.
2. LM Studio, a GUI polida
LM Studio é o aplicativo que a maioria das pessoas instala primeiro. Ele vem com um navegador de modelo completo, uma interface de conversa e, desde a versão 0.3, um servidor local integrado que executa múltiplos modelos simultaneamente. O catálogo de modelos é extraído diretamente do Hugging Face e filtrado pelo que caberá em sua máquina. O modo Split Chat permite comparar dois modelos no mesmo prompt em tempo real.
Onde fica aquém: Não é de código aberto (gratuito para uso pessoal, entre em contato para uso comercial). A versão llama.cpp incluída pode ficar atrás do upstream.
Preços:
- Gratuito: Todos os recursos para uso pessoal.
- Pago: Contacte vendas para licenças de equipe/comerciais.
Plataformas: Windows, macOS, Linux.
Baixar: LM Studio
Conclusão: O melhor ponto de entrada se você quer uma GUI. Combine com Ollama para scripting.
3. Jan, o LM Studio de código aberto
Jan é a alternativa de código aberto para LM Studio: a mesma ideia, licença MIT e objetivo declarado de funcionar totalmente offline. Threads de conversa multi-modelo permitem que cada thread se fixe a um modelo diferente. Ele executa seu próprio backend llama.cpp e pode fazer proxy para um Ollama remoto ou API compatível com OpenAI quando você quer um modelo maior.
Onde fica aquém: Projeto mais jovem que LM Studio. Menos extensões empacotadas.
Preços:
- Gratuito: Tudo (código aberto).
Plataformas: Windows, macOS, Linux.
Conclusão: Escolha isto se código aberto importa. Funcionalmente muito similar ao LM Studio.
4. llama.cpp server, a primitiva base
llama.cpp vem com um servidor HTTP sem estado que você inicia por modelo. Dois comandos shell, duas portas, dois modelos. Esta é a forma mais apertada de manter duas quantizações GGUF em RAM: sem wrapper, sem scheduler, sem telemetria e o menor overhead de memória de qualquer coisa aqui.
Onde fica aquém: Você conecta seu próprio roteamento. Sem GUI. Sem gerenciador de modelos. Apenas linha de comando para configurar.
Preços:
- Gratuito: Código aberto (MIT).
Plataformas: Windows, macOS, Linux (também Docker).
Baixar: GitHub
Conclusão: Para pessoas que querem entender o que as camadas de abstração escondem. Perfeito para rigs de scripting.
5. LiteLLM, o roteador
LiteLLM não hospeda modelos; ele os roteia. Aponte para sua instância Ollama, servidor LM Studio, chave API Anthropic e endpoint Azure, depois envie cada solicitação através de uma URL compatível com OpenAI e deixe o roteador decidir. Um arquivo de configuração YAML com fallbacks por modelo e limites de taxa permite que um assistente de codificação volte para um modelo local menor quando o grande está ocupado.
Onde fica aquém: Adiciona um processo extra para gerenciar. Depurar decisões de roteamento requer alguma leitura de log.
Preços:
- Gratuito: Código aberto (proxy e SDK).
- Pago: LiteLLM Cloud (opcional) baseado em assinatura para observabilidade.
Plataformas: Windows, macOS, Linux (Python, Docker).
Baixar: GitHub
Conclusão: A cola entre múltiplos runners. Pule se você só executa um backend, obrigatório se você executa três.
6. Open WebUI, o frontend tipo ChatGPT
Open WebUI é a interface de conversa polida para modelos locais. Conecte-a a Ollama (ou qualquer endpoint compatível com OpenAI), e ela oferece autenticação multi-usuário, histórico de conversa, alternância de modelo no meio da conversa e comparação lado a lado de modelos em uma única aba do navegador. Útil para um domicílio onde quatro pessoas compartilham uma máquina.
Onde fica aquém: É executado em Docker para experiência suave; instalação nativa é possível mas mais complicada. Usa cerca de 500 MB de RAM antes de qualquer modelo ser carregado.
Preços:
- Gratuito: Código aberto (BSD-3).
Plataformas: Windows, macOS, Linux (Docker).
Baixar: GitHub
Conclusão: O melhor frontend se você já tem Ollama executando. O modo Split Chat é a funcionalidade matadora.
7. vLLM, o motor de throughput
vLLM é o que você instala quando as ferramentas de desktop deixam de escalar. Gerenciamento de memória PagedAttention mantém múltiplos modelos com melhor utilização de VRAM do que qualquer runner de modelo único. Paralelismo tensorial divide um modelo entre GPUs; múltiplos deployments no mesmo servidor hospedam diferentes modelos simultaneamente. Excessivo para um laptop, essencial para uma estação de trabalho com dois GPUs.
Onde fica aquém: Linux-first (Windows via WSL2). Requer Python e configuração CUDA. Não direcionado para usuários casuais.
Preços:
- Gratuito: Código aberto (Apache 2.0).
Plataformas: Linux, Windows (WSL2), macOS (Apple Silicon parcial).
Baixar: GitHub
Conclusão: Só alcance isto se você tiver uma GPU séria. Em uma única 4090, Ollama é mais fácil e quase tão rápido.
8. Msty, o aplicativo desktop local+cloud
Msty vem como um único binário de desktop que executa modelos locais através de um runtime agrupado e modelos em nuvem através de suas próprias chaves API, lado a lado na mesma janela. Split Chat compara até quatro modelos por prompt. O recurso Knowledge Stacks indexa documentos locais e compartilha o índice entre modelos.
Onde fica aquém: O nível gratuito é generoso mas limita o split chat a dois modelos. O nível pago para split de quatro vias está no lado caro.
Preços:
- Gratuito: Split chat de duas vias, todos os recursos do modelo local.
- Pago: 8,99 USD/mês ou 79 USD/ano para split de quatro vias e sincronização premium.
Plataformas: Windows, macOS, Linux.
Baixar: Msty
Conclusão: A forma mais fácil de comparar modelos locais vs. nuvem lado a lado. Pague por ele apenas se precisar de split de quatro vias.
Como escolher o correto
- Se está começando do zero, instale Ollama e Open WebUI. Essa é a pilha de referência.
- Se quiser uma GUI sem tocar Docker, LM Studio ou Jan.
- Se código aberto importa e quer uma GUI, Jan.
- Se roteia entre APIs locais e em nuvem, adicione LiteLLM.
- Se compara saídas de modelo constantemente, Msty ou LM Studio Split Chat.
- Se faz scripts de tudo, servidor llama.cpp em portas personalizadas.
- Se seu rig tem dois GPUs e você serve um pequeno time, vLLM.
FAQ
Posso executar dois LLMs em uma única GPU?
Sim, se ambas as versões quantizadas cabem em VRAM. Um modelo 3B em Q4_K_M usa cerca de 2 GB; dois desses cabem confortavelmente em um card de 8 GB. Defina OLLAMA_MAX_LOADED_MODELS acima de 1 para mantê-los aquecidos.
LLMs locais pequenos são realmente bons?
Desde Qwen 2.5 e Llama 3.2 na faixa 3B-7B, modelos pequenos lidam com resumo, conclusão de código, extração e conversa breve com qualidade próxima a GPT-3.5. Eles falham em raciocínio de contexto longo e tarefas multi-passos complexas. Contorne isto com um modelo maior para prompts difíceis.
Qual é a diferença entre Ollama e LM Studio?
Ollama é um runtime CLI-first com API HTTP. LM Studio é um aplicativo de desktop GUI-first que executa um servidor llama.cpp agrupado. Eles podem executar em paralelo na mesma máquina.
Preciso de uma GPU para executar LLMs locais?
Não, mas ajuda. Um modelo 3B executa com velocidade legível (10 a 20 tokens/segundo) em um CPU Apple Silicon moderno ou chip Intel/AMD com 16 GB de RAM. GPUs empurram isto para 60 a 200 tokens/segundo.
Qual aplicativo é executado mais rápido?
Por token, vLLM em uma GPU NVIDIA moderna. Por install, llama.cpp com uma boa quantização. Por conveniência, Ollama.