LLMs locais costumavam parecer um compromisso. Você abria mão da qualidade do modelo em troca de privacidade e sem fatura por token. Modelos de raciocínio inverteram isso. DeepSeek R1 destila, Qwen 3 com modo de pensamento e GPT-OSS produzem traços visíveis de cadeia de pensamento antes de sua resposta final, e os menores funcionam em um laptop de 16GB. O gargalo não é mais o modelo. É o aplicativo de desktop que você usa para carregá-lo, executá-lo e conversar com ele. Testamos oito deles no mesmo hardware, e estes são os sete que valem a pena instalar.
O que procurar em um aplicativo para LLMs de raciocínio
- Exibição de modo de pensamento de primeira classe. Modelos de raciocínio emitem blocos
<think>. Bons aplicativos permitem que você mostre ou oculte esses blocos por conversa. - Catálogo de modelos e gerenciamento de quantização. Você quer pesquisar, puxar e excluir pesos quantizados sem editar arquivos de configuração manualmente.
- Funciona offline. O ponto é uma pilha de inferência local. Nenhum login em nuvem deve ser necessário.
- Uma API compatível com OpenAI. Para que o mesmo modelo alimente sua janela de bate-papo e qualquer editor, agente ou script.
- Fallback de GPU e CPU. Lida com NVIDIA CUDA, Apple Metal, AMD ROCm no Linux e um caminho apenas CPU para máquinas sem GPU.
- Padrões sensatos. Modelos de raciocínio consomem contexto. O aplicativo deve definir uma janela de contexto grande sem você precisar saber disso.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Preço inicial/mês | Nota |
|---|---|---|---|---|---|
| Ollama | Desenvolvedores que vivem no terminal | Windows, macOS, Linux | Sim | Gratuito | Serve qualquer modelo através de um endpoint compatível com OpenAI |
| LM Studio | Navegação GUI de modelos | Windows, macOS, Linux | Sim | Gratuito | Melhor catálogo interativo de modelos |
| Jan | Substituto privado do ChatGPT | Windows, macOS, Linux | Sim | Gratuito | Totalmente local por padrão, sem telemetria |
| Msty | Bate-papo multi-modelo lado a lado | Windows, macOS, Linux | Sim | $9 vitalício para Pro | Conversa com vários modelos em paralelo |
| Open WebUI | IU auto-hospedada para equipe | Docker em qualquer lugar | Sim | Gratuito | Transforma Ollama em um espaço de trabalho compartilhado |
| GPT4All | Iniciantes absolutos | Windows, macOS, Linux | Sim | Gratuito | Instalação com um clique, lista de modelos curada |
| Text Generation WebUI | Usuários avançados e ajuste fino | Windows, macOS, Linux | Sim | Gratuito | Controles de amostragem e LoRA mais profundos |
Os aplicativos
1. Ollama - Melhor para desenvolvedores que vivem no terminal
Ollama é a camada base à qual a maioria dos outros aplicativos nesta lista se conecta. Ele é executado como um serviço de segundo plano, expõe uma API compatível com OpenAI em localhost:11434 e puxa modelos com um único comando como ollama pull deepseek-r1:14b. Modelos de raciocínio são cidadãos de primeira classe: o CLI mostra saída <think> ao vivo e há um alternador /set think para ativar o modo de pensamento em Qwen 3 e GPT-OSS.
Onde fica aquém: a interface de bate-papo é um terminal, o que é bom para desenvolvedores e inútil para qualquer outra pessoa. Não gerencia documentação de cartão de modelo ou comparações.
Preços:
- Gratuito: tudo
- Pago: nenhum
Plataformas: Windows, macOS, Linux, Docker
Download: ollama.com
Conclusão: instale isto primeiro, depois adicione uma GUI em cima. Pule se você nunca quiser ver uma linha de comando.
2. LM Studio - Melhor GUI para navegar e testar modelos
LM Studio é o aplicativo para abrir quando você quer ver o que está disponível. Seu catálogo integrado envolve a lista de modelos de Hugging Face com filtros sensatos, visualizações e recomendações de quantização. A janela de bate-papo mostra blocos de pensamento em uma seção recolhível e o modo servidor local expõe o mesmo endpoint compatível com OpenAI como Ollama, para que ferramentas como Cursor ou Continue apontem para ele sem diferença.
Onde fica aquém: o aplicativo é fechado. Se isso importa para você, use Jan em seu lugar.
Preços:
- Gratuito: aplicativo completo para uso pessoal
- Pago: LM Studio for Work, orçamento, para implementações de equipe
Plataformas: Windows, macOS, Linux
Download: lmstudio.ai
Conclusão: a maneira mais rápida de testar cinco modelos de raciocínio antes do jantar.
3. Jan - Melhor para pessoas que querem um clone privado do ChatGPT
Jan parece e se comporta como ChatGPT, exceto que cada mensagem fica no seu disco. O aplicativo é open-source sob Apache 2.0, envia um servidor compatível com OpenAI e puxa de um hub de modelos integrado com tags de modelos de raciocínio nas principais entradas de DeepSeek e Qwen. Extensões adicionam comportamento de busca na web ou intérprete de código sem que nada disso toque um endpoint em nuvem por padrão.
Onde fica aquém: o catálogo de modelos é menor que o LM Studio. Parâmetros de amostragem avançados estão ocultos atrás de alternadores.
Preços:
- Gratuito: aplicativo completo
- Pago: nenhum
Plataformas: Windows, macOS, Linux
Download: jan.ai
Conclusão: a escolha certa quando a privacidade é a razão pela qual você deixou o ChatGPT.
4. Msty - Melhor para comparar modelos de raciocínio lado a lado
Msty envia um bate-papo de visualização dividida que executa o mesmo prompt através de dois ou três modelos ao mesmo tempo. Quando você está tentando decidir se DeepSeek R1 14B vale a VRAM sobre Qwen 3 8B, ver ambas as respostas, ambos os traços <think> e ambos os tempos na mesma tela comprime horas de testes em minutos. Ele também suporta APIs remotas, portanto, um modelo de raciocínio local pode ser comparado com um modelo de fronteira em nuvem na mesma conversa.
Onde fica aquém: a visualização dividida usa mais RAM. Recursos Pro estão bloqueados atrás de uma licença única.
Preços:
- Gratuito: bate-papo de modelo único, modelos locais ilimitados
- Pago: $9 uma vez para Msty Pro, adiciona divisões multi-modelo e pilhas de conhecimento
Plataformas: Windows, macOS, Linux
Download: msty.app
Conclusão: compre o desbloqueio de $9 na primeira vez que lamentar não tê-lo.
5. Open WebUI - Melhor para compartilhar um LLM local com uma equipe
Open WebUI transforma Ollama em um espaço de trabalho compartilhado com contas de usuário, histórico de bate-papo e RAG. Modelos de raciocínio renderizam com clareza, <think> colapsa por padrão e admins podem restringir quais modelos cada usuário pode acessar. Funciona no Docker em uma linha, expõe a mesma interface do usuário na LAN e funciona bem com uma estação de trabalho que hospeda o modelo enquanto notebooks se conectam através do navegador.
Onde fica aquém: a configuração é mais pesada que os aplicativos de desktop. Você precisa de Docker e um proxy reverso ou uma porta dedicada.
Preços:
- Gratuito: licenciado pelo MIT, auto-hospedado
- Pago: nenhum
Plataformas: Docker no Windows, macOS, Linux
Download: openwebui.com
Conclusão: a escolha quando mais de uma pessoa precisa do mesmo modelo local.
6. GPT4All - Melhor para uma primeira instalação sem curva de aprendizado
GPT4All da Nomic AI é a maneira menos incômoda de colocar um modelo de raciocínio em funcionamento. Instale o aplicativo, clique em um modelo, clique em bate-papo. O catálogo é curado (cerca de uma dúzia de modelos em vez de centenas), o que é um recurso para pessoas que não querem pensar sobre quantização. LocalDocs adiciona RAG sobre uma pasta de arquivos em três cliques.
Onde fica aquém: o catálogo curado deixa de fora modelos que usuários avançados desejam. O desempenho fica atrás de Ollama em GPU.
Preços:
- Gratuito: aplicativo completo
- Pago: nenhum
Plataformas: Windows, macOS, Linux
Download: gpt4all.io
Conclusão: o aplicativo para instalar na máquina de um pai ou colega.
7. Text Generation WebUI - Melhor para usuários avançados e ajuste fino
Text Generation WebUI (oobabooga) é o aplicativo dos hobbistas. Expõe cada parâmetro de amostragem, suporta carregamento de LoRA e alterna backends entre llama.cpp, ExLlamaV2, Transformers e vLLM. Se você quer comparar formatos de quantização ou executar um modelo de raciocínio com tokens de parada personalizados, este é o aplicativo que permite fazer isso sem patching de fonte.
Onde fica aquém: a interface do usuário é muito. Cada prompt de modelo de raciocínio precisa de um modelo de instrução compatível selecionado manualmente.
Preços:
- Gratuito: AGPL v3
- Pago: nenhum
Plataformas: Windows, macOS, Linux
Download: github.com/oobabooga/text-generation-webui
Conclusão: o aplicativo para pessoas que leem cartões de modelo de Hugging Face por diversão.
Como escolher o certo
- Se você só quer o bate-papo de modelo de raciocínio mais rápido em seu laptop: LM Studio.
- Se você quer um clone do ChatGPT que não armazena nada na nuvem: Jan.
- Se você está construindo ferramentas em torno de um modelo local e precisa de um servidor compatível com OpenAI: Ollama.
- Se você compartilha o modelo com uma equipe: Open WebUI em cima de Ollama.
- Se você quer comparar dois modelos de raciocínio no mesmo prompt: Msty.
- Se você está instalando isso na máquina de alguém que nunca usou um modelo local: GPT4All.
- Se você quer brincar com quantização e LoRA: Text Generation WebUI.
Perguntas frequentes
Qual é o melhor aplicativo gratuito para executar DeepSeek R1 localmente?
Ollama com LM Studio ou Jan como cliente de bate-papo. Ollama puxa as destilações de R1 e as serve, e tanto LM Studio quanto Jan renderizam os blocos <think> com clareza.
Posso executar um LLM de raciocínio em um laptop sem GPU? Sim, em modelos menores. GPT4All e Ollama fazem fallback para CPU. Espere 3 a 8 tokens por segundo em um laptop moderno para uma destilação de raciocínio de 7B ou 8B.
Qual aplicativo LLM local mostra a cadeia de pensamento?
LM Studio, Msty, Jan e Open WebUI todos renderizam blocos <think> em uma seção recolhível. Ollama os mostra no terminal por padrão.
Esses aplicativos funcionam offline? Todos os sete fazem. Ollama, Jan, GPT4All e Text Generation WebUI não precisam de rede após o download do modelo. LM Studio e Msty só ligam para casa para atualizações de catálogo opcionais.
Msty vale $9 pelo nível Pro? Se você compara modelos mais de uma vez por semana, sim. A visualização dividida multi-modelo sozinha justifica o preço na primeira vez que você a usa para pular uma planilha de benchmark.