A diferença entre modelos hospedados e locais em uma GPU decente fechou o suficiente para que tarefas de coding sejam concluídas agora sem abrir Claude. Qwen 3, Llama 3.3 e DeepSeek-Coder rodam responsivamente em uma placa de 16 GB e lidam com refatorações, testes e pequenos recursos. O que faltava era tooling: os modelos locais eram bons, os aplicativos em torno deles não. Isso mudou nos últimos doze meses. Estes são os sete aplicativos de desktop que testamos contra repositórios reais, classificados por quais ainda tínhamos instalados uma semana depois.
O que procurar em um aplicativo de coding LLM local
Nem toda ferramenta de “IA local” é adequada para trabalho de coding. Um escolha séria deve cobrir a maioria disto:
- Executa modelos em sua máquina ou LAN, nunca roteia prompts para uma API hospedada por padrão.
- Entende um projeto, não apenas arquivos individuais: contexto em todo o repositório, referências de arquivo e diffs.
- Funciona dentro de um editor ou vem com o próprio, para que completações e refatorações pousem onde você escreve.
- Fluxos de chamadas de ferramentas da forma que ferramentas agentic fazem (ler arquivo, editar arquivo, executar comando).
- Lida com pelo menos modelos 7B e 14B sem falhar em uma GPU de 16 GB.
- Vem com uma API compatível com OpenAI para que você possa apontar outras ferramentas para o mesmo runtime.
Tudo abaixo atende a quatro ou mais. Os principais escolhem atendem aos seis.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Local | Preço inicial/mês | Classificação |
|---|---|---|---|---|---|
| Continue.dev | Extensão de editor para modelos locais | Win/Mac/Linux | Sim | Grátis | 4.6 |
| Ollama | Runtime de modelo local rápido | Win/Mac/Linux | Sim | Grátis | 4.7 |
| LM Studio | GUI para navegar e executar modelos | Win/Mac/Linux | Sim | Grátis | 4.5 |
| Aider | Programação em par CLI | Win/Mac/Linux | Sim | Grátis | 4.5 |
| Cursor | IDE agentic com roteamento local | Win/Mac/Linux | Opcional | $20 | 4.6 |
| Cline | Agente de coding autônomo | VS Code + Ollama | Sim | Grátis | 4.4 |
| Tabby | Copilot auto-hospedado | Win/Mac/Linux | Sim | Grátis | 4.3 |
Os aplicativos
1. Continue.dev, melhor extensão de editor para modelos locais
Continue.dev é uma extensão do VS Code e JetBrains que fala com qualquer endpoint compatível com OpenAI. Aponte para Ollama ou LM Studio rodando localmente e você obtém chat, edição e autocompletar dentro do editor. O config.json permite atribuir diferentes modelos a diferentes funções: um modelo pequeno rápido para autocompletar, um maior para refatorações, um especialista para embeddings.
Onde fica aquém: A latência de autocompletar em GPUs muito pequenas se manifesta. O sistema de regras e contexto é poderoso, mas a documentação pressupõe que você sabe por que desejaria um arquivo de prompt do sistema por projeto. Sem aplicativo de desktop nativo; o valor está em seu editor.
Preços:
- Grátis: extensão, uso ilimitado com seus próprios modelos
- Pago: nenhum
Plataformas: VS Code e JetBrains no Windows, macOS, Linux
Baixar: Continue.dev extension
Conclusão: A melhor escolha para ficar em seu editor com um modelo local fazendo o trabalho pesado.
2. Ollama, melhor runtime de modelo local
Ollama é o runtime que a maioria dos outros aplicativos nesta lista acabam conversando. Executa Llama, Qwen, DeepSeek, Mistral e dezenas de outros com um comando ollama run <model>, expõe uma API compatível com OpenAI na porta 11434 e lida com downloads de modelo, variantes de quantização e atualizações. Os aplicativos de desktop para Windows, macOS e Linux instalam um daemon na bandeja do sistema.
Onde fica aquém: UI é mínima por design. Você precisa de um frontend separado (Continue, LM Studio, Open WebUI) se quiser uma janela de chat. O gerenciamento de modelo é CLI-first e melhor através de scripts.
Preços:
- Grátis: runtime completo, todos os modelos
- Pago: nenhum
Plataformas: Windows, macOS, Linux
Baixar: Ollama for desktop
Conclusão: A melhor escolha como mecanismo por trás de todas as outras ferramentas nesta lista.
3. LM Studio, melhor GUI para navegar e executar modelos
LM Studio traz tudo que Ollama tem mais uma GUI: um navegador de modelo estilo Hugging Face, uma janela de chat e controles para offloading de GPU, comprimento do contexto e prompts do sistema. Também expõe uma API compatível com OpenAI na 1234 para que Continue, Cursor e Aider possam falar com ela.
Onde fica aquém: Pegada maior que Ollama. O catálogo de modelos é curado, então lançamentos de ponta às vezes levam um dia para aparecer. O licenciamento não comercial no nível gratuito é um fator se você estiver enviando um produto.
Preços:
- Grátis: uso pessoal, todos os recursos
- Pago: LM Studio for Work com preço personalizado para uso comercial
Plataformas: Windows, macOS, Linux
Baixar: LM Studio for desktop
Conclusão: A melhor escolha se você quiser uma GUI para comparar modelos antes de se comprometer.
4. Aider, melhor programação em par CLI
Aider é um aplicativo de terminal que trata seu repositório como o espaço de trabalho compartilhado. Você descreve uma mudança, Aider descobre quais arquivos tocar, edita-os, executa os testes que você diz e faz commit com uma mensagem. Funciona contra qualquer endpoint compatível com OpenAI, portanto Ollama ou LM Studio o impulsionam localmente.
Onde fica aquém: Apenas CLI, então sem autocompletar dentro do seu editor. Requer um repositório git limpo para seu loop de editar-e-commit ser seguro. Mais lento em repositórios muito grandes onde a heurística de seleção de arquivo tem mais para peneirar.
Preços:
- Grátis: aplicativo completo, todos os recursos
- Pago: nenhum
Plataformas: Windows, macOS, Linux (pacote Python)
Baixar: Aider on GitHub
Conclusão: A melhor escolha quando você prefere descrever uma mudança em palavras do que clicar pela UI.
5. Cursor, melhor IDE agentic com roteamento local
Cursor é um fork do VS Code focado em fluxos de trabalho centrados em IA. O modo Agente planeja, edita e testa em todo o repositório. Você pode rotear Cursor para Ollama ou qualquer endpoint local através da configuração “Override OpenAI Base URL”, mantendo prompts em sua máquina enquanto usa a UI agentic do Cursor.
Onde fica aquém: O nível pago é onde a maioria dos recursos do Cursor vivem; o nível gratuito limita completações e execuções de Agente. O roteamento de modelo local é oficialmente “avançado”, o que significa que a configuração está documentada, mas não é o padrão.
Preços:
- Grátis: 2000 completações/mês, Agente limitado
- Pago: Pro a $20/mês para completações ilimitadas, Business a $40/usuário/mês
Plataformas: Windows, macOS, Linux
Baixar: Cursor for desktop
Conclusão: A melhor escolha se você deseja uma IDE agentic e está disposto a configurá-la para conversar com um modelo local.
6. Cline, melhor agente de coding autônomo dentro do VS Code
Cline é uma extensão do VS Code que executa um agente de coding passo a passo dentro do editor. Lê arquivos, escreve edições, executa comandos de terminal e relata, tudo de um painel de chat que mostra cada ação antes de aplicá-la. Cline funciona com qualquer endpoint compatível com OpenAI, portanto Ollama na mesma máquina mantém o loop totalmente local.
Onde fica aquém: Modelos locais mais lentos que 30 tokens/seg fazem o loop passo a passo parecer lento. O modo aprovar-cada-ação é o padrão, o que é mais seguro, mas adiciona atrito. Algumas ferramentas funcionam melhor com modelos de fronteira hospedados do que com 14B locais.
Preços:
- Grátis: extensão, uso ilimitado com seus próprios modelos
- Pago: nenhum
Plataformas: VS Code no Windows, macOS, Linux
Baixar: Cline extension
Conclusão: A melhor escolha quando você quer um loop de agente real sem ceder o controle da chave API.
7. Tabby, melhor Copilot auto-hospedado
Tabby é uma alternativa auto-hospedada para GitHub Copilot. Executa um servidor que fala o protocolo Copilot, portanto qualquer editor com suporte a Copilot (VS Code, JetBrains, Neovim) pode apontá-lo. A imagem Docker é o caminho mais rápido para uma configuração funcionando; o aplicativo de desktop no Windows, macOS e Linux executa o mesmo servidor atrás de uma GUI.
Onde fica aquém: O modelo de conclusão é bom, mas não no nível dos modelos proprietários do Copilot. Os recursos de equipe (análises, políticas) vivem no nível pago. RAG sobre seu codebase está disponível, mas requer ajuste fino.
Preços:
- Grátis: usuário único, completações ilimitadas
- Pago: Plano de Equipe a $19/usuário/mês para análises e SSO
Plataformas: Windows, macOS, Linux (servidor + plugins de editor)
Baixar: Tabby for desktop
Conclusão: A melhor escolha se você quiser um substituto de Copilot pronto para usar que sua equipe possa executar em seu próprio hardware.
Como escolher o certo
- Se você quer o ponto de partida mais simples: Ollama mais Continue.dev dentro do VS Code.
- Se você quer uma janela de chat enquanto compara modelos: LM Studio.
- Se você prefere descrever mudanças do que clicar por elas: Aider.
- Se você quer a experiência de agente polida sem bloqueio exclusivo de hospedagem: Cursor apontado para um endpoint local, ou Cline para um loop totalmente local.
- Se você precisa de Copilot para um pequeno time em seu próprio hardware: Tabby.
- Se você tentou uma ferramenta de coding hospedada e quebrou seu orçamento: Qualquer uma das quatro opções gratuitas. Um 4090 se paga contra um plano empresarial de $200/mês em alguns meses.
FAQ
Qual é o melhor aplicativo LLM local gratuito para coding?
Continue.dev dentro de seu editor, alimentado por Ollama em background, é a pilha gratuita mais produtiva. Aider é a opção mais forte focada em CLI. Cline é o melhor loop de agente gratuito.
Esses aplicativos realmente mantêm meu código privado?
Sim quando configurado contra um endpoint local. Ollama, LM Studio e Tabby todos executam modelos em sua máquina ou LAN. Os wrappers (Continue, Aider, Cline, Cursor) enviam prompts para qualquer URL que você definir, portanto apontar para localhost mantém tudo local. Cursor envia prompts para seus próprios servidores por padrão; o override do endpoint local é o que muda.
Que GPU preciso para executar um modelo de coding localmente?
Uma placa de 16 GB executa modelos 14B em velocidades utilizáveis e modelos 34B com quantização pesada. Uma placa de 24 GB executa confortavelmente um modelo 34B completo em 4-bit. Apenas em CPU, modelos 7B funcionam, mas lentamente o suficiente para que o loop pareça frustrante para qualquer coisa além de autocompletar.
Posso usar esses aplicativos com GitHub Copilot?
Tabby fala o protocolo Copilot e funciona como substituição. Os outros rodam ao lado do Copilot em vez de substituí-lo. Continue e Cline ambos funcionam bem com Copilot ativado no mesmo editor.
Qual modelo local é melhor para coding agora?
Para coding geral, Qwen 3 Coder 30B e DeepSeek-Coder-V2 16B são as melhores escolhas que cabem em uma placa de 24 GB. Para uma placa de 16 GB, Qwen 3 Coder 14B e Codestral 22B (Q4) atingem o ponto ideal. Todos os quatro rodam em Ollama e LM Studio de fábrica.