Ninguém precisa de um cartão de 24 GB para executar um modelo local útil em 2026. Modelos quantizados de 7 a 14 bilhões de parâmetros cabem em 8 a 12 GB de VRAM com velocidades que uma GTX 1080 ou RTX 2080 usada produz confortavelmente, e a diferença entre “apenas nuvem” e “local a maior parte do tempo” agora é apenas uma instalação de driver e um download de 4 GB. O truque é o runtime. Alguns aplicativos assumem um cartão RTX 50-series novo; outros foram construídos especificamente para o hardware antigo sentado em um chassi de servidor doméstico.
Testamos 8 aplicativos para desktop para executar IA local em GPUs NVIDIA antigas, focando em Pascal (série GTX 10 e Quadro P), Turing (série RTX 20 e Quadro T) e Ampere inicial (série RTX 30 e estações de trabalho série A). Cada aplicativo na lista executa Llama 3.1, Qwen 2.5, Mistral 7B ou Gemma 2 em 8 GB de VRAM com uma taxa de tokens por segundo utilizável. Qual se ajusta à nossa configuração depende se queremos uma janela de bate-papo, um serviço ou um runtime de baixo nível.
O que procurar em um aplicativo de IA local para GPUs antigas
As restrições de hardware importam mais que a cópia de marketing.
- Suporte CUDA 11, não apenas CUDA 12 (Pascal máximo em CUDA 12.6 no Linux, mais tarde no Windows).
- Formatos de quantização que ajustam 7B em 8 GB (GGUF Q4_K_M, Q5_K_M ou AWQ 4-bit).
- Descarregamento de camada para que um modelo de 13B possa descarregar camadas em excesso para a CPU sem ficar inútil.
- Uma instalação em um clique que não requer compilar PyTorch a partir da fonte.
- Uma API compatível com OpenAI para que qualquer cliente possa apontar para localhost sem um shim personalizado.
- Download de modelo que retoma e verifica somas de verificação (paranoia da era do discagem discada ainda ajuda).
Comparação rápida
| Aplicativo | Melhor para | Windows / Linux | Plano gratuito | Recurso de destaque | Licença |
|---|---|---|---|---|---|
| Ollama | Daemon headless e scripts | Ambos | Grátis | Puxar modelo em uma linha, orientado para CLI | MIT |
| LM Studio | Bate-papo tudo em um | Ambos | Grátis | Navegador de modelos + bate-papo + servidor | Proprietária |
| KoboldCPP | Runtime executável único | Ambos | Grátis | Sem instalação, GGUF, TTS, imagens | AGPL 3.0 |
| text-generation-webui | Mexer do usuário avançado | Ambos | Grátis | Todos os formatos de quantização suportados | AGPL 3.0 |
| GPT4All | Primeiro modelo em um laptop modesto | Ambos | Grátis | Barra lateral LocalDocs, predefinições de VRAM baixo | Tipo MIT |
| Jan | Equivalente LM Studio totalmente de código aberto | Ambos | Grátis | Suporte MCP, compatível com OpenAI | Apache 2.0 |
| llama.cpp | Velocidade bare-metal | Ambos | Grátis | CPU mais rápido + descarregamento de GPU parcial | MIT |
| vLLM | Servidor de API multiusuário | Linux (WSL no Windows) | Grátis | Atenção paginada, melhor produção | Apache 2.0 |
Os aplicativos
1. Ollama – melhor daemon headless em cartões NVIDIA antigas
Ollama é o runtime que a maioria das pessoas instala primeiro porque todo o fluxo de trabalho é ollama pull llama3.1:8b depois ollama run llama3.1. Em um GTX 1080 Ti (11 GB), Llama 3.1 8B Q4_K_M é executado a 25 a 30 tokens por segundo; em um RTX 2080 Super (8 GB), o mesmo modelo é executado em torno de 40. Ollama vincula um ponto de extremidade compatível com OpenAI em localhost:11434, e qualquer frontend que fale OpenAI (Open WebUI, Msty, LibreChat) se conecta com uma mudança de URL base.
Onde fica aquém: O cliente de bate-papo é um terminal. Ollama não vem com uma GUI; o uso gráfico significa adicionar Open WebUI ou outro frontend.
Preços:
- Grátis: Tudo, licenciado sob MIT
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: ollama.com
Conclusão: A escolha certa quando o objetivo é servir um modelo para outras ferramentas e scripts, não conversar em um aplicativo.
2. LM Studio – melhor tudo em um para uma instalação inicial
LM Studio é a opção “baixar um EXE e conversar com um modelo em cinco minutos”. O aplicativo agrupa um navegador Hugging Face, painel de bate-papo e um botão para expor um servidor compatível com OpenAI em localhost:1234. A detecção de VRAM é precisa em cartões antigos, e a lista de modelos marca quais compilações cabem completamente em nossa GPU versus quais precisam de descarregamento de CPU.
Onde fica aquém: O cliente é de código fechado. O uso comercial requer preencher o formulário de licença do LM Studio Team e aguardar uma cotação.
Preços:
- Grátis: Uso pessoal
- Pago: Licença de equipe sob demanda
Plataformas: Windows, macOS, Linux
Baixar: lmstudio.ai
Conclusão: A instalação inicial mais amigável em hardware NVIDIA antigo, com o caminho mais rápido para uma janela de bate-papo funcional.
3. KoboldCPP – melhor runtime sem instalação
KoboldCPP é um executável único (koboldcpp.exe no Windows, um binário estático no Linux) que executa modelos GGUF, geração de imagens Stable Diffusion e transcrição Whisper sem qualquer ambiente Python. Em um GTX 1660 Super (6 GB), um modelo 7B Q4 ainda cabe com algumas camadas descarregadas para a CPU, e o mesmo executável manipula a geração rápida de imagens sem trocar de aplicativo.
Onde fica aquém: A interface do usuário é baseada na web (abre em uma aba do navegador) e parece funcional em vez de polida. A profundidade do recurso é alta, a descoberta é baixa.
Preços:
- Grátis: Tudo, AGPL 3.0
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: github.com/LostRuins/koboldcpp
Conclusão: A escolha quando a máquina de destino é um laptop, um homelab ou o PC de um amigo onde não queremos instalar o Python em toda a máquina.
4. text-generation-webui – melhor para usuários avançados
text-generation-webui (oobabooga) suporta todos os formatos de quantização que importam (GGUF, GPTQ, AWQ, exllamav2), nos permite alternar carregadores dinamicamente e expõe botões de geração de baixo nível (escala de rope, mirostat, temperatura dinâmica) que outros aplicativos escondem. Em um RTX 3060 (12 GB), executa felizmente um modelo 14B em Q4 com 20 a 30 tokens por segundo.
Onde fica aquém: O instalador baixa alguns gigabytes de dependências do Python. O primeiro lançamento leva 5 a 10 minutos. Não é a ferramenta para alguém que quer clicar em uma coisa e conversar.
Preços:
- Grátis: Tudo, AGPL 3.0
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: github.com/oobabooga/text-generation-webui
Conclusão: Ideal para o usuário que deseja comparar quantizações de modelos e estratégias de geração no mesmo hardware.
5. GPT4All – melhor ponto de partida com VRAM baixo
GPT4All tem o piso mais baixo: o catálogo de modelos integrado sinaliza modelos 3B e 4B que funcionam em cartões de 4 GB, e a barra lateral LocalDocs manipula pequenos trabalhos de RAG sem um banco de dados de vetores separado. Em um GTX 1060 (6 GB), Mistral 7B Instruct executa a uma taxa utilizável de 15 a 20 tokens por segundo.
Onde fica aquém: A GUI é projetada para uso individual; não há API multiusuário integrada. O catálogo de modelos é menor que o do LM Studio ou Ollama.
Preços:
- Grátis: Tudo
- Pago: Nenhum; suporte empresarial é um complemento pago
Plataformas: Windows, macOS, Linux
Baixar: gpt4all.io
Conclusão: A instalação inicial apropriada em um laptop com 4 a 6 GB de VRAM.
6. Jan – melhor equivalente LM Studio totalmente de código aberto
Jan é o que LM Studio pareceria se o próprio cliente fosse Apache 2.0. Catálogo de modelos de primeira parte, servidor compatível com OpenAI em localhost:1337, suporte do Model Context Protocol para que Claude Desktop e Continue possam acessar um modelo hospedado em Jan, e sem telemetria.
Onde fica aquém: Projeto mais jovem que o LM Studio; o catálogo é menor e algumas quantizações do Hugging Face chegam mais tarde. A aceleração de GPU do Windows em hardware não CUDA ainda está se recuperando.
Preços:
- Grátis: Tudo, Apache 2.0
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: jan.ai
Conclusão: A escolha de código aberto quando queremos um aplicativo ao estilo LM Studio cuja licença possamos ler em uma tarde.
7. llama.cpp – melhor runtime bare-metal
llama.cpp é o projeto C++ no qual o resto do ecossistema é construído. Funciona em qualquer lugar, é compilado em cinco minutos no Linux e produz a melhor taxa de transferência de usuário único em GPUs antigas porque não há abstração de Python entre o driver e o modelo. Em um GTX 1080 Ti com -ngl 33, atinge taxas de token brutas que os aplicativos de nível superior ficam para trás por alguns pontos percentuais.
Onde fica aquém: Sem instalador, sem GUI. Estamos compilando e executando ferramentas de linha de comando. A configuração inicial para um usuário do Windows requer mais trabalho do que qualquer outro aplicativo nesta lista.
Preços:
- Grátis: Tudo, MIT
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Baixar: github.com/ggml-org/llama.cpp
Conclusão: Para desenvolvedores que querem saber exatamente o que acontece entre o arquivo do modelo e o primeiro token.
8. vLLM – melhor servidor de API multiusuário no Linux
vLLM é o runtime para transformar uma estação de trabalho antiga em um pequeno servidor de inferência de equipe. A atenção paginada dimensiona a taxa de transferência quase linearmente com solicitações simultâneas, e modelos quantizados AWQ de 4 bits permitem que um cartão de 24 GB sirva dois ou três pessoas digitando simultaneamente sem travar. Executa nativamente no Linux; usuários do Windows precisam de WSL 2 com passthrough CUDA.
Onde fica aquém: Não é um aplicativo de bate-papo. vLLM é um servidor compatível com OpenAI e espera que os clientes o acessem. O suporte a modelos pequenos é bom, mas o foco de otimização do projeto está em implantações maiores.
Preços:
- Grátis: Tudo, Apache 2.0
- Pago: Nenhum
Plataformas: Linux (WSL no Windows)
Baixar: github.com/vllm-project/vllm
Conclusão: A escolha quando o objetivo é um clone privado do OpenAI que um pequeno grupo compartilha.
Como escolher o certo
- Se queremos uma janela de bate-papo nos próximos 10 minutos: LM Studio ou GPT4All.
- Se estamos servindo modelos para outras ferramentas: Ollama.
- Se queremos a mesma experiência de código aberto: Jan.
- Se nossa máquina não pode instalar nada em todo o sistema: KoboldCPP.
- Se queremos extrair o último percentual de desempenho: llama.cpp.
- Se queremos comparar compilações e quantizações de modelos: text-generation-webui.
- Se um pequeno time vai compartilhar a máquina: vLLM no Linux.
Perguntas frequentes
Qual é a idade em que uma GPU é muito antiga para executar IA local?
Cartões com 4 GB de VRAM e Compute Capability 6.0 ou superior (Pascal em diante) podem executar modelos 3B e 4B confortavelmente. Abaixo de 4 GB, a resposta prática é inferência apenas de CPU com um modelo pequeno.
Um GTX 1080 Ti ainda faz sentido em 2026?
Sim para IA local. Tem 11 GB de VRAM, amplo suporte CUDA 12 e computação suficiente para modelos 7B e 8B a 25 a 30 tokens por segundo. Não é o suficiente para geração de imagens de alta resolução.
Qual formato de quantização é melhor para cartões antigos?
GGUF Q4_K_M ou Q5_K_M para qualidade de bate-papo, AWQ de 4 bits para taxa de transferência máxima ao usar vLLM. GPTQ ainda funciona, mas o formato está sendo silenciosamente descontinuado.
Posso executar esses aplicativos em GPUs AMD ou Intel?
Ollama, LM Studio, KoboldCPP e llama.cpp suportam Vulkan ou ROCm em muitos cartões AMD. Intel Arc é suportado via SYCL em llama.cpp e OpenVINO em alguns forks. Este artigo se concentra em NVIDIA porque é onde a conversa sobre cartões antigos reside.
Devo me preocupar com telemetria?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All e vLLM vêm sem telemetria. LM Studio tem alternâncias de telemetria em configurações; desativar na primeira execução.