Melhores aplicativos para executar IA local em GPUs NVIDIA antigas

Ninguém precisa de um cartão de 24 GB para executar um modelo local útil em 2026. Modelos quantizados de 7 a 14 bilhões de parâmetros cabem em 8 a 12 GB de VRAM com velocidades que uma GTX 1080 ou RTX 2080 usada produz confortavelmente, e a diferença entre “apenas nuvem” e “local a maior parte do tempo” agora é apenas uma instalação de driver e um download de 4 GB. O truque é o runtime. Alguns aplicativos assumem um cartão RTX 50-series novo; outros foram construídos especificamente para o hardware antigo sentado em um chassi de servidor doméstico.

Testamos 8 aplicativos para desktop para executar IA local em GPUs NVIDIA antigas, focando em Pascal (série GTX 10 e Quadro P), Turing (série RTX 20 e Quadro T) e Ampere inicial (série RTX 30 e estações de trabalho série A). Cada aplicativo na lista executa Llama 3.1, Qwen 2.5, Mistral 7B ou Gemma 2 em 8 GB de VRAM com uma taxa de tokens por segundo utilizável. Qual se ajusta à nossa configuração depende se queremos uma janela de bate-papo, um serviço ou um runtime de baixo nível.

O que procurar em um aplicativo de IA local para GPUs antigas

As restrições de hardware importam mais que a cópia de marketing.

Comparação rápida

Aplicativo Melhor para Windows / Linux Plano gratuito Recurso de destaque Licença
Ollama Daemon headless e scripts Ambos Grátis Puxar modelo em uma linha, orientado para CLI MIT
LM Studio Bate-papo tudo em um Ambos Grátis Navegador de modelos + bate-papo + servidor Proprietária
KoboldCPP Runtime executável único Ambos Grátis Sem instalação, GGUF, TTS, imagens AGPL 3.0
text-generation-webui Mexer do usuário avançado Ambos Grátis Todos os formatos de quantização suportados AGPL 3.0
GPT4All Primeiro modelo em um laptop modesto Ambos Grátis Barra lateral LocalDocs, predefinições de VRAM baixo Tipo MIT
Jan Equivalente LM Studio totalmente de código aberto Ambos Grátis Suporte MCP, compatível com OpenAI Apache 2.0
llama.cpp Velocidade bare-metal Ambos Grátis CPU mais rápido + descarregamento de GPU parcial MIT
vLLM Servidor de API multiusuário Linux (WSL no Windows) Grátis Atenção paginada, melhor produção Apache 2.0

Os aplicativos

1. Ollama – melhor daemon headless em cartões NVIDIA antigas

Ollama é o runtime que a maioria das pessoas instala primeiro porque todo o fluxo de trabalho é ollama pull llama3.1:8b depois ollama run llama3.1. Em um GTX 1080 Ti (11 GB), Llama 3.1 8B Q4_K_M é executado a 25 a 30 tokens por segundo; em um RTX 2080 Super (8 GB), o mesmo modelo é executado em torno de 40. Ollama vincula um ponto de extremidade compatível com OpenAI em localhost:11434, e qualquer frontend que fale OpenAI (Open WebUI, Msty, LibreChat) se conecta com uma mudança de URL base.

Onde fica aquém: O cliente de bate-papo é um terminal. Ollama não vem com uma GUI; o uso gráfico significa adicionar Open WebUI ou outro frontend.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: ollama.com

Conclusão: A escolha certa quando o objetivo é servir um modelo para outras ferramentas e scripts, não conversar em um aplicativo.

2. LM Studio – melhor tudo em um para uma instalação inicial

LM Studio é a opção “baixar um EXE e conversar com um modelo em cinco minutos”. O aplicativo agrupa um navegador Hugging Face, painel de bate-papo e um botão para expor um servidor compatível com OpenAI em localhost:1234. A detecção de VRAM é precisa em cartões antigos, e a lista de modelos marca quais compilações cabem completamente em nossa GPU versus quais precisam de descarregamento de CPU.

Onde fica aquém: O cliente é de código fechado. O uso comercial requer preencher o formulário de licença do LM Studio Team e aguardar uma cotação.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: lmstudio.ai

Conclusão: A instalação inicial mais amigável em hardware NVIDIA antigo, com o caminho mais rápido para uma janela de bate-papo funcional.

3. KoboldCPP – melhor runtime sem instalação

KoboldCPP é um executável único (koboldcpp.exe no Windows, um binário estático no Linux) que executa modelos GGUF, geração de imagens Stable Diffusion e transcrição Whisper sem qualquer ambiente Python. Em um GTX 1660 Super (6 GB), um modelo 7B Q4 ainda cabe com algumas camadas descarregadas para a CPU, e o mesmo executável manipula a geração rápida de imagens sem trocar de aplicativo.

Onde fica aquém: A interface do usuário é baseada na web (abre em uma aba do navegador) e parece funcional em vez de polida. A profundidade do recurso é alta, a descoberta é baixa.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: github.com/LostRuins/koboldcpp

Conclusão: A escolha quando a máquina de destino é um laptop, um homelab ou o PC de um amigo onde não queremos instalar o Python em toda a máquina.

4. text-generation-webui – melhor para usuários avançados

text-generation-webui (oobabooga) suporta todos os formatos de quantização que importam (GGUF, GPTQ, AWQ, exllamav2), nos permite alternar carregadores dinamicamente e expõe botões de geração de baixo nível (escala de rope, mirostat, temperatura dinâmica) que outros aplicativos escondem. Em um RTX 3060 (12 GB), executa felizmente um modelo 14B em Q4 com 20 a 30 tokens por segundo.

Onde fica aquém: O instalador baixa alguns gigabytes de dependências do Python. O primeiro lançamento leva 5 a 10 minutos. Não é a ferramenta para alguém que quer clicar em uma coisa e conversar.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: github.com/oobabooga/text-generation-webui

Conclusão: Ideal para o usuário que deseja comparar quantizações de modelos e estratégias de geração no mesmo hardware.

5. GPT4All – melhor ponto de partida com VRAM baixo

GPT4All tem o piso mais baixo: o catálogo de modelos integrado sinaliza modelos 3B e 4B que funcionam em cartões de 4 GB, e a barra lateral LocalDocs manipula pequenos trabalhos de RAG sem um banco de dados de vetores separado. Em um GTX 1060 (6 GB), Mistral 7B Instruct executa a uma taxa utilizável de 15 a 20 tokens por segundo.

Onde fica aquém: A GUI é projetada para uso individual; não há API multiusuário integrada. O catálogo de modelos é menor que o do LM Studio ou Ollama.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: gpt4all.io

Conclusão: A instalação inicial apropriada em um laptop com 4 a 6 GB de VRAM.

6. Jan – melhor equivalente LM Studio totalmente de código aberto

Jan é o que LM Studio pareceria se o próprio cliente fosse Apache 2.0. Catálogo de modelos de primeira parte, servidor compatível com OpenAI em localhost:1337, suporte do Model Context Protocol para que Claude Desktop e Continue possam acessar um modelo hospedado em Jan, e sem telemetria.

Onde fica aquém: Projeto mais jovem que o LM Studio; o catálogo é menor e algumas quantizações do Hugging Face chegam mais tarde. A aceleração de GPU do Windows em hardware não CUDA ainda está se recuperando.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: jan.ai

Conclusão: A escolha de código aberto quando queremos um aplicativo ao estilo LM Studio cuja licença possamos ler em uma tarde.

7. llama.cpp – melhor runtime bare-metal

llama.cpp é o projeto C++ no qual o resto do ecossistema é construído. Funciona em qualquer lugar, é compilado em cinco minutos no Linux e produz a melhor taxa de transferência de usuário único em GPUs antigas porque não há abstração de Python entre o driver e o modelo. Em um GTX 1080 Ti com -ngl 33, atinge taxas de token brutas que os aplicativos de nível superior ficam para trás por alguns pontos percentuais.

Onde fica aquém: Sem instalador, sem GUI. Estamos compilando e executando ferramentas de linha de comando. A configuração inicial para um usuário do Windows requer mais trabalho do que qualquer outro aplicativo nesta lista.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: github.com/ggml-org/llama.cpp

Conclusão: Para desenvolvedores que querem saber exatamente o que acontece entre o arquivo do modelo e o primeiro token.

8. vLLM – melhor servidor de API multiusuário no Linux

vLLM é o runtime para transformar uma estação de trabalho antiga em um pequeno servidor de inferência de equipe. A atenção paginada dimensiona a taxa de transferência quase linearmente com solicitações simultâneas, e modelos quantizados AWQ de 4 bits permitem que um cartão de 24 GB sirva dois ou três pessoas digitando simultaneamente sem travar. Executa nativamente no Linux; usuários do Windows precisam de WSL 2 com passthrough CUDA.

Onde fica aquém: Não é um aplicativo de bate-papo. vLLM é um servidor compatível com OpenAI e espera que os clientes o acessem. O suporte a modelos pequenos é bom, mas o foco de otimização do projeto está em implantações maiores.

Preços:

Plataformas: Linux (WSL no Windows)

Baixar: github.com/vllm-project/vllm

Conclusão: A escolha quando o objetivo é um clone privado do OpenAI que um pequeno grupo compartilha.

Como escolher o certo

Perguntas frequentes

Qual é a idade em que uma GPU é muito antiga para executar IA local?
Cartões com 4 GB de VRAM e Compute Capability 6.0 ou superior (Pascal em diante) podem executar modelos 3B e 4B confortavelmente. Abaixo de 4 GB, a resposta prática é inferência apenas de CPU com um modelo pequeno.

Um GTX 1080 Ti ainda faz sentido em 2026?
Sim para IA local. Tem 11 GB de VRAM, amplo suporte CUDA 12 e computação suficiente para modelos 7B e 8B a 25 a 30 tokens por segundo. Não é o suficiente para geração de imagens de alta resolução.

Qual formato de quantização é melhor para cartões antigos?
GGUF Q4_K_M ou Q5_K_M para qualidade de bate-papo, AWQ de 4 bits para taxa de transferência máxima ao usar vLLM. GPTQ ainda funciona, mas o formato está sendo silenciosamente descontinuado.

Posso executar esses aplicativos em GPUs AMD ou Intel?
Ollama, LM Studio, KoboldCPP e llama.cpp suportam Vulkan ou ROCm em muitos cartões AMD. Intel Arc é suportado via SYCL em llama.cpp e OpenVINO em alguns forks. Este artigo se concentra em NVIDIA porque é onde a conversa sobre cartões antigos reside.

Devo me preocupar com telemetria?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All e vLLM vêm sem telemetria. LM Studio tem alternâncias de telemetria em configurações; desativar na primeira execução.