Melhores aplicativos para transformar um PC antigo em servidor de IA local

Aquele velho PC gamer sentado no armário ainda tem muito tempo de vida útil. Uma máquina da era 2018 com Ryzen ou Intel, 32 GB de RAM e uma GPU usada executará um modelo 7B em velocidade de conversa e acomodará confortavelmente um modelo 13B. Aponte os laptops da família para ela e você tem uma IA privada, sempre ligada que responde na LAN em alguns segundos. Os melhores aplicativos para transformar um PC antigo em servidor de IA local escolhem bem seus modelos, fornecem uma API HTTP para outras ferramentas e permitem que a máquina durma entre as solicitações. Escolhemos sete que transformam hardware de dez anos em um serviço de IA utilizável.

O que procurar em um aplicativo de servidor de IA local

Seis coisas importam para IA em hardware antigo:

Comparação rápida

Aplicativo Melhor para Suporte GPU API Destaque
Ollama Servidor mais simples Nvidia, AMD, Apple Compatível com OpenAI Um comando executa um modelo
LM Studio UI amigável Nvidia, AMD, Apple Compatível com OpenAI Melhor descoberta de modelos
Jan Clone ChatGPT totalmente local Nvidia, AMD, Apple Compatível com OpenAI Chat mais servidor em um aplicativo
GPT4All Baseline apenas CPU Nvidia, AMD, CPU API local Funciona em hardware antigo
llama.cpp Controle bare-metal Nvidia, AMD, Apple, CPU HTTP puro O mecanismo sob a maioria da lista
Open WebUI Frontend web para Ollama Qualquer um (cliente) Fala com Ollama UI tipo ChatGPT para a LAN
LocalAI Substituição direta do OpenAI Nvidia, AMD, CPU Compatível com OpenAI Serve imagens, áudio, embeddings também

Os aplicativos

1. Ollama, melhor para “executar um modelo em um comando”

Ollama fornece um serviço de fundo que puxa, quantiza e serve modelos de uma biblioteca selecionada. Um comando (ollama run llama3.2) baixa os pesos, carrega o modelo e coloca o usuário em um chat. O serviço expõe um endpoint compatível com OpenAI em localhost:11434, então qualquer ferramenta que fale com OpenAI pode apontar para o PC antigo e obter o mesmo comportamento.

Onde ele falha: A própria biblioteca do Ollama usa um formato de manifesto personalizado. Trazer um GGUF aleatório do Hugging Face requer um pequeno Modelfile e uma etapa de importação.

Preço: Grátis, licença MIT.

Plataformas: Windows, macOS, Linux.

Download: Ollama

Resumo: Comece aqui. Instale-o, execute um comando, e a LAN tem um servidor de IA.

2. LM Studio, melhor para UI amigável

LM Studio é um aplicativo de desktop que navega no Hugging Face, baixa modelos GGUF e os executa localmente. Tem uma interface de chat e um toggle “servidor local” que expõe um endpoint compatível com OpenAI. A interface mostra o uso previsto de RAM e VRAM antes do download, o que é genuinamente útil ao escolher uma quantização.

Onde ele falha: Código fechado. Algumas partes do aplicativo dependem de alcance à Internet mesmo para uso local, embora o modelo funcione offline.

Preço: Grátis para uso pessoal.

Plataformas: Windows, macOS, Linux.

Download: LM Studio

Resumo: Escolha isso quando o amigo que executa o PC antigo não quer tocar em um terminal.

3. Jan, melhor para clone ChatGPT totalmente local

Jan é um aplicativo de desktop que vem como um cliente em formato ChatGPT, gerenciador de modelos e servidor API local em um pacote. Os downloads de modelos são visíveis, e o “modo servidor” disponibiliza os mesmos modelos para outros aplicativos na LAN. Todo o design é código aberto e focado em privacidade.

Onde ele falha: Mais recente que Ollama e LM Studio; ocasionalmente arestas ásperas no suporte de modelos.

Preço: Grátis, licença AGPL.

Plataformas: Windows, macOS, Linux.

Download: Jan

Resumo: A escolha se o objetivo é um único aplicativo que funcione como cliente de chat e servidor na LAN.

4. GPT4All, melhor para baseline apenas CPU

GPT4All foi construído para o caso onde não há GPU nenhuma. Ele executa modelos GGUF na CPU com desempenho utilizável em qualquer máquina de 2018 em diante. O aplicativo de desktop gerencia modelos, e um servidor API local pode ser ligado a partir das configurações.

Onde ele falha: A velocidade na CPU é limitada pela largura de banda da memória. Espere 4 a 8 tok/s em um modelo 7B em uma CPU moderna sem GPU.

Preço: Grátis, licença MIT.

Plataformas: Windows, macOS, Linux.

Download: GPT4All

Resumo: Para o PC de escritório sem GPU. Ainda executa um assistente.

5. llama.cpp, melhor para controle bare-metal

llama.cpp é o mecanismo que a maioria dos aplicativos acima envolve. Executá-lo diretamente é o caminho mais rápido em hardware antigo porque não há overhead. O binário llama-server expõe um endpoint HTTP; o binário llama-cli executa chat interativo. Tudo é um projeto C++ sem runtime.

Onde ele falha: Apenas linha de comando. A configuração fica em flags, não em uma UI.

Preço: Grátis, licença MIT.

Plataformas: Windows, macOS, Linux (compila a partir da fonte em todo lugar).

Download: GitHub

Resumo: A escolha quando o objetivo é extrair cada último token por segundo da máquina antiga.

6. Open WebUI, melhor para frontend web

Open WebUI é uma interface web auto-hospedada que fala com Ollama (ou qualquer endpoint compatível com OpenAI). Instale-o no PC antigo, e cada dispositivo na LAN obtém uma página tipo ChatGPT em http://server-ip:3000. Usuários, permissões, documentos RAG e roteamento multi-modelo estão todos integrados.

Onde ele falha: Funciona no topo de um backend de modelo, então precisa de Ollama ou um servidor compatível com OpenAI atrás.

Preço: Grátis, auto-hospedado; BSD-3-Clause.

Plataformas: Docker em qualquer host.

Download: GitHub

Resumo: A interface de usuário que a maioria das famílias quer. Instale logo após Ollama.

7. LocalAI, melhor para substituição direta do OpenAI

LocalAI substitui a API OpenAI na LAN. Conclusões de chat, embeddings, geração de imagens (Stable Diffusion), text-to-speech e speech-to-text vivem atrás dos mesmos endpoints HTTP que OpenAI usa. Qualquer ferramenta com um SDK OpenAI funciona contra LocalAI mudando uma variável env.

Onde ele falha: Escopo amplo significa inicialização mais lenta. Cada modalidade tem suas próprias opções de modelo.

Preço: Grátis, licença MIT.

Plataformas: Docker em Linux, Windows (WSL2), macOS.

Download: LocalAI · GitHub

Resumo: Escolha isso quando o objetivo é trocar OpenAI por um servidor local em muitos aplicativos ao mesmo tempo.

Como escolher a combinação correta

Para uma configuração home-lab que precisa funcionar: Ollama mais Open WebUI. Um serve modelos na LAN; o outro dá à família uma página para visitar.

Para um amigo que não vai tocar em um terminal: LM Studio no desktop e deixe-o conversar localmente.

Para uma velha máquina de escritório apenas CPU: GPT4All com um modelo 3B. Ou llama.cpp com o mesmo modelo se um terminal está bem.

Para um tudo-em-um que oferece chat e servidor sem se dividir em dois aplicativos: Jan.

Para uma casa executando muitas ferramentas de IA (assistentes pessoais, IDEs de codificação, apps de notas): LocalAI para que cada ferramenta veja um endpoint tipo OpenAI.

FAQ

Que modelo devo executar primeiro? Llama 3.2 3B ou Qwen 2.5 3B em Q4_K_M. Ambos cabem em 4 GB de RAM, funcionam a 15 a 30 tok/s em uma CPU moderna sozinha, e dão respostas praticamente de ponta para perguntas comuns.

Preciso de uma GPU? Não, mas muda o que você pode executar. Sem GPU, espere modelos 7B a 5 a 10 tok/s. Mesmo com uma Nvidia RTX 3060 usada (12 GB), um modelo 13B a 30 a 50 tok/s se torna prático.

Quanto de RAM eu preciso? 16 GB é o mínimo para modelos 7B. 32 GB abre o território 13B. 64 GB ou mais começam a manter 34B e 70B (com quantização).

Posso acessar isso de fora de casa? Sim, através de uma VPN mesh como Tailscale. Não exponha um endpoint Ollama ou LocalAI na internet pública. Não há auth integrada por padrão.

Quanto de energia um PC antigo consome em standby? Um desktop antigo com GPU fica em 40 a 80 W em standby. São $50 a $100 por ano de eletricidade na maioria dos mercados. Se a máquina é consultada apenas algumas vezes por dia, defina wake-on-LAN no BIOS e coloque-a em modo de espera entre sessões.

Como isso se compara com executar Ollama em um Mac mini? Um Mac mini Apple Silicon com 16 ou 24 GB de memória unificada é o caminho mais eficiente em energia. Se o PC antigo ainda tem valor em outro lugar, mantenha-o. Se começar do zero, um M1 mini usado geralmente supera uma torre 2018 em watts por token.