Cada mensagem enviada ao ChatGPT ou Claude sai do prédio. Para a maioria das pessoas, esse compromisso é aceitável. Para um número crescente de proprietários de laboratórios domésticos, não é, e um servidor Proxmox que já executa Plex, Home Assistant e Pi-hole tem exatamente a CPU, RAM e (frequentemente) GPU que um modelo de linguagem local precisa. Um relatório recente de um auto-hospedeiro que abandonou a IA em nuvem por um LLM local no Proxmox resumiu bem o apelo: o hardware já estava pago, então o modelo se tornou o que finalmente tornou o laboratório doméstico inteiro valer a pena. Reunimos sete aplicativos que vale a pena executar em uma VM ou contêiner LXC para alcançar isso, classificados por esforço de configuração, eficiência de hardware e quão próximo o dia a dia se aproxima do ChatGPT. Estes são os melhores aplicativos para hospedar um LLM local no Proxmox este ano.
O que procurar em um host LLM do Proxmox
Nem todo projeto LLM local é construído para ser executado sem cabeça em um hipervisor. Algumas coisas separam as que valem a pena instalar daquelas que vão lutar contra você.
- VM versus contêiner LXC. Um contêiner LXC é mais leve em RAM e disco e inicia mais rapidamente; uma VM completa é mais segura para passthrough de GPU e isola problemas de driver do próprio host Proxmox.
- Suporte de passthrough de GPU. Qualquer coisa executando um modelo maior que alguns bilhões de parâmetros quer uma GPU dedicada. Verifique se o aplicativo funciona bem com uma placa NVIDIA passada via vGPU ou passthrough PCI, ou se degrada graciosamente em hardware somente CPU.
- Um endpoint compatível com API. Uma API REST compatível com OpenAI é o que permite que outros serviços na rede, como Home Assistant ou um editor de código, fale com o modelo sem código personalizado.
- Um gerenciador de modelos. Puxar, trocar e quantizar modelos a partir de uma linha de comando ou interface simples é melhor do que editar manualmente arquivos de configuração toda vez que um novo modelo é lançado.
- Uma interface web. Uma interface de bate-papo baseada em navegador é o que faz o servidor parecer uma substituição do ChatGPT em vez de apenas um serviço backend que outro software pode alcançar.
- Suporte de quantização. Formatos quantizados como GGUF são o que permite que um modelo 7B ou 13B caiba em 8 a 16 GB de VRAM, ou seja executado em CPU em uma velocidade utilizável.
Comparação rápida
| Aplicativo | Melhor para | Implantação | Nível gratuito | Suporte GPU |
|---|---|---|---|---|
| Ollama | Host Proxmox geral | Linux VM, LXC, Docker | Gratuito, código aberto | NVIDIA, AMD (ROCm), CPU |
| Open WebUI | Melhor interface em cima do Ollama | Docker na mesma VM/LXC | Gratuito, código aberto | Herda GPU de backend |
| LM Studio | Descoberta de modelo na área de trabalho | Aplicativo de desktop (não sem cabeça) | Gratuito | NVIDIA, Apple Silicon |
| text-generation-webui | Formatos de modelo avançados e mais antigos | Linux VM, Docker | Gratuito, código aberto | NVIDIA, AMD, CPU |
| vLLM | Serviço de alto rendimento, produção | Linux VM, Docker | Gratuito, código aberto | NVIDIA (melhor), AMD (parcial) |
| llama.cpp server | Mais leve, nativo GGUF | Linux VM, LXC, Docker | Gratuito, código aberto | NVIDIA, AMD, Apple Silicon, CPU |
| LocalAI | Substituição drop-in OpenAI-API | Linux VM, LXC, Docker | Gratuito, código aberto | NVIDIA, CPU |
Os 7 aplicativos classificados
1. Ollama — Melhor geral
Ollama é o aplicativo em que a maioria dos proprietários de laboratórios domésticos Proxmox aterrissa primeiro, e geralmente aquele em que ficam. A instalação é um único comando shell dentro de uma VM Debian ou Ubuntu (ou um contêiner LXC privilegiado com os módulos de kernel corretos), e puxar um modelo é tão simples quanto ollama run llama3. Ele expõe uma API compatível com OpenAI na porta 11434 por padrão, o que significa que Home Assistant, Continue.dev e dezenas de outras ferramentas se conectam a ele sem configuração adicional.
Onde fica aquém: A interface agrupada é um bate-papo de linha de comando, não uma interface web, então a maioria das pessoas a emparelha com Open WebUI ou um front-end similar. Passthrough de GPU em um contêiner LXC requer que o driver NVIDIA corresponda exatamente entre o host e o contêiner, o que quer dizer mais nos iniciantes do que na rota VM.
Preço: Gratuito, código aberto.
Plataformas: Linux VM, LXC, Docker, também nativo no Windows e macOS para testes locais fora do laboratório.
Baixar: ollama.com
Resumo: A escolha padrão para um host LLM do Proxmox, e o backend em que a maioria dos outros aplicativos nesta lista são construídos.
2. Open WebUI — Melhor interface em cima do Ollama
Open WebUI transforma Ollama em algo que realmente parece e se sente como ChatGPT: histórico de chat, múltiplas conversas, comutação de modelo de um dropdown, carregamento de documentos com respostas aprimoradas por recuperação e logins multiusuário com permissões por usuário. Ele é executado em seu próprio contêiner Docker ao lado do Ollama, então os dois juntos se encaixam confortavelmente em um contêiner LXC ou uma VM pequena.
Implementações familiares ou domésticas se beneficiam mais aqui. Cada pessoa obtém seu próprio login, seu próprio histórico de chat, e um administrador pode definir quais modelos estão disponíveis para quem.
Onde fica aquém: É um frontend, não um servidor de modelo, portanto depende inteiramente do Ollama (ou outro backend compatível com OpenAI) já em execução abaixo dele. As telas de gerenciamento de permissões e usuários levam alguns minutos para se acostumar na primeira vez.
Preço: Gratuito, código aberto.
Plataformas: Docker em uma VM Linux ou contêiner LXC, ao lado do Ollama.
Baixar: github.com/open-webui/open-webui
Resumo: A escolha para quem quer que a família realmente use o LLM local em vez de apenas a pessoa que o configurou.
3. LM Studio — Melhor para descoberta de modelo
LM Studio é um aplicativo de desktop refinado para Windows, macOS e Linux que torna a navegação, o download e o teste de modelos Hugging Face indolor, com um catálogo integrado, estimativas de RAM e VRAM antes de baixar e um modo de servidor local que expõe a mesma API compatível com OpenAI que os outros aplicativos nesta lista. É menos nativo do Proxmox do que o Ollama, pois foi projetado para ser executado com GUI em uma estação de trabalho em vez de sem cabeça em um contêiner, mas merece um lugar aqui porque é a forma mais rápida de descobrir qual modelo realmente se encaixa no seu hardware antes de se comprometer com uma implantação Proxmox.
Alguns proprietários de laboratórios domésticos executam LM Studio em uma máquina desktop puramente para pesquisa de modelo, e depois puxam o modelo vencedor para Ollama na caixa Proxmox para o servidor always-on.
Onde fica aquém: Executá-lo sem cabeça dentro de uma VM funciona mas perde o ponto do aplicativo, já que a GUI é o principal atrativo. Não foi construído para o tipo de operação desassistida, boot-and-forget que um servidor de laboratório doméstico deseja.
Preço: Gratuito.
Plataformas: Desktop Windows, macOS, Linux (não nativo de contêiner).
Baixar: lmstudio.ai
Resumo: Útil como ferramenta de reconhecimento antes da implantação, não como host Proxmox em si.
4. text-generation-webui — Melhor para formatos de modelo avançados e mais antigos
text-generation-webui, frequentemente chamado de “oobabooga” em homenagem ao seu criador, é o veterano desta lista e ainda o aplicativo com o suporte de formato mais amplo: GGUF, GPTQ, AWQ e EXL2 carregam através da mesma interface, junto com suporte de ajuste fino LoRA e um modo de conclusão estilo notebook. Para quem está executando um modelo mais antigo ou obscuro que ferramentas mais novas descontinuaram o suporte, este é geralmente o lugar onde ainda funciona.
A interface web inclui cartões de personagens, predefinições de bate-papo e extensões para coisas como memória de longo prazo e voz, recursos voltados mais para experimentação de hobby do que para uma experiência de bate-papo limpa e diária.
Onde fica aquém: A interface mostra sua idade ao lado do Open WebUI, e o grande número de configurações e extensões pode sobrecarregar alguém que apenas quer uma caixa de bate-papo funcional. As atualizações ocasionalmente quebram a compatibilidade com formatos de quantização específicos.
Preço: Gratuito, código aberto.
Plataformas: Linux VM, Docker, também funciona no Windows e macOS.
Baixar: github.com/oobabooga/text-generation-webui
Resumo: A escolha certa para fãs de bricolage que executam formatos de modelo incomuns ou ajustes finos que outros servidores não suportam.
5. vLLM — Melhor para alto rendimento e serviço de produção
vLLM é construído para um problema diferente da maioria desta lista: servir muitas solicitações simultâneas rapidamente, usando PagedAttention para manter a memória GPU eficiente sob carga. Em uma caixa Proxmox com uma GPU adequadamente passada, vLLM vai superar o Ollama por uma margem ampla quando várias pessoas ou várias aplicações atingem o modelo ao mesmo tempo, o que importa para um laboratório doméstico executando um LLM atrás de vários serviços (assistente de codificação, interface de bate-papo e oleoduto de automação, tudo ao mesmo tempo).
Ele fala nativamente a API OpenAI, portanto se encaixa nas mesmas ferramentas que falam com Ollama.
Onde fica aquém: A configuração é mais pesada, os requisitos de GPU são mais rigorosos e o desempenho de bate-papo de usuário único não é significativamente melhor do que as opções mais simples aqui. Laboratórios domésticos apenas para CPU ou com VRAM baixo obtêm pouco benefício dele.
Preço: Gratuito, código aberto.
Plataformas: Linux VM com passthrough de GPU, Docker.
Baixar: github.com/vllm-project/vllm
Resumo: Overkill para uma substituição do ChatGPT de usuário único, mas a ferramenta certa uma vez que um laboratório doméstico começa a servir um modelo local para múltiplos aplicativos ou pessoas ao mesmo tempo.
6. llama.cpp server — Mais leve, nativo GGUF
llama.cpp é o mecanismo de inferência C++ que a maioria dos aplicativos nesta lista executa sob o capô, e seu próprio servidor agrupado (llama-server) é a forma mais leve de expor um modelo GGUF sobre uma API compatível com OpenAI sem camadas extras. O uso de recursos é o mais baixo nesta lista, o que o torna uma opção forte para um pequeno contêiner LXC ou um host Proxmox que também precisa executar outros serviços no mesmo hardware.
Inclui uma interface de bate-papo web integrada mínima, funcional mas simples, que é suficiente para uso básico sem adicionar Open WebUI em cima.
Onde fica aquém: Sem gerenciador de modelos, sem contas multiusuário, e a configuração acontece através de sinalizadores de linha de comando em vez de uma tela de configurações. Recompensa alguém confortável com um terminal mais do que alguém que quer uma configuração de apontar e clicar.
Preço: Gratuito, código aberto.
Plataformas: Linux VM, LXC, Docker, também compila no Windows, macOS e Apple Silicon.
Baixar: github.com/ggerganov/llama.cpp
Resumo: A escolha para espremer um modelo em hardware mínimo ou um contêiner LXC com recursos limitados.
7. LocalAI — Melhor substituição drop-in OpenAI-API
LocalAI visa ser uma substituição quase total do tipo drop-in para a API OpenAI, cobrindo não apenas conclusões de chat, mas geração de imagem, conversão de texto em fala e incorporações atrás da mesma interface. Para um laboratório doméstico que já tem aplicativos ou automações conectados para chamar a API OpenAI, LocalAI permite que esse ponto de integração permaneça inalterado enquanto a inferência real acontece localmente na caixa Proxmox.
Suporta uma ampla gama de backends, incluindo llama.cpp, portanto o mesmo servidor pode executar vários formatos de modelo diferentes dependendo do que uma determinada solicitação requer.
Onde fica aquém: A amplitude dos tipos de modelo suportados adiciona complexidade de configuração em comparação com um servidor de propósito único como Ollama, e o projeto se move rápido o suficiente para que a documentação ocasionalmente fique para trás da versão mais recente.
Preço: Gratuito, código aberto.
Plataformas: Linux VM, LXC, Docker.
Baixar: localai.io
Resumo: A escolha certa quando a ferramenta existente já está construída contra a API OpenAI e trocar o endpoint, não reescrever a integração, é o objetivo.
Como escolher o certo
Para uma pessoa que substitui ChatGPT para uso diário, Ollama emparelhado com Open WebUI cobre quase tudo: uma interface de bate-papo, comutação de modelo e um endpoint de API para qualquer outra coisa na rede. Uma família compartilhando uma caixa Proxmox se beneficia do mesmo emparelhamento, já que logins por usuário do Open WebUI mantêm históricos de bate-papo separados sem necessidade de múltiplas VMs.
Um amador que quer mexer em ajustes finos, predefinições de personagem ou formatos de quantização mais antigos obtém mais quilometragem do text-generation-webui, mesmo com sua curva de aprendizado mais acentuada. Alguém ainda decidindo qual modelo se encaixa no seu hardware deve começar com LM Studio em um desktop antes de se comprometer com uma VM Proxmox em uma configuração específica.
Um rig rico em GPU servindo múltiplos aplicativos ou usuários ao mesmo tempo é o único caso em que vLLM merece seu custo de configuração adicional, pois sua vantagem de throughput só aparece sob carga concorrente. Uma caixa apenas para CPU ou um host Proxmox com RAM limitado para economizar é melhor servido pelo servidor llama.cpp diretamente, que tem a menor sobrecarga de qualquer coisa nesta lista. E um laboratório com automação existente já chamando a API OpenAI é o caso claro para LocalAI, pois permite que esse ponto de integração permaneça exatamente como era.
Perguntas frequentes
Proxmox pode executar LLMs sem uma GPU? Sim. Ollama, servidor llama.cpp e LocalAI todos rodam em CPU apenas, e um modelo 7B ou 8B quantizado é utilizável para bate-papo em uma CPU multicore moderna, embora as respostas cheguem notavelmente mais lentamente do que em uma GPU. Modelos quantizados menores (3B e abaixo) permanecem responsivos mesmo em hardware modesto.
Qual LLM local está mais próximo da qualidade do ChatGPT? A qualidade do modelo depende de quais pesos são carregados, não qual servidor os executa, então qualquer um desses aplicativos pode executar os mesmos modelos. Modelos abertos maiores na faixa de 70B-plus, executados em uma boa quantização, chegam mais perto das respostas de nível ChatGPT, embora precisem de VRAM substancial ou fallback de CPU lento para funcionar bem.
Ollama é gratuito? Sim. Ollama é gratuito e código aberto, sem nível pago, assinatura ou limites de uso, pois a inferência acontece inteiramente no hardware em que ela funciona.
Devo usar uma VM ou contêiner LXC para Ollama? Um contêiner LXC é mais leve e inicia mais rápido, o que convém a uma configuração apenas para CPU ou um laboratório apertado em RAM. Uma VM é a escolha mais segura para passthrough de GPU, pois isola a pilha de drivers NVIDIA do host Proxmox e evita problemas de correspondência de versão que surgem quando um contêiner compartilha o kernel e drivers do host.
Qual modelo funciona em 16 GB de VRAM? Um modelo 13B em quantização GGUF de 4 bits ou 5 bits se encaixa confortavelmente em 16 GB de VRAM com espaço para uma janela de contexto razoável. Algumas quantizações 34B bem otimizadas também se encaixam com um comprimento de contexto reduzido, embora 13B e abaixo deem o maior espaço de cabeça para conversas mais longas.