
Gemma 4 em um laptop é responsivo. A GPU faz seu trabalho, as respostas chegam em segundos e o modelo se sente como um assistente real. Mude-o para um NAS e ele vai ficar lento o suficiente para que uma pergunta se torne um pequeno compromisso. Essa diferença é o ponto. Quando o modelo fica no armazenamento compartilhado, toda a família ou equipe pode chamá-lo, e o latência extra de um segundo o transforma novamente em uma ferramenta em vez de um reflexo.
Selecionamos oito aplicativos que executamos em um NAS para hospedar LLMs locais hoje. Alguns são o servidor, alguns são o front-end, alguns são a camada de implantação. Juntos, eles cobrem o fluxo de trabalho desde o download de um modelo até uma família de clientes chamando um endpoint compartilhado.
O que procurar em um aplicativo LLM hospedado em NAS
- Funciona sem interface. Um NAS não tem monitor e muitas vezes não tem GPU.
- Expõe uma API HTTP estável para que qualquer cliente possa se comunicar.
- Gerencia modelos sem reempacotar uma imagem Docker.
- Transmite tokens, porque um modelo hospedado em NAS é mais lento e o streaming o torna utilizável.
- Uma camada de controle de acesso, até mesmo um token simples, porque o endpoint fica na LAN.
Os oito abaixo atendem a pelo menos quatro dos cinco. A classificação os ordena pela facilidade de execução em Synology, QNAP ou um NAS auto-construído.
Comparação rápida
| Aplicativo | Melhor para | Funciona em | Suporte a GPU | Licença |
|---|---|---|---|---|
| Ollama | O servidor NAS mais fácil | Linux, macOS, Windows | CUDA, Metal, ROCm | MIT |
| LM Studio | Host de modelo de clique e ponto | Linux, macOS, Windows | CUDA, Metal, ROCm | Proprietary (free) |
| Open WebUI | Front-end web compartilhado | Docker | Via o backend | MIT |
| LocalAI | Drop-in compatível com OpenAI | Docker | CUDA, ROCm, CPU | MIT |
| Text Generation WebUI | Ajuste do usuário avançado | Linux, macOS, Windows | CUDA, ROCm, CPU | AGPL |
| Jan | Cliente de desktop local-first | Windows, macOS, Linux | CUDA, Metal, CPU | AGPL |
| vLLM | Inferência de alto rendimento | Linux | CUDA (GPUs de servidor) | Apache 2 |
| llama.cpp | Inferência de CPU bare-metal | Qualquer | Qualquer | MIT |
1. Ollama, melhor para o servidor NAS mais fácil
Ollama é o mais próximo de uma instalação de um comando para um NAS. Imagem Docker, porta 11434, e cada cliente que fala Ollama ou API OpenAI pode se comunicar com ele. A biblioteca de modelos cobre Llama, Gemma, Mistral, Qwen e uma lista crescente de variantes de instrução.
Onde fica aquém: os controles de amostragem de granulação fina ficam ocultos atrás de sinalizadores. Qualquer pessoa que queira trocar modelos de prompt manualmente acaba na sintaxe do modelfile.
Preço:
- Grátis, MIT.
Plataformas: Linux, macOS, Windows (todos como Docker ou nativos).
Download: ollama.com
Conclusão: A recomendação padrão para quem configurar um LLM NAS pela primeira vez.
2. LM Studio, melhor para host de modelo de clique e ponto
LM Studio é o aplicativo de desktop que também executa um servidor compatível com OpenAI. Aponte-o para uma pasta de modelo montada em NAS, ative o servidor e os clientes na LAN podem chamá-lo. A GUI oculta as partes do llama.cpp que assustam as pessoas.
Onde fica aquém: é um aplicativo de desktop em primeiro lugar, então a instalação sem interface em um NAS significa executá-lo dentro de um servidor X leve ou escolher um NAS com tela para configuração.
Preço:
- Grátis para uso pessoal.
Plataformas: Windows, macOS, Linux.
Download: lmstudio.ai
Conclusão: A escolha certa quando um membro da família quer alterar modelos e não quer tocar no terminal.
3. Open WebUI, melhor para front-end web compartilhado
Open WebUI é a interface web estilo ChatGPT para um backend hospedado em NAS. Aponte-o para Ollama, LM Studio ou LocalAI, adicione usuários e cada membro da família obtém seus próprios chats e uma biblioteca compartilhada de prompts. RAG sobre arquivos locais vem na caixa.
Onde fica aquém: é um front-end, não um runtime. Ollama ou LocalAI ainda faz o trabalho do modelo.
Preço:
- Grátis, MIT.
Plataformas: Docker em Linux, mais uma instalação nativa de NAS via Portainer.
Download: openwebui.com
Conclusão: O emparelhamento certo com Ollama quando o objetivo é um chat familiar compartilhado e focado em navegador.
4. LocalAI, melhor para drop-in compatível com OpenAI
LocalAI expõe um endpoint compatível com OpenAI (chat, embeddings, imagens, TTS) contra modelos locais. Qualquer aplicativo que fale a API OpenAI pode se comunicar sem mudanças. Os backends cobrem llama.cpp, whisper.cpp e stable-diffusion.cpp.
Onde fica aquém: o arquivo de configuração é denso e cada modelo precisa de sua própria entrada. Ollama cuida do mapeamento para você.
Preço:
- Grátis, MIT.
Plataformas: Docker em Linux, mais builds nativos para Windows e macOS.
Download: localai.io
Conclusão: O servidor certo quando o cliente é um SDK OpenAI e trocar a URL base é toda a migração.
5. Text Generation WebUI, melhor para ajuste do usuário avançado
Text Generation WebUI (oobabooga) é o front-end mais antigo e rico que também executa um servidor. Parâmetros de amostragem, carregamento de LoRA e modelos de prompt de estilo cartão de personagem são todos expostos. Qualquer pessoa que queira ajustar um modelo além do padrão se senta aqui.
Onde fica aquém: a interface foi reconstruída duas vezes e ainda mostra suas raízes de usuário avançado. Não é a ferramenta que você entrega a um membro da família.
Preço:
- Grátis, AGPL.
Plataformas: Windows, macOS, Linux.
Download: github.com/oobabooga/text-generation-webui
Conclusão: A escolha para quem quer os botões de amostragem que Ollama e LM Studio ocultam.
6. Jan, melhor para cliente desktop local-first
Jan é o cliente ChatGPT local-first. Vem com seu próprio runtime para NAS somente CPU, mas também fala com um servidor Ollama ou LocalAI remoto. Chats e prompts ficam em disco, então todo o histórico é um arquivo local.
Onde fica aquém: como servidor NAS, não é o melhor encaixe. Use-o como cliente e deixe Ollama ou LocalAI fazer a parte do servidor.
Preço:
- Grátis, AGPL.
Plataformas: Windows, macOS, Linux.
Download: jan.ai
Conclusão: O companheiro desktop certo para um servidor NAS para quem não quer uma aba web.
7. vLLM, melhor para inferência de alto rendimento
vLLM é o servidor em nível de produção. Atenção paginada, paralelismo de tensor e agrupamento contínuo o tornam a maneira mais rápida de servir um grande modelo para muitos clientes. A pegadinha é que precisa de uma GPU real (Ampere ou mais recente).
Onde fica aquém: não é uma instalação amigável ao NAS. Um chassis NAS sem uma GPU de data center não pode executá-lo da forma que os docs presumem.
Preço:
- Grátis, Apache 2.
Plataformas: Linux (normalmente Docker com kit de ferramentas de contêiner NVIDIA).
Download: github.com/vllm-project/vllm
Conclusão: A escolha quando o “NAS” é uma caixa Linux com uma GPU real servindo um homelab de clientes.
8. llama.cpp, melhor para inferência de CPU bare-metal
llama.cpp é o runtime de baixo nível que tudo nesta lista envolve. Funciona em builds de NAS somente CPU onde uma GPU real está ausente, com modelos quantizados que encolhem um modelo de parâmetro 8B para alguns gigabytes.
Onde fica aquém: não há interface. É um binário de servidor e CLI. Combine com Open WebUI ou Ollama.
Preço:
- Grátis, MIT.
Plataformas: Qualquer (Linux, macOS, Windows, ARM incluindo Raspberry Pi e Apple Silicon).
Download: github.com/ggerganov/llama.cpp
Conclusão: A escolha certa quando o NAS é somente CPU e cada gigabyte de RAM importa.
Como escolher a certa
- Instalação de um comando em um NAS: Ollama.
- Chat web compartilhado para a família: Ollama mais Open WebUI.
- Endpoint compatível com OpenAI que qualquer SDK possa chamar: LocalAI.
- Troca de modelo de clique e ponto: LM Studio.
- Controle de amostragem e LoRA: Text Generation WebUI.
- Cliente de desktop local apontando para um NAS: Jan.
- Rendimento de GPU séria para muitos clientes: vLLM.
- NAS somente CPU: llama.cpp.
Perguntas frequentes
Qual modelo funciona em um NAS sem GPU?
Versões quantizadas de Gemma, Llama ou Mistral na faixa 3B-8B funcionam em uma CPU NAS moderna com alguns tokens por segundo. Isso é lento para chat interativo, bom para um resumo único ou um trabalho noturno.
Preciso de uma GPU no meu NAS?
Apenas para velocidade interativa. Um NAS somente CPU ainda executa um modelo pequeno; os tempos de resposta ficam em segundos por frase em vez de tokens por segundo.
Posso manter o modelo hospedado em NAS privado para minha LAN?
Sim. Ollama, LM Studio e LocalAI se vinculam à interface LAN por padrão. Adicione autenticação básica ou um proxy reverso para qualquer coisa mais que uma LAN doméstica.
Quanto espaço em disco os modelos locais precisam?
Um modelo quantizado 8B fica em torno de 5 GB. Um modelo quantizado 70B fica mais próximo de 40 GB. Um NAS com um volume de sobra de 500 GB segura uma biblioteca completa.
Várias pessoas podem usar o modelo ao mesmo tempo?
Ollama, LocalAI e Text Generation WebUI serializam por padrão. vLLM lida com requisições simultâneas nativamente. Para uma pequena família, a serialização está bem.
E quanto à privacidade?
Cada aplicativo nesta lista executa o modelo localmente. Nenhum prompt ou resposta é enviado para terceiros a menos que o aplicativo seja configurado para fazer isso.