Ollama, um dos aplicativos usados para executar LLMs locais em um NAS

Gemma 4 em um laptop é responsivo. A GPU faz seu trabalho, as respostas chegam em segundos e o modelo se sente como um assistente real. Mude-o para um NAS e ele vai ficar lento o suficiente para que uma pergunta se torne um pequeno compromisso. Essa diferença é o ponto. Quando o modelo fica no armazenamento compartilhado, toda a família ou equipe pode chamá-lo, e o latência extra de um segundo o transforma novamente em uma ferramenta em vez de um reflexo.

Selecionamos oito aplicativos que executamos em um NAS para hospedar LLMs locais hoje. Alguns são o servidor, alguns são o front-end, alguns são a camada de implantação. Juntos, eles cobrem o fluxo de trabalho desde o download de um modelo até uma família de clientes chamando um endpoint compartilhado.

O que procurar em um aplicativo LLM hospedado em NAS

Os oito abaixo atendem a pelo menos quatro dos cinco. A classificação os ordena pela facilidade de execução em Synology, QNAP ou um NAS auto-construído.

Comparação rápida

Aplicativo Melhor para Funciona em Suporte a GPU Licença
Ollama O servidor NAS mais fácil Linux, macOS, Windows CUDA, Metal, ROCm MIT
LM Studio Host de modelo de clique e ponto Linux, macOS, Windows CUDA, Metal, ROCm Proprietary (free)
Open WebUI Front-end web compartilhado Docker Via o backend MIT
LocalAI Drop-in compatível com OpenAI Docker CUDA, ROCm, CPU MIT
Text Generation WebUI Ajuste do usuário avançado Linux, macOS, Windows CUDA, ROCm, CPU AGPL
Jan Cliente de desktop local-first Windows, macOS, Linux CUDA, Metal, CPU AGPL
vLLM Inferência de alto rendimento Linux CUDA (GPUs de servidor) Apache 2
llama.cpp Inferência de CPU bare-metal Qualquer Qualquer MIT

1. Ollama, melhor para o servidor NAS mais fácil

Ollama é o mais próximo de uma instalação de um comando para um NAS. Imagem Docker, porta 11434, e cada cliente que fala Ollama ou API OpenAI pode se comunicar com ele. A biblioteca de modelos cobre Llama, Gemma, Mistral, Qwen e uma lista crescente de variantes de instrução.

Onde fica aquém: os controles de amostragem de granulação fina ficam ocultos atrás de sinalizadores. Qualquer pessoa que queira trocar modelos de prompt manualmente acaba na sintaxe do modelfile.

Preço:

Plataformas: Linux, macOS, Windows (todos como Docker ou nativos).

Download: ollama.com

Conclusão: A recomendação padrão para quem configurar um LLM NAS pela primeira vez.

2. LM Studio, melhor para host de modelo de clique e ponto

LM Studio é o aplicativo de desktop que também executa um servidor compatível com OpenAI. Aponte-o para uma pasta de modelo montada em NAS, ative o servidor e os clientes na LAN podem chamá-lo. A GUI oculta as partes do llama.cpp que assustam as pessoas.

Onde fica aquém: é um aplicativo de desktop em primeiro lugar, então a instalação sem interface em um NAS significa executá-lo dentro de um servidor X leve ou escolher um NAS com tela para configuração.

Preço:

Plataformas: Windows, macOS, Linux.

Download: lmstudio.ai

Conclusão: A escolha certa quando um membro da família quer alterar modelos e não quer tocar no terminal.

3. Open WebUI, melhor para front-end web compartilhado

Open WebUI é a interface web estilo ChatGPT para um backend hospedado em NAS. Aponte-o para Ollama, LM Studio ou LocalAI, adicione usuários e cada membro da família obtém seus próprios chats e uma biblioteca compartilhada de prompts. RAG sobre arquivos locais vem na caixa.

Onde fica aquém: é um front-end, não um runtime. Ollama ou LocalAI ainda faz o trabalho do modelo.

Preço:

Plataformas: Docker em Linux, mais uma instalação nativa de NAS via Portainer.

Download: openwebui.com

Conclusão: O emparelhamento certo com Ollama quando o objetivo é um chat familiar compartilhado e focado em navegador.

4. LocalAI, melhor para drop-in compatível com OpenAI

LocalAI expõe um endpoint compatível com OpenAI (chat, embeddings, imagens, TTS) contra modelos locais. Qualquer aplicativo que fale a API OpenAI pode se comunicar sem mudanças. Os backends cobrem llama.cpp, whisper.cpp e stable-diffusion.cpp.

Onde fica aquém: o arquivo de configuração é denso e cada modelo precisa de sua própria entrada. Ollama cuida do mapeamento para você.

Preço:

Plataformas: Docker em Linux, mais builds nativos para Windows e macOS.

Download: localai.io

Conclusão: O servidor certo quando o cliente é um SDK OpenAI e trocar a URL base é toda a migração.

5. Text Generation WebUI, melhor para ajuste do usuário avançado

Text Generation WebUI (oobabooga) é o front-end mais antigo e rico que também executa um servidor. Parâmetros de amostragem, carregamento de LoRA e modelos de prompt de estilo cartão de personagem são todos expostos. Qualquer pessoa que queira ajustar um modelo além do padrão se senta aqui.

Onde fica aquém: a interface foi reconstruída duas vezes e ainda mostra suas raízes de usuário avançado. Não é a ferramenta que você entrega a um membro da família.

Preço:

Plataformas: Windows, macOS, Linux.

Download: github.com/oobabooga/text-generation-webui

Conclusão: A escolha para quem quer os botões de amostragem que Ollama e LM Studio ocultam.

6. Jan, melhor para cliente desktop local-first

Jan é o cliente ChatGPT local-first. Vem com seu próprio runtime para NAS somente CPU, mas também fala com um servidor Ollama ou LocalAI remoto. Chats e prompts ficam em disco, então todo o histórico é um arquivo local.

Onde fica aquém: como servidor NAS, não é o melhor encaixe. Use-o como cliente e deixe Ollama ou LocalAI fazer a parte do servidor.

Preço:

Plataformas: Windows, macOS, Linux.

Download: jan.ai

Conclusão: O companheiro desktop certo para um servidor NAS para quem não quer uma aba web.

7. vLLM, melhor para inferência de alto rendimento

vLLM é o servidor em nível de produção. Atenção paginada, paralelismo de tensor e agrupamento contínuo o tornam a maneira mais rápida de servir um grande modelo para muitos clientes. A pegadinha é que precisa de uma GPU real (Ampere ou mais recente).

Onde fica aquém: não é uma instalação amigável ao NAS. Um chassis NAS sem uma GPU de data center não pode executá-lo da forma que os docs presumem.

Preço:

Plataformas: Linux (normalmente Docker com kit de ferramentas de contêiner NVIDIA).

Download: github.com/vllm-project/vllm

Conclusão: A escolha quando o “NAS” é uma caixa Linux com uma GPU real servindo um homelab de clientes.

8. llama.cpp, melhor para inferência de CPU bare-metal

llama.cpp é o runtime de baixo nível que tudo nesta lista envolve. Funciona em builds de NAS somente CPU onde uma GPU real está ausente, com modelos quantizados que encolhem um modelo de parâmetro 8B para alguns gigabytes.

Onde fica aquém: não há interface. É um binário de servidor e CLI. Combine com Open WebUI ou Ollama.

Preço:

Plataformas: Qualquer (Linux, macOS, Windows, ARM incluindo Raspberry Pi e Apple Silicon).

Download: github.com/ggerganov/llama.cpp

Conclusão: A escolha certa quando o NAS é somente CPU e cada gigabyte de RAM importa.

Como escolher a certa

Perguntas frequentes

Qual modelo funciona em um NAS sem GPU?

Versões quantizadas de Gemma, Llama ou Mistral na faixa 3B-8B funcionam em uma CPU NAS moderna com alguns tokens por segundo. Isso é lento para chat interativo, bom para um resumo único ou um trabalho noturno.

Preciso de uma GPU no meu NAS?

Apenas para velocidade interativa. Um NAS somente CPU ainda executa um modelo pequeno; os tempos de resposta ficam em segundos por frase em vez de tokens por segundo.

Posso manter o modelo hospedado em NAS privado para minha LAN?

Sim. Ollama, LM Studio e LocalAI se vinculam à interface LAN por padrão. Adicione autenticação básica ou um proxy reverso para qualquer coisa mais que uma LAN doméstica.

Quanto espaço em disco os modelos locais precisam?

Um modelo quantizado 8B fica em torno de 5 GB. Um modelo quantizado 70B fica mais próximo de 40 GB. Um NAS com um volume de sobra de 500 GB segura uma biblioteca completa.

Várias pessoas podem usar o modelo ao mesmo tempo?

Ollama, LocalAI e Text Generation WebUI serializam por padrão. vLLM lida com requisições simultâneas nativamente. Para uma pequena família, a serialização está bem.

E quanto à privacidade?

Cada aplicativo nesta lista executa o modelo localmente. Nenhum prompt ou resposta é enviado para terceiros a menos que o aplicativo seja configurado para fazer isso.