O artigo da XDA da semana passada terminou onde toda thread de home-lab termina: apenas um dos sete LLMs locais se manteve como o cérebro de uma casa inteligente quando as automações ficaram interessantes. O resto alucinava em chamadas de função, perdia a intenção de “apagar a luz da varanda” ou esquentava tanto que os ventiladores do NAS giravam por horas. Um modelo local em um NAS é uma resposta legítima para controle por voz, mas a escolha do runtime importa mais que a escolha do modelo.
Testamos 7 aplicativos de desktop que rodam em um NAS doméstico ou um mini PC na mesma LAN, expõem um endpoint compatível com OpenAI e se integram perfeitamente com o pipeline de voz baseado em LLM do Home Assistant. Tudo abaixo roda offline após os pesos serem baixados, e tudo tem uma imagem Docker documentada.
O que procurar
- API compatível com OpenAI. Home Assistant’s Assist espera isso, e todos os outros ferramental abaixo se conectam da mesma forma.
- Suporte a chamadas de função. Um modelo que não consegue emitir uma chamada de função estruturada não pode acender uma luz.
- Suporte a modelos GGUF ou GPTQ. Se o NAS não tiver GPU, um Q4 GGUF em CPU é o ponto de partida honesto.
- Consumo de memória sensato. Um modelo 7B Q4 deve ficar abaixo de 6 GB de RAM em repouso.
- Inicialização a quente. Carregar a frio um modelo 7B em cada comando de voz é um atraso de cinco segundos que você notará.
- Um gerenciador de processo estável. O NAS reinicia semanalmente para atualizações; o modelo deve voltar automaticamente.
Comparação rápida
| App | Melhor para | Plataformas | Plano gratuito | Destaque |
|---|---|---|---|---|
| Ollama | O runner padrão que a maioria dos guias Home Assistant visa | Linux, macOS, Windows | Sim (open source) | Catálogo de modelos e um endpoint estável compatível com OpenAI |
| LocalAI | Drop-in tudo em um para APIs OpenAI, incluindo áudio | Linux, macOS, Windows (Docker) | Sim (open source) | Lida com chat, embeddings, TTS e STT de um único container |
| LM Studio | GUI no host do NAS e servidor para a LAN | Windows, macOS, Linux | Sim | Descoberta de modelos e toggle de servidor com um clique |
| Open WebUI | Frontend de chat web que também fala com Home Assistant | Linux, macOS, Windows (Docker) | Sim (open source) | Chat multi-usuário com Ollama, LocalAI ou qualquer backend compatível com OpenAI |
| Home Assistant | O consumidor do endpoint | Windows, macOS, Linux (HAOS, Docker) | Sim | Integração nativa do Assist LLM com roteamento de chamadas de função |
| vLLM | Melhor throughput em um NAS com GPU | Linux (Docker) | Sim (open source) | Batching contínuo e atenção paginada para uso multi-usuário |
| llama.cpp | O runner bare-metal C++ por trás da maioria dos anteriores | Linux, macOS, Windows | Sim (open source) | Executa GGUF em CPU em quase qualquer hardware |
As 7 melhores apps para um LLM de casa inteligente local em NAS
1. Ollama — o melhor runner padrão que a maioria dos guias visa
Ollama envolve llama.cpp com um CLI limpo, uma biblioteca de modelos e um servidor HTTP compatível com OpenAI que a integração Assist LLM do Home Assistant reconhece direto da caixa. Instale no NAS, execute ollama pull qwen2.5:7b-instruct e aponte Home Assistant para http://<nas-ip>:11434. O gerenciador de serviço o mantém funcionando através de reinicializações.
Onde falha: Concorrência multi-usuário é single-lane; requisições paralelas ficam na fila em vez de serem agrupadas. O suporte do Windows chegou recentemente e fica atrás do Linux em estabilidade.
Preço:
- Grátis: open source sob MIT
- Pago: nenhum para self-hosting
Plataformas: Linux, macOS, Windows (nativo e Docker)
Baixar: ollama.com
Resumo: Escolha Ollama primeiro, e saia apenas quando uma limitação específica o empurre para isso.
2. LocalAI — melhor se você quer chat, fala e embeddings de um container
LocalAI é o drop-in que cobre toda a superfície OpenAI: conclusões de chat, embeddings, TTS, STT e geração de imagem, tudo local. O protocolo Wyoming do Home Assistant pode apontar para o endpoint Whisper do LocalAI para STT e Piper para TTS, significando que todo o loop de voz vive no NAS.
Onde falha: O arquivo de config é denso e requer uma primeira leitura. Os caminhos de aceleração GPU (CUDA, ROCm, Vulkan) são por compilação e escolher a imagem errada dá um fallback silencioso para CPU.
Preço:
- Grátis: open source sob MIT
- Pago: nenhum
Plataformas: Linux, macOS, Windows (Docker)
Baixar: localai.io
Resumo: Escolha LocalAI se o objetivo é uma pilha de voz autossuficiente com STT, TTS e chat tudo em um só lugar.
3. LM Studio — melhor quando uma UI mais amigável importa
LM Studio começou como um aplicativo de chat de desktop e cresceu em modo servidor headless. Em um NAS com display ou sessão KVM remota, o seletor de modelos e o seletor de quantização são mais tolerantes que um CLI bruto. O servidor integrado expõe o endpoint compatível com OpenAI que Home Assistant espera.
Onde falha: O aplicativo principal é closed source, o que é um não categórico para alguns setups de home-lab. O modo headless está disponível mas ainda é um cidadão de segunda classe.
Preço:
- Grátis: aplicativo completo
- Pago: nenhum
Plataformas: Windows, macOS, Linux
Baixar: lmstudio.ai
Resumo: Escolha LM Studio se você quer uma UI para testar modelos antes de travar um para o papel de casa inteligente.
4. Open WebUI — o melhor frontend de chat que mantém humanos no loop
Open WebUI é o frontend baseado em navegador estilo ChatGPT que roda contra Ollama, LocalAI ou qualquer endpoint compatível com OpenAI. Em um NAS, funciona como uma superfície de teste: execute um prompt contra o mesmo modelo que o pipeline Assist usa, ajuste o prompt do sistema, depois atualize Home Assistant. O suporte multi-usuário com papéis mantém a família longe do console de admin.
Onde falha: É uma UI de chat, não parte do caminho de automação em si. A configuração requer um volume persistente e um proxy reverso para acesso LAN ou Tailscale.
Preço:
- Grátis: open source sob MIT
- Pago: nenhum
Plataformas: Linux, macOS, Windows (Docker)
Baixar: openwebui.com
Resumo: Escolha Open WebUI como o chat voltado para usuários sobre qualquer runtime em que você se instale.
5. Home Assistant — o melhor consumidor do endpoint
Home Assistant’s integração Assist LLM é o que transforma “acender a luz da cozinha” em uma chamada de função. Aponte para Ollama, LocalAI, LM Studio ou qualquer endpoint compatível com OpenAI, marque “expose to Assist” nas entidades que você quer que o modelo controle, e a voz roda inteiramente na LAN. O template de prompt é editável, é assim que você impede o modelo de alucinar cômodos.
Onde falha: A qualidade das chamadas de função depende do modelo, e Home Assistant não vai te dizer quando o modelo retorna um ID de entidade plausível mas errado. O debug vive no painel de debug do Assist e leva tempo para dominar.
Preço:
- Grátis: open source
- Pago: Cloud Nabu Casa opcional, não necessário para voz local
Plataformas: Windows, macOS, Linux (HAOS, Docker, VM)
Baixar: home-assistant.io
Resumo: Escolha Home Assistant porque o LLM só é interessante se algo agir sobre sua saída, e isso é exatamente isso.
6. vLLM — melhor se o NAS tem uma GPU real
vLLM é o runtime focado em throughput. Batching contínuo, atenção paginada e uma fila multi-requisição apropriada transformam um pequeno cartão NVIDIA em um endpoint em escala familiar que pode servir requisições de voz, uma aba Open WebUI e um plugin Obsidian simultaneamente sem um bloquear o outro.
Onde falha: Apenas GPU, então um NAS only-CPU fica de fora. A compatibilidade de modelos é mais estreita que a do Ollama e adicionar uma nova arquitetura é um passo de compilação.
Preço:
- Grátis: open source sob Apache 2.0
- Pago: nenhum
Plataformas: Linux (Docker)
Baixar: github.com/vllm-project/vllm
Resumo: Escolha vLLM se o NAS tem um cartão NVIDIA suportado e mais de um usuário pesado vai usar o modelo simultaneamente.
7. llama.cpp — o melhor runner bare-metal para hardware limitado
llama.cpp é o projeto C++ por trás da maioria dos runtimes acima. Executá-lo direto, com o servidor HTTP integrado, é a forma mais econômica de espremer um modelo 7B em um Synology ou uma velha caixa ARM. O suporte para Metal no Apple Silicon e CUDA no NVIDIA permite que um binário cubra a maioria dos setups domésticos.
Onde falha: Sem gerenciamento de modelos, sem auto-updates, sem scripts de serviço prontos. É um kit de ferramentas, não um produto.
Preço:
- Grátis: open source sob MIT
- Pago: nenhum
Plataformas: Linux, macOS, Windows (source, binário ou Docker)
Baixar: github.com/ggerganov/llama.cpp
Resumo: Escolha llama.cpp se o NAS é pequeno, o SO é incomum e você quer a mínima abstração possível sobre o arquivo de modelo.
Como escolher
Se você está começando do zero, instale Ollama no NAS e aponte Home Assistant para ele.
Se a pilha de voz precisa de STT e TTS na mesma caixa, troque Ollama por LocalAI e puxe as imagens Whisper e Piper.
Se você quer uma UI para comparar modelos antes de se comprometer, instale LM Studio e use seu modo servidor.
Se a família quer conversar com o mesmo modelo que executa as automações, adicione Open WebUI por cima.
Se o NAS tem uma GPU NVIDIA e mais de um usuário pesado, mude para vLLM para concorrência.
Se o hardware é inusitadamente pequeno e cada megabyte importa, execute llama.cpp direto.
FAQ
Posso realmente executar um modelo útil em um NAS?
Sim. Um modelo 7B Q4 em llama.cpp em uma CPU octa-núcleo moderna gera em velocidade legível para respostas de comandos de voz curtos. Se o NAS tem 16 GB de RAM e cache NVMe, o modelo carrega em segundos após uma inicialização a quente. Para chats longos ou raciocínio, adicione uma GPU.
Qual modelo lida melhor com chamadas de função Home Assistant?
Qwen 2.5 Instruct, Llama 3.1 8B Instruct e Hermes-3-Llama são as opções locais confiáveis no tamanho 7B-8B. Abaixo de 7B, a formatação de chamadas de função começa a quebrar. Teste com o painel de debug do Assist em um punhado de comandos realistas antes de se comprometer.
O modelo vê todo o estado da minha casa?
Apenas as entidades que você explicitamente expõe para Assist. O toggle de exposição é por-entidade, então uma luz no escritório não precisa vazar para o contexto do modelo. Mantenha o conjunto exposto pequeno; o prompt é mais barato e o modelo comete menos erros.
O que acontece quando a internet cai?
Nada muda. STT, LLM e TTS todos rodam no NAS, então o controle por voz continua funcionando. O único caminho que precisa de WAN é acesso remoto, e Cloud Nabu Casa ou uma VPN self-hosted ambos consertam isso separadamente.