Melhores apps para um LLM de casa inteligente local em NAS em 2026

O artigo da XDA da semana passada terminou onde toda thread de home-lab termina: apenas um dos sete LLMs locais se manteve como o cérebro de uma casa inteligente quando as automações ficaram interessantes. O resto alucinava em chamadas de função, perdia a intenção de “apagar a luz da varanda” ou esquentava tanto que os ventiladores do NAS giravam por horas. Um modelo local em um NAS é uma resposta legítima para controle por voz, mas a escolha do runtime importa mais que a escolha do modelo.

Testamos 7 aplicativos de desktop que rodam em um NAS doméstico ou um mini PC na mesma LAN, expõem um endpoint compatível com OpenAI e se integram perfeitamente com o pipeline de voz baseado em LLM do Home Assistant. Tudo abaixo roda offline após os pesos serem baixados, e tudo tem uma imagem Docker documentada.

O que procurar

Comparação rápida

App Melhor para Plataformas Plano gratuito Destaque
Ollama O runner padrão que a maioria dos guias Home Assistant visa Linux, macOS, Windows Sim (open source) Catálogo de modelos e um endpoint estável compatível com OpenAI
LocalAI Drop-in tudo em um para APIs OpenAI, incluindo áudio Linux, macOS, Windows (Docker) Sim (open source) Lida com chat, embeddings, TTS e STT de um único container
LM Studio GUI no host do NAS e servidor para a LAN Windows, macOS, Linux Sim Descoberta de modelos e toggle de servidor com um clique
Open WebUI Frontend de chat web que também fala com Home Assistant Linux, macOS, Windows (Docker) Sim (open source) Chat multi-usuário com Ollama, LocalAI ou qualquer backend compatível com OpenAI
Home Assistant O consumidor do endpoint Windows, macOS, Linux (HAOS, Docker) Sim Integração nativa do Assist LLM com roteamento de chamadas de função
vLLM Melhor throughput em um NAS com GPU Linux (Docker) Sim (open source) Batching contínuo e atenção paginada para uso multi-usuário
llama.cpp O runner bare-metal C++ por trás da maioria dos anteriores Linux, macOS, Windows Sim (open source) Executa GGUF em CPU em quase qualquer hardware

As 7 melhores apps para um LLM de casa inteligente local em NAS

1. Ollama — o melhor runner padrão que a maioria dos guias visa

Ollama envolve llama.cpp com um CLI limpo, uma biblioteca de modelos e um servidor HTTP compatível com OpenAI que a integração Assist LLM do Home Assistant reconhece direto da caixa. Instale no NAS, execute ollama pull qwen2.5:7b-instruct e aponte Home Assistant para http://<nas-ip>:11434. O gerenciador de serviço o mantém funcionando através de reinicializações.

Onde falha: Concorrência multi-usuário é single-lane; requisições paralelas ficam na fila em vez de serem agrupadas. O suporte do Windows chegou recentemente e fica atrás do Linux em estabilidade.

Preço:

Plataformas: Linux, macOS, Windows (nativo e Docker)

Baixar: ollama.com

Resumo: Escolha Ollama primeiro, e saia apenas quando uma limitação específica o empurre para isso.


2. LocalAI — melhor se você quer chat, fala e embeddings de um container

LocalAI é o drop-in que cobre toda a superfície OpenAI: conclusões de chat, embeddings, TTS, STT e geração de imagem, tudo local. O protocolo Wyoming do Home Assistant pode apontar para o endpoint Whisper do LocalAI para STT e Piper para TTS, significando que todo o loop de voz vive no NAS.

Onde falha: O arquivo de config é denso e requer uma primeira leitura. Os caminhos de aceleração GPU (CUDA, ROCm, Vulkan) são por compilação e escolher a imagem errada dá um fallback silencioso para CPU.

Preço:

Plataformas: Linux, macOS, Windows (Docker)

Baixar: localai.io

Resumo: Escolha LocalAI se o objetivo é uma pilha de voz autossuficiente com STT, TTS e chat tudo em um só lugar.


3. LM Studio — melhor quando uma UI mais amigável importa

LM Studio começou como um aplicativo de chat de desktop e cresceu em modo servidor headless. Em um NAS com display ou sessão KVM remota, o seletor de modelos e o seletor de quantização são mais tolerantes que um CLI bruto. O servidor integrado expõe o endpoint compatível com OpenAI que Home Assistant espera.

Onde falha: O aplicativo principal é closed source, o que é um não categórico para alguns setups de home-lab. O modo headless está disponível mas ainda é um cidadão de segunda classe.

Preço:

Plataformas: Windows, macOS, Linux

Baixar: lmstudio.ai

Resumo: Escolha LM Studio se você quer uma UI para testar modelos antes de travar um para o papel de casa inteligente.


4. Open WebUI — o melhor frontend de chat que mantém humanos no loop

Open WebUI é o frontend baseado em navegador estilo ChatGPT que roda contra Ollama, LocalAI ou qualquer endpoint compatível com OpenAI. Em um NAS, funciona como uma superfície de teste: execute um prompt contra o mesmo modelo que o pipeline Assist usa, ajuste o prompt do sistema, depois atualize Home Assistant. O suporte multi-usuário com papéis mantém a família longe do console de admin.

Onde falha: É uma UI de chat, não parte do caminho de automação em si. A configuração requer um volume persistente e um proxy reverso para acesso LAN ou Tailscale.

Preço:

Plataformas: Linux, macOS, Windows (Docker)

Baixar: openwebui.com

Resumo: Escolha Open WebUI como o chat voltado para usuários sobre qualquer runtime em que você se instale.


5. Home Assistant — o melhor consumidor do endpoint

Home Assistant’s integração Assist LLM é o que transforma “acender a luz da cozinha” em uma chamada de função. Aponte para Ollama, LocalAI, LM Studio ou qualquer endpoint compatível com OpenAI, marque “expose to Assist” nas entidades que você quer que o modelo controle, e a voz roda inteiramente na LAN. O template de prompt é editável, é assim que você impede o modelo de alucinar cômodos.

Onde falha: A qualidade das chamadas de função depende do modelo, e Home Assistant não vai te dizer quando o modelo retorna um ID de entidade plausível mas errado. O debug vive no painel de debug do Assist e leva tempo para dominar.

Preço:

Plataformas: Windows, macOS, Linux (HAOS, Docker, VM)

Baixar: home-assistant.io

Resumo: Escolha Home Assistant porque o LLM só é interessante se algo agir sobre sua saída, e isso é exatamente isso.


6. vLLM — melhor se o NAS tem uma GPU real

vLLM é o runtime focado em throughput. Batching contínuo, atenção paginada e uma fila multi-requisição apropriada transformam um pequeno cartão NVIDIA em um endpoint em escala familiar que pode servir requisições de voz, uma aba Open WebUI e um plugin Obsidian simultaneamente sem um bloquear o outro.

Onde falha: Apenas GPU, então um NAS only-CPU fica de fora. A compatibilidade de modelos é mais estreita que a do Ollama e adicionar uma nova arquitetura é um passo de compilação.

Preço:

Plataformas: Linux (Docker)

Baixar: github.com/vllm-project/vllm

Resumo: Escolha vLLM se o NAS tem um cartão NVIDIA suportado e mais de um usuário pesado vai usar o modelo simultaneamente.


7. llama.cpp — o melhor runner bare-metal para hardware limitado

llama.cpp é o projeto C++ por trás da maioria dos runtimes acima. Executá-lo direto, com o servidor HTTP integrado, é a forma mais econômica de espremer um modelo 7B em um Synology ou uma velha caixa ARM. O suporte para Metal no Apple Silicon e CUDA no NVIDIA permite que um binário cubra a maioria dos setups domésticos.

Onde falha: Sem gerenciamento de modelos, sem auto-updates, sem scripts de serviço prontos. É um kit de ferramentas, não um produto.

Preço:

Plataformas: Linux, macOS, Windows (source, binário ou Docker)

Baixar: github.com/ggerganov/llama.cpp

Resumo: Escolha llama.cpp se o NAS é pequeno, o SO é incomum e você quer a mínima abstração possível sobre o arquivo de modelo.

Como escolher

Se você está começando do zero, instale Ollama no NAS e aponte Home Assistant para ele.

Se a pilha de voz precisa de STT e TTS na mesma caixa, troque Ollama por LocalAI e puxe as imagens Whisper e Piper.

Se você quer uma UI para comparar modelos antes de se comprometer, instale LM Studio e use seu modo servidor.

Se a família quer conversar com o mesmo modelo que executa as automações, adicione Open WebUI por cima.

Se o NAS tem uma GPU NVIDIA e mais de um usuário pesado, mude para vLLM para concorrência.

Se o hardware é inusitadamente pequeno e cada megabyte importa, execute llama.cpp direto.

FAQ

Posso realmente executar um modelo útil em um NAS?

Sim. Um modelo 7B Q4 em llama.cpp em uma CPU octa-núcleo moderna gera em velocidade legível para respostas de comandos de voz curtos. Se o NAS tem 16 GB de RAM e cache NVMe, o modelo carrega em segundos após uma inicialização a quente. Para chats longos ou raciocínio, adicione uma GPU.

Qual modelo lida melhor com chamadas de função Home Assistant?

Qwen 2.5 Instruct, Llama 3.1 8B Instruct e Hermes-3-Llama são as opções locais confiáveis no tamanho 7B-8B. Abaixo de 7B, a formatação de chamadas de função começa a quebrar. Teste com o painel de debug do Assist em um punhado de comandos realistas antes de se comprometer.

O modelo vê todo o estado da minha casa?

Apenas as entidades que você explicitamente expõe para Assist. O toggle de exposição é por-entidade, então uma luz no escritório não precisa vazar para o contexto do modelo. Mantenha o conjunto exposto pequeno; o prompt é mais barato e o modelo comete menos erros.

O que acontece quando a internet cai?

Nada muda. STT, LLM e TTS todos rodam no NAS, então o controle por voz continua funcionando. O único caminho que precisa de WAN é acesso remoto, e Cloud Nabu Casa ou uma VPN self-hosted ambos consertam isso separadamente.