
Um escritor do XDA conectou um LLM local ao Home Assistant para controle de voz, depois o desligou para a maioria do que disseram. Comandos de palavra-chave lidam com “acenda a luz da cozinha” mais rápido e nunca erram, então o LLM só executa quando uma solicitação é verdadeiramente aberta. Essa divisão é a configuração sensata para uma casa cheia de comandos de voz, e se alinha com a forma como o Assist funciona: intenções primeiro, LLM como fallback. Estes são os melhores aplicativos para controle de voz híbrido com Home Assistant no desktop, as peças que tornam o caminho rápido rápido e mantêm o LLM pronto quando uma palavra-chave não consegue cobrir a solicitação.
Testamos oito ferramentas em instalações de Home Assistant OS, Home Assistant Container e Supervised no Linux, Windows e macOS. Cada escolha funciona com o protocolo Wyoming para que as peças se troquem facilmente. Critérios de avaliação: com que rapidez o caminho de palavra-chave se resolve, se o LLM pode ser chamado por nome ou em caso de falha, e se toda a pilha permanece local quando a internet cai.
O que procurar em uma configuração de voz híbrida
- Intenções primeiro, LLM segundo. A ferramenta deve tentar intenções de palavra-chave antes de tocar em um modelo de linguagem.
- Suporte ao protocolo Wyoming. Palavra de ativação, STT, TTS e satélites se comunicam com Home Assistant através de um fio comum.
- Caminho completamente offline. Cada camada funciona na rede local quando necessário.
- Invocação explícita de LLM. Uma frase, prefixo ou entidade que promove uma solicitação ao LLM propositalmente.
- Ajuste por satélite. Um satélite de cozinha pode usar uma palavra de ativação e um quarto outra.
- Troca de modelo sem reflashing. O tamanho do Whisper, a voz do Piper e o backend do LLM mudam da interface.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Tier pago | Avaliação |
|---|---|---|---|---|---|
| Home Assistant Assist | Pipeline de voz híbrida padrão | Linux, Windows, macOS | Totalmente gratuito | Nenhum | 4.7 |
| Rhasspy | Voz completamente offline focada em palavras-chave | Linux, Windows, macOS, Docker | Totalmente gratuito | Nenhum | 4.6 |
| Wyoming Satellite | Transformar um Pi ou laptop antigo em um microfone de sala | Linux | Totalmente gratuito | Nenhum | 4.7 |
| Ollama Conversation | O fallback de LLM que funciona na sua máquina | Linux, Windows, macOS | Totalmente gratuito | Nenhum | 4.8 |
| Whisper (Wyoming) | Fala para texto local que acompanha o ritmo | Linux, Windows, macOS | Totalmente gratuito | Nenhum | 4.7 |
| Piper (Wyoming) | Síntese de fala para texto natural local | Linux, Windows, macOS | Totalmente gratuito | Nenhum | 4.7 |
| OpenWakeWord | Palavras de ativação personalizadas sem treinamento em nuvem | Linux, Windows, macOS | Totalmente gratuito | Nenhum | 4.5 |
| Willow | Firmware de satélite de voz construído com propósito | Linux, ESP32-S3 | Totalmente gratuito | Nenhum | 4.6 |
Os aplicativos
1. Home Assistant Assist para voz híbrida — Melhor pipeline padrão
Home Assistant Assist é o mecanismo de voz integrado, e desde a reformulação de 2024 já executa o padrão híbrido pronto para uso. Uma solicitação atinge primeiro um correspondente de intenção rápido, então “desligue o ventilador” se resolve em milissegundos sem um LLM. Qualquer coisa que o correspondente não possa analisar cai no agente de conversação configurado, onde Ollama ou OpenAI se conectam. Assist também possui o roteamento de STT e TTS, então o pipeline é uma tela em vez de cinco.
Onde falha: A sintaxe de intenção ainda confunde as pessoas. Frases complexas precisam de um gatilho de frase ou uma intenção personalizada, o que é mais trabalho do que editar uma automação.
Preços:
- Gratuito: Totalmente gratuito com um pipeline local.
- Pago: Nabu Casa a partir de cerca de $6,50/mês hospeda STT e TTS em nuvem se você não quiser executá-los localmente.
Plataformas: Qualquer instalação do Home Assistant (Linux, Windows via Docker, macOS via Docker).
Baixar: home-assistant.io/voice-pe · github.com/home-assistant/core
Conclusão: Comece aqui. Cada outra escolha abaixo estende ou substitui uma peça do Assist, não tudo.
2. Rhasspy para voz híbrida — Melhor stack offline focado em palavras-chave
Rhasspy precede Assist e continua funcionando bem quando a prioridade é zero chamadas de nuvem. Resolve comandos de um arquivo de modelo de frase fixa, o que torna a camada de palavra-chave rápida e previsível. Rhasspy 3 fala o protocolo Wyoming, portanto seu STT e mecanismo de intenção se encaixam no Home Assistant como o caminho rápido, com um agente de conversação Ollama como fallback de LLM no Assist.
Onde falha: A sintaxe do modelo se sente antiquada ao lado das intenções do Assist. E a interface é funcional, não amigável.
Preços:
- Gratuito: Totalmente gratuito.
- Pago: Nenhum.
Plataformas: Linux, Windows, macOS. Funciona bem em Docker em um Pi 4 ou melhor.
Baixar: rhasspy.readthedocs.io · github.com/rhasspy/rhasspy3
Conclusão: Escolha Rhasspy se o objetivo é uma sala que responda mesmo quando a WAN cai por uma semana.
3. Wyoming Satellite para voz híbrida — Melhor microfone de sala DIY
Wyoming Satellite transforma um laptop antigo, uma Raspberry Pi ou um mini PC em um ponto de extremidade de voz que o Home Assistant trata como um satélite de primeira classe. A detecção de ativação funciona no satélite, o áudio é enviado ao servidor para STT e TTS retorna. Essa divisão permite que um Pi de $35 seja o microfone enquanto uma máquina mais poderosa executa Whisper e o LLM, que é a configuração que mantém o padrão híbrido rápido.
Onde falha: A configuração é um serviço systemd e um arquivo de configuração, não um assistente. Satélites alimentados por bateria precisam de trabalho extra.
Preços:
- Gratuito: Totalmente gratuito.
- Pago: Nenhum.
Plataformas: Linux (Debian, Ubuntu, Raspberry Pi OS).
Baixar: github.com/rhasspy/wyoming-satellite
Conclusão: Use-o para espalhhar microfones por toda a casa sem comprar oito de tudo.
4. Ollama Conversation para voz híbrida — Melhor fallback de LLM local
Ollama Conversation é a integração que permite ao Assist transferir uma solicitação para um modelo Ollama local quando o correspondente de intenção desiste. Llama 3 8B, Qwen 2.5 7B ou um Phi-3 menor funcionam bem como o cérebro de fallback. O LLM vê as entidades expostas como ferramentas, então pode chamar métodos de serviço quando a solicitação tem estrutura e responder conversacionalmente quando não.
Onde falha: A primeira execução de um modelo frio pode levar um segundo em uma GPU modesta. O armazenamento em cache de prompts ajuda, mas um standby quente é uma decisão real de GPU.
Preços:
- Gratuito: Totalmente gratuito.
- Pago: Nenhum. Downloads de modelos são gratuitos.
Plataformas: Linux, Windows, macOS.
Baixar: ollama.com · github.com/home-assistant/core/tree/dev/homeassistant/components/ollama
Conclusão: O único backend de LLM a escolher quando o objetivo é manter todo o loop de voz desconectado da internet.
5. Whisper (Wyoming) para voz híbrida — Melhor fala para texto local
Whisper com o wrapper Wyoming é o mecanismo STT em que a maioria das configurações híbridas termina. Os modelos small.en e base.en são rápidos o suficiente em CPU para uma casa com alguns satélites, e medium.en em uma GPU modesta acompanha uma família falando uma com a outra. Whisper lê bem a intenção, então o caminho rápido de palavra-chave pousa mais frequentemente do que com mecanismos mais antigos.
Onde falha: A escolha do modelo importa. O modelo minúsculo falha em nomes e comandos curtos. Base ou small é o mínimo para uma configuração real.
Preços:
- Gratuito: Totalmente gratuito.
- Pago: Nenhum.
Plataformas: Linux, Windows, macOS. A imagem Docker funciona em ARM e x86.
Baixar: github.com/rhasspy/wyoming-faster-whisper
Conclusão: O STT padrão para quem quer ouvir “luzes desligadas” na primeira vez.
6. Piper (Wyoming) para voz híbrida — Melhor síntese de fala local
Piper é o mecanismo TTS neural que fez a voz local soar como um assistente real em vez de uma unidade GPS de uma década. As vozes são pequenas (dezenas de megabytes cada uma), a inferência apenas em CPU é rápida e o catálogo cobre dezenas de idiomas. Piper lida com confirmações curtas (“OK”) e respostas de LLM mais longas sem atraso entre elas.
Onde falha: Algumas vozes soam finas ao lado de um TTS em nuvem. A clonagem de voz permanece fora do escopo, o que funciona bem para a maioria das casas.
Preços:
- Gratuito: Totalmente gratuito.
- Pago: Nenhum.
Plataformas: Linux, Windows, macOS.
Baixar: github.com/rhasspy/piper
Conclusão: O TTS certo para uma pilha híbrida onde a casa ouve a saída o dia todo.
7. OpenWakeWord para voz híbrida — Melhor palavra de ativação personalizada
OpenWakeWord treina uma palavra de ativação sem enviar áudio para lugar nenhum. Isso importa para configurações híbridas porque uma palavra de ativação ruim é o que quebra a ilusão focada em palavras-chave: uma ativação falsa envia fala real para STT, depois para LLM, e a casa ouve o ventilador girar. OpenWakeWord vem com vários modelos prontos e um notebook Colab para um novo.
Onde falha: Uma palavra personalizada de qualidade precisa de alguns milhares de amostras geradas. “Alexa”, “Hey Jarvis” e “Hey Rhasspy” pré-treinados são as escolhas de baixo esforço.
Preços:
- Gratuito: Totalmente gratuito.
- Pago: Nenhum.
Plataformas: Linux, Windows, macOS.
Baixar: github.com/dscripka/openWakeWord
Conclusão: A escolha certa quando o nome da casa não é uma das palavras de ativação pré-treinadas.
8. Willow para voz híbrida — Melhor firmware de satélite construído com propósito
Willow é um firmware de satélite de voz para ESP32-S3-BOX e placas de desenvolvimento similares, e trata Home Assistant Assist como um backend de primeira classe. A detecção de ativação no dispositivo significa que nenhum tráfego sai do dispositivo até que ele o ouça, e toda a viagem é rápida o suficiente para que os comandos de palavra-chave se sintam instantâneos. O Inference Server de Willow também pode hospedar Whisper e LLMs se a carga de trabalho deve viver em uma caixa.
Onde falha: Hardware é um pequeno conjunto. O fornecimento de ESP32-S3-BOX vai e vem.
Preços:
- Gratuito: Firmware totalmente gratuito.
- Pago: Nenhum.
Plataformas: Linux (para o Inference Server), ESP32-S3-BOX e hardware compatível.
Baixar: heywillow.io · github.com/toverainc/willow
Conclusão: Use Willow quando os satélites precisam ser pequenos, silenciosos e sempre ouvindo sem um PC na sala.
Como escolher o certo
- Se você quer o pipeline híbrido mais simples: Home Assistant Assist com Ollama Conversation como fallback e Whisper mais Piper para STT e TTS.
- Se você quer dependência zero da nuvem: Rhasspy para a camada de intenção, mais Ollama para fallback de LLM e Piper para TTS.
- Se você já tem um Pi de reposição: Wyoming Satellite para que o Pi se torne o microfone e o LLM viva em uma máquina maior.
- Se as palavras de ativação estão disparando falsamente: OpenWakeWord com uma palavra específica da casa.
- Se você tentou Assist e odiou a configuração: Willow flasheia ESP32-S3-BOX em minutos e fala Assist nativamente.
FAQ
Qual é o melhor LLM local para controle de voz Home Assistant?
Tanto Llama 3 8B quanto Qwen 2.5 7B funcionam bem quando combinados com o wrapper de chamada de ferramenta que Assist expõe. Modelos Phi-3 menores funcionam em máquinas apenas com CPU, mas perdem mais chamadas de serviço. O modelo certo é o maior que mantém uma solicitação abaixo de dois segundos na sua GPU.
Posso usar o controle de voz Home Assistant sem conexão à internet?
Sim. Whisper, Piper, Ollama e Assist todos funcionam localmente, e Wyoming Satellite carrega áudio pela LAN. A pilha sobrevive a uma interrupção de internet enquanto o servidor e os satélites estiverem na mesma rede.
Preciso de uma GPU para executar um LLM local para controle de voz Home Assistant?
Não para modelos menores. Um modelo 7B quantizado para Q4 funciona em CPU moderno ou GPU de médio alcance. Uma GPU é o que mantém o tempo de resposta abaixo de um segundo, o que torna a voz em tempo real.
Como faço o Home Assistant Assist usar palavras-chave primeiro e o LLM apenas como fallback?
Assist já faz isso. Em Configurações, defina o agente Conversação do pipeline para um LLM. As intenções são executadas primeiro e apenas solicitações não coincidentes chegam ao LLM. Frases personalizadas em intents.yaml adicionam mais cobertura de palavras-chave.
Qual é a diferença entre Rhasspy e Home Assistant Assist?
Rhasspy é o mecanismo mais antigo, orientado por modelo, focado em palavras-chave que funciona de forma independente ou como provedor STT/intenção do Assist. Assist é a integração mais recente e mais apertada integrada ao Home Assistant com fallback de LLM incorporado. A maioria das configurações de 2026 usa Assist e toma ideias emprestadas do Rhasspy.