Melhores aplicativos para controle de voz híbrido com Home Assistant em 2026

Um escritor do XDA conectou um LLM local ao Home Assistant para controle de voz, depois o desligou para a maioria do que disseram. Comandos de palavra-chave lidam com “acenda a luz da cozinha” mais rápido e nunca erram, então o LLM só executa quando uma solicitação é verdadeiramente aberta. Essa divisão é a configuração sensata para uma casa cheia de comandos de voz, e se alinha com a forma como o Assist funciona: intenções primeiro, LLM como fallback. Estes são os melhores aplicativos para controle de voz híbrido com Home Assistant no desktop, as peças que tornam o caminho rápido rápido e mantêm o LLM pronto quando uma palavra-chave não consegue cobrir a solicitação.

Testamos oito ferramentas em instalações de Home Assistant OS, Home Assistant Container e Supervised no Linux, Windows e macOS. Cada escolha funciona com o protocolo Wyoming para que as peças se troquem facilmente. Critérios de avaliação: com que rapidez o caminho de palavra-chave se resolve, se o LLM pode ser chamado por nome ou em caso de falha, e se toda a pilha permanece local quando a internet cai.

O que procurar em uma configuração de voz híbrida

Comparação rápida

Aplicativo Melhor para Plataformas Plano gratuito Tier pago Avaliação
Home Assistant Assist Pipeline de voz híbrida padrão Linux, Windows, macOS Totalmente gratuito Nenhum 4.7
Rhasspy Voz completamente offline focada em palavras-chave Linux, Windows, macOS, Docker Totalmente gratuito Nenhum 4.6
Wyoming Satellite Transformar um Pi ou laptop antigo em um microfone de sala Linux Totalmente gratuito Nenhum 4.7
Ollama Conversation O fallback de LLM que funciona na sua máquina Linux, Windows, macOS Totalmente gratuito Nenhum 4.8
Whisper (Wyoming) Fala para texto local que acompanha o ritmo Linux, Windows, macOS Totalmente gratuito Nenhum 4.7
Piper (Wyoming) Síntese de fala para texto natural local Linux, Windows, macOS Totalmente gratuito Nenhum 4.7
OpenWakeWord Palavras de ativação personalizadas sem treinamento em nuvem Linux, Windows, macOS Totalmente gratuito Nenhum 4.5
Willow Firmware de satélite de voz construído com propósito Linux, ESP32-S3 Totalmente gratuito Nenhum 4.6

Os aplicativos

1. Home Assistant Assist para voz híbrida — Melhor pipeline padrão

Home Assistant Assist é o mecanismo de voz integrado, e desde a reformulação de 2024 já executa o padrão híbrido pronto para uso. Uma solicitação atinge primeiro um correspondente de intenção rápido, então “desligue o ventilador” se resolve em milissegundos sem um LLM. Qualquer coisa que o correspondente não possa analisar cai no agente de conversação configurado, onde Ollama ou OpenAI se conectam. Assist também possui o roteamento de STT e TTS, então o pipeline é uma tela em vez de cinco.

Onde falha: A sintaxe de intenção ainda confunde as pessoas. Frases complexas precisam de um gatilho de frase ou uma intenção personalizada, o que é mais trabalho do que editar uma automação.

Preços:

Plataformas: Qualquer instalação do Home Assistant (Linux, Windows via Docker, macOS via Docker).

Baixar: home-assistant.io/voice-pe · github.com/home-assistant/core

Conclusão: Comece aqui. Cada outra escolha abaixo estende ou substitui uma peça do Assist, não tudo.

2. Rhasspy para voz híbrida — Melhor stack offline focado em palavras-chave

Rhasspy precede Assist e continua funcionando bem quando a prioridade é zero chamadas de nuvem. Resolve comandos de um arquivo de modelo de frase fixa, o que torna a camada de palavra-chave rápida e previsível. Rhasspy 3 fala o protocolo Wyoming, portanto seu STT e mecanismo de intenção se encaixam no Home Assistant como o caminho rápido, com um agente de conversação Ollama como fallback de LLM no Assist.

Onde falha: A sintaxe do modelo se sente antiquada ao lado das intenções do Assist. E a interface é funcional, não amigável.

Preços:

Plataformas: Linux, Windows, macOS. Funciona bem em Docker em um Pi 4 ou melhor.

Baixar: rhasspy.readthedocs.io · github.com/rhasspy/rhasspy3

Conclusão: Escolha Rhasspy se o objetivo é uma sala que responda mesmo quando a WAN cai por uma semana.

3. Wyoming Satellite para voz híbrida — Melhor microfone de sala DIY

Wyoming Satellite transforma um laptop antigo, uma Raspberry Pi ou um mini PC em um ponto de extremidade de voz que o Home Assistant trata como um satélite de primeira classe. A detecção de ativação funciona no satélite, o áudio é enviado ao servidor para STT e TTS retorna. Essa divisão permite que um Pi de $35 seja o microfone enquanto uma máquina mais poderosa executa Whisper e o LLM, que é a configuração que mantém o padrão híbrido rápido.

Onde falha: A configuração é um serviço systemd e um arquivo de configuração, não um assistente. Satélites alimentados por bateria precisam de trabalho extra.

Preços:

Plataformas: Linux (Debian, Ubuntu, Raspberry Pi OS).

Baixar: github.com/rhasspy/wyoming-satellite

Conclusão: Use-o para espalhhar microfones por toda a casa sem comprar oito de tudo.

4. Ollama Conversation para voz híbrida — Melhor fallback de LLM local

Ollama Conversation é a integração que permite ao Assist transferir uma solicitação para um modelo Ollama local quando o correspondente de intenção desiste. Llama 3 8B, Qwen 2.5 7B ou um Phi-3 menor funcionam bem como o cérebro de fallback. O LLM vê as entidades expostas como ferramentas, então pode chamar métodos de serviço quando a solicitação tem estrutura e responder conversacionalmente quando não.

Onde falha: A primeira execução de um modelo frio pode levar um segundo em uma GPU modesta. O armazenamento em cache de prompts ajuda, mas um standby quente é uma decisão real de GPU.

Preços:

Plataformas: Linux, Windows, macOS.

Baixar: ollama.com · github.com/home-assistant/core/tree/dev/homeassistant/components/ollama

Conclusão: O único backend de LLM a escolher quando o objetivo é manter todo o loop de voz desconectado da internet.

5. Whisper (Wyoming) para voz híbrida — Melhor fala para texto local

Whisper com o wrapper Wyoming é o mecanismo STT em que a maioria das configurações híbridas termina. Os modelos small.en e base.en são rápidos o suficiente em CPU para uma casa com alguns satélites, e medium.en em uma GPU modesta acompanha uma família falando uma com a outra. Whisper lê bem a intenção, então o caminho rápido de palavra-chave pousa mais frequentemente do que com mecanismos mais antigos.

Onde falha: A escolha do modelo importa. O modelo minúsculo falha em nomes e comandos curtos. Base ou small é o mínimo para uma configuração real.

Preços:

Plataformas: Linux, Windows, macOS. A imagem Docker funciona em ARM e x86.

Baixar: github.com/rhasspy/wyoming-faster-whisper

Conclusão: O STT padrão para quem quer ouvir “luzes desligadas” na primeira vez.

6. Piper (Wyoming) para voz híbrida — Melhor síntese de fala local

Piper é o mecanismo TTS neural que fez a voz local soar como um assistente real em vez de uma unidade GPS de uma década. As vozes são pequenas (dezenas de megabytes cada uma), a inferência apenas em CPU é rápida e o catálogo cobre dezenas de idiomas. Piper lida com confirmações curtas (“OK”) e respostas de LLM mais longas sem atraso entre elas.

Onde falha: Algumas vozes soam finas ao lado de um TTS em nuvem. A clonagem de voz permanece fora do escopo, o que funciona bem para a maioria das casas.

Preços:

Plataformas: Linux, Windows, macOS.

Baixar: github.com/rhasspy/piper

Conclusão: O TTS certo para uma pilha híbrida onde a casa ouve a saída o dia todo.

7. OpenWakeWord para voz híbrida — Melhor palavra de ativação personalizada

OpenWakeWord treina uma palavra de ativação sem enviar áudio para lugar nenhum. Isso importa para configurações híbridas porque uma palavra de ativação ruim é o que quebra a ilusão focada em palavras-chave: uma ativação falsa envia fala real para STT, depois para LLM, e a casa ouve o ventilador girar. OpenWakeWord vem com vários modelos prontos e um notebook Colab para um novo.

Onde falha: Uma palavra personalizada de qualidade precisa de alguns milhares de amostras geradas. “Alexa”, “Hey Jarvis” e “Hey Rhasspy” pré-treinados são as escolhas de baixo esforço.

Preços:

Plataformas: Linux, Windows, macOS.

Baixar: github.com/dscripka/openWakeWord

Conclusão: A escolha certa quando o nome da casa não é uma das palavras de ativação pré-treinadas.

8. Willow para voz híbrida — Melhor firmware de satélite construído com propósito

Willow é um firmware de satélite de voz para ESP32-S3-BOX e placas de desenvolvimento similares, e trata Home Assistant Assist como um backend de primeira classe. A detecção de ativação no dispositivo significa que nenhum tráfego sai do dispositivo até que ele o ouça, e toda a viagem é rápida o suficiente para que os comandos de palavra-chave se sintam instantâneos. O Inference Server de Willow também pode hospedar Whisper e LLMs se a carga de trabalho deve viver em uma caixa.

Onde falha: Hardware é um pequeno conjunto. O fornecimento de ESP32-S3-BOX vai e vem.

Preços:

Plataformas: Linux (para o Inference Server), ESP32-S3-BOX e hardware compatível.

Baixar: heywillow.io · github.com/toverainc/willow

Conclusão: Use Willow quando os satélites precisam ser pequenos, silenciosos e sempre ouvindo sem um PC na sala.

Como escolher o certo

FAQ

Qual é o melhor LLM local para controle de voz Home Assistant?
Tanto Llama 3 8B quanto Qwen 2.5 7B funcionam bem quando combinados com o wrapper de chamada de ferramenta que Assist expõe. Modelos Phi-3 menores funcionam em máquinas apenas com CPU, mas perdem mais chamadas de serviço. O modelo certo é o maior que mantém uma solicitação abaixo de dois segundos na sua GPU.

Posso usar o controle de voz Home Assistant sem conexão à internet?
Sim. Whisper, Piper, Ollama e Assist todos funcionam localmente, e Wyoming Satellite carrega áudio pela LAN. A pilha sobrevive a uma interrupção de internet enquanto o servidor e os satélites estiverem na mesma rede.

Preciso de uma GPU para executar um LLM local para controle de voz Home Assistant?
Não para modelos menores. Um modelo 7B quantizado para Q4 funciona em CPU moderno ou GPU de médio alcance. Uma GPU é o que mantém o tempo de resposta abaixo de um segundo, o que torna a voz em tempo real.

Como faço o Home Assistant Assist usar palavras-chave primeiro e o LLM apenas como fallback?
Assist já faz isso. Em Configurações, defina o agente Conversação do pipeline para um LLM. As intenções são executadas primeiro e apenas solicitações não coincidentes chegam ao LLM. Frases personalizadas em intents.yaml adicionam mais cobertura de palavras-chave.

Qual é a diferença entre Rhasspy e Home Assistant Assist?
Rhasspy é o mecanismo mais antigo, orientado por modelo, focado em palavras-chave que funciona de forma independente ou como provedor STT/intenção do Assist. Assist é a integração mais recente e mais apertada integrada ao Home Assistant com fallback de LLM incorporado. A maioria das configurações de 2026 usa Assist e toma ideias emprestadas do Rhasspy.