Esta semana, um escritor do XDA notou que as builds recentes do VS Code incluem silenciosamente um modelo de reconhecimento de fala local. Sem viagens para a nuvem, sem chave API do OpenAI, sem dados saindo da máquina. A transcrição foi, segundo suas palavras, “surpreendentemente boa”. Essa história se alinha com o que aconteceu no mundo mais amplo da fala de código aberto nos últimos dois anos: modelos de classe Whisper agora rodam em um laptop, em tempo real, sem enviar áudio para lugar nenhum.
Testamos sete aplicativos de desktop para voz para código offline e ditado em 2026. Cada um deles mantém o áudio no dispositivo. Um casal foi construído especificamente para codificadores. O resto são ferramentas de ditado geral que se conectam a um editor.
O que importa em um aplicativo de voz para código offline
- Tudo no dispositivo. O áudio e a transcrição permanecem na máquina, verificável com o cabo de rede desconectado.
- Verdadeira consciência de código. Nomear uma variável “cammel case getUserId” deveria produzir
getUserId, não “camel case get user id”. - Modo de comando. Uma gramática de voz para comandos de editor: “linha 42”, “deletar palavra”, “executar teste”.
- Baixa latência. Transcrição de streaming abaixo de 500ms parece utilizável. Qualquer coisa acima de um segundo e deixamos de confiar nela.
- Precisão multiplataforma. A qualidade do modelo diminui em idiomas não latinos e sotaques fortes. Os bons aplicativos nos deixam escolher um modelo maior quando precisamos.
- Integração de editor. Suporte para VS Code, JetBrains e terminal cobre a maioria dos fluxos de trabalho.
Comparação rápida
| Aplicativo | Melhor para | Plano gratuito | Preço inicial | Plataformas |
|---|---|---|---|---|
| whisper.cpp | Transcrição Whisper bare-metal em qualquer lugar | Aplicativo completo | Grátis, código aberto | Windows, macOS, Linux |
| Talon Voice | Codificação sem as mãos com gramática real | Nível gratuito | Cerca de $15/mês Pro (opcional) | Windows, macOS, Linux |
| Serenade | Comandos de voz dentro do VS Code | Nível gratuito | Cerca de $10/mês Pro | Windows, macOS, Linux |
| Vosk | Modelos pequenos e incorporáveis | Kit de ferramentas completo | Grátis, código aberto | Windows, macOS, Linux |
| WhisperKit | Whisper nativo Apple Silicon | Framework completo | Grátis, código aberto | macOS |
| Wispr Flow | Ditado em todo o sistema com polimento | Teste de 7 dias | Cerca de $12/mês | macOS, Windows |
| SuperWhisper | Menu-bar Whisper offline em macOS | Nível gratuito | Cerca de $9 uma única vez ou nível vitalício | macOS |
Os aplicativos
1. whisper.cpp — Melhor transcrição bare-metal offline
whisper.cpp é a porta em C++ do Whisper do OpenAI feita por Georgi Gerganov. Funciona em CPU, em Apple Silicon via Metal e em GPUs Nvidia via CUDA. A transcrição de streaming em tempo real funciona com o modelo small.en ou medium.en em qualquer laptop dos últimos cinco anos. Todo o runtime é um único binário; Python não é necessário.
Onde ele falha: é uma biblioteca, não uma GUI. Colocar texto em um aplicativo de destino significa usar um script que canaliza para wl-copy, xdotool ou AppleScript.
Preços:
- Grátis: Código-fonte completo, licença MIT
- Pago: Nenhum
Plataformas: Windows, macOS, Linux
Download: whisper.cpp no GitHub
Conclusão: Toda ferramenta de ditado offline nesta lista usa whisper.cpp por baixo ou compete com ele. Comece aqui.
2. Talon Voice — Melhor codificação sem as mãos
Talon Voice é o que desenvolvedores afetados por LER de longa duração usam para escrever código inteiramente por voz. O sistema de gramática entende camelCase, snake_case, SCREAMING_SNAKE e todos os movimentos de editor que poderíamos pedir. Talon roda offline por padrão com seu próprio mecanismo de reconhecimento de fala (modelos Conformer, não Whisper).
Onde ele falha: a curva de aprendizado é real. Escrever gramáticas personalizadas leva uma tarde antes que o aplicativo se pague. Pacotes de idioma mantidos pela comunidade (talon-community) são essenciais.
Preços:
- Grátis: Aplicativo completo para uso pessoal
- Pago: Um nível de apoio em torno de $15/mês desbloqueia um modelo maior e atualizações prioritárias (opcional)
Plataformas: Windows, macOS, Linux
Download: Downloads do Talon Voice
Conclusão: O padrão-ouro para codificação sem as mãos. Se escrevemos para ganhar a vida, Talon vale a semana de configuração.
3. Serenade — Melhor edição controlada por voz no VS Code
Serenade fica dentro do VS Code, IDEs JetBrains e terminais, ouve comandos estruturados (“add function foo taking user”) e produz o código correspondente. Executa um modelo de fala local em hardware moderno.
Onde ele falha: o nível gratuito limita os minutos de voz diários. A gramática de comandos é mais rigorosa que a do Talon; ditado de forma livre não é seu ponto forte.
Preços:
- Grátis: Minutos de voz diários limitados
- Pago: Pro cerca de $10/mês
Plataformas: Windows, macOS, Linux
Download: Downloads do Serenade
Conclusão: Para edição de voz leve em um IDE mainstream, Serenade requer menos configuração que Talon.
4. Vosk — Melhor kit de ferramentas pequeno de reconhecimento de fala offline
Vosk é o kit de ferramentas de reconhecimento de fala da Alpha Cephei. Os modelos começam em 50MB (menor que o modelo pequeno do whisper.cpp) e rodamnhardware Raspberry Pi. Bindings nativos para Python, Node, C#, Java e Go.
Onde ele falha: precisão abaixo dos modelos de classe Whisper em inglês geral. Mais adequado para gramáticas de comando, palavras-chave de ativação e vocabulários limitados.
Preços:
- Grátis: Kit de ferramentas completo e modelos padrão (Apache 2.0)
- Pago: Nenhum
Plataformas: Windows, macOS, Linux, Android, iOS
Download: Downloads do Vosk
Conclusão: Não é a escolha para ditado gratuito. Excelente para escrever uma palavra-chave ou gramática de comando restrita em um aplicativo existente.
5. WhisperKit — Melhor pilha Whisper do Apple Silicon
WhisperKit é o pacote Swift da Argmax que executa Whisper no Apple Neural Engine. Em um Mac da série M, medium.en transcreve em 30 a 60x o tempo real usando watts de um dígito.
Onde ele falha: apenas macOS. Construir sobre ele significa escrever Swift.
Preços:
- Grátis: Código-fonte completo, MIT
- Pago: Nenhum
Plataformas: macOS, iOS
Download: WhisperKit no GitHub
Conclusão: A biblioteca que todo aplicativo de ditado Mac sério usa agora. Não algo que instalamos diretamente, mas a razão pela qual SuperWhisper e Wispr Flow se sentem instantâneos no Apple Silicon.
6. Wispr Flow — Melhor ditado em todo o sistema com polimento
Wispr Flow é o mais próximo de uma experiência de “simplesmente fale em qualquer campo de texto”. Acione com uma tecla de atalho, fale, libere e o texto transcrito é inserido onde o cursor está. Pontuação, capitalização e formatação amigável ao código tudo acontece no dispositivo.
Onde ele falha: pago após o teste. macOS é a construção madura; Windows ainda está alcançando opções de modelo e controles de menu-bar.
Preços:
- Grátis: Teste de 7 dias
- Pago: Cerca de $12/mês
Plataformas: macOS, Windows
Download: Site oficial do Wispr Flow
Conclusão: Se o ditado deve parecer parte do SO, esta é a opção paga com menos fricção.
7. SuperWhisper — Melhor Whisper de menu-bar offline no macOS
SuperWhisper é um aplicativo de menu-bar autossuficiente que executa Whisper localmente, transcreve em qualquer campo de texto ativo e pode pós-processar a saída com um LLM no dispositivo (Ollama, LM Studio ou modelos no dispositivo Apple).
Onde ele falha: apenas macOS. O preço único seria modesto para um aplicativo apenas para Mac, mas o nível de atualização “vitalício” ainda existe e vale a pena o custo para usuários diários.
Preços:
- Grátis: Nível básico com modelos padrão
- Pago: Cerca de $9 uma única vez ou nível vitalício para um catálogo de modelo maior
Plataformas: macOS
Download: Site oficial do SuperWhisper
Conclusão: Usuários de Mac que querem ditado offline sem encanamento de pipeline: instale isso em cinco minutos e pule o resto da lista.
Como escolher o certo
- Queremos a melhor opção gratuita, multiplataforma: whisper.cpp, acionado a partir de um pequeno script de wrapper.
- Escrevemos código inteiramente por voz: Talon Voice.
- Queremos comandos de voz especificamente dentro do VS Code: Serenade.
- Usamos um Mac e queremos configuração zero: SuperWhisper ou Wispr Flow.
- Estamos incorporando fala em um aplicativo existente: Vosk (pegada pequena) ou WhisperKit (Apple Silicon).
FAQ
O reconhecimento de fala offline é realmente tão bom quanto ditado em nuvem? Para inglês, whisper-large-v3 rodando localmente está a um fio de cabelo do que os serviços de ditado em nuvem retornam. Idiomas não ingleses ainda ficam atrás das ofertas em nuvem, mas a lacuna continua fechando a cada lançamento de modelo.
Posso executar isso em uma CPU sem GPU? Sim. whisper.cpp, Vosk, Talon e Serenade todos rodam em CPU. Whisper-medium roda em velocidade em tempo real em qualquer CPU de laptop moderna.
Qual é a diferença entre Whisper e Vosk? Whisper é um grande modelo baseado em transformador treinado em áudio multilíngue; precisão é alta, modelos são mais pesados. Vosk usa modelos menores otimizados para streaming; precisão é mais baixa para ditado geral, mas latência e pegada são melhores para uso incorporado.
Algum deles mantém o áudio no dispositivo para sempre? Sim. whisper.cpp, Vosk, WhisperKit, Talon (em sua configuração padrão) e SuperWhisper são todos offline. Serenade e Wispr Flow usam modelos no dispositivo por padrão, mas verifique as configurações se lidamos com áudio sensível.
Ditado é mais rápido que digitação? Para prosa, sim, uma vez que nos adaptamos. Para código, corresponde à digitação tátil após algumas horas de prática com Talon ou Serenade. O maior ganho é conseguir trabalhar através de uma lesão no pulso sem perder o dia.