Um desenvolvedor ditando código em um laptop com um modelo de fala offline que transcreve localmente

Esta semana, um escritor do XDA notou que as builds recentes do VS Code incluem silenciosamente um modelo de reconhecimento de fala local. Sem viagens para a nuvem, sem chave API do OpenAI, sem dados saindo da máquina. A transcrição foi, segundo suas palavras, “surpreendentemente boa”. Essa história se alinha com o que aconteceu no mundo mais amplo da fala de código aberto nos últimos dois anos: modelos de classe Whisper agora rodam em um laptop, em tempo real, sem enviar áudio para lugar nenhum.

Testamos sete aplicativos de desktop para voz para código offline e ditado em 2026. Cada um deles mantém o áudio no dispositivo. Um casal foi construído especificamente para codificadores. O resto são ferramentas de ditado geral que se conectam a um editor.

O que importa em um aplicativo de voz para código offline

Comparação rápida

Aplicativo Melhor para Plano gratuito Preço inicial Plataformas
whisper.cpp Transcrição Whisper bare-metal em qualquer lugar Aplicativo completo Grátis, código aberto Windows, macOS, Linux
Talon Voice Codificação sem as mãos com gramática real Nível gratuito Cerca de $15/mês Pro (opcional) Windows, macOS, Linux
Serenade Comandos de voz dentro do VS Code Nível gratuito Cerca de $10/mês Pro Windows, macOS, Linux
Vosk Modelos pequenos e incorporáveis Kit de ferramentas completo Grátis, código aberto Windows, macOS, Linux
WhisperKit Whisper nativo Apple Silicon Framework completo Grátis, código aberto macOS
Wispr Flow Ditado em todo o sistema com polimento Teste de 7 dias Cerca de $12/mês macOS, Windows
SuperWhisper Menu-bar Whisper offline em macOS Nível gratuito Cerca de $9 uma única vez ou nível vitalício macOS

Os aplicativos

1. whisper.cpp — Melhor transcrição bare-metal offline

whisper.cpp é a porta em C++ do Whisper do OpenAI feita por Georgi Gerganov. Funciona em CPU, em Apple Silicon via Metal e em GPUs Nvidia via CUDA. A transcrição de streaming em tempo real funciona com o modelo small.en ou medium.en em qualquer laptop dos últimos cinco anos. Todo o runtime é um único binário; Python não é necessário.

Onde ele falha: é uma biblioteca, não uma GUI. Colocar texto em um aplicativo de destino significa usar um script que canaliza para wl-copy, xdotool ou AppleScript.

Preços:

Plataformas: Windows, macOS, Linux

Download: whisper.cpp no GitHub

Conclusão: Toda ferramenta de ditado offline nesta lista usa whisper.cpp por baixo ou compete com ele. Comece aqui.

2. Talon Voice — Melhor codificação sem as mãos

Talon Voice é o que desenvolvedores afetados por LER de longa duração usam para escrever código inteiramente por voz. O sistema de gramática entende camelCase, snake_case, SCREAMING_SNAKE e todos os movimentos de editor que poderíamos pedir. Talon roda offline por padrão com seu próprio mecanismo de reconhecimento de fala (modelos Conformer, não Whisper).

Onde ele falha: a curva de aprendizado é real. Escrever gramáticas personalizadas leva uma tarde antes que o aplicativo se pague. Pacotes de idioma mantidos pela comunidade (talon-community) são essenciais.

Preços:

Plataformas: Windows, macOS, Linux

Download: Downloads do Talon Voice

Conclusão: O padrão-ouro para codificação sem as mãos. Se escrevemos para ganhar a vida, Talon vale a semana de configuração.

3. Serenade — Melhor edição controlada por voz no VS Code

Serenade fica dentro do VS Code, IDEs JetBrains e terminais, ouve comandos estruturados (“add function foo taking user”) e produz o código correspondente. Executa um modelo de fala local em hardware moderno.

Onde ele falha: o nível gratuito limita os minutos de voz diários. A gramática de comandos é mais rigorosa que a do Talon; ditado de forma livre não é seu ponto forte.

Preços:

Plataformas: Windows, macOS, Linux

Download: Downloads do Serenade

Conclusão: Para edição de voz leve em um IDE mainstream, Serenade requer menos configuração que Talon.

4. Vosk — Melhor kit de ferramentas pequeno de reconhecimento de fala offline

Vosk é o kit de ferramentas de reconhecimento de fala da Alpha Cephei. Os modelos começam em 50MB (menor que o modelo pequeno do whisper.cpp) e rodamnhardware Raspberry Pi. Bindings nativos para Python, Node, C#, Java e Go.

Onde ele falha: precisão abaixo dos modelos de classe Whisper em inglês geral. Mais adequado para gramáticas de comando, palavras-chave de ativação e vocabulários limitados.

Preços:

Plataformas: Windows, macOS, Linux, Android, iOS

Download: Downloads do Vosk

Conclusão: Não é a escolha para ditado gratuito. Excelente para escrever uma palavra-chave ou gramática de comando restrita em um aplicativo existente.

5. WhisperKit — Melhor pilha Whisper do Apple Silicon

WhisperKit é o pacote Swift da Argmax que executa Whisper no Apple Neural Engine. Em um Mac da série M, medium.en transcreve em 30 a 60x o tempo real usando watts de um dígito.

Onde ele falha: apenas macOS. Construir sobre ele significa escrever Swift.

Preços:

Plataformas: macOS, iOS

Download: WhisperKit no GitHub

Conclusão: A biblioteca que todo aplicativo de ditado Mac sério usa agora. Não algo que instalamos diretamente, mas a razão pela qual SuperWhisper e Wispr Flow se sentem instantâneos no Apple Silicon.

6. Wispr Flow — Melhor ditado em todo o sistema com polimento

Wispr Flow é o mais próximo de uma experiência de “simplesmente fale em qualquer campo de texto”. Acione com uma tecla de atalho, fale, libere e o texto transcrito é inserido onde o cursor está. Pontuação, capitalização e formatação amigável ao código tudo acontece no dispositivo.

Onde ele falha: pago após o teste. macOS é a construção madura; Windows ainda está alcançando opções de modelo e controles de menu-bar.

Preços:

Plataformas: macOS, Windows

Download: Site oficial do Wispr Flow

Conclusão: Se o ditado deve parecer parte do SO, esta é a opção paga com menos fricção.

7. SuperWhisper — Melhor Whisper de menu-bar offline no macOS

SuperWhisper é um aplicativo de menu-bar autossuficiente que executa Whisper localmente, transcreve em qualquer campo de texto ativo e pode pós-processar a saída com um LLM no dispositivo (Ollama, LM Studio ou modelos no dispositivo Apple).

Onde ele falha: apenas macOS. O preço único seria modesto para um aplicativo apenas para Mac, mas o nível de atualização “vitalício” ainda existe e vale a pena o custo para usuários diários.

Preços:

Plataformas: macOS

Download: Site oficial do SuperWhisper

Conclusão: Usuários de Mac que querem ditado offline sem encanamento de pipeline: instale isso em cinco minutos e pule o resto da lista.

Como escolher o certo

FAQ

O reconhecimento de fala offline é realmente tão bom quanto ditado em nuvem? Para inglês, whisper-large-v3 rodando localmente está a um fio de cabelo do que os serviços de ditado em nuvem retornam. Idiomas não ingleses ainda ficam atrás das ofertas em nuvem, mas a lacuna continua fechando a cada lançamento de modelo.

Posso executar isso em uma CPU sem GPU? Sim. whisper.cpp, Vosk, Talon e Serenade todos rodam em CPU. Whisper-medium roda em velocidade em tempo real em qualquer CPU de laptop moderna.

Qual é a diferença entre Whisper e Vosk? Whisper é um grande modelo baseado em transformador treinado em áudio multilíngue; precisão é alta, modelos são mais pesados. Vosk usa modelos menores otimizados para streaming; precisão é mais baixa para ditado geral, mas latência e pegada são melhores para uso incorporado.

Algum deles mantém o áudio no dispositivo para sempre? Sim. whisper.cpp, Vosk, WhisperKit, Talon (em sua configuração padrão) e SuperWhisper são todos offline. Serenade e Wispr Flow usam modelos no dispositivo por padrão, mas verifique as configurações se lidamos com áudio sensível.

Ditado é mais rápido que digitação? Para prosa, sim, uma vez que nos adaptamos. Para código, corresponde à digitação tátil após algumas horas de prática com Talon ou Serenade. O maior ganho é conseguir trabalhar através de uma lesão no pulso sem perder o dia.