O artigo do XDA “Clonei minha voz com 5 segundos de áudio e sem GPU, e agora entendo o pânico” é breve, mas a demonstração que apresenta conta a história completa. Um laptop de consumidor comum, sem CUDA, um clipe de referência de seis segundos extraído de uma gravação telefônica, e um clone aceitável da voz do autor lendo um script que nunca foi dito em voz alta. O motivo pelo qual o pânico é justificado não é que o resultado seja perfeito. É que a barreira para um clone “bom o suficiente” desabou para cinco minutos de configuração em hardware que a maioria das pessoas já possui.
Analisamos os melhores apps para clonagem de voz no desktop depois que esse artigo foi publicado. Sete escolhas, testadas no Windows, macOS e Linux, cobrindo as opções de código aberto que mantêm o áudio em disco e as plataformas comerciais que entregam um produto polido hoje. O uso baseado em consentimento (ler nossos próprios scripts com nossa própria voz, dar a um estúdio pequeno um ciclo mais rápido com talento aprovado, prototipar um narrador de audiolivro com a permissão do narrador) é o contexto. Impersonar alguém sem permissão é o caso de abuso que todo app nesta lista pelo menos menciona, e os que auto-hospedam tornam o consentimento sua responsabilidade, não deles.
O que procurar em um app de clonagem de voz
- Zero-shot vs fine-tuned. Modelos zero-shot geram um clone a partir de uma amostra curta (5 a 60 segundos). Modelos fine-tuned treinam um embedding de falante dedicado a partir de um conjunto de dados mais longo. Zero-shot é mais rápido para testar, fine-tuned aguenta melhor em saída de longa forma.
- Local vs nuvem. Ferramentas locais mantêm o áudio de referência e os clipes gerados no laptop. Ferramentas na nuvem enviam a amostra e a transcrição, o que importa quando a voz é de uma pessoa real.
- Honestidade de hardware. Alguns modelos funcionam felizmente em CPU (lento mas viável). Outros precisam de uma GPU NVIDIA recente para serem usáveis. Leia os requisitos do mundo real da ferramenta antes de instalar.
- Fluxo de consentimento. ElevenLabs força você a gravar um clipe de autorização. Ferramentas de código aberto empurram essa responsabilidade para o usuário. Nenhum está errado, mas o modelo de conformidade é diferente.
- Cobertura de idiomas e controle de emoção. Clonar o timbre é tabela de ingressos. Saída multilíngue, tags de emoção e sons paralinguísticos (risos, suspiros) são o que separa uma demo de uma narração funcional.
- Licença. Pesos licenciados MIT são seguros para saída comercial. Licenças não comerciais (como o CPML do Coqui) são boas para pesquisa e trabalho pessoal, mas não para um audiolivro pago.
Comparação rápida
| App | Melhor para | Licença | Local / Nuvem | Nível gratuito | Pago |
|---|---|---|---|---|---|
| Applio | Conversão de voz estilo RVC e fala | MIT | Local | Totalmente gratuito | Nenhum |
| Coqui XTTS-v2 | Text-to-speech zero-shot de 6 segundos em 17 idiomas | CPML (não comercial) | Local | Totalmente gratuito | Licença comercial por arranjo |
| OpenVoice V2 | Clones multilíngues com controle de emoção, sotaque e ritmo | MIT | Local | Totalmente gratuito | Nenhum |
| Chatterbox | Clone licenciado MIT com exageração de emoção e tags paralinguísticos | MIT | Local | Totalmente gratuito | API hospedada do Resemble |
| Fish Speech S2 Pro | Cobertura de 80 idiomas com controle de expressão orientado por tags | Apache 2.0 (pesos) | Local | Totalmente gratuito | Planos hospedados do fish.audio |
| ElevenLabs | Clonagem de voz comercial polida com qualidade de produção | Proprietário | Nuvem (web PWA) | Limitado gratuito (10.000 caracteres/mês) | Starter $5, Creator $22, Pro $99/mês |
| Bark | Áudio não verbal expressivo, risos, canto, efeitos sonoros | MIT | Local | Totalmente gratuito | Nenhum |
Os 7 melhores apps de clonagem de voz com IA para desktop
1. Applio, melhor no geral para clonagem RVC em desktop
Applio é a interface RVC (Retrieval-based Voice Conversion) que transformou um projeto Python complicado em algo que um não desenvolvedor pode instalar e usar. Os instaladores do Windows, macOS e Linux configuram o ambiente Python para você, colocam uma interface web Gradio no navegador e expõem o pipeline de treinamento, o pipeline de inferência e a camada TTS como abas separadas. Ele lida com conversão de voz (alimente-o com um vocal de origem, recupere-o em uma voz de destino treinada) e text-to-speech através de modelos conectados como Edge TTS com a voz RVC sobreposta.
Onde fica aquém: Os mantenedores anunciaram no início de 2026 que o desenvolvimento ativo de recursos está em pausa, com patches de segurança e bumps de dependência continuando. É estável, não descontinuado, mas não espere grandes novos recursos. O treinamento de modelo ainda se beneficia de uma GPU NVIDIA moderna (inferência é usável em CPU, treinamento não é).
Preços:
- Gratuito: Todos os recursos, sem limite.
- Pago: Nenhum. O projeto é licenciado MIT.
Plataformas: Windows, macOS, Linux.
Download: Applio no GitHub
Conclusão: A escolha para uma configuração de clonagem de voz em desktop funcional com uma interface real, especialmente para conversão de canto e remixagem de faixas vocais existentes.
2. Coqui XTTS-v2, melhor clonagem zero-shot gratuita
Coqui XTTS-v2 é o modelo que o artigo do XDA está quase certamente descrevendo quando fala sobre uma amostra de seis segundos e um clone aceitável. Dê a ele um clipe de referência curto (seis segundos é o mínimo documentado, dez ou mais funciona melhor) e um script em qualquer um dos 17 idiomas suportados, e ele gera o clone. Ele funciona em CPU (lentamente), em uma GPU de consumidor moderna (em tempo quase real) e dentro de dezenas de wrappers (de uma simples CLI tts para implantações Docker totalmente locais).
Onde fica aquém: Coqui a empresa fechou em janeiro de 2024. Os pesos do modelo e o código ainda estão totalmente disponíveis, e um fork da comunidade em idiap/coqui-ai-TTS mantém a construção em Python e PyTorch atuais. Os pesos são enviados sob a Coqui Public Model License, que é não comercial. Uso pessoal, pesquisa e prototipagem estão bem. Vender audiolivros gerados por XTTS-v2 requer um arranjo de licença separado.
Preços:
- Gratuito: Tudo, para uso não comercial.
- Pago: Uso comercial requer entrar em contato para uma licença.
Plataformas: Windows, macOS, Linux (via Python).
Download: Coqui XTTS-v2 no GitHub | Fork ativo da comunidade | Modelo no Hugging Face
Conclusão: A escolha para qualquer pessoa testando clonagem de voz zero-shot em sua máquina antes de se comprometer com uma stack paga.
3. OpenVoice V2, melhor para clones multilíngues com controle de tom
OpenVoice V2 é a colaboração MIT e MyShell cujo diferencial é a separação entre o conversor de tom e o modelo de falante base. Você clona o tom de um clipe de referência curto uma vez, depois gera fala em inglês, espanhol, francês, chinês, japonês ou coreano sem precisar de uma nova referência para cada idioma. Os parâmetros para sotaque, emoção, ritmo, pausas e entonação são expostos como controles deslizantes em vez de incorporados ao modelo, então o mesmo clone pode ler um script quente e lento ou rápido e cortante.
Onde fica aquém: A configuração é nativa em Python. Você clona o repositório, cria um ambiente conda, baixa os checkpoints e inicia o app Gradio local você mesmo. O documento de instalação é claro, mas esta não é uma experiência de um clique como Applio.
Preços:
- Gratuito: Pesos completos V2 sob licença MIT.
- Pago: Nenhum. A plataforma MyShell hospedada é um produto separado.
Plataformas: Windows, macOS, Linux.
Download: OpenVoice no GitHub
Conclusão: A escolha quando o clone precisa falar múltiplos idiomas e o escritor precisa de controle fino sobre como ele entrega a frase.
4. Chatterbox, melhor clonagem de voz licenciada MIT com controle de emoção
Chatterbox é o projeto TTS state-of-the-art que Resemble AI lançou sob uma licença MIT, o que significa que os pesos são seguros para enviar dentro de um produto comercial sem royalties, sem compartilhamento de receita e sem limites de uso. A clonagem zero-shot funciona a partir de alguns segundos de áudio de referência, e o parâmetro de exageração de emoção é o destaque: um único controle leva a saída de monótona para notavelmente expressiva sem tocar no clone base. Tags paralinguísticas no script ([sigh], [gasp], [cough], [laugh]) são renderizadas na voz clonada com o tom emocional certo em vez de serem amostras de estoque.
Onde fica aquém: A variante multilíngue cobre 23 idiomas e a variante turbo é rápida, mas Chatterbox ainda é um projeto mais novo que XTTS-v2 ou RVC. Ferramentas comunitárias, nós ComfyUI e UIs pré-construídas estão se desenvolvendo mas não em todo lugar ainda.
Preços:
- Gratuito: Todos os pesos, totalmente MIT.
- Pago: API hospedada opcional do Resemble para equipes que querem infraestrutura gerenciada.
Plataformas: Windows, macOS, Linux. Funciona em NVIDIA (CUDA), AMD (ROCm) e CPU.
Download: Chatterbox no GitHub | Wrapper do servidor auto-hospedado
Conclusão: A escolha quando a saída tem que ser enviada em um produto comercial sem uma renegociação de licença.
5. Fish Speech S2 Pro, melhor cobertura multilíngue
Fish Speech S2 Pro é o modelo de peso aberto do projeto fish.audio treinado em torno de 10 milhões de horas de áudio em aproximadamente 80 idiomas. Clone a partir de um clipe de referência de 10 a 30 segundos, então conduza a entrega com tags embutidas. O vocabulário de tags é incomumente grande (os documentos citam aproximadamente 15.000 tags suportadas, de “laughing” a “professional broadcast tone” para descritores de forma livre). Fish envia tanto uma interface web Gradio quanto uma interface desktop PyQt6 que fala com um servidor de API local, então a experiência do dia dois é mais próxima a um aplicativo real do que uma demo de pesquisa.
Onde fica aquém: A instalação é moldada para desenvolvedor. Você clona o repositório, instala dependências Python e puxa pesos via um token Hugging Face. Não é difícil, mas “não é difícil” aqui ainda significa o terminal.
Preços:
- Gratuito: Pesos abertos, instalação local.
- Pago: Planos hospedados em fish.audio se você preferir não executar inferência você mesmo.
Plataformas: Windows, macOS, Linux.
Download: Fish Speech no GitHub
Conclusão: A escolha quando o script abrange idiomas que os modelos abertos menores não cobrem bem.
6. ElevenLabs, melhor clonagem de voz comercial
ElevenLabs é o padrão comercial que quase toda listagem aponta primeiro, e depois de testá-lo contra a stack de código aberto, o motivo é chato: o polimento. Instant Voice Cloning gera um clone usável a partir de cerca de um minuto de áudio; Professional Voice Cloning usa 30 minutos ou mais e retorna uma voz que aguenta bem em saída de longa forma como audiolivros. A plataforma envia text-to-speech, Studio (para projetos de longa forma), Dubbing (localiza um vídeo existente em outro idioma enquanto mantém o clone) e uma API com 32+ idiomas suportados.
Não há app de desktop nativo. Tudo funciona em um navegador, e a instalação recomendada para uma experiência “desktop” é salvar o site como um Progressive Web App do Chrome ou Edge. Antes de poder criar um clone, ElevenLabs força você a gravar uma mensagem de autorização lendo um script curto, o que previne o caso de abuso óbvio.
Onde fica aquém: Somente nuvem. O áudio de referência e todos os clipes gerados vivem nos servidores ElevenLabs. Os limites de caracteres em níveis inferiores se acumulam rapidamente quando você começa a narrar algo longo. Os bumps de preço foram comuns nos últimos dois anos.
Preços:
- Gratuito: 10.000 caracteres por mês, uso pessoal.
- Pago: Starter em $5/mês (30.000 caracteres), Creator em $22/mês (100.000 caracteres), Pro em $99/mês (500.000 caracteres) e preços empresariais acima disso.
Plataformas: Web (funciona em Windows, macOS, Linux, Chromebook). Instalável como PWA.
Download: ElevenLabs
Conclusão: A escolha quando o objetivo é clonagem de voz com qualidade de produção sem trabalho de infraestrutura e armazenamento em nuvem do áudio é aceitável.
7. Bark, melhor para áudio não verbal expressivo
Bark é o modelo de áudio generativo baseado em transformer da Suno, e pertence a esta lista pela coisa com que os outros lutam: sons não verbais. Risos, suspiros, pigarros, melodias sussurradas, frases cantadas e passagens curtas de música emergem do mesmo modelo que gera a fala, conduzido pelo mesmo prompt. Bark não faz clonagem de voz tão limpa quanto XTTS ou Chatterbox, mas um ecosistema saudável de forks (Bark-Voice-Clone, híbridos RVC-Bark) conecta a clonagem ao pipeline para pessoas que querem a expressividade mais uma voz de destino específica.
Onde fica aquém: O desenvolvimento ativo da Suno em Bark parou depois que eles mudaram para seu produto de música. Os forks da comunidade são o que mantém interessante. A clonagem zero-shot reta é mais complicada que XTTS ou Chatterbox, e a saída é mais variável por geração.
Preços:
- Gratuito: Modelo licenciado MIT e pesos.
- Pago: Nenhum.
Plataformas: Windows, macOS, Linux (via Python).
Download: Bark no GitHub
Conclusão: A escolha quando a gravação precisa de um riso, uma linha cantada ou um zumbido de fundo na voz clonada, não apenas leitura limpa em voz alta.
Como escolher o certo
Se o objetivo é uma ferramenta de clonagem de voz em desktop funcional com uma interface real: Applio.
Se o objetivo é testar clonagem zero-shot a partir de uma amostra de seis segundos: Coqui XTTS-v2.
Se o clone tem que falar múltiplos idiomas a partir de uma referência: OpenVoice V2.
Se a saída tem que ser enviada dentro de um produto comercial com uma licença limpa: Chatterbox.
Se os idiomas de destino estão fora do conjunto usual inglês, espanhol, francês, chinês, japonês, coreano: Fish Speech S2 Pro.
Se a qualidade importa mais que o controle local e o armazenamento em nuvem está bem: ElevenLabs.
Se a gravação precisa de risos, suspiros, zumbidos ou frases cantadas na voz clonada: Bark.
Se você tentou ElevenLabs e quer a mesma qualidade de saída sem a assinatura e sem o upload em nuvem: Chatterbox primeiro, depois Coqui XTTS-v2, nessa ordem.
Uma nota sobre consentimento
Todo app nesta lista pode ser usado para impersonar alguém sem sua permissão. Isso é um crime grave em uma lista crescente de jurisdições (a “regra de impersonação” da Comissão Federal de Comércio dos EUA e os requisitos de transparência da Lei de IA da UE se aplicam), e é o caso de abuso sobre o qual o pânico no artigo do XDA é.
Os apps que funcionam em sua própria máquina não podem impor consentimento sobre você. Os apps que funcionam na nuvem (ElevenLabs, Chatterbox hospedado, Fish hospedado) requerem uma gravação de autorização ou termos aceitos antes de criar um clone. De qualquer forma, a responsabilidade de apenas clonar vozes que você tem permissão para clonar vive com a pessoa clicando em Generate.
Perguntas frequentes
Qual é o melhor app gratuito de clonagem de voz com IA? Para text-to-speech zero-shot a partir de uma amostra curta, Coqui XTTS-v2 e Chatterbox são as escolhas gratuitas mais fortes. Para conversão de voz em modelos RVC treinados, Applio é o mais fácil de instalar. Todos os três são gratuitos, funcionam localmente e mantêm o áudio de referência em disco.
Posso clonar uma voz com 5 segundos de áudio? Sim. O mínimo documentado do Coqui XTTS-v2 é seis segundos, OpenVoice V2 e Chatterbox funcionam com clipes no mesmo intervalo, e ElevenLabs’ Instant Voice Cloning fica feliz com cerca de um minuto de áudio limpo mas funciona com menos. Dez segundos de uma gravação quieta mono dão resultados notavelmente melhores do que cinco segundos de um clipe de chamada telefônica.
Preciso de uma GPU para executar esses localmente? Coqui XTTS-v2 e Chatterbox executam em CPU, lentamente. OpenVoice V2 e Fish Speech S2 Pro também executam em CPU com paciência. O pipeline de treinamento do Applio realisticamente precisa de uma GPU NVIDIA moderna; suas camadas de inferência e TTS não. Bark é o mais GPU-guloso das escolhas abertas e é lento em CPU.
A clonagem de voz é legal? Clonar sua própria voz ou uma voz que você tem consentimento documentado para clonar é legal na maioria das jurisdições. Clonar uma pessoa real sem permissão e usar para impersonar, defraudar ou assediar não é, e a aplicação acelerou nos EUA, UE e Reino Unido no último ano. Verifique as regras específicas onde o clone será publicado, especialmente para uso comercial.
Qual é o melhor app de clonagem de voz para canto? Applio, porque modelos RVC foram originalmente treinados para conversão vocal. As bibliotecas de modelos da comunidade em huggingface e rvc-models.com incluem milhares de vozes de canto pré-treinadas. Bark pode produzir frases cantadas curtas dentro da mesma voz que as linhas faladas, o que é o truque que o pipeline RVC puro não faz.
ElevenLabs pode clonar uma voz de uma amostra pequena? Sim, mas os dois produtos se comportam diferentemente. Instant Voice Cloning leva cerca de um minuto de áudio e gera um clone em menos de um minuto. Professional Voice Cloning leva 30 minutos ou mais de áudio limpo e consistente e retorna uma voz que permanece coerente em saída de longa forma como audiolivros. Os níveis pagos incluem um número fixo de vozes personalizadas por mês.
Qual ferramenta de clonagem de voz de código aberto é segura para uso comercial? Chatterbox é licenciado MIT, portanto seus pesos e código são usáveis em um produto comercial sem royalties. Bark também é MIT. Os pesos do modelo do Coqui XTTS-v2 são não comerciais (CPML). Os pesos do Fish Speech S2 Pro são enviados sob Apache 2.0. OpenVoice V2 é MIT. Em caso de dúvida, leia o arquivo de licença que é enviado com os pesos, não a licença na base de código.