
O lançamento do Kimi K3 na semana passada foi o ponto em que “o melhor modelo de código aberto” e “o melhor modelo, ponto final” deixaram de estar tão distantes. O problema, conforme observou a reportagem da XDA, é que ainda não é possível executar o K3 em casa. O que você pode executar é o nível anterior: Qwen, DeepSeek, Llama, Gemma e Mistral têm pesos abertos, e as ferramentas do Android em torno deles avançaram significativamente nos últimos doze meses.
Testamos sete aplicativos Android que permitem você conversar com modelos de código aberto, seja no dispositivo ou contra um servidor que você controla. Alguns são aplicativos sofisticados para consumidores que apenas expõem uma opção de peso aberto. Outros são ferramentas francas para entusiastas que permitem você carregar um GGUF e ver o que o SoC do seu telefone realmente pode fazer.
O que procurar em um aplicativo de chat de IA aberto
- No dispositivo vs remoto. No dispositivo significa que o modelo é executado na NPU ou CPU do seu telefone. Remoto significa que você envia mensagens para um servidor (seu ou do fornecedor) que executa o modelo.
- Fonte de pesos. Aplicativos para consumidores a escondem. Aplicativos para entusiastas permitem você baixar ou carregar arquivos GGUF ou MLC específicos.
- Janela de contexto. Modelos menores executáveis em telefones geralmente são limitados a 8K ou 32K tokens. Aplicativos com suporte de servidor executam o contexto completo anunciado.
- Se o aplicativo requer uma conta. DeepSeek e Perplexity exigem. MLC Chat e PocketPal não exigem.
- Caminho de privacidade. Inferência no dispositivo nunca sai do telefone. Tudo mais precisa de uma verificação de política.
Comparação rápida
| Aplicativo | Melhor para | No dispositivo? | Plano gratuito | Destaque |
|---|---|---|---|---|
| DeepSeek | Chat DeepSeek-V3 | Não | Gratuito com conta | Acesso gratuito a um modelo de primeira linha |
| Google Gemini | Gemini Nano no dispositivo | Sim (Nano) | Gratuito | Executa em chips Tensor G3+ |
| Google AICore | Gemini Nano ao nível do sistema | Sim | Gratuito, integrado | Alimenta IA no dispositivo para outros aplicativos |
| MLC Chat | Llama/Mistral/Gemma no dispositivo | Sim | Gratuito, código aberto | Executor universal GGUF/MLC |
| PocketPal | Experimentação casual com modelos locais | Sim | Gratuito, código aberto | Executa arquivos GGUF do Hugging Face |
| ChatterUI | Chat de personagem em qualquer backend | Sim e remoto | Gratuito, código aberto | Funciona com APIs locais ou hospedadas |
| Perplexity | Respostas de peso aberto com fontes | Não | Plano gratuito mais Pro | Modelo Sonar sobre pesos abertos |
Os sete aplicativos
1. DeepSeek, melhor acesso gratuito a um modelo de código aberto de primeira linha
O aplicativo Android do DeepSeek é uma interface de chat limpa para DeepSeek-V3, um dos modelos de peso aberto mais poderosos disponíveis hoje. Chat, DeepThink para raciocínio estendido e pesquisa na web são os três modos. O aplicativo em si é gratuito e o modelo subjacente é fornecido sem uma assinatura paga para uso pessoal.
Onde falha: o modelo é executado na infraestrutura do DeepSeek, não no seu telefone. Você precisa de uma conta. Conversas são usadas para melhorar o serviço a menos que você opte por não participar nas configurações.
Preço: Gratuito com conta.
Download: Aptoide · Google Play
Conclusão: A escolha quando você quer qualidade de modelo de código aberto de primeira linha sem hospedar nada.
2. Google Gemini, melhor chat no dispositivo com polimento mainstream
O aplicativo Android do Google Gemini é fornecido com Gemini Nano sendo executado totalmente no dispositivo em chips Tensor G3 e posteriores. Em outros telefones, o aplicativo volta para Gemini na nuvem. Nano é limitado a tarefas de contexto curto como resumo e respostas rápidas, mas o aplicativo é a forma mais fluida de ver inferência no dispositivo em ação.
Onde falha: o chat completo ainda vai e volta para a nuvem. Os recursos do Nano no dispositivo são silenciosos na interface do usuário, portanto nem sempre é óbvio o que é local e o que é remoto.
Preço: Gratuito. A assinatura Google One AI Premium de $19,99 por mês adiciona Gemini Advanced e contexto maior.
Download: Aptoide · Google Play
Conclusão: A escolha polida se você já tem um Pixel 8 ou mais recente.
3. Google AICore, melhor backbone no dispositivo ao nível do sistema
AICore não é um aplicativo de chat por si só. É o serviço do sistema que hospeda Gemini Nano e o expõe a outros aplicativos que desejam geração no dispositivo. Uma vez instalado, outras ferramentas podem chamá-lo sem carregar seus próprios pesos de modelo. Resumos de gravação e descrições de imagem do TalkBack já dependem dele.
Onde falha: sem interface de usuário. É um serviço em segundo plano, e sua utilidade é inteiramente função dos aplicativos que o chamam.
Preço: Gratuito, incluído no Pixel e Samsung Galaxy AI.
Download: Aptoide · Google Play
Conclusão: Mantenha atualizado se você usar qualquer recurso de IA no dispositivo do Google.
4. MLC Chat, melhor executor universal no dispositivo
MLC LLM é o projeto da comunidade que transformou inferência local em estilo llama.cpp em um aplicativo Android adequado. MLC Chat é fornecido como um APK de código aberto que executa variantes de Llama, Mistral, Phi, Gemma e Qwen convertidas para o formato MLC. O catálogo dentro do aplicativo permite você baixar um modelo via Wi-Fi e conversar com ele completamente offline.
Onde falha: modelos ocupam gigabytes de armazenamento. Inferência em telefones de faixa média é lenta o suficiente para que respostas mais longas pareçam digitar em um terminal dos anos 90. Sem retorno à nuvem.
Preço: Gratuito e código aberto.
Download: GitHub release APK. Atualmente não disponível no Aptoide ou Google Play.
Conclusão: A escolha preferida quando você quer provar que chat de peso aberto pode executar sem servidor.
5. PocketPal, melhor para experimentação casual com modelos
PocketPal é um aplicativo Android de código aberto amigável para testar modelos locais. Ele baixa pesos GGUF do Hugging Face e os executa através de um núcleo llama.cpp, com uma interface de chat simples e configurações por conversação para temperatura, top-p e janela de contexto. É a maneira menos intimidadora de executar um pequeno modelo local.
Onde falha: o desempenho é uma função do modelo. Um quantizador Q4 de 3B é utilizável, 8B é lento, qualquer coisa maior não cabe em RAM. Sem retorno à nuvem.
Preço: Gratuito e código aberto.
Download: Aptoide · Google Play
Conclusão: A escolha certa para explorar Qwen 3B ou Gemma 2B sem configurar um servidor.
6. ChatterUI, melhor para conectar qualquer backend
ChatterUI é uma interface de chat Android que se comunica com qualquer backend que você aponta: um modelo local via llama.cpp, uma instância Ollama auto-hospedada na sua LAN, ou uma API hospedada. É um aplicativo traga-seu-próprio-modelo que mantém a interface consistente enquanto você muda provedores abaixo.
Onde falha: a configuração requer saber onde seu modelo realmente vive. Não é apropriado se você quer que o aplicativo escolha um modelo para você.
Preço: Gratuito e código aberto.
Download: GitHub releases APK. Também disponível em algumas lojas APK de terceiros.
Conclusão: A escolha quando você já tem uma instância Ollama, LM Studio ou endpoint hospedado e quer um frontend móvel.
7. Perplexity, melhor mecanismo de resposta de peso aberto com fontes
Perplexity usa uma mistura de modelos proprietários e de peso aberto sob o capô, incluindo sua família Sonar que é treinada em Llama. O aplicativo Android emparelha esses modelos com pesquisa na web ao vivo e retorna respostas com fontes citadas inline. Não é no dispositivo, mas é um dos usos mais poderosos do lado do consumidor de fundações de peso aberto.
Onde falha: a seleção de modelo é limitada no nível gratuito. Modos Sonar Pro e DeepSeek exigem assinatura Perplexity Pro.
Preço: Gratuito com conta. Perplexity Pro aproximadamente $20 por mês desbloqueia seleção de modelo.
Download: Aptoide
Conclusão: A escolha para assistentes de peso aberto que também fazem pesquisa com fontes.
Como escolher a correta
- Apenas quer um chat forte com um modelo de código aberto: DeepSeek.
- Tem um Pixel 8+ e quer polimento no dispositivo: Google Gemini.
- Quer provar que inferência local funciona em um telefone: MLC Chat ou PocketPal.
- Já executa Ollama em casa: ChatterUI.
- Quer respostas citadas sobre pesos abertos: Perplexity.
FAQ
Posso executar Kimi K3 no meu telefone? Não de forma útil. K3 é um grande modelo de mistura de especialistas que requer hardware de classe servidor. Variantes menores de Qwen e Llama são o que realmente cabe em telefones hoje.
Qual é o melhor modelo de código aberto gratuito que posso conversar no Android? DeepSeek é a experiência de chat gratuita mais forte. Para no dispositivo, Gemma 2B ou Qwen 2.5 3B em MLC Chat ou PocketPal são as escolhas práticas.
Modelos locais drenam a bateria rapidamente? Sim. Inferência sustentada puxa forte no SoC. Espere 5 a 10 por cento de bateria para um chat longo com um modelo 3B.
É seguro usar DeepSeek na Europa? DeepSeek foi objeto de debates de privacidade em vários países da UE. Seu aplicativo Android processa conversas em servidores na China. Escolha de acordo.
Para que realmente serve Google AICore? É um serviço do sistema que hospeda Gemini Nano para que outros aplicativos possam chamá-lo sem enviar seus próprios pesos. Instale se você quer que os recursos de IA no dispositivo em outros aplicativos do Google funcionem.