Open-source AI chat apps on Android

O lançamento do Kimi K3 na semana passada foi o ponto em que “o melhor modelo de código aberto” e “o melhor modelo, ponto final” deixaram de estar tão distantes. O problema, conforme observou a reportagem da XDA, é que ainda não é possível executar o K3 em casa. O que você pode executar é o nível anterior: Qwen, DeepSeek, Llama, Gemma e Mistral têm pesos abertos, e as ferramentas do Android em torno deles avançaram significativamente nos últimos doze meses.

Testamos sete aplicativos Android que permitem você conversar com modelos de código aberto, seja no dispositivo ou contra um servidor que você controla. Alguns são aplicativos sofisticados para consumidores que apenas expõem uma opção de peso aberto. Outros são ferramentas francas para entusiastas que permitem você carregar um GGUF e ver o que o SoC do seu telefone realmente pode fazer.

O que procurar em um aplicativo de chat de IA aberto

Comparação rápida

Aplicativo Melhor para No dispositivo? Plano gratuito Destaque
DeepSeek Chat DeepSeek-V3 Não Gratuito com conta Acesso gratuito a um modelo de primeira linha
Google Gemini Gemini Nano no dispositivo Sim (Nano) Gratuito Executa em chips Tensor G3+
Google AICore Gemini Nano ao nível do sistema Sim Gratuito, integrado Alimenta IA no dispositivo para outros aplicativos
MLC Chat Llama/Mistral/Gemma no dispositivo Sim Gratuito, código aberto Executor universal GGUF/MLC
PocketPal Experimentação casual com modelos locais Sim Gratuito, código aberto Executa arquivos GGUF do Hugging Face
ChatterUI Chat de personagem em qualquer backend Sim e remoto Gratuito, código aberto Funciona com APIs locais ou hospedadas
Perplexity Respostas de peso aberto com fontes Não Plano gratuito mais Pro Modelo Sonar sobre pesos abertos

Os sete aplicativos

1. DeepSeek, melhor acesso gratuito a um modelo de código aberto de primeira linha

O aplicativo Android do DeepSeek é uma interface de chat limpa para DeepSeek-V3, um dos modelos de peso aberto mais poderosos disponíveis hoje. Chat, DeepThink para raciocínio estendido e pesquisa na web são os três modos. O aplicativo em si é gratuito e o modelo subjacente é fornecido sem uma assinatura paga para uso pessoal.

Onde falha: o modelo é executado na infraestrutura do DeepSeek, não no seu telefone. Você precisa de uma conta. Conversas são usadas para melhorar o serviço a menos que você opte por não participar nas configurações.

Preço: Gratuito com conta.

Download: Aptoide · Google Play

Conclusão: A escolha quando você quer qualidade de modelo de código aberto de primeira linha sem hospedar nada.

2. Google Gemini, melhor chat no dispositivo com polimento mainstream

O aplicativo Android do Google Gemini é fornecido com Gemini Nano sendo executado totalmente no dispositivo em chips Tensor G3 e posteriores. Em outros telefones, o aplicativo volta para Gemini na nuvem. Nano é limitado a tarefas de contexto curto como resumo e respostas rápidas, mas o aplicativo é a forma mais fluida de ver inferência no dispositivo em ação.

Onde falha: o chat completo ainda vai e volta para a nuvem. Os recursos do Nano no dispositivo são silenciosos na interface do usuário, portanto nem sempre é óbvio o que é local e o que é remoto.

Preço: Gratuito. A assinatura Google One AI Premium de $19,99 por mês adiciona Gemini Advanced e contexto maior.

Download: Aptoide · Google Play

Conclusão: A escolha polida se você já tem um Pixel 8 ou mais recente.

3. Google AICore, melhor backbone no dispositivo ao nível do sistema

AICore não é um aplicativo de chat por si só. É o serviço do sistema que hospeda Gemini Nano e o expõe a outros aplicativos que desejam geração no dispositivo. Uma vez instalado, outras ferramentas podem chamá-lo sem carregar seus próprios pesos de modelo. Resumos de gravação e descrições de imagem do TalkBack já dependem dele.

Onde falha: sem interface de usuário. É um serviço em segundo plano, e sua utilidade é inteiramente função dos aplicativos que o chamam.

Preço: Gratuito, incluído no Pixel e Samsung Galaxy AI.

Download: Aptoide · Google Play

Conclusão: Mantenha atualizado se você usar qualquer recurso de IA no dispositivo do Google.

4. MLC Chat, melhor executor universal no dispositivo

MLC LLM é o projeto da comunidade que transformou inferência local em estilo llama.cpp em um aplicativo Android adequado. MLC Chat é fornecido como um APK de código aberto que executa variantes de Llama, Mistral, Phi, Gemma e Qwen convertidas para o formato MLC. O catálogo dentro do aplicativo permite você baixar um modelo via Wi-Fi e conversar com ele completamente offline.

Onde falha: modelos ocupam gigabytes de armazenamento. Inferência em telefones de faixa média é lenta o suficiente para que respostas mais longas pareçam digitar em um terminal dos anos 90. Sem retorno à nuvem.

Preço: Gratuito e código aberto.

Download: GitHub release APK. Atualmente não disponível no Aptoide ou Google Play.

Conclusão: A escolha preferida quando você quer provar que chat de peso aberto pode executar sem servidor.

5. PocketPal, melhor para experimentação casual com modelos

PocketPal é um aplicativo Android de código aberto amigável para testar modelos locais. Ele baixa pesos GGUF do Hugging Face e os executa através de um núcleo llama.cpp, com uma interface de chat simples e configurações por conversação para temperatura, top-p e janela de contexto. É a maneira menos intimidadora de executar um pequeno modelo local.

Onde falha: o desempenho é uma função do modelo. Um quantizador Q4 de 3B é utilizável, 8B é lento, qualquer coisa maior não cabe em RAM. Sem retorno à nuvem.

Preço: Gratuito e código aberto.

Download: Aptoide · Google Play

Conclusão: A escolha certa para explorar Qwen 3B ou Gemma 2B sem configurar um servidor.

6. ChatterUI, melhor para conectar qualquer backend

ChatterUI é uma interface de chat Android que se comunica com qualquer backend que você aponta: um modelo local via llama.cpp, uma instância Ollama auto-hospedada na sua LAN, ou uma API hospedada. É um aplicativo traga-seu-próprio-modelo que mantém a interface consistente enquanto você muda provedores abaixo.

Onde falha: a configuração requer saber onde seu modelo realmente vive. Não é apropriado se você quer que o aplicativo escolha um modelo para você.

Preço: Gratuito e código aberto.

Download: GitHub releases APK. Também disponível em algumas lojas APK de terceiros.

Conclusão: A escolha quando você já tem uma instância Ollama, LM Studio ou endpoint hospedado e quer um frontend móvel.

7. Perplexity, melhor mecanismo de resposta de peso aberto com fontes

Perplexity usa uma mistura de modelos proprietários e de peso aberto sob o capô, incluindo sua família Sonar que é treinada em Llama. O aplicativo Android emparelha esses modelos com pesquisa na web ao vivo e retorna respostas com fontes citadas inline. Não é no dispositivo, mas é um dos usos mais poderosos do lado do consumidor de fundações de peso aberto.

Onde falha: a seleção de modelo é limitada no nível gratuito. Modos Sonar Pro e DeepSeek exigem assinatura Perplexity Pro.

Preço: Gratuito com conta. Perplexity Pro aproximadamente $20 por mês desbloqueia seleção de modelo.

Download: Aptoide

Conclusão: A escolha para assistentes de peso aberto que também fazem pesquisa com fontes.

Como escolher a correta

FAQ

Posso executar Kimi K3 no meu telefone? Não de forma útil. K3 é um grande modelo de mistura de especialistas que requer hardware de classe servidor. Variantes menores de Qwen e Llama são o que realmente cabe em telefones hoje.

Qual é o melhor modelo de código aberto gratuito que posso conversar no Android? DeepSeek é a experiência de chat gratuita mais forte. Para no dispositivo, Gemma 2B ou Qwen 2.5 3B em MLC Chat ou PocketPal são as escolhas práticas.

Modelos locais drenam a bateria rapidamente? Sim. Inferência sustentada puxa forte no SoC. Espere 5 a 10 por cento de bateria para um chat longo com um modelo 3B.

É seguro usar DeepSeek na Europa? DeepSeek foi objeto de debates de privacidade em vários países da UE. Seu aplicativo Android processa conversas em servidores na China. Escolha de acordo.

Para que realmente serve Google AICore? É um serviço do sistema que hospeda Gemini Nano para que outros aplicativos possam chamá-lo sem enviar seus próprios pesos. Instale se você quer que os recursos de IA no dispositivo em outros aplicativos do Google funcionem.