Um telefone Android moderno com 8 GB de RAM pode manter um modelo 3B na memória e responder perguntas em alguns segundos, offline. O objetivo não é substituir GPT ou Claude para problemas difíceis. O objetivo é um bate-papo privado sem rede que sobreviva a um voo, uma travessia de fronteira ou um Wi-Fi de hotel ruim. Os melhores aplicativos para executar LLM no dispositivo no Android diferem de três maneiras: quais formatos de modelo quantizados eles carregam, quanto RAM eles precisam para permanecer estáveis e quão utilizável é a interface de bate-papo em uma tela pequena. Colocamos sete em um mês de uso diário.
O que procurar em um aplicativo LLM no dispositivo
Seis coisas separam um aplicativo de bate-papo que permanece instalado de um que é desinstalado em uma semana:
- Suporte de formato de modelo. GGUF é o mais comum; MLC e ONNX vêm a seguir. Qualquer que seja o formato que o aplicativo suporta determina quais modelos estão disponíveis.
- Opções de quantização. Q4_K_M é o ponto ideal para um modelo 3B em 8 GB; Q3 é menor mas notavelmente pior.
- Manipulação de janela de contexto. Se o aplicativo mantém um histórico contínuo ou reinicia a cada turno.
- Tokens por segundo em hardware modesto. Um telefone Snapdragon 8 Gen 2 executa um 3B Q4 em aproximadamente 15 a 25 tok/s.
- Comportamento da bateria. Gerações longas aquecem o telefone. Um sinalizador de fundo ou um temporizador que limita as sessões ajuda.
- Custo e status de código fechado. Algumas opções são freemium com fallbacks na nuvem que precisam ser desativados.
Comparação rápida
| Aplicativo | Melhor para | Formatos de modelo | Nível gratuito | Destaque |
|---|---|---|---|---|
| PocketPal AI | Bate-papo geral no dispositivo | GGUF | Gratuito, código aberto | Melhor UX de download para modelos GGUF |
| MLC Chat | Velocidade no Snapdragon 8 | MLC | Gratuito, código aberto | Tok/s mais rápido de qualquer um aqui |
| Layla | Bate-papo de personagem e interpretação de papéis | GGUF | Nível gratuito, assinatura | UI polido, biblioteca de personagens |
| MyDeviceAI | Assistente com ferramentas | GGUF, ONNX | Gratuito, código aberto | Busca na web incorporada, permanece no dispositivo |
| SmolChat | Telefones pequenos (4 a 6 GB) | GGUF (small) | Gratuito, código aberto | Executa modelos 1B e 1.5B perfeitamente |
| Private AI Chat | Sem conta, sem telemetria | GGUF | Gratuito | Enviado com lista de modelos selecionada |
| Enchanted | Ollama no servidor doméstico | Remoto para Ollama | Gratuito, código aberto | Melhor quando o telefone fala com um LLM doméstico |
Os aplicativos
1. PocketPal AI, melhor bate-papo geral no dispositivo
PocketPal AI baixa modelos GGUF do Hugging Face dentro do aplicativo e os gerencia em uma biblioteca. Pré-configurações para Phi-3.5, Gemma 3, Llama 3.2 e Qwen 2.5 oferecem quantizações iniciais sensatas. A interface de bate-papo suporta prompts de sistema, temperatura, top-p e penalidade de repetição por modelo, o que é mais controle do que a maioria dos aplicativos aqui.
Onde fica aquém: Usuários de primeira vez precisam ter uma ideia aproximada de qual modelo escolher. Não há recomendação no aplicativo.
Preço: Gratuito, código aberto (MIT).
Plataformas: Android, iOS.
Download: GitHub · Google Play
Conclusão: Comece aqui. É a opção gratuita mais completa e não promove uma camada paga.
2. MLC Chat, melhor velocidade bruta no Snapdragon 8
MLC Chat compila modelos para o formato MLC antecipadamente e os executa via TVM. Em um telefone Snapdragon 8 Gen 2, Gemma 2B MLC funciona em aproximadamente o dobro do tok/s do mesmo modelo em GGUF em llama.cpp. As opções de modelo são mais restritas porque cada modelo é pré-construído.
Onde fica aquém: Adicionar um novo modelo requer o conjunto de ferramentas MLC em um laptop. Não é um fluxo de trabalho “baixe e vá”.
Preço: Gratuito, licença Apache.
Plataformas: Android, iOS.
Download: MLC Chat · Google Play
Conclusão: A escolha se o telefone é um smartphone de ponta recente e o objetivo é a resposta no dispositivo mais rápida possível.
3. Layla, melhor para bate-papo de personagem e interpretação de papéis
Layla envolve llama.cpp em uma interface de bate-papo polida com personagens, entrada de voz e uma biblioteca de personas comunitárias. O nível gratuito inclui download de modelo local; a assinatura adiciona modelos hospedados na nuvem e geração de imagens, ambos opcionais. Como o aplicativo está no dispositivo por padrão, a biblioteca de personagens funciona offline.
Onde fica aquém: O foco de RP aparece nos prompts padrão. Transformá-lo em um assistente genérico significa sobrescrever o prompt do sistema a cada sessão.
Preço:
- Nível gratuito: apenas modelos locais
- Pro: a partir de uma taxa mensal modesta adiciona modelos hospedados e imagens
Plataformas: Android, iOS.
Download: Layla
Conclusão: Para quem quer um bate-papo que se incline mais para o criativo do que para a utilidade.
4. MyDeviceAI, melhor assistente com ferramentas
MyDeviceAI executa um modelo GGUF local, depois adiciona uma etapa de busca na web que lê trechos e os devolve ao modelo como contexto. Permanece privado porque a consulta de busca é a única coisa que sai do telefone. É o mais próximo de um assistente ao estilo Perplexity com raciocínio local.
Onde fica aquém: A integração de busca na web depende de um backend de busca que muda. Chamadas de ferramentas ocasionalmente quebradas cabem ao operador notar.
Preço: Gratuito, código aberto.
Plataformas: Android.
Download: GitHub
Conclusão: A escolha quando o assistente precisa de informações atuais, não apenas o que cabe nos pesos do modelo.
5. SmolChat, melhor para telefones pequenos
SmolChat tem como alvo telefones com 4 a 6 GB de RAM. Ele vem com configurações ajustadas para modelos 1B e 1.5B (Phi-3-mini, Gemma 2 2B, Llama 3.2 1B) e recusa abrir os maiores. O resultado é um aplicativo de bate-papo que permanece responsivo em um telefone de gama média de dois anos.
Onde fica aquém: Propositalmente limitado. Se o telefone pode executar um modelo 3B, use o PocketPal AI.
Preço: Gratuito, código aberto.
Plataformas: Android.
Download: GitHub · Google Play
Conclusão: Para telefones de gama média que congelariam em um modelo 7B.
6. Private AI Chat, melhor “sem conta, sem telemetria”
Private AI Chat envia uma pequena lista de modelos GGUF verificados, baixa-os na primeira execução e nunca pede uma conta. O histórico de bate-papo permanece em um banco de dados no dispositivo. A política de privacidade cabe em uma tela porque o aplicativo não coleta dados.
Onde fica aquém: Sem fallback na nuvem se o modelo não for suficiente para uma pergunta difícil. Sem modelos adicionados pelo usuário além da lista selecionada.
Preço: Gratuito.
Plataformas: Android.
Download: Google Play
Conclusão: A escolha quando o ponto inteiro é “nenhum dado sai do telefone” e escolher um modelo não é a parte divertida.
7. Enchanted, melhor se você já executa Ollama em casa
Enchanted é um cliente de telefone para Ollama em execução no servidor doméstico. Não é totalmente no dispositivo (o modelo executa na máquina doméstica, que lida com a computação), mas o bate-papo permanece na LAN ou via um túnel Tailscale. Para quem já tem uma caixa doméstica potente hospedando Ollama, este é o caminho mais curto para um modelo 70B do telefone.
Onde fica aquém: Requer uma instância Ollama doméstica. O uso celular precisa de um túnel como Tailscale para alcançar o servidor.
Preço: Gratuito, código aberto.
Plataformas: Android, iOS.
Download: GitHub
Conclusão: A escolha quando o telefone é um cliente fino para um modelo local muito maior.
Como escolher o certo
Se o telefone tem 8 GB de RAM ou mais, comece com PocketPal AI e um modelo 3B Q4. A interface é a mais amigável e a biblioteca de modelos é a mais ampla.
Se o telefone é um smartphone de ponta recente e a velocidade importa mais do que a escolha do modelo, mude para MLC Chat.
Se o telefone tem 4 a 6 GB de RAM, use SmolChat com um modelo 1.5B ou 2B.
Se o objetivo é um assistente privado que possa pesquisar, use MyDeviceAI.
Se o dia envolve bate-papo criativo ou interpretação de papéis, use Layla.
Se um servidor doméstico potente já está executando Ollama, use Enchanted e trate o telefone como um cliente fino.
FAQ
Quais telefones Android podem executar um modelo 7B? Telefones com pelo menos 12 GB de RAM (Pixel 9 Pro XL, Galaxy S25 Ultra, OnePlus 13). Um modelo 7B Q4 mais o SO cabe bem em 12 GB e se move. Em 8 GB o telefone faz swap e o aplicativo falha em minutos.
Esses aplicativos drenam a bateria? Sim, durante a geração. Um modelo 3B em 20 tok/s em um SoC moderno consome 4 a 6 W. Uma conversa de dez minutos é aproximadamente um por cento de bateria. Gerações longas aquecem o telefone.
Posso usar estes offline? Sim, esse é o ponto. PocketPal AI, MLC Chat, SmolChat, Layla e Private AI Chat executam totalmente no dispositivo após o download do modelo. O modo avião não os afeta.
Meus dados são privados? Nos seis aplicativos no dispositivo, sim. Enchanted envia bate-papo para seu próprio servidor Ollama. Nenhum deles envia prompts para uma nuvem de terceiros no modo padrão.
Com qual modelo devo começar? Phi-3.5-mini em Q4_K_M é o padrão mais seguro em 8 GB. Responde bem a perguntas comuns e cabe em cerca de 2,5 GB de RAM. Mude para Gemma 2 2B ou Llama 3.2 3B se o telefone conseguir lidar.
Estes podem substituir o ChatGPT? Para perguntas rápidas, rascunho de texto curto e trechos de código de menos de 200 linhas, sim. Para raciocínio prolongado, eventos atuais e código complexo, não. Trate no dispositivo como a camada privada, offline, não a caixa de ferramentas completa.