
Um smartphone flagship moderno possui mais RAM do que a maioria dos laptops enviados há cinco anos atrás, e nunca sai do bolso do usuário. Essa combinação é finalmente suficiente para executar modelos de linguagem quantizados 4B e 7B no dispositivo: sem faturas de API, sem dados saindo do telefone, sem limitação quando o Wi-Fi do avião cai. Testamos seis aplicativos Android que tornam a inferência LLM local viável, desde downloads de um único toque até flexibilidade no nível do Termux. Estes são os melhores aplicativos para executar LLMs locais em telefones Android em 2026.
O que procurar em um aplicativo LLM local
Os compromissos são sempre os mesmos: qualidade do modelo versus pressão de memória, latência versus drenagem de bateria, facilidade de configuração versus controle.
- Catálogo de modelos. Modelos GGUF e MLC devem estar a um toque, não a um download manual do Hugging Face.
- Quantização. Q4_K_M e Q5_K_M importam mais do que a contagem de parâmetros brutos em um telefone.
- Janela de contexto. 8k é viável, 32k é confortável, qualquer coisa menor parece apertada em 2026.
- Limite de memória. Um telefone com 8 GB de RAM utilizável mal pode conter um modelo 7B Q4 mais o SO.
- Isolamento de fundo. Um telefone que OOM durante uma videochamada porque o LLM se recusa a descarregar é inutilizável.
- Compatibilidade de API. Um endpoint local compatível com OpenAI significa que outros aplicativos no telefone podem apontar para ele.
Comparação rápida
| Aplicativo | Melhor para | Catálogo de modelos | Contexto máx. | Código aberto |
|---|---|---|---|---|
| PocketPal AI | Kit inicial | GGUF do Hugging Face | 8k padrão | Sim |
| MLC Chat | Inferência acelerada por GPU | MLC pré-construído | 4k-8k | Sim |
| ChatterUI | Roleplay e personagens | Qualquer caminho GGUF | 16k+ | Sim |
| Layla Lite | Bate-papo com personagem pronto | GGUF curado | 8k | Freemium |
| Termux | Executando llama.cpp diretamente | Qualquer coisa | Depende do modelo | Sim |
| Google AI Edge Gallery | Demo Gemma e Phi | Catálogo Google | 4k | Sim |
6 melhores aplicativos LLM locais para Android em 2026
1. PocketPal AI, o kit inicial
PocketPal AI é o aplicativo a recomendar primeiro. O download do modelo é um navegador Hugging Face pesquisável dentro do aplicativo, a quantização é escolhida de um dropdown, e a inferência usa llama.cpp sob o capô. Carregar um modelo 3B Q4_K_M em um telefone com 12 GB de RAM leva cerca de dez segundos. A interface de bate-papo suporta prompts do sistema, edição de mensagens e um modo benchmark que informa tokens por segundo.
A compilação 2026 adicionou um modo de preenchimento de texto junto ao bate-papo, que é útil para fluxos de trabalho de estilo autocompletar ao invés de apenas Q&A baseado em turnos.
Onde fica aquém: As configurações padrão favorecem velocidade sobre qualidade em telefones de gama média. Bate-papos persistentes vivem em um arquivo SQLite sem criptografia em repouso.
Preço:
- Grátis, código aberto (MIT).
Plataformas: Android 8.0 e posteriores, melhor em chips com 8 GB de RAM ou mais.
Resumo: Instale isto em primeiro lugar. É a rampa de lançamento para inferência local no Android.
2. MLC Chat, a opção acelerada por GPU
MLC Chat vem com modelos pré-construídos compilados para o backend Vulkan ou OpenCL do telefone pela equipe MLC-LLM. Em um Snapdragon 8 Gen 3 ou Tensor G4, isso significa tokens por segundo notavelmente melhores do que uma compilação pura llama.cpp de CPU. A seleção do modelo é estreita, mas curada: compilações das famílias Gemma, Phi e Llama estão todas incluídas.
O compromisso é flexibilidade. Os modelos MLC são recompilados pelos mantenedores, então um novo upload do Hugging Face leva uma ou duas semanas para chegar.
Onde fica aquém: Sem importações de modelos personalizados. O backend da GPU compete com o gerenciador de memória compartilhada do SO em algumas compilações Samsung, causando ocasionais travamentos.
Preço:
- Grátis, código aberto (Apache-2.0).
Plataformas: Android 8.0 e posteriores, GPU com Vulkan ou OpenCL.
Resumo: Melhor velocidade pura no dispositivo quando o usuário está disposto a executar apenas o que MLC pré-construiu.
3. ChatterUI, o frontend de roleplay e personagens
ChatterUI é um frontend completo para inferência local com cards de personagens estilo SillyTavern, deslizamento de mensagens, bate-papos em grupo e prompts de sistema por personagem. Ele carrega qualquer GGUF do armazenamento local, tornando-o a escolha para usuários que já têm uma coleção Hugging Face em cache.
O seletor de template de instrução importa aqui: desabilitar um template de bate-papo Mistral em uma compilação Llama-3 prejudica a qualidade, e ChatterUI expõe a escolha explicitamente.
Onde fica aquém: A configuração é a mais íngreme nesta lista. A primeira execução pede ao usuário para apontar para um arquivo de modelo, escolher um template de bate-papo e definir um comprimento de contexto antes de fazer qualquer coisa.
Preço:
- Grátis, código aberto (AGPL-3.0).
Plataformas: Android 8.0 e posteriores.
Resumo: Para usuários avançados que querem SillyTavern no telefone.
4. Layla Lite, o bate-papo com personagem pronto
Layla Lite é uma compilação reduzida do Layla AI com um catálogo de modelos curado e uma interface de bate-papo com personagem direcionada a usuários que querem conversar com um assistente no telefone sem escolher templates de bate-papo. Os downloads são quantizados antecipadamente e nomeados de acordo com a personalidade em vez do modelo subjacente, o que é mais amigável para quem é novo neste espaço.
O Layla pago traz texto para voz, geração de imagens no dispositivo e entradas de visão.
Onde fica aquém: O nível gratuito limita a seleção de modelos. A voz do personagem na compilação gratuita fica presa aos modelos pequenos.
Preço:
- Nível gratuito com um pequeno catálogo curado.
- O nível pago desbloqueia modelos maiores, voz e fluxos de trabalho de imagem.
Plataformas: Android 9.0 e posteriores.
Resumo: A escolha para usuários que querem bate-papo no dispositivo sem configurar nada.
5. Termux, a opção DIY
Termux não é um aplicativo LLM, é um shell Linux completo que executa llama.cpp, binários Ollama e stacks de inferência Python nativamente. Para quem já executa modelos locais em um laptop, Termux é o caminho mais curto para o mesmo fluxo de trabalho no telefone: pkg install llama-cpp, coloque GGUF em ~/models, execute.
Pareado com o complemento Termux:API para fazer scripts de inferência do Tasker ou um atalho, que é o mais próximo que o Android tem de um atalho de teclado para o modelo local.
Onde fica aquém: A compilação do Play Store está desatualizada. Use a versão F-Droid ou GitHub. A configuração é um shell, não uma UI.
Preço:
- Grátis, código aberto (GPL-3.0).
Plataformas: Android 7.0 e posteriores.
Resumo: Para usuários que preferem o CLI que já conhecem.
6. Google AI Edge Gallery, a caixa de demonstração Gemma
Google AI Edge Gallery é a vitrine oficial de inferência no dispositivo do Google. Vem com variantes Gemma e Phi pré-configuradas para a API de Inferência LLM do MediaPipe, mais fluxos de exemplo para bate-papo, resumo e compreensão de imagem. É a forma mais rápida de ver como um modelo Gemma moderno se sente em um telefone sem escolher uma compilação ou quantização.
O formato de galeria também serve como benchmark: cada card de modelo lista tokens por segundo no dispositivo, para que o usuário possa comparar um Pixel 9 Pro com um Snapdragon de gama média em menos de um minuto.
Onde fica aquém: Limitado às escolhas do Google. Não é um cliente de bate-papo de uso geral.
Preço:
- Grátis, código aberto (Apache-2.0).
Plataformas: Android 12 e posteriores.
Resumo: A demonstração limpa para avaliar se a inferência no dispositivo é rápida o suficiente em um determinado telefone antes de instalar algo mais pesado.
Como escolher o correto
- Se este é seu primeiro modelo local: PocketPal AI.
- Se a velocidade importa mais do que a seleção de modelos: MLC Chat.
- Se você quer personagens e contexto longo: ChatterUI.
- Se você quer um assistente pré-carregado sem configuração: Layla Lite.
- Se você já executa llama.cpp em um laptop: Termux com o pacote llama.cpp.
- Se você quer um benchmark antes de decidir: Google AI Edge Gallery.
Perguntas frequentes
Quanto de RAM um telefone Android precisa para executar um modelo de linguagem 7B?
Um modelo 7B Q4_K_M quantizado precisa de cerca de 4,5 GB de RAM para executar em velocidade utilizável, mais espaço para o SO e aplicativos de fundo. Na prática, um telefone de 8 GB funciona se o usuário fechar abas de fundo; telefones de 12 GB ou 16 GB o fazem sem notar.
Os aplicativos LLM locais drenam a bateria?
A inferência ativa é pesada, similar a uma videochamada. Aplicativos inativos não usam bateria porque os modelos são descarregados da memória entre bate-papos.
Posso executar um modelo local sem conexão com a Internet?
Sim, esse é o ponto. Downloads de modelos precisam de Internet, mas a inferência é completamente offline depois.
Qual quantização devo escolher?
Q4_K_M é o padrão que funciona na maioria dos telefones. Q5_K_M é melhor se há RAM de reposição. Abaixo de Q4, a qualidade cai drasticamente e raramente vale a economia de memória.