PocketPal AI executando um modelo de linguagem local no Android

Um smartphone flagship moderno possui mais RAM do que a maioria dos laptops enviados há cinco anos atrás, e nunca sai do bolso do usuário. Essa combinação é finalmente suficiente para executar modelos de linguagem quantizados 4B e 7B no dispositivo: sem faturas de API, sem dados saindo do telefone, sem limitação quando o Wi-Fi do avião cai. Testamos seis aplicativos Android que tornam a inferência LLM local viável, desde downloads de um único toque até flexibilidade no nível do Termux. Estes são os melhores aplicativos para executar LLMs locais em telefones Android em 2026.

O que procurar em um aplicativo LLM local

Os compromissos são sempre os mesmos: qualidade do modelo versus pressão de memória, latência versus drenagem de bateria, facilidade de configuração versus controle.

Comparação rápida

Aplicativo Melhor para Catálogo de modelos Contexto máx. Código aberto
PocketPal AI Kit inicial GGUF do Hugging Face 8k padrão Sim
MLC Chat Inferência acelerada por GPU MLC pré-construído 4k-8k Sim
ChatterUI Roleplay e personagens Qualquer caminho GGUF 16k+ Sim
Layla Lite Bate-papo com personagem pronto GGUF curado 8k Freemium
Termux Executando llama.cpp diretamente Qualquer coisa Depende do modelo Sim
Google AI Edge Gallery Demo Gemma e Phi Catálogo Google 4k Sim

6 melhores aplicativos LLM locais para Android em 2026

1. PocketPal AI, o kit inicial

PocketPal AI é o aplicativo a recomendar primeiro. O download do modelo é um navegador Hugging Face pesquisável dentro do aplicativo, a quantização é escolhida de um dropdown, e a inferência usa llama.cpp sob o capô. Carregar um modelo 3B Q4_K_M em um telefone com 12 GB de RAM leva cerca de dez segundos. A interface de bate-papo suporta prompts do sistema, edição de mensagens e um modo benchmark que informa tokens por segundo.

A compilação 2026 adicionou um modo de preenchimento de texto junto ao bate-papo, que é útil para fluxos de trabalho de estilo autocompletar ao invés de apenas Q&A baseado em turnos.

Onde fica aquém: As configurações padrão favorecem velocidade sobre qualidade em telefones de gama média. Bate-papos persistentes vivem em um arquivo SQLite sem criptografia em repouso.

Preço:

Plataformas: Android 8.0 e posteriores, melhor em chips com 8 GB de RAM ou mais.

Baixar: AptoideGoogle Play

Resumo: Instale isto em primeiro lugar. É a rampa de lançamento para inferência local no Android.


2. MLC Chat, a opção acelerada por GPU

MLC Chat vem com modelos pré-construídos compilados para o backend Vulkan ou OpenCL do telefone pela equipe MLC-LLM. Em um Snapdragon 8 Gen 3 ou Tensor G4, isso significa tokens por segundo notavelmente melhores do que uma compilação pura llama.cpp de CPU. A seleção do modelo é estreita, mas curada: compilações das famílias Gemma, Phi e Llama estão todas incluídas.

O compromisso é flexibilidade. Os modelos MLC são recompilados pelos mantenedores, então um novo upload do Hugging Face leva uma ou duas semanas para chegar.

Onde fica aquém: Sem importações de modelos personalizados. O backend da GPU compete com o gerenciador de memória compartilhada do SO em algumas compilações Samsung, causando ocasionais travamentos.

Preço:

Plataformas: Android 8.0 e posteriores, GPU com Vulkan ou OpenCL.

Baixar: Google Play

Resumo: Melhor velocidade pura no dispositivo quando o usuário está disposto a executar apenas o que MLC pré-construiu.


3. ChatterUI, o frontend de roleplay e personagens

ChatterUI é um frontend completo para inferência local com cards de personagens estilo SillyTavern, deslizamento de mensagens, bate-papos em grupo e prompts de sistema por personagem. Ele carrega qualquer GGUF do armazenamento local, tornando-o a escolha para usuários que já têm uma coleção Hugging Face em cache.

O seletor de template de instrução importa aqui: desabilitar um template de bate-papo Mistral em uma compilação Llama-3 prejudica a qualidade, e ChatterUI expõe a escolha explicitamente.

Onde fica aquém: A configuração é a mais íngreme nesta lista. A primeira execução pede ao usuário para apontar para um arquivo de modelo, escolher um template de bate-papo e definir um comprimento de contexto antes de fazer qualquer coisa.

Preço:

Plataformas: Android 8.0 e posteriores.

Baixar: F-Droid

Resumo: Para usuários avançados que querem SillyTavern no telefone.


4. Layla Lite, o bate-papo com personagem pronto

Layla Lite é uma compilação reduzida do Layla AI com um catálogo de modelos curado e uma interface de bate-papo com personagem direcionada a usuários que querem conversar com um assistente no telefone sem escolher templates de bate-papo. Os downloads são quantizados antecipadamente e nomeados de acordo com a personalidade em vez do modelo subjacente, o que é mais amigável para quem é novo neste espaço.

O Layla pago traz texto para voz, geração de imagens no dispositivo e entradas de visão.

Onde fica aquém: O nível gratuito limita a seleção de modelos. A voz do personagem na compilação gratuita fica presa aos modelos pequenos.

Preço:

Plataformas: Android 9.0 e posteriores.

Baixar: Google Play

Resumo: A escolha para usuários que querem bate-papo no dispositivo sem configurar nada.


5. Termux, a opção DIY

Termux não é um aplicativo LLM, é um shell Linux completo que executa llama.cpp, binários Ollama e stacks de inferência Python nativamente. Para quem já executa modelos locais em um laptop, Termux é o caminho mais curto para o mesmo fluxo de trabalho no telefone: pkg install llama-cpp, coloque GGUF em ~/models, execute.

Pareado com o complemento Termux:API para fazer scripts de inferência do Tasker ou um atalho, que é o mais próximo que o Android tem de um atalho de teclado para o modelo local.

Onde fica aquém: A compilação do Play Store está desatualizada. Use a versão F-Droid ou GitHub. A configuração é um shell, não uma UI.

Preço:

Plataformas: Android 7.0 e posteriores.

Baixar: F-Droid

Resumo: Para usuários que preferem o CLI que já conhecem.


Google AI Edge Gallery é a vitrine oficial de inferência no dispositivo do Google. Vem com variantes Gemma e Phi pré-configuradas para a API de Inferência LLM do MediaPipe, mais fluxos de exemplo para bate-papo, resumo e compreensão de imagem. É a forma mais rápida de ver como um modelo Gemma moderno se sente em um telefone sem escolher uma compilação ou quantização.

O formato de galeria também serve como benchmark: cada card de modelo lista tokens por segundo no dispositivo, para que o usuário possa comparar um Pixel 9 Pro com um Snapdragon de gama média em menos de um minuto.

Onde fica aquém: Limitado às escolhas do Google. Não é um cliente de bate-papo de uso geral.

Preço:

Plataformas: Android 12 e posteriores.

Baixar: F-Droid

Resumo: A demonstração limpa para avaliar se a inferência no dispositivo é rápida o suficiente em um determinado telefone antes de instalar algo mais pesado.

Como escolher o correto

Perguntas frequentes

Quanto de RAM um telefone Android precisa para executar um modelo de linguagem 7B?
Um modelo 7B Q4_K_M quantizado precisa de cerca de 4,5 GB de RAM para executar em velocidade utilizável, mais espaço para o SO e aplicativos de fundo. Na prática, um telefone de 8 GB funciona se o usuário fechar abas de fundo; telefones de 12 GB ou 16 GB o fazem sem notar.

Os aplicativos LLM locais drenam a bateria?
A inferência ativa é pesada, similar a uma videochamada. Aplicativos inativos não usam bateria porque os modelos são descarregados da memória entre bate-papos.

Posso executar um modelo local sem conexão com a Internet?
Sim, esse é o ponto. Downloads de modelos precisam de Internet, mas a inferência é completamente offline depois.

Qual quantização devo escolher?
Q4_K_M é o padrão que funciona na maioria dos telefones. Q5_K_M é melhor se há RAM de reposição. Abaixo de Q4, a qualidade cai drasticamente e raramente vale a economia de memória.