
XDA transformou um telefone antigo em um servidor LLM local e conseguiu executar o Gemma 4 bem o suficiente para trabalho produtivo real. Este é um uso bem adequado para um Android antigo guardado em uma gaveta, e graças às otimizações ARM do llama.cpp, um Snapdragon 8 Gen 1 ou mais recente pode hospedar um modelo quantizado de 3B a 7B que responde a outros dispositivos em nossa Wi-Fi. Sete aplicativos fazem o trabalho, alguns são clientes de bate-papo que também expõem uma API compatível com OpenAI, alguns são terminais que nos permitem executar llama.cpp ou ollama diretamente.
O que procurar em um aplicativo LLM local para Android
- Modo servidor API. Para “telefone antigo como servidor LLM”, o aplicativo deve expor um ponto de extremidade HTTP que outros dispositivos possam chamar, idealmente compatível com OpenAI.
- Suporte a formatos de modelo. GGUF via llama.cpp é o padrão, o formato próprio do MLC é outra opção.
- Offload de GPU. Backend Vulkan ou OpenCL que usa a GPU Adreno ou Mali do nosso telefone muda tokens por segundo em 3x a 5x.
- Controle de bateria e térmico. Inferência sustentada aquece um telefone. Procure por controles de serviço em primeiro plano e limitação térmica.
- Pegada de RAM. Telefones antigos com 4 a 6 GB de RAM não podem conter modelos maiores, nem com quantização agressiva.
- Persistência em segundo plano. O aplicativo deve sobreviver ao gerenciador de memória agressivo do Android em OEMs baratos.
Comparação rápida
| Aplicativo | Melhor para | Gratuito | Servidor API | Avaliação |
|---|---|---|---|---|
| Termux | llama.cpp ou ollama completo no terminal | Sim | Sim, via llama-server | 4.7 |
| PocketPal AI | Bate-papo GUI com alternância do servidor | Sim | Sim, experimental | 4.5 |
| Layla | Bate-papo refinado mais interpretação de papéis | Sim | Trial Pro API | 4.4 |
| MLC Chat | Modelos otimizados para MLC | Sim | Apenas local na versão estável | 4.3 |
| ChatterUI | Interface estilo SillyTavern | Sim | Sim, via servidor integrado | 4.4 |
| SmolChat | Cliente de bate-papo mínimo | Sim | Não | 4.3 |
| llama.cpp Android | Build de referência | Sim | Sim, via llama-server | 4.5 |
Os sete aplicativos
1. Termux, melhor llama.cpp ou ollama completo no terminal
Termux é o kit de ferramentas Linux-no-seu-bolso que nos permite construir e executar llama.cpp ou ollama diretamente. pkg install cmake python git, clone llama.cpp, compile com LLAMA_VULKAN=1 e inicie llama-server vinculado ao nosso IP de LAN. O telefone antigo agora serve uma API compatível com OpenAI para qualquer dispositivo em Wi-Fi.
Onde fica aquém: Não para os avessos ao terminal. A configuração inicial leva uma hora de gerenciamento de pacotes.
Preços:
- Gratuito: Kit de ferramentas completo
- Pago: Nenhum
Plataformas: Android
Termux para hospedagem de LLM local vence em flexibilidade. Qualquer coisa que llama.cpp suporte, Termux suporta.
Conclusão: A opção para leitores confortáveis em um terminal. O teto é muito mais alto do que qualquer GUI nesta lista.
2. PocketPal AI, melhor GUI com alternância do servidor
PocketPal AI é um cliente de bate-papo Android de código aberto que carrega modelos GGUF do Hugging Face e os executa no dispositivo. Compilações recentes adicionam uma alternância de servidor experimental que expõe o mesmo modelo em nossa LAN via um ponto de extremidade compatível com OpenAI.
Onde fica aquém: A alternância do servidor ainda está marcada como experimental e não possui TLS.
Preços:
- Gratuito: Código aberto sob MIT
- Pago: Nenhum
Plataformas: Android, iOS
Baixar: Google Play · F-Droid
PocketPal AI para hospedagem de LLM local vence em simplicidade de GUI. Escolha um modelo do Hugging Face, toque em carregar, comece a bater papo.
Conclusão: A opção para leitores que desejam uma GUI primeiro e uma API segundo.
3. Layla, melhor bate-papo refinado mais interpretação de papéis
Layla é um cliente de bate-papo Android amigável com pagamento que executa modelos quantizados no dispositivo com uma interface elegante. Interpretação de papéis de personagens, memória persistente e modo de voz inclusos. O nível Pro adiciona um modo servidor API que expõe o modelo carregado.
Onde fica aquém: O nível gratuito limita o comprimento do contexto. Os recursos de personagem adicionam complexidade à interface.
Preços:
- Gratuito: Bate-papo básico
- Pago: Assinatura Pro para contexto estendido e modo API
Plataformas: Android
Baixar: Google Play
Layla para hospedagem de LLM local vence em polimento de bate-papo e ferramentas de interpretação de papéis.
Conclusão: A opção para leitores que desejam uma interface focada em bate-papo, não uma ferramenta dev.
4. MLC Chat, melhor modelos otimizados para MLC
MLC Chat da equipe MLC vem com modelos pré-compilados otimizados para GPUs Qualcomm Adreno e MediaTek. Os tokens por segundo são os melhores nesta lista para telefones que o aplicativo oficialmente suporta, ao custo de uma biblioteca de modelos menor do que llama.cpp.
Onde fica aquém: O modo servidor API está no mapa de estradas, ainda não na versão estável.
Preços:
- Gratuito: Código aberto
- Pago: Nenhum
Plataformas: Android, iOS
MLC Chat para hospedagem de LLM local vence em velocidade de inferência bruta quando nosso telefone está na lista suportada.
Conclusão: A opção para leitores cujo dispositivo está na lista suportada do MLC e desejam tokens máximos por segundo localmente.
5. ChatterUI, melhor interface estilo SillyTavern
ChatterUI é um cliente de bate-papo Android modelado em SillyTavern. Cartões de personagem, ramos de bate-papo e um servidor integrado que outros dispositivos em nossa LAN podem atingir como um ponto de extremidade compatível com OpenAI.
Onde fica aquém: O formato do cartão de personagem é o ponto, mas torna ChatterUI mais pesado que PocketPal para Q&A simples.
Preços:
- Gratuito: Código aberto
- Pago: Nenhum
Plataformas: Android
Baixar: GitHub
ChatterUI para hospedagem de LLM local vence se nossa pilha de bate-papo existente tiver forma de SillyTavern.
Conclusão: A opção para leitores que já usam SillyTavern.
6. SmolChat, melhor cliente de bate-papo mínimo
SmolChat é um cliente Android minimalista para modelos llama.cpp GGUF. Não serve uma API, mas sua pegada é pequena o suficiente para que telefones mais antigos com 4 GB de RAM ainda possam caber em um modelo quantizado de 3B.
Onde fica aquém: Apenas bate-papo local, sem modo servidor.
Preços:
- Gratuito: Código aberto
- Pago: Nenhum
Plataformas: Android
Baixar: GitHub
SmolChat para hospedagem de LLM local vence como a opção mais leve para dispositivos de 4 GB.
Conclusão: A opção quando o telefone de destino é realmente antigo e com restrições de RAM.
7. llama.cpp Android, melhor build de referência
llama.cpp Android é o build de referência oficial de ggerganov. Não em nenhuma loja, baixamos o APK das versões do GitHub. Executa llama-server diretamente com os mesmos sinalizadores que usaríamos no Linux.
Onde fica aquém: Nenhum polimento de interface, e devemos conhecer os sinalizadores do llama.cpp antes de começar.
Preços:
- Gratuito: Código aberto sob MIT
- Pago: Nenhum
Plataformas: Android
Baixar: GitHub
llama.cpp Android para hospedagem de LLM local vence como implementação de referência.
Conclusão: A opção para leitores que desejam a mesma ferramenta que executam em um laptop, no Android.
Como escolher o certo
- Confortável em um terminal, quer máxima flexibilidade: Termux
- Quer GUI mais alternância de API: PocketPal AI
- Quer polimento de bate-papo com interpretação de papéis: Layla
- Telefone está na lista suportada do MLC e quer velocidade máxima: MLC Chat
- Já executa SillyTavern: ChatterUI
- Telefone tem apenas 4 GB de RAM: SmolChat
- Quer o build de referência llama.cpp: llama.cpp Android
Perguntas frequentes
Um telefone Android antigo pode realmente executar um LLM?
Sim, em Snapdragon 855 e mais recente, com 6 GB ou mais de RAM. Espere 3 a 5 tokens por segundo em um modelo quantizado de 3B em hardware mais antigo, e 10 a 20 tokens por segundo em telefones mais recentes.
Qual modelo funciona melhor no Android?
Gemma 2B, Phi-3 Mini, Llama 3.2 3B e Qwen 2.5 3B se encaixam confortavelmente na quantização Q4_K_M. Gemma 4 funciona em telefones mais recentes com 8 GB ou mais de RAM.
Posso usar meu telefone como servidor API LLM para meu laptop?
Sim. Termux executando llama-server vinculado ao nosso IP de LAN funciona. Aponte o cliente de bate-papo do nosso laptop para http://<phone-ip>:8080/v1 para o ponto de extremidade compatível com OpenAI.
Executar um LLM matará a bateria do meu telefone?
A inferência sustentada drena rapidamente, planeje para energia de parede. Também espere que o telefone fique quente, levante-o para fluxo de ar.
llama.cpp é gratuito?
Sim, licenciado MIT. Cada aplicativo nesta lista que o usa é código aberto ou pago sobre a base gratuita do llama.cpp.