Termux e outras ferramentas para executar um LLM local no Android

XDA transformou um telefone antigo em um servidor LLM local e conseguiu executar o Gemma 4 bem o suficiente para trabalho produtivo real. Este é um uso bem adequado para um Android antigo guardado em uma gaveta, e graças às otimizações ARM do llama.cpp, um Snapdragon 8 Gen 1 ou mais recente pode hospedar um modelo quantizado de 3B a 7B que responde a outros dispositivos em nossa Wi-Fi. Sete aplicativos fazem o trabalho, alguns são clientes de bate-papo que também expõem uma API compatível com OpenAI, alguns são terminais que nos permitem executar llama.cpp ou ollama diretamente.

O que procurar em um aplicativo LLM local para Android

Comparação rápida

Aplicativo Melhor para Gratuito Servidor API Avaliação
Termux llama.cpp ou ollama completo no terminal Sim Sim, via llama-server 4.7
PocketPal AI Bate-papo GUI com alternância do servidor Sim Sim, experimental 4.5
Layla Bate-papo refinado mais interpretação de papéis Sim Trial Pro API 4.4
MLC Chat Modelos otimizados para MLC Sim Apenas local na versão estável 4.3
ChatterUI Interface estilo SillyTavern Sim Sim, via servidor integrado 4.4
SmolChat Cliente de bate-papo mínimo Sim Não 4.3
llama.cpp Android Build de referência Sim Sim, via llama-server 4.5

Os sete aplicativos

1. Termux, melhor llama.cpp ou ollama completo no terminal

Termux é o kit de ferramentas Linux-no-seu-bolso que nos permite construir e executar llama.cpp ou ollama diretamente. pkg install cmake python git, clone llama.cpp, compile com LLAMA_VULKAN=1 e inicie llama-server vinculado ao nosso IP de LAN. O telefone antigo agora serve uma API compatível com OpenAI para qualquer dispositivo em Wi-Fi.

Onde fica aquém: Não para os avessos ao terminal. A configuração inicial leva uma hora de gerenciamento de pacotes.

Preços:

Plataformas: Android

Baixar: F-Droid · Aptoide

Termux para hospedagem de LLM local vence em flexibilidade. Qualquer coisa que llama.cpp suporte, Termux suporta.

Conclusão: A opção para leitores confortáveis em um terminal. O teto é muito mais alto do que qualquer GUI nesta lista.

2. PocketPal AI, melhor GUI com alternância do servidor

PocketPal AI é um cliente de bate-papo Android de código aberto que carrega modelos GGUF do Hugging Face e os executa no dispositivo. Compilações recentes adicionam uma alternância de servidor experimental que expõe o mesmo modelo em nossa LAN via um ponto de extremidade compatível com OpenAI.

Onde fica aquém: A alternância do servidor ainda está marcada como experimental e não possui TLS.

Preços:

Plataformas: Android, iOS

Baixar: Google Play · F-Droid

PocketPal AI para hospedagem de LLM local vence em simplicidade de GUI. Escolha um modelo do Hugging Face, toque em carregar, comece a bater papo.

Conclusão: A opção para leitores que desejam uma GUI primeiro e uma API segundo.

3. Layla, melhor bate-papo refinado mais interpretação de papéis

Layla é um cliente de bate-papo Android amigável com pagamento que executa modelos quantizados no dispositivo com uma interface elegante. Interpretação de papéis de personagens, memória persistente e modo de voz inclusos. O nível Pro adiciona um modo servidor API que expõe o modelo carregado.

Onde fica aquém: O nível gratuito limita o comprimento do contexto. Os recursos de personagem adicionam complexidade à interface.

Preços:

Plataformas: Android

Baixar: Google Play

Layla para hospedagem de LLM local vence em polimento de bate-papo e ferramentas de interpretação de papéis.

Conclusão: A opção para leitores que desejam uma interface focada em bate-papo, não uma ferramenta dev.

4. MLC Chat, melhor modelos otimizados para MLC

MLC Chat da equipe MLC vem com modelos pré-compilados otimizados para GPUs Qualcomm Adreno e MediaTek. Os tokens por segundo são os melhores nesta lista para telefones que o aplicativo oficialmente suporta, ao custo de uma biblioteca de modelos menor do que llama.cpp.

Onde fica aquém: O modo servidor API está no mapa de estradas, ainda não na versão estável.

Preços:

Plataformas: Android, iOS

Baixar: GitHub · Aptoide

MLC Chat para hospedagem de LLM local vence em velocidade de inferência bruta quando nosso telefone está na lista suportada.

Conclusão: A opção para leitores cujo dispositivo está na lista suportada do MLC e desejam tokens máximos por segundo localmente.

5. ChatterUI, melhor interface estilo SillyTavern

ChatterUI é um cliente de bate-papo Android modelado em SillyTavern. Cartões de personagem, ramos de bate-papo e um servidor integrado que outros dispositivos em nossa LAN podem atingir como um ponto de extremidade compatível com OpenAI.

Onde fica aquém: O formato do cartão de personagem é o ponto, mas torna ChatterUI mais pesado que PocketPal para Q&A simples.

Preços:

Plataformas: Android

Baixar: GitHub

ChatterUI para hospedagem de LLM local vence se nossa pilha de bate-papo existente tiver forma de SillyTavern.

Conclusão: A opção para leitores que já usam SillyTavern.

6. SmolChat, melhor cliente de bate-papo mínimo

SmolChat é um cliente Android minimalista para modelos llama.cpp GGUF. Não serve uma API, mas sua pegada é pequena o suficiente para que telefones mais antigos com 4 GB de RAM ainda possam caber em um modelo quantizado de 3B.

Onde fica aquém: Apenas bate-papo local, sem modo servidor.

Preços:

Plataformas: Android

Baixar: GitHub

SmolChat para hospedagem de LLM local vence como a opção mais leve para dispositivos de 4 GB.

Conclusão: A opção quando o telefone de destino é realmente antigo e com restrições de RAM.

7. llama.cpp Android, melhor build de referência

llama.cpp Android é o build de referência oficial de ggerganov. Não em nenhuma loja, baixamos o APK das versões do GitHub. Executa llama-server diretamente com os mesmos sinalizadores que usaríamos no Linux.

Onde fica aquém: Nenhum polimento de interface, e devemos conhecer os sinalizadores do llama.cpp antes de começar.

Preços:

Plataformas: Android

Baixar: GitHub

llama.cpp Android para hospedagem de LLM local vence como implementação de referência.

Conclusão: A opção para leitores que desejam a mesma ferramenta que executam em um laptop, no Android.

Como escolher o certo

Perguntas frequentes

Um telefone Android antigo pode realmente executar um LLM?

Sim, em Snapdragon 855 e mais recente, com 6 GB ou mais de RAM. Espere 3 a 5 tokens por segundo em um modelo quantizado de 3B em hardware mais antigo, e 10 a 20 tokens por segundo em telefones mais recentes.

Qual modelo funciona melhor no Android?

Gemma 2B, Phi-3 Mini, Llama 3.2 3B e Qwen 2.5 3B se encaixam confortavelmente na quantização Q4_K_M. Gemma 4 funciona em telefones mais recentes com 8 GB ou mais de RAM.

Posso usar meu telefone como servidor API LLM para meu laptop?

Sim. Termux executando llama-server vinculado ao nosso IP de LAN funciona. Aponte o cliente de bate-papo do nosso laptop para http://<phone-ip>:8080/v1 para o ponto de extremidade compatível com OpenAI.

Executar um LLM matará a bateria do meu telefone?

A inferência sustentada drena rapidamente, planeje para energia de parede. Também espere que o telefone fique quente, levante-o para fluxo de ar.

llama.cpp é gratuito?

Sim, licenciado MIT. Cada aplicativo nesta lista que o usa é código aberto ou pago sobre a base gratuita do llama.cpp.