
Melhores apps para executar LLMs quantizados no dispositivo em Android em 2026
Q4_K_M, Q5_K_S, Q8_0. Se essas tags ainda não significam nada, elas explicam por que um modelo de sete bilhões de parâmetros agora cabe dentro de um telefone com 6 GB. A quantização reduz os pesos do modelo de flutuantes de 16 bits para inteiros de 4 bits, encolhendo um modelo de chat de 14 GB para menos de 5 GB e permitindo que seu telefone o execute sem uma conta em uma API na nuvem.
Testamos sete apps em um Pixel 8 e um tablet Snapdragon 8 Gen 2. O que nos importava: quais apps carregavam pesos quantizados GGUF e MLC sem um laptop no meio, quais rodavam offline no modo avião, e quais mantinham uma conversa sem reduzir a velocidade por limitação térmica.
O que procurar em um app LLM no dispositivo
- Suporte para formatos comuns de quantização: GGUF (estilo llama.cpp) ou MLC (kernels compilados).
- Um catálogo de modelos que você possa navegar sem colar URLs do Hugging Face.
- Histórico de chat persistente salvo localmente, não transmitido para um servidor.
- Leitura de tokens por segundo, para você saber quando um modelo é pesado demais para o telefone.
- Alternadores de inferência de CPU vs GPU vs NPU, já que um NPU Snapdragon 8-series pode dobrar a taxa de transferência.
- Funcionamento em modo avião. Se precisa de Wi-Fi para responder “olá”, não é no dispositivo.
Comparação rápida
| App | Melhor para | Plano gratuito | Preço inicial/mês | Avaliação |
|---|---|---|---|---|
| MLC Chat | Kernels MLC compilados, melhor taxa de transferência | Sim (código aberto) | Gratuito | 4.4 |
| PocketPal AI | Modelos GGUF com catálogo amigável | Sim (código aberto) | Gratuito | 4.6 |
| Layla | Chats roleplay e longa contexto | Camada gratuita | $9.99 único | 4.5 |
| Sherpa | Shell mínimo llama.cpp | Sim (código aberto) | Gratuito | 4.2 |
| LLMFarm Companion | Sincronização de modelo entre dispositivos | Sim | $4.99 único | 4.3 |
| ChatterUI | Interface chat multi-modelo | Sim (código aberto) | Gratuito | 4.5 |
| Enchanted | Interface para servidor Ollama doméstico | Sim (código aberto) | Gratuito | 4.4 |
Os apps
1. MLC Chat — Melhor para kernels MLC compilados e melhor taxa de transferência
MLC Chat vem com modelos pré-compilados otimizados para a GPU Adreno ou Mali exata do seu telefone. Essa etapa de compilação é o que permite que um modelo Phi de três bilhões de parâmetros rode a 15+ tokens por segundo em um Pixel 8, aproximadamente o dobro do que um tempo de execução GGUF genérico consegue. O catálogo dentro do app é curto, mas curado: Llama, Phi, Gemma, Mistral, RedPajama.
Onde fica aquém: Sem suporte para arquivos GGUF arbitrários. Se você já tiver um modelo baixado, não consegue carregá-lo aqui sem recompilar para MLC.
Preços:
- Gratuito: Apache 2.0 código aberto.
- Pago: N/A.
Plataformas: Android 8.0 e superior.
Conclusão: Escolha MLC Chat quando o máximo de tokens por segundo importa e você consegue viver com o catálogo fixo.
2. PocketPal AI — Melhor para modelos GGUF com catálogo amigável
PocketPal AI carrega qualquer GGUF para o qual você aponte. A busca no app navega pelo Hugging Face sem mudar para um navegador, e a tela de download mostra nível de quantização, tamanho e uma estimativa aproximada de tokens por segundo para seu dispositivo antes de você comprometer 4 GB ao disco. O histórico de chat fica no dispositivo.
Onde fica aquém: Aceleração de GPU fica atrás do MLC no mesmo telefone. Conversas com contexto longo consomem RAM rapidamente em dispositivos com 6 GB.
Preços:
- Gratuito: Código aberto licenciado sob MIT.
- Pago: N/A.
Plataformas: Android 9.0 e superior.
Conclusão: A forma mais amigável de começar para qualquer um novo em quantização GGUF em Android.
3. Layla — Melhor para roleplay e chats de longo contexto
Layla se concentra no público de roleplay e escrita de histórias longas. Vem com modelos de prompt, importações de personagem-card e janelas de contexto padrão maiores ajustadas para manter continuidade de história em muitos turnos. Executa GGUF localmente; um nível pago adiciona entrada de voz e modelos premium.
Onde fica aquém: UI está ocupada. Alguns personagens pré-construídos tendem a temas adultos; o filtro de segurança precisa de ajuste manual para uso familiar.
Preços:
- Gratuito: Chat base com alguns modelos pré-configurados.
- Pago: $9.99 único (Pro) desbloqueia voz, modelos maiores e sincronização em nuvem.
Plataformas: Android 9.0 e superior.
Conclusão: Escolha Layla se o motivo que você quer um modelo local é escrita de ficção que um modelo na nuvem recusaria.
4. Sherpa — Melhor para um shell llama.cpp mínimo
Sherpa é o app para pessoas que já sabem o que querem. Aponte para um arquivo GGUF no cartão SD, defina seu comprimento de contexto e contagem de threads, e pronto. Sem catálogo, sem sincronização, sem detritos.
Onde fica aquém: Sem apoio. Os novatos podem carregar um modelo que não caberá e causar crash do app.
Preços:
- Gratuito: Licença MIT.
- Pago: N/A.
Plataformas: Android 8.0 e superior.
Conclusão: Para usuários avançados que querem um tempo de execução llama.cpp sem wrapper de app de chat.
5. LLMFarm Companion — Melhor para sincronização de modelo entre dispositivos
LLMFarm começou no iOS e tem um companion no Android que espelha o mesmo catálogo e biblioteca de prompt. Útil se você divide tempo entre um iPad e um tablet Android e quer os mesmos personagens e prompts de sistema em ambos.
Onde fica aquém: Menos alternadores de formato que PocketPal. Suporte de GPU em Adreno ainda está se atualizando.
Preços:
- Gratuito: Chat base.
- Pago: $4.99 único remove restrições de tamanho de modelo.
Plataformas: Android 10 e superior.
Conclusão: Escolha este se você já usa LLMFarm no iOS e quer paridade de prompt.
6. ChatterUI — Melhor interface chat multi-modelo
ChatterUI trata cada backend da mesma forma, se você está rodando llama.cpp no telefone, KoboldCpp em um laptop ou Ollama em um servidor doméstico. Mude durante uma conversa de um modelo local pequeno para um remoto maior sem perder o fio da meada.
Onde fica aquém: Configuração pesada no primeiro lançamento. Nenhuma opinião sobre qual modelo escolher, então os iniciantes ficam presos no seletor.
Preços:
- Gratuito: Código aberto GPLv3.
- Pago: N/A.
Plataformas: Android 8.0 e superior.
Download: GitHub Releases
Conclusão: A escolha certa quando o telefone é apenas um de vários lugares onde você executa inferência.
7. Enchanted — Melhor interface para servidor Ollama doméstico
Enchanted não é em si um mecanismo no dispositivo. É um app de chat polido que fala com uma instância Ollama que você executa em um laptop ou servidor doméstico. Na estrada, use um modelo quantizado local em um dos apps acima; em casa, pule para Enchanted para um modelo maior que seu telefone não consegue hospedar.
Onde fica aquém: Precisa de uma máquina em algum lugar rodando Ollama. Requer um túnel ou alcance LAN para uso remoto.
Preços:
- Gratuito: Código aberto MIT.
- Pago: N/A.
Plataformas: Android 9.0 e superior.
Download: GitHub Releases
Conclusão: Combine com qualquer app no dispositivo para os dias quando seu telefone não conseguir caber o modelo que você quer.
Como escolher o certo
- Se você quer os tokens mais rápidos por segundo e consegue viver com um catálogo fixo: escolha MLC Chat.
- Se você quer navegar e baixar modelos GGUF do Hugging Face dentro do app: escolha PocketPal AI.
- Se seu objetivo é escrita de ficção e chats de longo contexto: escolha Layla.
- Se você já conhece llama.cpp e quer um shell mínimo: escolha Sherpa.
- Se você divide tempo entre iOS e Android: escolha LLMFarm Companion.
- Se você quer alternar entre backends locais e remotos durante o chat: escolha ChatterUI.
- Se um servidor Ollama doméstico é seu principal hospedador de modelos: combine Enchanted com um dos acima para dias offline.
Os acrônimos ficam menos assustadores uma vez que você os usa. Uma quantização Q4_K_M de Llama 3.1 8B cabe confortavelmente em qualquer telefone com 8 GB; uma Q8_0 de Phi-3 Mini roda surpreendentemente bem em um com 6 GB. Comece por aí, observe os tokens por segundo, e suba ou desça.
FAQ
O que Q4_K_M realmente significa?
Q4 significa quantização de 4 bits dos pesos do modelo. K se refere a k-quants, um agrupamento mais inteligente introduzido por llama.cpp. M é a variante média, que mistura alguns tensores de 5 bits para qualidade. Na prática: Q4_K_M é o nível “padrão suficientemente bom”.
Quanto de RAM um modelo no dispositivo precisa?
Regra prática: tamanho do arquivo do modelo mais 30% para o tempo de execução e cache de contexto. Um modelo de 4 GB precisa de cerca de 5.5 GB livres. Telefones com 8 GB ou mais de RAM lidam com modelos de parâmetro 7B em Q4; telefones com 6 GB ficam com 3B.
Meu telefone vai superaquecer?
Inferência sustentada em um telefone de médio porte vai sofrer limitação térmica em poucos minutos. Prefira dispositivos mais novos Snapdragon 8 Gen 2/3 ou Tensor G4, e mantenha o telefone fora de uma superfície macia enquanto roda.
Esses apps enviam meus prompts para algum lugar?
Inferência no dispositivo fica no dispositivo. Enchanted e ChatterUI são exceções quando configurados para falar com um backend remoto. Leia os prompts de rede de cada app no primeiro lançamento.
Qual modelo devo começar?
Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, ou Gemma 2 2B são os pontos de partida seguros para um telefone Android moderno. Suba para Llama 3.1 8B se o dispositivo tiver 12 GB de RAM ou mais.