MLC Chat executando um LLM quantizado em Android

Melhores apps para executar LLMs quantizados no dispositivo em Android em 2026

Q4_K_M, Q5_K_S, Q8_0. Se essas tags ainda não significam nada, elas explicam por que um modelo de sete bilhões de parâmetros agora cabe dentro de um telefone com 6 GB. A quantização reduz os pesos do modelo de flutuantes de 16 bits para inteiros de 4 bits, encolhendo um modelo de chat de 14 GB para menos de 5 GB e permitindo que seu telefone o execute sem uma conta em uma API na nuvem.

Testamos sete apps em um Pixel 8 e um tablet Snapdragon 8 Gen 2. O que nos importava: quais apps carregavam pesos quantizados GGUF e MLC sem um laptop no meio, quais rodavam offline no modo avião, e quais mantinham uma conversa sem reduzir a velocidade por limitação térmica.

O que procurar em um app LLM no dispositivo

Comparação rápida

App Melhor para Plano gratuito Preço inicial/mês Avaliação
MLC Chat Kernels MLC compilados, melhor taxa de transferência Sim (código aberto) Gratuito 4.4
PocketPal AI Modelos GGUF com catálogo amigável Sim (código aberto) Gratuito 4.6
Layla Chats roleplay e longa contexto Camada gratuita $9.99 único 4.5
Sherpa Shell mínimo llama.cpp Sim (código aberto) Gratuito 4.2
LLMFarm Companion Sincronização de modelo entre dispositivos Sim $4.99 único 4.3
ChatterUI Interface chat multi-modelo Sim (código aberto) Gratuito 4.5
Enchanted Interface para servidor Ollama doméstico Sim (código aberto) Gratuito 4.4

Os apps

1. MLC Chat — Melhor para kernels MLC compilados e melhor taxa de transferência

MLC Chat vem com modelos pré-compilados otimizados para a GPU Adreno ou Mali exata do seu telefone. Essa etapa de compilação é o que permite que um modelo Phi de três bilhões de parâmetros rode a 15+ tokens por segundo em um Pixel 8, aproximadamente o dobro do que um tempo de execução GGUF genérico consegue. O catálogo dentro do app é curto, mas curado: Llama, Phi, Gemma, Mistral, RedPajama.

Onde fica aquém: Sem suporte para arquivos GGUF arbitrários. Se você já tiver um modelo baixado, não consegue carregá-lo aqui sem recompilar para MLC.

Preços:

Plataformas: Android 8.0 e superior.

Download: Aptoide

Conclusão: Escolha MLC Chat quando o máximo de tokens por segundo importa e você consegue viver com o catálogo fixo.

2. PocketPal AI — Melhor para modelos GGUF com catálogo amigável

PocketPal AI carrega qualquer GGUF para o qual você aponte. A busca no app navega pelo Hugging Face sem mudar para um navegador, e a tela de download mostra nível de quantização, tamanho e uma estimativa aproximada de tokens por segundo para seu dispositivo antes de você comprometer 4 GB ao disco. O histórico de chat fica no dispositivo.

Onde fica aquém: Aceleração de GPU fica atrás do MLC no mesmo telefone. Conversas com contexto longo consomem RAM rapidamente em dispositivos com 6 GB.

Preços:

Plataformas: Android 9.0 e superior.

Download: Google Play

Conclusão: A forma mais amigável de começar para qualquer um novo em quantização GGUF em Android.

3. Layla — Melhor para roleplay e chats de longo contexto

Layla se concentra no público de roleplay e escrita de histórias longas. Vem com modelos de prompt, importações de personagem-card e janelas de contexto padrão maiores ajustadas para manter continuidade de história em muitos turnos. Executa GGUF localmente; um nível pago adiciona entrada de voz e modelos premium.

Onde fica aquém: UI está ocupada. Alguns personagens pré-construídos tendem a temas adultos; o filtro de segurança precisa de ajuste manual para uso familiar.

Preços:

Plataformas: Android 9.0 e superior.

Download: Google Play

Conclusão: Escolha Layla se o motivo que você quer um modelo local é escrita de ficção que um modelo na nuvem recusaria.

4. Sherpa — Melhor para um shell llama.cpp mínimo

Sherpa é o app para pessoas que já sabem o que querem. Aponte para um arquivo GGUF no cartão SD, defina seu comprimento de contexto e contagem de threads, e pronto. Sem catálogo, sem sincronização, sem detritos.

Onde fica aquém: Sem apoio. Os novatos podem carregar um modelo que não caberá e causar crash do app.

Preços:

Plataformas: Android 8.0 e superior.

Download: F-Droid

Conclusão: Para usuários avançados que querem um tempo de execução llama.cpp sem wrapper de app de chat.

5. LLMFarm Companion — Melhor para sincronização de modelo entre dispositivos

LLMFarm começou no iOS e tem um companion no Android que espelha o mesmo catálogo e biblioteca de prompt. Útil se você divide tempo entre um iPad e um tablet Android e quer os mesmos personagens e prompts de sistema em ambos.

Onde fica aquém: Menos alternadores de formato que PocketPal. Suporte de GPU em Adreno ainda está se atualizando.

Preços:

Plataformas: Android 10 e superior.

Download: Google Play

Conclusão: Escolha este se você já usa LLMFarm no iOS e quer paridade de prompt.

6. ChatterUI — Melhor interface chat multi-modelo

ChatterUI trata cada backend da mesma forma, se você está rodando llama.cpp no telefone, KoboldCpp em um laptop ou Ollama em um servidor doméstico. Mude durante uma conversa de um modelo local pequeno para um remoto maior sem perder o fio da meada.

Onde fica aquém: Configuração pesada no primeiro lançamento. Nenhuma opinião sobre qual modelo escolher, então os iniciantes ficam presos no seletor.

Preços:

Plataformas: Android 8.0 e superior.

Download: GitHub Releases

Conclusão: A escolha certa quando o telefone é apenas um de vários lugares onde você executa inferência.

7. Enchanted — Melhor interface para servidor Ollama doméstico

Enchanted não é em si um mecanismo no dispositivo. É um app de chat polido que fala com uma instância Ollama que você executa em um laptop ou servidor doméstico. Na estrada, use um modelo quantizado local em um dos apps acima; em casa, pule para Enchanted para um modelo maior que seu telefone não consegue hospedar.

Onde fica aquém: Precisa de uma máquina em algum lugar rodando Ollama. Requer um túnel ou alcance LAN para uso remoto.

Preços:

Plataformas: Android 9.0 e superior.

Download: GitHub Releases

Conclusão: Combine com qualquer app no dispositivo para os dias quando seu telefone não conseguir caber o modelo que você quer.

Como escolher o certo

Os acrônimos ficam menos assustadores uma vez que você os usa. Uma quantização Q4_K_M de Llama 3.1 8B cabe confortavelmente em qualquer telefone com 8 GB; uma Q8_0 de Phi-3 Mini roda surpreendentemente bem em um com 6 GB. Comece por aí, observe os tokens por segundo, e suba ou desça.

FAQ

O que Q4_K_M realmente significa?

Q4 significa quantização de 4 bits dos pesos do modelo. K se refere a k-quants, um agrupamento mais inteligente introduzido por llama.cpp. M é a variante média, que mistura alguns tensores de 5 bits para qualidade. Na prática: Q4_K_M é o nível “padrão suficientemente bom”.

Quanto de RAM um modelo no dispositivo precisa?

Regra prática: tamanho do arquivo do modelo mais 30% para o tempo de execução e cache de contexto. Um modelo de 4 GB precisa de cerca de 5.5 GB livres. Telefones com 8 GB ou mais de RAM lidam com modelos de parâmetro 7B em Q4; telefones com 6 GB ficam com 3B.

Meu telefone vai superaquecer?

Inferência sustentada em um telefone de médio porte vai sofrer limitação térmica em poucos minutos. Prefira dispositivos mais novos Snapdragon 8 Gen 2/3 ou Tensor G4, e mantenha o telefone fora de uma superfície macia enquanto roda.

Esses apps enviam meus prompts para algum lugar?

Inferência no dispositivo fica no dispositivo. Enchanted e ChatterUI são exceções quando configurados para falar com um backend remoto. Leia os prompts de rede de cada app no primeiro lançamento.

Qual modelo devo começar?

Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, ou Gemma 2 2B são os pontos de partida seguros para um telefone Android moderno. Suba para Llama 3.1 8B se o dispositivo tiver 12 GB de RAM ou mais.