
O post do XDA que caiu nas primeiras páginas ressaltou um ponto que muitos usuários do Obsidian estavam testando silenciosamente: um telefone Android moderno com 8 ou 12 GB de RAM pode executar um modelo de 3 bilhões de parâmetros em velocidade legível, completamente offline, e emparelhado com Obsidian, transforma o cofre em algo entre um diário e um segundo cérebro pesquisável. Sem ida à nuvem, sem contas por token, sem sinal necessário em um avião ou viagem de metrô.
Testamos 7 aplicativos Android que tornam esse emparelhamento funcional na prática. Cada um abaixo executa o modelo no dispositivo, conecta-se a um cofre Obsidian armazenado no telefone e permanece útil sem conexão de rede.
O que procurar
- Inferência no dispositivo. Se o aplicativo chama uma API, não é a ferramenta que estamos testando.
- Modelos razoáveis. Q4-quantizado 3B ou 7B é o ponto ideal; qualquer coisa maior causa swap.
- Acesso ao cofre. Acesso direto ao sistema de arquivos do cofre Obsidian é melhor que copiar-colar sempre.
- Velocidade de prompt. Menos de 15 tokens por segundo é inutilizável para qualquer coisa mais longa que uma frase.
- Comportamento da bateria. Uma geração que leva dois minutos a 30% de CPU está bem; uma que leva dez minutos a 100% não está.
- Padrões sensatos. Templates, busca ciente de tags e histórico de chat que sobrevive ao fechamento do aplicativo.
Comparação rápida
| Aplicativo | Melhor para | Plano gratuito | Recurso de destaque | Avaliação |
|---|---|---|---|---|
| Obsidian | O cofre em si, no telefone | Sim | Mesmo cofre em desktop e mobile com plugins locais | 4,7 estrelas no Aptoide |
| MLC Chat | Inferência mais rápida no dispositivo para chat | Sim (código aberto) | Modelos 3B e 7B acelerados por Vulkan em velocidade razoável | Apenas sideload |
| PocketPal AI | Melhor rampa de entrada para iniciantes em LLM local | Sim (código aberto) | Baixa GGUFs do Hugging Face dentro do aplicativo | 4,4 estrelas |
| Layla | Chat com RAG local sobre qualquer arquivo | Nível gratuito | Executa um modelo pequeno sobre suas notas sem configuração | 4,3 estrelas |
| Ollama in Termux | Servidor Ollama completo no telefone, para usuários avançados | Sim (código aberto) | Mesma API que o desktop, então plugins só funcionam | Apenas sideload |
| Smart Composer (plugin Obsidian) | Acesso a modelo local do Obsidian mobile | Sim (código aberto) | Fala com qualquer endpoint compatível com OpenAI, incluindo Ollama local | Plugin gratuito |
| Text Generator (plugin Obsidian) | Prompts com template contra modelos locais | Sim (código aberto) | Transforma qualquer nota em um prompt com variáveis | Plugin gratuito |
Os 7 melhores aplicativos para Obsidian com LLM local no Android
1. Obsidian — melhor porque tudo abaixo é executado contra seu cofre
Obsidian no Android carrega o mesmo cofre Markdown que o desktop, sincroniza através de Obsidian Sync, Syncthing ou um repositório Git auto-hospedado, e executa a maioria dos plugins que não requerem uma API de navegador. Plugins locais significam que a camada de IA permanece no telefone mesmo quando o cofre está em outro lugar.
Onde ele falha: Plugins da comunidade que assumem um ambiente de desktop falham silenciosamente. Usuários do iCloud têm que contar com Obsidian Sync ou Working Copy, pois Android não vê iCloud.
Preços:
- Gratuito: aplicativo completo com cofres locais
- Pago: Obsidian Sync (opcional) para sincronização de cofre criptografada
Plataformas: Android, iOS, Windows, macOS, Linux
Download: obsidian.md — também disponível em Aptoide e Google Play
Conclusão: Escolha Obsidian primeiro, porque cada plugin de IA aqui tem como alvo um cofre no telefone.
2. MLC Chat — melhor velocidade de inferência no dispositivo
MLC Chat fornece modelos compilados pelo projeto MLC LLM para execução na GPU do telefone via Vulkan. Um modelo 3B como Phi-3.5-mini gera a mais de 20 tokens por segundo em um Snapdragon 8 Gen 3, e um 7B Q4 quantizado é utilizável em telefones topo de linha. Chats vivem localmente, nenhuma conta necessária.
Onde ele falha: Apenas sideload, o catálogo de modelos é menor que o PocketPal, e adicionar um modelo personalizado requer uma etapa de compilação no desktop.
Preços:
- Gratuito: código aberto sob Apache 2.0
- Pago: nenhum
Plataformas: Android (sideload APK)
Download: llm.mlc.ai
Conclusão: Escolha MLC Chat quando você quer a geração local mais rápida no telefone e está confortável com um APK sideload.
3. PocketPal AI — melhor rampa inicial para pessoas novas em LLMs locais
PocketPal AI é a forma mais amigável de entrar na estrada de modelos locais. Instale o aplicativo, navegue por um conjunto selecionado de modelos GGUF do Hugging Face, toque para baixar e comece a conversar. Templates cobrem a maioria das famílias de modelos fora da caixa, então um usuário pela primeira vez não está editando chat_template JSON na tela do telefone.
Onde ele falha: Inferência apenas CPU via llama.cpp, então as velocidades são menores que MLC Chat no mesmo hardware. Acesso ao cofre é copiar-colar a menos que você o combine com um plugin Obsidian.
Preços:
- Gratuito: código aberto sob MIT
- Pago: nenhum
Plataformas: Android, iOS
Download: Google Play
Conclusão: Escolha PocketPal se esta é a sua primeira vez rodando um modelo em um telefone.
4. Layla — melhor quando o chat precisa ver suas notas
Layla executa pequenos modelos localmente e coloca uma leve etapa de recuperação aumentada em cima, então um prompt pode fazer referência a notas ou PDFs que você aponta. Para um usuário Obsidian, isto significa “resumir as notas da última semana” funciona sem nenhum trabalho de plugin, contanto que o cofre esteja em uma pasta que Layla pode ler.
Onde ele falha: A qualidade do RAG em um modelo pequeno é inconsistente. O nível gratuito limita o tamanho do modelo; o nível pago o remove. O polimento da UI fica atrás do PocketPal.
Preços:
- Nível gratuito com modelos limitados
- Pago: atualização única desbloqueia modelos maiores
Plataformas: Android, iOS
Download: Google Play
Conclusão: Escolha Layla se o objetivo é “responder perguntas sobre minhas notas” e você não quer construir o pipeline você mesmo.
5. Ollama in Termux — melhor configuração de usuário avançado que espelha o desktop
Instalar Ollama dentro do Termux dá ao telefone o mesmo servidor HTTP que é executado no desktop, na interface loopback. Qualquer plugin Obsidian que fale com Ollama então conversa com ele diretamente. A bateria é mais pesada porque Termux não sai graciosamente, mas o desempenho supera a maioria dos executores GUI no mesmo telefone.
Onde ele falha: Termux da Play Store está desatualizado; sideload do F-Droid ou build oficial do GitHub. Permissões de serviço em primeiro plano precisam de cuidado, e aceleração térmica pode prejudicar gerações longas.
Preços:
- Gratuito: código aberto
- Pago: nenhum
Plataformas: Android (Termux)
Download: ollama.com com Termux
Conclusão: Escolha isto se você já está confortável em Termux e quer a experiência de desktop Ollama no telefone.
6. Smart Composer — melhor plugin Obsidian para apontar para um modelo local
Smart Composer é o plugin da comunidade que transforma um chat dentro do Obsidian em uma conversa com qualquer endpoint compatível com OpenAI, incluindo Ollama local ou LM Studio rodando no mesmo telefone via Termux, ou em um servidor doméstico na LAN. Prompts podem @-mencionar notas, pastas e tags, então um prompt “reescreva este parágrafo no tom das notas diárias do mês passado” tem contexto real.
Onde ele falha: O plugin ainda assume que você pode alcançar um servidor, então se o telefone estiver offline e não houver nenhum servidor local rodando, ele não faz nada.
Preços:
- Gratuito: código aberto sob MIT
- Pago: nenhum
Plataformas: Android, iOS, Windows, macOS, Linux (dentro de Obsidian)
Download: github.com/glowingjade/obsidian-smart-composer
Conclusão: Escolha Smart Composer como a ponte entre Obsidian e o modelo, seja esse modelo rodando no telefone ou no seu servidor doméstico.
7. Text Generator — melhor plugin para templates de prompt
Text Generator trata notas como templates. Envolva uma variável, adicione um prompt do sistema, e executar o template em qualquer nota preenche os espaços reservados e envia o resultado para o modelo configurado. Funciona contra Ollama local, LM Studio ou provedores hospedados, e a biblioteca de templates no fórum da comunidade é grande.
Onde ele falha: A sintaxe leva uma tarde para aprender. Depurar um template que falhou em mobile é mais doloroso que no desktop.
Preços:
- Gratuito: código aberto sob GPLv3
- Pago: nenhum
Plataformas: Android, iOS, Windows, macOS, Linux (dentro de Obsidian)
Download: text-gen.com
Conclusão: Escolha Text Generator se você quer templates de prompt reutilizáveis que transformem uma nota em uma ação de IA repetível.
Como escolher
Se você ainda não tem um cofre no telefone, instale Obsidian primeiro e sincronize.
Se você quer a geração local mais rápida e está confortável com um APK sideload, execute MLC Chat.
Se esta é a sua primeira vez tentando modelos locais em um telefone, instale PocketPal AI e escolha um modelo 3B.
Se o chat precisa ver suas notas sem um pipeline manual, tente Layla com a pasta do cofre compartilhada.
Se você já mora em Termux, instale Ollama lá e deixe cada plugin Obsidian apontar para localhost.
Para trazer o modelo para Obsidian em si, adicione Smart Composer como a superfície de chat.
Para prompts com template repetíveis em notas, adicione também Text Generator.
FAQ
Qual é o menor telefone que pode executar um modelo útil?
Um telefone com 8 GB de RAM das últimas duas gerações de topo executará um modelo 3B em velocidade útil. Um telefone com 12 GB de RAM abre quants 7B Q4. Abaixo de 6 GB, o SO continua swappando o modelo e as velocidades caem no precipício.
Com qual modelo devo começar?
Phi-3.5-mini e Llama-3.2-3B são ambos bons padrões para um telefone. Ambos cabem abaixo de 3 GB em Q4, geram coerentemente e sabem conhecimento geral suficiente para ser útil. Suba para um 7B como Qwen2.5-7B ou Mistral-7B em um dispositivo topo de linha.
Executar o modelo vai destruir minha bateria?
Gerações curtas de algumas centenas de tokens estão bem. Execuções de agentes longos, pipelines RAG que re-codificam um grande cofre ou uso contínuo em primeiro plano vão drenar um telefone normal em algumas horas. Trate o modelo local como um assistente de forma curta, não um serviço de fundo.
Obsidian mobile pode chamar um modelo rodando no meu desktop?
Sim. Aponte Smart Composer para o IP local do seu desktop e porta Ollama sobre sua rede doméstica. Adicione Tailscale ou WireGuard se você quer que a mesma conexão funcione quando você está longe de casa. O telefone permanece privado; o modelo apenas está em outro lugar.