Um redator do XDA-Developers recentemente descreveu o cancelamento de uma assinatura Perplexity e ChatGPT após associar um LLM local com Perplexica e SearXNG, e a configuração é mais fácil de replicar do que parece. Um modelo de gama média como Qwen, Llama ou Mistral executando através do Ollama já lida bem com raciocínio e resumo. O que lhe falta é informação fresca da web aberta, e é isso que uma camada de metabusca self-hosted fornece: um recuperador privado que busca e classifica resultados, depois os passa para o modelo citar e sintetizar. O resultado se parece com Perplexity, menos a assinatura e o registro de consultas.
Este resumo aborda os melhores aplicativos para busca de IA self-hosted, desde clones completos do Perplexity até o mecanismo de metabusca abaixo da maioria deles. Cada escolha é executada em um servidor doméstico ou computador desktop de sobra, conecta-se ao Ollama, LM Studio ou qualquer endpoint compatível com OpenAI, e vem com uma imagem Docker para que toda a pilha suba com um comando.
O que procurar em um aplicativo de busca de IA self-hosted
Nem todo projeto de “busca de IA” é realmente construído para isso. Alguns traços separam os que valem a pena executar daqueles que ficam presos em uma demonstração:
- Suporte a modelo local. Tem que conversar com Ollama, LM Studio ou um endpoint genérico compatível com OpenAI, não apenas uma chave de API hospedada.
- Fontes citadas. As respostas devem vincular de volta às páginas de onde extraem, não apresentar texto sintetizado como fato sem rastro.
- Uma verdadeira etapa de reranking. Resultados brutos de busca precisam ser reclassificados ou pontuados por relevância antes de alcançar o modelo, ou as respostas se desviam do tema em consultas ambíguas.
- Configuração Docker de um comando. Um
docker compose upque traz seu próprio backend de metabusca vence uma instalação manual com cinco partes móveis. - Suporte multiusuário. Importa se mais de uma pessoa em casa ou na equipe fará consultas.
- Chamada de ferramentas e plugins. Agentes mais fortes podem encadear uma busca, abrir um resultado e buscar novamente antes de responder.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Licença | Docker | Preço inicial |
|---|---|---|---|---|---|
| Perplexica (Vane) | Clone Perplexity mais próximo | Windows, macOS, Linux | MIT | Sim, imagem oficial | Grátis |
| SearXNG | Apenas camada de metabusca | Windows, macOS, Linux | AGPL-3.0 | Sim, imagem oficial | Grátis |
| Farfalle | Escolhendo seu próprio backend de busca | Windows, macOS, Linux | Apache-2.0 | Sim, arquivo compose | Grátis |
| Morphic | Respostas com UI generativa | Windows, macOS, Linux | Apache-2.0 | Sim, arquivo compose | Grátis |
| Open WebUI | Adicionando busca a uma configuração Ollama existente | Windows, macOS, Linux | BSD-3-Clause (cláusula de branding acima de 50 usuários) | Sim, imagem oficial | Grátis |
| MindSearch | Pesquisa profunda multiagente | Windows, macOS, Linux | Apache-2.0 | Sim, Dockerfile | Grátis |
| LLocalSearch | Agente local totalmente mínimo | Windows, macOS, Linux | Apache-2.0 | Sim, arquivo compose | Grátis |
| AnythingLLM | Busca dentro de um espaço de trabalho RAG mais amplo | Windows, macOS, Linux | MIT | Sim, imagem oficial | Grátis |
Os 8 melhores aplicativos de busca de IA self-hosted para desktop em 2026
1. Perplexica — melhor para o clone Perplexity mais próximo
Perplexica é o projeto em torno do qual o artigo XDA construiu sua configuração: um frontend Next.js e backend API que agrupam uma instância SearXNG privada, então um contêiner Docker fornece uma caixa de busca, uma resposta LLM com citações inline e painéis de imagens e vídeos. Foi renomeado para Vane em março de 2026, embora o repositório GitHub, imagens Docker e comunidade ainda usem o nome Perplexica com o qual foi lançado. Se conecta ao Ollama para modelos locais ou a OpenAI, Anthropic e outros provedores de nuvem quando você quer um backend mais forte para consultas mais difíceis.
Onde fica aquém: A renomeação deixou a documentação e resultados de busca divididos entre nomes antigos e novos, o que torna a solução de problemas um pouco mais confusa do que deveria.
Preço: Grátis e código aberto, sem nível pago.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: A coisa mais próxima de executar Perplexity no hardware que você possui, e o projeto em que toda essa categoria tira suas dicas.
2. SearXNG — melhor para a camada de metabusca sozinha
SearXNG é o mecanismo de metabusca federado que alimenta Perplexica, Farfalle e Morphic sob o capô, e vale a pena executar por conta própria se tudo que você quer é um frontend privado para Google, Bing, DuckDuckGo, Brave e aproximadamente 280 outros serviços de busca sem uma camada de IA. As consultas atingem esses mecanismos a partir do seu servidor, não do seu navegador, então nenhum deles vê seu IP ou cria um perfil a partir de suas buscas. Aponte qualquer um dos aplicativos de busca de IA abaixo para uma instância SearXNG existente em vez de deixá-los executar seus próprios, e você consegue um backend de busca compartilhado para várias ferramentas.
Onde fica aquém: Sem síntese de IA por conta própria. Retorna links classificados, não respostas, a menos que emparelhado com um frontend LLM.
Preço: Grátis e código aberto, sem nível pago.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: A fundação de metabusca sob a maioria desta lista, e o ponto de partida correto se a camada de IA é uma adição posterior, não o primeiro dia.
3. Farfalle — melhor para escolher seu próprio backend de busca
Farfalle é um mecanismo de resposta estilo Perplexity que deixa o provedor de busca a seu critério: SearXNG, Tavily, Serper ou Bing, misturados com modelos locais via Ollama ou modelos de nuvem via LiteLLM. A pilha Next.js e FastAPI vem com um docker-compose.dev.yaml que obtém uma instância funcionando em localhost:3000 a partir de um clone fresco em alguns minutos, e trocar provedores de busca ou modelos é uma mudança de configuração, não uma reconstrução.
Onde fica aquém: A configuração padrão espera pelo menos uma chave de API (um provedor de busca ou um modelo de nuvem) a menos que tudo seja roteado por meio de um par local SearXNG e Ollama, então o caminho sem chave requer um pouco mais de configuração que Perplexica.
Preço: Grátis e código aberto, sem nível pago.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: A escolha para quem quer uma experiência como Perplexica mas com mais controle sobre quais provedores de busca e modelo estão por trás das respostas.
4. Morphic — melhor para respostas com UI generativa
Morphic renderiza respostas como mais do que texto plano: grades de imagens com crédito de fonte, títulos estruturados e componentes inline se constroem junto com a resposta escrita em vez de uma parede de prosa com links na parte inferior. Suporta modos de busca Rápida e Adaptativa, um seletor de modelo em OpenAI, Anthropic, Google, Ollama e qualquer provedor compatível com OpenAI, e vem com PostgreSQL, Redis e SearXNG em seu arquivo Docker Compose, então nenhuma chave de API de busca externa é necessária para começar.
Onde fica aquém: A UI mais rica significa mais partes móveis (Postgres, Redis, SearXNG, o próprio aplicativo) que uma configuração de contêiner único, o que requer mais monitoramento se algo quebrar.
Preço: Grátis e código aberto, sem nível pago.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: O mecanismo de resposta mais bonito desta lista, vale os contêineres extras se uma UI polida e componentizada é tão importante quanto a qualidade da resposta.
5. Open WebUI — melhor para adicionar busca a uma configuração Ollama existente
Open WebUI começou como uma interface de bate-papo para Ollama e APIs compatíveis com OpenAI, e seu toggle de busca web integrado (apoiado por SearXNG ou alguns outros provedores) transforma uma configuração de bate-papo local existente em um mecanismo de resposta sem ter um aplicativo separado. Qualquer pessoa já executando Open WebUI para bate-papo local obtém busca de IA como uma mudança de configuração em vez de uma nova implementação.
Onde fica aquém: Busca é um recurso aparafusado a uma UI de bate-papo, não o objetivo principal do design, então a renderização de citações e classificação de fonte são menos polidas que nos mecanismos de resposta dedicados acima. Implementações servindo 51 ou mais usuários em uma janela móvel de 30 dias devem manter o branding Open WebUI visível sob sua licença atual.
Preço: Grátis e código aberto, sem nível pago; uma licença empresarial separada cobre implementações de marca branca ou em larga escala.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: O caminho de atualização de menor esforço para quem já está executando Open WebUI para bate-papo local e quer busca adicionada por cima.
6. MindSearch — melhor para pesquisa profunda multiagente
MindSearch, construído pela InternLM, divide uma consulta entre dois papéis de agente: um WebPlanner que decompõe a pergunta em subconsultas e constrói um grafo de raciocínio, e um ou mais WebSearchers que executam essas subconsultas e relatam descobertas. Essa estrutura permite trabalhar com mais de 300 páginas de fonte em uma pergunta de pesquisa complexa, muito além do que um aplicativo de busca e resumo de passagem única lida adequadamente. Funciona contra os próprios modelos da InternLM ou GPT-4, e suporta DuckDuckGo, Bing, Brave e Google Serper como backends de busca.
Onde fica aquém: O desenvolvimento desacelerou desde sua refatoração no final de 2024, e a configuração tende para usuários confortáveis configurando um framework de agente em vez de um appliance one-click.
Preço: Grátis e código aberto, sem nível pago.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: A escolha para perguntas de pesquisa verdadeiramente profundas e multi-etapa onde uma única passagem de busca perderia contexto.
7. LLocalSearch — melhor para um agente local totalmente mínimo
LLocalSearch envolve um LLM local em um simples loop de uso de ferramentas: o modelo decide quando buscar, lê o que volta e decide se deve buscar novamente antes de responder, com toda a cadeia visível em um log ao vivo. Não precisa de chaves de API e foi construído para rodar em hardware modesto, o que o tornou uma primeira parada popular para qualquer um testando busca de IA local em uma GPU barata.
Onde fica aquém: GitHub arquivou o repositório em junho de 2026 e o projeto está sem desenvolvimento ativo há mais de um ano, então ainda funciona via Docker mas não receberá correções ou atualizações de compatibilidade de modelo em diante.
Preço: Grátis e código aberto, sem nível pago.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: Ainda funcional e vale a pena tentar pela simplicidade de seu design, mas trate como uma implementação de referência em vez de um driver diário de longo prazo.
8. AnythingLLM — melhor para busca dentro de um espaço de trabalho RAG mais amplo
AnythingLLM é menos um mecanismo de busca dedicado e mais um espaço de trabalho completo: RAG de documentos, agentes de IA e controle de acesso multiusuário, com busca web disponível como uma ferramenta que um agente pode chamar junto com recuperação de documentos. Qualquer pessoa que já quer uma plataforma de bate-papo self-hosted para seus próprios arquivos obtém busca de IA como mais uma capacidade em vez de uma implementação separada, com funções Admin, Manager e Default para uso de casa ou equipe compartilhada.
Onde fica aquém: Busca é uma ferramenta entre várias, não o foco, então não corresponderá ao formato de citações do mecanismo de resposta dedicado ou qualidade de classificação em consultas de busca pura.
Preço: Grátis e código aberto, sem nível pago; um plano hospedado está disponível para quem não quer self-host.
Plataformas: Windows, macOS, Linux (Docker), self-hosted.
Download: GitHub
Conclusão: A escolha certa quando a busca precisa viver ao lado de bate-papo de documentos e agentes em um espaço de trabalho, não isolado.
Como escolher
Se você quer o clone Perplexity mais simples: Perplexica. Um contêiner, um comando, citações e imagens fora da caixa.
Se você quer a camada de metabusca sozinha, sem IA anexada ainda: SearXNG. Execute primeiro, aponte um mecanismo de resposta para ele mais tarde.
Se você quer controle sobre quais provedores de busca e modelo estão por trás das respostas: Farfalle.
Se a interface é tão importante quanto a resposta: Morphic, pela sua UI generativa e grades de imagens com crédito de fonte.
Se Open WebUI já é seu aplicativo de bate-papo local: ative sua busca web integrada em vez de implementar algo novo.
Se a pergunta precisa de pesquisa multi-etapa, multi-fonte: MindSearch, pelo seu design de agente planejador-e-buscador.
Se hardware com orçamento limitado e zero chaves de API são a prioridade, e a estabilidade importa menos que simplicidade: LLocalSearch, com a ressalva de que está arquivado.
Se a busca precisa ficar dentro de um espaço de trabalho de bate-papo de documentos e agentes: AnythingLLM.
Perguntas frequentes
Esses aplicativos funcionam sem conexão à Internet?
Não. O LLM em si pode rodar completamente offline uma vez baixado, mas cada aplicativo nesta lista ainda precisa alcançar a web aberta para buscar resultados de busca atuais. O que permanece local é a inferência do modelo e, dependendo da configuração, a própria consulta, já que uma instância SearXNG self-hosted consulta outros mecanismos de busca em nome do seu servidor em vez de enviar seu IP diretamente.
Quais modelos locais combinam melhor com esses mecanismos de busca?
Um modelo de tamanho médio ajustado para instruções na faixa de 7B a 30B, como uma construção recente de Qwen, Llama ou Mistral, lida bem com síntese pesada de citações em hardware GPU de consumidor. Modelos menores tendem a alucinar em torno de fontes em vez de citá-las com precisão, então vale a pena testar uma consulta em uma resposta conhecida antes de confiar na saída de um modelo leve.
Preciso de uma GPU para executar uma pilha de busca de IA self-hosted?
Não estritamente. O lado de busca e recuperação (SearXNG, o backend do aplicativo) funciona bem na CPU. O LLM é a parte que se beneficia de uma GPU; sem um, espere respostas notavelmente mais lentas, especialmente em modelos maiores, ou aponte o aplicativo para uma API de modelo de nuvem como fallback.
A busca de IA self-hosted é realmente mais privada que Perplexity ou ChatGPT?
Consultas de busca ficam em infraestrutura que você controla em vez de servidores do fornecedor, e nenhum dos aplicativos desta lista envia histórico de conversa para terceiros por padrão. O trade-off é que os mecanismos de busca subjacentes (Google, Bing e o resto) ainda veem as consultas individuais que SearXNG transmite a eles, apenas sem seu IP ou conta.
Mais de uma pessoa pode usar a mesma instância self-hosted?
Alguns desses aplicativos suportam isso nativamente. AnythingLLM e Open WebUI ambos vêm com contas multiusuário baseadas em papel fora da caixa. Outros, incluindo Perplexica, Farfalle e Morphic, foram construídos com uso de usuário único ou pequena casa em mente e precisam de configuração adicional (por exemplo, um proxy reverso com autenticação) antes de expô-lo a um grupo maior com segurança.
O que acontece se um projeto como LLocalSearch deixar de ser mantido?
Um repositório open-source arquivado continua funcionando exatamente como estava no seu último commit; imagens Docker já construídas continuam rodando. O que para são correções para novos bugs, atualizações de compatibilidade para APIs de modelo mais recentes e patches de segurança, então um projeto arquivado é bom para testes ou uso leve mas uma aposta de longo prazo ruim para qualquer coisa dependendo de atualizações contínuas.