Aplicativos de busca na web com LLM local

A maior limitação de um LLM local não é mais alucinação. É a data limite do treinamento. Pergunte ao Llama 3.1 sobre uma biblioteca lançada seis meses após seu limite e o modelo inventa com segurança chamadas de API que nunca existiram. A solução é a integração de busca na web, e até recentemente isso exigia a API do OpenAI. Agora as ferramentas para adicionar busca em tempo real a um modelo local existem, funcionam e permanecem privadas.

Testamos sete aplicativos que dão a um LLM local acesso à web atual. Alguns são interfaces completas com busca integrada. Alguns são middleware entre um mecanismo de busca e seu endpoint Ollama. Abaixo está o que cada um faz, onde falha e qual combinação funciona melhor para os stacks LLM locais comuns.

O que procurar em uma ferramenta de busca na web para LLM local

A camada de busca na web importa mais do que o modelo por trás dela. Alguns critérios.

Comparação rápida

Aplicativo Melhor para Plataformas Plano gratuito Preço inicial/mês Classificação
Perplexica Interface ao estilo Perplexity Docker Totalmente gratuito Gratuito 4.7
SearXNG Backend de meta-busca privada Docker, Linux Totalmente gratuito Gratuito 4.6
Open WebUI Interface LLM com plugin web Docker Totalmente gratuito Gratuito 4.7
AnythingLLM RAG + agente de navegação web Windows, macOS, Linux Totalmente gratuito Gratuito 4.5
LibreChat Clone do ChatGPT com plugins de busca Docker Totalmente gratuito Gratuito 4.6
LlamaIndex Pipelines web-aware DIY Biblioteca Python Totalmente gratuito Gratuito 4.5
Msty Aplicativo desktop local-first com chat LLM Windows, macOS, Linux Nível gratuito Cerca de $10/mês Pro 4.4

Os aplicativos

1. Perplexica — Melhor clone do Perplexity para LLMs locais

Perplexica reconstrói a UX do Perplexity.ai para modelos locais. Faça uma pergunta, ela busca (via SearXNG por padrão), raspa as páginas principais, as divide e alimenta trechos relevantes ao seu LLM local com um prompt que pede respostas citadas.

A resposta transmite com citações inline que vinculam às páginas de origem. Funciona com Ollama e qualquer endpoint compatível com OpenAI, então llama.cpp com o shim OpenAI também funciona.

Onde falha: A configuração requer Docker mais SearXNG executando lado a lado. O polimento da UI está um pouco atrás do Perplexity comercial.

Preços:

Plataformas: Docker (funciona em qualquer lugar onde Docker funciona)

Baixar: Perplexica

Conclusão: A escolha padrão se você deseja um substituto do Perplexity que funcione localmente. A configuração leva 30 minutos com Docker Compose.

2. SearXNG — Melhor backend de busca privada

SearXNG é um mecanismo de meta-busca que consulta Google, Bing, DuckDuckGo, Brave e dezenas de outras fontes e retorna resultados unificados. Auto-hospede e cada busca de seu stack LLM local se torna anônima para os mecanismos originais.

Todas as ferramentas acima (Perplexica, Open WebUI, LibreChat) suportam SearXNG como backend de busca. Ele fica sob toda a pilha.

Onde falha: O SearXNG autônomo é uma página de busca, não uma ferramenta LLM. Você precisa de uma interface que consuma seus resultados.

Preços:

Plataformas: Docker, Python

Baixar: SearXNG

Conclusão: Instale uma vez e aponte todas as outras ferramentas LLM locais para ele. Remove o problema “qual chave de API preciso”.

3. Open WebUI — Melhor interface LLM completa com busca na web

Open WebUI envia busca na web como plugin. Ative a ferramenta de busca no painel de administração, escolha SearXNG ou uma API paga (Serper, Brave), e todo chat agora pode disparar uma busca quando o modelo a solicitar.

Combinado com RAG de documentos do Open WebUI, autenticação por usuário e suporte multi-modelo, isso cobre a maioria do que um usuário LLM local precisa em uma interface.

Onde falha: O plugin de busca é opt-in por chat por padrão, então usuários de primeira vez não o obtêm automaticamente. Requer uma etapa de configuração adicional.

Preços:

Plataformas: Docker (qualquer host Linux, macOS, Windows)

Baixar: Open WebUI

Conclusão: Melhor escolha se você já executa Open WebUI. Adicionar busca é uma mudança de configuração.

4. AnythingLLM — Melhor para aplicativo desktop com agentes

AnythingLLM é um aplicativo desktop autônomo (não apenas Docker) que funciona em Windows, macOS e Linux. Vem com primitivas de agente, e o agente de busca na web usa SearXNG, Serper ou API do Bing para buscar páginas atuais.

RAG sobre documentos locais fica na mesma interface, então você pode misturar “buscar na web” com “buscar meu cofre Obsidian” em um chat.

Onde falha: O aplicativo desktop é mais pesado que uma UI baseada em navegador. Alguns modos de busca requerem uma chave de API mesmo com o nível gratuito.

Preços:

Plataformas: Windows, macOS, Linux, Docker

Baixar: AnythingLLM

Conclusão: Escolha isso se você deseja um verdadeiro aplicativo desktop em vez de uma aba localhost. Melhor tudo em um para uso pessoal.

5. LibreChat — Melhor para UX ao estilo ChatGPT com plugins de busca

LibreChat clona a interface do ChatGPT e adiciona suporte a plugins. A busca na web vem do plugin Web Browsing integrado, que suporta backends Google, Brave e Serper. Aponte o chat para Ollama e você obtém ChatGPT com acesso web em cima de um modelo local.

A arquitetura do plugin significa que novas ferramentas (calculadora, execução de código, geração de imagens) se instalam sem alterar a interface.

Onde falha: A configuração do plugin é mais pesada que a de Perplexica ou Open WebUI. Requer edição de arquivos JSON.

Preços:

Plataformas: Docker, Node.js

Baixar: LibreChat

Conclusão: Melhor escolha se você especificamente deseja o clone de UI do ChatGPT. O ecossistema de plugins é mais amplo que a maioria das alternativas.

6. LlamaIndex — Melhor para construir seu próprio pipeline web-aware

LlamaIndex é um framework Python, não uma interface. Use quando você deseja um aplicativo personalizado: RAG sobre web + PDF + banco de dados, loops de agente, chamadas de ferramenta, e tudo conectado através de seu endpoint Ollama ou llama.cpp.

A integração de busca na web suporta Google, Bing, DuckDuckGo, Serper, Tavily e mais. Os primitivos de reranking (BM25, cross-encoders) vão além do que as UIs pré-construídas oferecem.

Onde falha: Sem UI. Você escreve o aplicativo.

Preços:

Plataformas: Biblioteca Python

Baixar: LlamaIndex

Conclusão: Escolha isso para qualquer coisa além do que as UIs pré-construídas oferecem. Curva de aprendizado mais íngreme, teto mais alto.

7. Msty — Melhor aplicativo desktop local-first com busca integrada

Msty é um aplicativo desktop de download único que combina UI de chat, gerenciamento de modelo e modo de busca na web integrado. Ative “buscar web” em qualquer chat e Msty raspa resultados e os alimenta em seu prompt.

O instalador de modelo com um clique para modelos Ollama o torna o ponto de partida mais fácil para alguém que nunca tocou Docker ou terminal.

Onde falha: O nível gratuito limita alguns recursos (divisões de modelo múltiplo, espaços de trabalho). A fonte de busca é proprietária.

Preços:

Plataformas: Windows, macOS, Linux

Baixar: Msty

Conclusão: Melhor escolha para um usuário não técnico que deseja um LLM local com acesso na web e não quer tocar em um terminal.

Como escolher o certo

Se você deseja a configuração mais rápida: Msty. Baixe, instale, ative a busca na web.

Se você deseja o substituto mais próximo do Perplexity: Perplexica + SearXNG. Trinta minutos com Docker Compose.

Se você já executa uma interface LLM local: ative a busca na web dentro de Open WebUI, LibreChat ou AnythingLLM. Mais rápido que implantar uma segunda ferramenta.

Se você está construindo aplicativos de IA personalizados: LlamaIndex. Ignore as interfaces completamente.

Se a privacidade é a prioridade: SearXNG no meio, sem APIs de terceiros. Perplexica ou Open WebUI no topo.

FAQ

Qual LLM local lida melhor com respostas aumentadas por busca na web? Llama 3.1 8B ou Qwen 2.5 7B são o mínimo prático para síntese coerente de múltiplas fontes. Abaixo de 7B parâmetros, o modelo luta para reconciliar fontes conflitantes. Acima de 30B, a qualidade melhora marginalmente, mas a demanda de hardware cresce rapidamente.

Preciso de uma chave de API para busca na web? Não. SearXNG mais qualquer uma das interfaces acima funciona sem contas externas. Backends pagos (Serper, Brave API, Tavily) fornecem resultados mais confiáveis por consulta e maior taxa de transferência.

Posso usar isso com LM Studio? LM Studio expõe um endpoint compatível com OpenAI. Perplexica, Open WebUI, LibreChat, AnythingLLM e LlamaIndex se conectam a ele. Aponte-os para http://localhost:1234/v1 e escolha o modelo.

Como o LLM local aumentado por busca na web difere do RAG em documentos locais? RAG em documentos locais pesquisa seus próprios arquivos. Busca na web aumenta com a internet atual. A maioria das ferramentas acima faz ambos no mesmo chat.

Qual é o melhor stack gratuito de LLM local mais busca na web? Ollama executando Llama 3.1 8B, Open WebUI como interface, SearXNG como backend de busca, tudo em Docker. Gratuito para sempre, nenhuma API de terceiros necessária.

Posso executar isso em um laptop com 16GB de RAM? Sim para modelos 7B e 8B na quantização Q4. Modelos maiores querem 32GB ou mais.