A maior limitação de um LLM local não é mais alucinação. É a data limite do treinamento. Pergunte ao Llama 3.1 sobre uma biblioteca lançada seis meses após seu limite e o modelo inventa com segurança chamadas de API que nunca existiram. A solução é a integração de busca na web, e até recentemente isso exigia a API do OpenAI. Agora as ferramentas para adicionar busca em tempo real a um modelo local existem, funcionam e permanecem privadas.
Testamos sete aplicativos que dão a um LLM local acesso à web atual. Alguns são interfaces completas com busca integrada. Alguns são middleware entre um mecanismo de busca e seu endpoint Ollama. Abaixo está o que cada um faz, onde falha e qual combinação funciona melhor para os stacks LLM locais comuns.
O que procurar em uma ferramenta de busca na web para LLM local
A camada de busca na web importa mais do que o modelo por trás dela. Alguns critérios.
- Fonte de busca. SearXNG (meta-busca, privada), API do Bing, API Brave Search ou Google raspado. Algumas ferramentas funcionam com todas; algumas o trancam.
- Chunking e reranking. Resultados de busca brutos confundem a maioria dos modelos locais. Boas ferramentas dividem os melhores resultados, os incorporam, reordenam por relevância e alimentam apenas os melhores trechos no prompt.
- Qualidade da citação. A resposta deve dizer de quais URLs ela foi extraída. Links de citação ao estilo Perplexity são o padrão ouro.
- Compatibilidade com Ollama ou llama.cpp. Algumas ferramentas assumem a API do OpenAI. A compatibilidade com Ollama é agora padrão, mas verifique.
- Streaming. Esperar que busca + recuperação + geração sejam concluídas antes de mostrar algo estraga a UX. O streaming deve começar no momento em que os tokens estão prontos.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Preço inicial/mês | Classificação |
|---|---|---|---|---|---|
| Perplexica | Interface ao estilo Perplexity | Docker | Totalmente gratuito | Gratuito | 4.7 |
| SearXNG | Backend de meta-busca privada | Docker, Linux | Totalmente gratuito | Gratuito | 4.6 |
| Open WebUI | Interface LLM com plugin web | Docker | Totalmente gratuito | Gratuito | 4.7 |
| AnythingLLM | RAG + agente de navegação web | Windows, macOS, Linux | Totalmente gratuito | Gratuito | 4.5 |
| LibreChat | Clone do ChatGPT com plugins de busca | Docker | Totalmente gratuito | Gratuito | 4.6 |
| LlamaIndex | Pipelines web-aware DIY | Biblioteca Python | Totalmente gratuito | Gratuito | 4.5 |
| Msty | Aplicativo desktop local-first com chat LLM | Windows, macOS, Linux | Nível gratuito | Cerca de $10/mês Pro | 4.4 |
Os aplicativos
1. Perplexica — Melhor clone do Perplexity para LLMs locais
Perplexica reconstrói a UX do Perplexity.ai para modelos locais. Faça uma pergunta, ela busca (via SearXNG por padrão), raspa as páginas principais, as divide e alimenta trechos relevantes ao seu LLM local com um prompt que pede respostas citadas.
A resposta transmite com citações inline que vinculam às páginas de origem. Funciona com Ollama e qualquer endpoint compatível com OpenAI, então llama.cpp com o shim OpenAI também funciona.
Onde falha: A configuração requer Docker mais SearXNG executando lado a lado. O polimento da UI está um pouco atrás do Perplexity comercial.
Preços:
- Gratuito: Open source
- Pago: Nenhum
Plataformas: Docker (funciona em qualquer lugar onde Docker funciona)
Baixar: Perplexica
Conclusão: A escolha padrão se você deseja um substituto do Perplexity que funcione localmente. A configuração leva 30 minutos com Docker Compose.
2. SearXNG — Melhor backend de busca privada
SearXNG é um mecanismo de meta-busca que consulta Google, Bing, DuckDuckGo, Brave e dezenas de outras fontes e retorna resultados unificados. Auto-hospede e cada busca de seu stack LLM local se torna anônima para os mecanismos originais.
Todas as ferramentas acima (Perplexica, Open WebUI, LibreChat) suportam SearXNG como backend de busca. Ele fica sob toda a pilha.
Onde falha: O SearXNG autônomo é uma página de busca, não uma ferramenta LLM. Você precisa de uma interface que consuma seus resultados.
Preços:
- Gratuito: Open source
- Pago: Nenhum
Plataformas: Docker, Python
Baixar: SearXNG
Conclusão: Instale uma vez e aponte todas as outras ferramentas LLM locais para ele. Remove o problema “qual chave de API preciso”.
3. Open WebUI — Melhor interface LLM completa com busca na web
Open WebUI envia busca na web como plugin. Ative a ferramenta de busca no painel de administração, escolha SearXNG ou uma API paga (Serper, Brave), e todo chat agora pode disparar uma busca quando o modelo a solicitar.
Combinado com RAG de documentos do Open WebUI, autenticação por usuário e suporte multi-modelo, isso cobre a maioria do que um usuário LLM local precisa em uma interface.
Onde falha: O plugin de busca é opt-in por chat por padrão, então usuários de primeira vez não o obtêm automaticamente. Requer uma etapa de configuração adicional.
Preços:
- Gratuito: Open source
- Pago: Nenhum
Plataformas: Docker (qualquer host Linux, macOS, Windows)
Baixar: Open WebUI
Conclusão: Melhor escolha se você já executa Open WebUI. Adicionar busca é uma mudança de configuração.
4. AnythingLLM — Melhor para aplicativo desktop com agentes
AnythingLLM é um aplicativo desktop autônomo (não apenas Docker) que funciona em Windows, macOS e Linux. Vem com primitivas de agente, e o agente de busca na web usa SearXNG, Serper ou API do Bing para buscar páginas atuais.
RAG sobre documentos locais fica na mesma interface, então você pode misturar “buscar na web” com “buscar meu cofre Obsidian” em um chat.
Onde falha: O aplicativo desktop é mais pesado que uma UI baseada em navegador. Alguns modos de busca requerem uma chave de API mesmo com o nível gratuito.
Preços:
- Gratuito: Aplicativo desktop, todos os recursos
- Pago: Cerca de $50/mês nível Cloud para hospedado
Plataformas: Windows, macOS, Linux, Docker
Baixar: AnythingLLM
Conclusão: Escolha isso se você deseja um verdadeiro aplicativo desktop em vez de uma aba localhost. Melhor tudo em um para uso pessoal.
5. LibreChat — Melhor para UX ao estilo ChatGPT com plugins de busca
LibreChat clona a interface do ChatGPT e adiciona suporte a plugins. A busca na web vem do plugin Web Browsing integrado, que suporta backends Google, Brave e Serper. Aponte o chat para Ollama e você obtém ChatGPT com acesso web em cima de um modelo local.
A arquitetura do plugin significa que novas ferramentas (calculadora, execução de código, geração de imagens) se instalam sem alterar a interface.
Onde falha: A configuração do plugin é mais pesada que a de Perplexica ou Open WebUI. Requer edição de arquivos JSON.
Preços:
- Gratuito: Open source
- Pago: Nenhum
Plataformas: Docker, Node.js
Baixar: LibreChat
Conclusão: Melhor escolha se você especificamente deseja o clone de UI do ChatGPT. O ecossistema de plugins é mais amplo que a maioria das alternativas.
6. LlamaIndex — Melhor para construir seu próprio pipeline web-aware
LlamaIndex é um framework Python, não uma interface. Use quando você deseja um aplicativo personalizado: RAG sobre web + PDF + banco de dados, loops de agente, chamadas de ferramenta, e tudo conectado através de seu endpoint Ollama ou llama.cpp.
A integração de busca na web suporta Google, Bing, DuckDuckGo, Serper, Tavily e mais. Os primitivos de reranking (BM25, cross-encoders) vão além do que as UIs pré-construídas oferecem.
Onde falha: Sem UI. Você escreve o aplicativo.
Preços:
- Gratuito: Open source (MIT)
- Pago: Nenhum (LlamaCloud gerenciado existe separadamente)
Plataformas: Biblioteca Python
Baixar: LlamaIndex
Conclusão: Escolha isso para qualquer coisa além do que as UIs pré-construídas oferecem. Curva de aprendizado mais íngreme, teto mais alto.
7. Msty — Melhor aplicativo desktop local-first com busca integrada
Msty é um aplicativo desktop de download único que combina UI de chat, gerenciamento de modelo e modo de busca na web integrado. Ative “buscar web” em qualquer chat e Msty raspa resultados e os alimenta em seu prompt.
O instalador de modelo com um clique para modelos Ollama o torna o ponto de partida mais fácil para alguém que nunca tocou Docker ou terminal.
Onde falha: O nível gratuito limita alguns recursos (divisões de modelo múltiplo, espaços de trabalho). A fonte de busca é proprietária.
Preços:
- Gratuito: Pessoal, recursos principais
- Pago: Cerca de $10/mês Pro, $50 vitalício
Plataformas: Windows, macOS, Linux
Baixar: Msty
Conclusão: Melhor escolha para um usuário não técnico que deseja um LLM local com acesso na web e não quer tocar em um terminal.
Como escolher o certo
Se você deseja a configuração mais rápida: Msty. Baixe, instale, ative a busca na web.
Se você deseja o substituto mais próximo do Perplexity: Perplexica + SearXNG. Trinta minutos com Docker Compose.
Se você já executa uma interface LLM local: ative a busca na web dentro de Open WebUI, LibreChat ou AnythingLLM. Mais rápido que implantar uma segunda ferramenta.
Se você está construindo aplicativos de IA personalizados: LlamaIndex. Ignore as interfaces completamente.
Se a privacidade é a prioridade: SearXNG no meio, sem APIs de terceiros. Perplexica ou Open WebUI no topo.
FAQ
Qual LLM local lida melhor com respostas aumentadas por busca na web? Llama 3.1 8B ou Qwen 2.5 7B são o mínimo prático para síntese coerente de múltiplas fontes. Abaixo de 7B parâmetros, o modelo luta para reconciliar fontes conflitantes. Acima de 30B, a qualidade melhora marginalmente, mas a demanda de hardware cresce rapidamente.
Preciso de uma chave de API para busca na web? Não. SearXNG mais qualquer uma das interfaces acima funciona sem contas externas. Backends pagos (Serper, Brave API, Tavily) fornecem resultados mais confiáveis por consulta e maior taxa de transferência.
Posso usar isso com LM Studio?
LM Studio expõe um endpoint compatível com OpenAI. Perplexica, Open WebUI, LibreChat, AnythingLLM e LlamaIndex se conectam a ele. Aponte-os para http://localhost:1234/v1 e escolha o modelo.
Como o LLM local aumentado por busca na web difere do RAG em documentos locais? RAG em documentos locais pesquisa seus próprios arquivos. Busca na web aumenta com a internet atual. A maioria das ferramentas acima faz ambos no mesmo chat.
Qual é o melhor stack gratuito de LLM local mais busca na web? Ollama executando Llama 3.1 8B, Open WebUI como interface, SearXNG como backend de busca, tudo em Docker. Gratuito para sempre, nenhuma API de terceiros necessária.
Posso executar isso em um laptop com 16GB de RAM? Sim para modelos 7B e 8B na quantização Q4. Modelos maiores querem 32GB ou mais.