O artigo do XDA sobre o Nvidia Personal AI Router tocou em um ponto sensível: dois PCs por trás de um ponto final, requisições de modelo roteadas por peso e saúde, sem editar arquivos de configuração em cinco aplicativos. A questão é que o lançamento da Nvidia é apenas um sabor de uma categoria que a pilha de código aberto já cobre, e cobre com suporte de modelo mais amplo. Se você tem uma estação de trabalho com uma 4090 e um mini PC rodando Ollama no armário, um proxy que os unifica é a peça que falta.
Testamos sete balanceadores de carga e gateways para inferência local de LLM em 2026. Cada opção fica na frente do Ollama, vLLM, LM Studio, llama.cpp ou uma mistura, expõe um ponto final compatível com OpenAI e lida com roteamento quando um backend está ocupado, offline ou não é a ferramenta certa para o trabalho.
O que procurar em um balanceador de carga de IA local
- Superfície compatível com OpenAI. Cada cliente sério (Open WebUI, Cline, Continue, Aider, Zed) espera
/v1/chat/completions. Se seu roteador fala uma API customizada, você passa o próximo fim de semana corrigindo clientes. - Cobertura de backend. Ollama, vLLM, LM Studio, llama.cpp e SGLang são os engines locais comuns. Cubra todos ou você joga fora o roteador em três meses.
- Verificações de saúde e failover. Rigs locais ficam offline. Um roteador que continua enviando requisições para uma GPU desligada é pior que round-robin.
- Roteamento baseado em custo e capacidade. Nem toda requisição precisa de um modelo 70B. Rotear prompts leves para um modelo local pequeno e reservar o grande para casos difíceis.
- Observabilidade. Logs, latência por modelo e rastreamento de requisições são a diferença entre “é lento” e “o 8B está comendo todo o tráfego porque sempre responde primeiro.”
Comparação rápida
| Aplicativo | Melhor para | Backends | Licença | Código aberto |
|---|---|---|---|---|
| LiteLLM | Proxy universal com 100+ provedores | Qualquer compatível com OpenAI | MIT | Sim |
| Olla | Puro local, pegada minúscula | Ollama, vLLM, LM Studio, SGLang, llama.cpp | Apache 2.0 | Sim |
| Nvidia Personal AI Router | Setups Nvidia em Windows | Backends otimizados Nvidia | Grátis (registro) | Não |
| vLLM | Servimento de modelo único de alto throughput | Engine vLLM | Apache 2.0 | Sim |
| Ollama | Host multimodelo mais simples | Nativo | MIT | Sim |
| LocalAI | Clone OpenAI drop-in com mais modelos de mídia | GGUF, ONNX, diffusers | MIT | Sim |
| Portkey | Gateway corporativo com controles de política | 200+ provedores | AGPL / nível pago | Source-available |
Os 7 melhores aplicativos para balanceamento de carga de inferência local de IA
1. LiteLLM — melhor em geral
LiteLLM roda como um proxy Python ou Rust na frente de seus modelos e entrega um ponto final /v1 que fala OpenAI. Aponte para qualquer mistura de Ollama, vLLM, Anthropic hospedado e OpenAI, e ele fará balanceamento de carga entre eles, retrocederá em 429s, cacheará prompts repetidos e aplicará orçamentos por chave. A reescrita em Rust 2026 empurra o throughput além de 1500 requisições por segundo em um único node, o que é muito mais do que um lab doméstico jamais precisará, mas agradável em um gateway de equipe compartilhada.
Onde fica aquém: O arquivo de configuração cresce rapidamente depois que você adiciona árvores de fallback e níveis de custo. O dashboard é funcional mas nada que você mostraria.
Preço: Grátis e código aberto (MIT). Um nível empresarial pago adiciona SSO e logs de auditoria.
Plataformas: Windows, macOS, Linux, Docker.
Baixar: litellm.ai · GitHub
Conclusão: Se você quer um roteador que cresça do lab doméstico para APIs hospedadas, comece aqui.
2. Olla — melhor opção puramente local
Olla é um proxy LLM propositalmente construído para inferência auto-hospedada. Fala com Ollama, LM Studio, vLLM, llama.cpp, SGLang e LiteLLM em si, descobre modelos em cada backend automaticamente e fica abaixo de 50 MB de memória. Failover entre dois Ollamas é um arquivo YAML de cinco linhas, e as métricas expostas alimentam Prometheus sem plugin.
Onde fica aquém: Sem rastreamento de custo incorporado ou aplicação de orçamento, porque não toca APIs hospedadas. Comunidade menor que a de LiteLLM.
Preço: Grátis e código aberto (Apache 2.0).
Plataformas: Windows, macOS, Linux, Docker. Um único binário estático.
Baixar: thushan.github.io/olla · GitHub
Conclusão: Escolha isso se seu stack inteiro está em hardware que você possui e quer um roteador que inicialize em um segundo.
3. Nvidia Personal AI Router — melhor opção turnkey em hardware Nvidia
Nvidia Personal AI Router é o assunto do artigo do XDA. Vem como um aplicativo Windows que escaneia sua LAN, encontra nodes de inferência baseados em Nvidia e os agrupa atrás de um ponto final local. Roteamento de modelo, streaming e transferência de quantização são tratados dentro do roteador, e os aplicativos cliente do mesmo conjunto (Nvidia ChatRTX e Nvidia AI Workbench) se conectam diretamente.
Onde fica aquém: Focado em Nvidia: rigs Radeon e Intel Arc são cidadãos de segunda classe. O roteador não expõe um ponto final compatível com OpenAI nativamente, então clientes de terceiros precisam de um shim.
Preço: Grátis com conta de desenvolvedor Nvidia.
Plataformas: Windows.
Baixar: nvidia.com/ai-router
Conclusão: Forma mais fácil de juntar dois rigs Nvidia em um ponto final de IA se você nunca sair do ecossistema Nvidia.
4. vLLM — melhor para maximizar uma única GPU poderosa
vLLM não é um roteador por si só, mas seu servidor compatível com OpenAI com batching contínuo e PagedAttention empurra o throughput em uma única GPU muito além do que Ollama pode alcançar por uma margem larga. Em uma configuração de dois nodes, rodar vLLM atrás de LiteLLM ou Olla é o padrão para servir um grande modelo a uma equipe, enquanto backends mais baratos tratam a cauda longa.
Onde fica aquém: Carregamento de modelo mais lento que Ollama; sem fallback somente CPU. Suporte de quantização atrasa llama.cpp.
Preço: Grátis e código aberto (Apache 2.0).
Plataformas: Linux com CUDA, ROCm ou Intel XPU. Windows via WSL2. Suporte Metal macOS é impulsionado pela comunidade.
Conclusão: Use isso como um dos backends para o qual seu roteador direciona trabalho, não como o roteador em si.
5. Ollama — melhor para hospedagem multimodelo simples
Ollama permanece na lista porque a maioria das configurações domésticas já o roda, e sua fila incorporada lida com múltiplas requisições simultâneas razoavelmente bem. Combine com um roteador na frente para alta disponibilidade, ou rode dois Ollamas com Olla para failover de hot spare.
Onde fica aquém: Throughput por GPU atrasa vLLM por 4-8x em cargas em lote. Sem rastreamento de custo, sem inteligência de roteamento.
Preço: Grátis e código aberto (MIT).
Plataformas: Windows, macOS, Linux, Docker.
Baixar: ollama.com · GitHub
Conclusão: O backend confiável, não o roteador. Mantenha e coloque algo mais inteligente na frente.
6. LocalAI — melhor se o roteador também funciona como host de inferência
LocalAI é um único binário que fala a API OpenAI e hospeda LLMs, modelos de embedding, TTS, geração de imagem e speech-to-text. Pode chamar outros backends Ollama ou vLLM nos bastidores, o que o torna decente como tudo-em-um para um lab doméstico de nó único onde você preferiria rodar um processo ao invés de três.
Onde fica aquém: Menos flexível que LiteLLM para setups híbridos locais mais hospedados. Suporte de modelos de mídia significa que o binário é pesado.
Preço: Grátis e código aberto (MIT).
Plataformas: Windows, macOS, Linux, Docker.
Baixar: localai.io · GitHub
Conclusão: Boa escolha se você quer um roteador e um host completo de modelos de mídia na mesma caixa.
7. Portkey — melhor se você precisa de controles de política
Portkey é a opção de nível corporativo. Enfrenta modelos locais e hospedados como LiteLLM faz mas adiciona guardrails, redação de PII e políticas de roteamento por equipe prontos para uso. A versão OSS auto-hospedada cobre os conceitos básicos de roteamento; SSO, auditoria e o dashboard gerenciado ficam atrás do nível pago.
Onde fica aquém: AGPL assusta alguns homelabbers. O mecanismo de política completo é útil apenas se uma equipe se apoia nele.
Preço: Auto-hospedado grátis (AGPL); níveis gerenciados pagos começam em uma modesta taxa mensal por assento.
Plataformas: Docker em qualquer SO host.
Baixar: portkey.ai · GitHub
Conclusão: Excessivo para um lab doméstico solo, tamanho certo para um gateway de equipe pequena.
Como escolher o certo
- Se você quer um roteador que cresça do lab doméstico para APIs hospedadas: LiteLLM.
- Se seu stack inteiro é local e você quer a pegada menor: Olla.
- Se ambos os PCs são Nvidia e você nunca sai do Windows: Nvidia Personal AI Router.
- Se uma equipe pequena precisa de guardrails e política: Portkey.
- Se você quer um roteador que também hospede diffusers e TTS: LocalAI.
- Mantenha Ollama como seu backend confiável e vLLM para a única GPU poderosa.
FAQ
Qual é a diferença entre um balanceador de carga e um engine de inferência?
Um engine de inferência (vLLM, Ollama, llama.cpp) roda o modelo real. Um balanceador de carga ou gateway (LiteLLM, Olla) fica na frente e decide qual engine recebe cada requisição. Você precisa dos dois: um para servir, um para rotear.
Posso fazer balanceamento de carga de modelos locais com uma API hospedada como fallback?
Sim. LiteLLM e Portkey são construídos exatamente para isso. Configure o modelo local primeiro com um peso de custo mais baixo, depois um provedor hospedado como fallback; o roteador usa a API hospedada apenas quando sua GPU está desligada ou sobrecarregada.
Preciso de um roteador se tenho apenas uma GPU?
Não estritamente, mas ainda ajuda. Um roteador te dá um ponto final estável, lógica de retry e observabilidade, então se você trocar Ollama por vLLM depois você não precisa tocar nenhum aplicativo cliente.
O Nvidia Personal AI Router funciona com GPUs AMD ou Intel?
Não oficialmente. Ele alvo hardware Nvidia e CUDA. Para setups mistos, LiteLLM ou Olla tratarão qualquer backend compatível com OpenAI igual independentemente do fabricante.
Qual tem a latência mais baixa?
Olla adiciona menos de 5 ms em uma rede local em testes, graças ao seu core Go. LiteLLM fica por volta de 10-15 ms com o engine Rust em um cache quente. Para a maioria de cargas de chat e coding, ambos são invisíveis ao lado do próprio tempo de decodificação do modelo.