LiteLLM

O artigo do XDA sobre o Nvidia Personal AI Router tocou em um ponto sensível: dois PCs por trás de um ponto final, requisições de modelo roteadas por peso e saúde, sem editar arquivos de configuração em cinco aplicativos. A questão é que o lançamento da Nvidia é apenas um sabor de uma categoria que a pilha de código aberto já cobre, e cobre com suporte de modelo mais amplo. Se você tem uma estação de trabalho com uma 4090 e um mini PC rodando Ollama no armário, um proxy que os unifica é a peça que falta.

Testamos sete balanceadores de carga e gateways para inferência local de LLM em 2026. Cada opção fica na frente do Ollama, vLLM, LM Studio, llama.cpp ou uma mistura, expõe um ponto final compatível com OpenAI e lida com roteamento quando um backend está ocupado, offline ou não é a ferramenta certa para o trabalho.

O que procurar em um balanceador de carga de IA local

Comparação rápida

Aplicativo Melhor para Backends Licença Código aberto
LiteLLM Proxy universal com 100+ provedores Qualquer compatível com OpenAI MIT Sim
Olla Puro local, pegada minúscula Ollama, vLLM, LM Studio, SGLang, llama.cpp Apache 2.0 Sim
Nvidia Personal AI Router Setups Nvidia em Windows Backends otimizados Nvidia Grátis (registro) Não
vLLM Servimento de modelo único de alto throughput Engine vLLM Apache 2.0 Sim
Ollama Host multimodelo mais simples Nativo MIT Sim
LocalAI Clone OpenAI drop-in com mais modelos de mídia GGUF, ONNX, diffusers MIT Sim
Portkey Gateway corporativo com controles de política 200+ provedores AGPL / nível pago Source-available

Os 7 melhores aplicativos para balanceamento de carga de inferência local de IA

1. LiteLLM — melhor em geral

LiteLLM roda como um proxy Python ou Rust na frente de seus modelos e entrega um ponto final /v1 que fala OpenAI. Aponte para qualquer mistura de Ollama, vLLM, Anthropic hospedado e OpenAI, e ele fará balanceamento de carga entre eles, retrocederá em 429s, cacheará prompts repetidos e aplicará orçamentos por chave. A reescrita em Rust 2026 empurra o throughput além de 1500 requisições por segundo em um único node, o que é muito mais do que um lab doméstico jamais precisará, mas agradável em um gateway de equipe compartilhada.

Onde fica aquém: O arquivo de configuração cresce rapidamente depois que você adiciona árvores de fallback e níveis de custo. O dashboard é funcional mas nada que você mostraria.

Preço: Grátis e código aberto (MIT). Um nível empresarial pago adiciona SSO e logs de auditoria.

Plataformas: Windows, macOS, Linux, Docker.

Baixar: litellm.ai · GitHub

Conclusão: Se você quer um roteador que cresça do lab doméstico para APIs hospedadas, comece aqui.

2. Olla — melhor opção puramente local

Olla é um proxy LLM propositalmente construído para inferência auto-hospedada. Fala com Ollama, LM Studio, vLLM, llama.cpp, SGLang e LiteLLM em si, descobre modelos em cada backend automaticamente e fica abaixo de 50 MB de memória. Failover entre dois Ollamas é um arquivo YAML de cinco linhas, e as métricas expostas alimentam Prometheus sem plugin.

Onde fica aquém: Sem rastreamento de custo incorporado ou aplicação de orçamento, porque não toca APIs hospedadas. Comunidade menor que a de LiteLLM.

Preço: Grátis e código aberto (Apache 2.0).

Plataformas: Windows, macOS, Linux, Docker. Um único binário estático.

Baixar: thushan.github.io/olla · GitHub

Conclusão: Escolha isso se seu stack inteiro está em hardware que você possui e quer um roteador que inicialize em um segundo.

3. Nvidia Personal AI Router — melhor opção turnkey em hardware Nvidia

Nvidia Personal AI Router é o assunto do artigo do XDA. Vem como um aplicativo Windows que escaneia sua LAN, encontra nodes de inferência baseados em Nvidia e os agrupa atrás de um ponto final local. Roteamento de modelo, streaming e transferência de quantização são tratados dentro do roteador, e os aplicativos cliente do mesmo conjunto (Nvidia ChatRTX e Nvidia AI Workbench) se conectam diretamente.

Onde fica aquém: Focado em Nvidia: rigs Radeon e Intel Arc são cidadãos de segunda classe. O roteador não expõe um ponto final compatível com OpenAI nativamente, então clientes de terceiros precisam de um shim.

Preço: Grátis com conta de desenvolvedor Nvidia.

Plataformas: Windows.

Baixar: nvidia.com/ai-router

Conclusão: Forma mais fácil de juntar dois rigs Nvidia em um ponto final de IA se você nunca sair do ecossistema Nvidia.

4. vLLM — melhor para maximizar uma única GPU poderosa

vLLM não é um roteador por si só, mas seu servidor compatível com OpenAI com batching contínuo e PagedAttention empurra o throughput em uma única GPU muito além do que Ollama pode alcançar por uma margem larga. Em uma configuração de dois nodes, rodar vLLM atrás de LiteLLM ou Olla é o padrão para servir um grande modelo a uma equipe, enquanto backends mais baratos tratam a cauda longa.

Onde fica aquém: Carregamento de modelo mais lento que Ollama; sem fallback somente CPU. Suporte de quantização atrasa llama.cpp.

Preço: Grátis e código aberto (Apache 2.0).

Plataformas: Linux com CUDA, ROCm ou Intel XPU. Windows via WSL2. Suporte Metal macOS é impulsionado pela comunidade.

Baixar: vllm.ai · GitHub

Conclusão: Use isso como um dos backends para o qual seu roteador direciona trabalho, não como o roteador em si.

5. Ollama — melhor para hospedagem multimodelo simples

Ollama permanece na lista porque a maioria das configurações domésticas já o roda, e sua fila incorporada lida com múltiplas requisições simultâneas razoavelmente bem. Combine com um roteador na frente para alta disponibilidade, ou rode dois Ollamas com Olla para failover de hot spare.

Onde fica aquém: Throughput por GPU atrasa vLLM por 4-8x em cargas em lote. Sem rastreamento de custo, sem inteligência de roteamento.

Preço: Grátis e código aberto (MIT).

Plataformas: Windows, macOS, Linux, Docker.

Baixar: ollama.com · GitHub

Conclusão: O backend confiável, não o roteador. Mantenha e coloque algo mais inteligente na frente.

6. LocalAI — melhor se o roteador também funciona como host de inferência

LocalAI é um único binário que fala a API OpenAI e hospeda LLMs, modelos de embedding, TTS, geração de imagem e speech-to-text. Pode chamar outros backends Ollama ou vLLM nos bastidores, o que o torna decente como tudo-em-um para um lab doméstico de nó único onde você preferiria rodar um processo ao invés de três.

Onde fica aquém: Menos flexível que LiteLLM para setups híbridos locais mais hospedados. Suporte de modelos de mídia significa que o binário é pesado.

Preço: Grátis e código aberto (MIT).

Plataformas: Windows, macOS, Linux, Docker.

Baixar: localai.io · GitHub

Conclusão: Boa escolha se você quer um roteador e um host completo de modelos de mídia na mesma caixa.

7. Portkey — melhor se você precisa de controles de política

Portkey é a opção de nível corporativo. Enfrenta modelos locais e hospedados como LiteLLM faz mas adiciona guardrails, redação de PII e políticas de roteamento por equipe prontos para uso. A versão OSS auto-hospedada cobre os conceitos básicos de roteamento; SSO, auditoria e o dashboard gerenciado ficam atrás do nível pago.

Onde fica aquém: AGPL assusta alguns homelabbers. O mecanismo de política completo é útil apenas se uma equipe se apoia nele.

Preço: Auto-hospedado grátis (AGPL); níveis gerenciados pagos começam em uma modesta taxa mensal por assento.

Plataformas: Docker em qualquer SO host.

Baixar: portkey.ai · GitHub

Conclusão: Excessivo para um lab doméstico solo, tamanho certo para um gateway de equipe pequena.

Como escolher o certo

FAQ

Qual é a diferença entre um balanceador de carga e um engine de inferência?

Um engine de inferência (vLLM, Ollama, llama.cpp) roda o modelo real. Um balanceador de carga ou gateway (LiteLLM, Olla) fica na frente e decide qual engine recebe cada requisição. Você precisa dos dois: um para servir, um para rotear.

Posso fazer balanceamento de carga de modelos locais com uma API hospedada como fallback?

Sim. LiteLLM e Portkey são construídos exatamente para isso. Configure o modelo local primeiro com um peso de custo mais baixo, depois um provedor hospedado como fallback; o roteador usa a API hospedada apenas quando sua GPU está desligada ou sobrecarregada.

Preciso de um roteador se tenho apenas uma GPU?

Não estritamente, mas ainda ajuda. Um roteador te dá um ponto final estável, lógica de retry e observabilidade, então se você trocar Ollama por vLLM depois você não precisa tocar nenhum aplicativo cliente.

O Nvidia Personal AI Router funciona com GPUs AMD ou Intel?

Não oficialmente. Ele alvo hardware Nvidia e CUDA. Para setups mistos, LiteLLM ou Olla tratarão qualquer backend compatível com OpenAI igual independentemente do fabricante.

Qual tem a latência mais baixa?

Olla adiciona menos de 5 ms em uma rede local em testes, graças ao seu core Go. LiteLLM fica por volta de 10-15 ms com o engine Rust em um cache quente. Para a maioria de cargas de chat e coding, ambos são invisíveis ao lado do próprio tempo de decodificação do modelo.