OpenAI cortou os preços da API GPT-5.6 em até 80% na semana passada, Anthropic e Google revisaram suas tabelas de preços em julho, e Groq e Cerebras estão lançando novos planos a cada mês. Se seu produto cobra gastos entre quatro ou cinco provedores de modelo, uma solicitação descontrolada pode silenciosamente custar mais do que um servidor pequeno antes da fatura chegar. Esses são os sete melhores aplicativos para rastreamento de custos de API de IA em desktop em 2026, testados em um pipeline de produção real que se estende por Claude, GPT-5, Gemini e um endpoint Llama auto-hospedado.
Cada ferramenta abaixo proxifica suas chamadas (para ver cada solicitação e resposta), ou envolve os SDKs do modelo para registrar o uso, e cada uma tem um painel de desktop ou web que você pode fixar. Os preços estão em USD em agosto de 2026.
O que procurar em um rastreador de custos de API
Seis critérios que separam as ferramentas úteis dos painéis que ninguém lê.
- Custo por chamada, não por token. Você quer dólares por fluxo de trabalho, não tokens por modelo.
- Multiprovedor. OpenAI, Anthropic, Google, Groq, Together, mais endpoints compatíveis com OpenAI auto-hospedados.
- Marcar por usuário, recurso, ambiente. Para que um pico possa ser rastreado até um cliente ou caminho de código.
- Alertas de orçamento. Um ping no Slack em 80% do limite mensal, não uma surpresa na fatura.
- Propriedade dos dados. Auto-hospedável ou política de retenção documentada.
- Proxy de baixa latência. Se uma ferramenta fica entre seu aplicativo e o modelo, a latência adicionada deve ser inferior a 100ms.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Recurso destacado |
|---|---|---|---|---|
| OpenRouter | Roteamento multi-modelo mais faturamento | Web | Grátis (taxas por chamada) | Uma chave de API em 250+ modelos |
| Helicone | Proxy com painel rápido | Web, auto-hospedado | 10K solicitações/mês | Latência de proxy abaixo de 25ms |
| Langfuse | Observabilidade de código aberto | Auto-hospedado ou nuvem | Grátis auto-hospedado | Árvore de rastreamento completa por solicitação |
| LangSmith | Nativo LangChain | Web | Nível dev gratuito | Melhor para aplicativos LangChain |
| Portkey | Gateway empresarial | Web, auto-hospedado | 10K solicitações/mês | Balanceamento de carga e failover |
| PromptLayer | Análise no nível do prompt | Web | Nível gratuito | Teste A/B de versões de prompt |
| Braintrust | Avaliação mais custo | Web | Nível gratuito | Vincula gasto a pontuações de avaliação |
| W&B Weave | Nativo da equipe ML | Web | Nível gratuito | Cabe nas cadeiras W&B existentes |
1. OpenRouter, melhor para roteamento multi-modelo mais faturamento
OpenRouter é um gateway com ponto final único que fica em frente a 250+ modelos em todos os provedores. Você preenche um saldo, usa uma chave de API, e OpenRouter cobra a taxa por token do modelo mais uma pequena margem. O painel mostra gasto exato por chave, por modelo, por dia, e você pode limitar a taxa de cada chave.
Onde falha: para registro puro (não roteamento) não é a ferramenta; você quer Helicone ou Langfuse. Além disso, a latência do prompt depende de qual provedor você roteou para.
Preços:
- Grátis para se inscrever.
- Taxas de pagamento conforme o uso por chamada, aproximadamente preço da lista do modelo + 5%.
- Empresarial: personalizado.
Plataformas: painel web; a API é agnóstica em relação ao idioma (Windows, macOS, Linux).
Download: openrouter.ai.
Resumo: a escolha se você deseja uma fatura em todos os provedores de modelo com um painel de gasto ao vivo.
2. Helicone, melhor proxy com painel rápido
Helicone envolve suas chamadas OpenAI/Anthropic/etc existentes com um cabeçalho proxy (uma linha de código) e cada solicitação registra em um painel ao vivo com custo, latência e carga útil. Auto-hospedável via Docker.
Onde falha: o plano gratuito é limitado a 10.000 solicitações por mês, que uma ferramenta interna ocupada esgota em dias.
Preços:
- Grátis: 10K solicitações/mês.
- Pro: $20/usuário/mês, 100K solicitações.
- Empresarial: personalizado.
- Auto-hospedado: grátis (código aberto, Apache 2.0).
Plataformas: painel web; auto-hospedado em qualquer host Docker.
Download: helicone.ai ou github.com/Helicone/helicone.
Resumo: a escolha se você quer o proxy com menos fricção que oferece um painel rápido e pode ser auto-hospedado depois.
3. Langfuse, melhor observabilidade de código aberto
Langfuse é a plataforma de observabilidade LLM de código aberto. Captura traços completos (uma cadeia de chamadas de modelo mais chamadas de ferramenta por sessão), mais custo, mais pontuações de execuções de avaliação. Auto-hospedado em Docker, ou Langfuse Cloud para uma instância gerenciada.
Onde falha: você escreve mais instrumentação do que com Helicone. O SDK de rastreamento é pequeno, mas não é “adicionar um cabeçalho”.
Preços:
- Grátis: totalmente código aberto (MIT), auto-hospedado.
- Cloud Hobby: nível gratuito.
- Cloud Pro: $59/mês.
- Empresarial: personalizado.
Plataformas: auto-hospedado em Docker; painel web na nuvem.
Download: langfuse.com ou github.com/langfuse/langfuse.
Resumo: a escolha se a propriedade de dados importa e você quer uma árvore de rastreamento real por sessão de usuário.
4. LangSmith, melhor para aplicativos LangChain
LangSmith é a observabilidade de primeira parte do LangChain. Se seu aplicativo já está construído no LangChain (Python ou JS), LangSmith se conecta com duas variáveis de ambiente e rastreia cada cadeia, agente e chamada de ferramenta com custo.
Onde falha: é melhor quando o aplicativo subjacente executa LangChain. Projetos não-LangChain ainda podem usar o SDK, mas você perde a fiação automática.
Preços:
- Desenvolvedor: grátis, 5K rastreamentos/mês.
- Plus: $39/usuário/mês.
- Empresarial: personalizado.
Plataformas: painel web.
Download: smith.langchain.com.
Resumo: a escolha se a base de código é nativa do LangChain.
5. Portkey, melhor gateway empresarial
Portkey fica entre seu aplicativo e cada provedor de LLM, equilibra carga entre modelos, volta para limites de taxa e registra custo por usuário. É a coisa mais próxima de um gateway de API empresarial para LLM, com tentativas, cache semântico e redação de PII integrados.
Onde falha: quanto mais você usa seus recursos, mais você depende do proxy. Auto-hospedagem está disponível, mas a carga de operações não é zero.
Preços:
- Grátis: 10K solicitações/mês.
- Produção: $49/mês.
- Empresarial: personalizado.
- Auto-hospedado: disponível sob solicitação.
Plataformas: painel web, auto-hospedado em Docker.
Download: portkey.ai.
Resumo: a escolha se você quer cache, failover e resiliência de limite de taxa além do rastreamento de custos.
6. PromptLayer, melhor para análise no nível do prompt
PromptLayer organiza chamadas por versão de prompt. Se você testa A/B duas versões do mesmo prompt, PromptLayer mostra custo por versão, latência por versão e taxa de sucesso por versão.
Onde falha: conjunto de recursos mais reduzido do que Helicone ou Langfuse; a força é a análise de prompt, não rastreamento de solicitação completa.
Preços:
- Grátis: 5K solicitações/mês.
- Pro: $20/usuário/mês.
- Empresarial: personalizado.
Plataformas: painel web.
Download: promptlayer.com.
Resumo: a escolha se o fluxo de trabalho é “iterar em prompts e escolher o vencedor por custo e latência”.
7. Braintrust, melhor para vincular gasto a pontuações de avaliação
Braintrust combina um framework de avaliação (defina uma suíte de testes, pontue saídas do modelo) com rastreamento de custos. Cada execução de avaliação mostra não apenas precisão, mas dólares gastos para alcançá-la, para que você possa trocar um modelo menor por um maior em números reais.
Onde falha: você investe tempo escrevendo avaliações para obter o valor total. Não é um logger plug-and-play.
Preços:
- Grátis: 1K spans/mês.
- Pro: $249/mês.
- Empresarial: personalizado.
Plataformas: painel web.
Download: braintrust.dev.
Resumo: a escolha se você já executa avaliações estruturadas e quer custo por benchmark.
Como escolher o correto
- Se você quer a cobertura de modelo mais ampla em uma fatura: OpenRouter.
- Se você quer um proxy de duas linhas com um painel ao vivo: Helicone.
- Se propriedade de dados e auto-hospedagem importam: Langfuse.
- Se a base de código é nativa do LangChain: LangSmith.
- Se você precisa de tentativas, failover e cache em um gateway: Portkey.
- Se a iteração de prompt é o fluxo de trabalho: PromptLayer.
- Se custo por benchmark é a métrica: Braintrust.
FAQ
Qual é a margem de custo do OpenRouter? Aproximadamente 5% acima do preço da lista do provedor, mais uma taxa de stripe em recargas. Em cargas de trabalho de baixo volume, vale a pena para faturamento unificado.
Posso auto-hospedar um rastreador de custos de IA? Sim. Langfuse, Helicone e Portkey publicam imagens Docker auto-hospedáveis. Langfuse é o mais permissivo (MIT); Helicone é Apache 2.0.
Qual rastreador adiciona menos latência? O proxy de Helicone mede menos de 25ms na maioria das regiões. O logger assincronizado de Langfuse adiciona latência zero de bloqueio porque as gravações são fire-and-forget.
Como devo orçar para uma fatura de LLM imprevisível? Defina um limite mensal no painel do seu provedor (OpenAI e Anthropic suportam), mais um alerta suave em 80% no seu rastreador de custos. Combine com Portkey ou OpenRouter para voltar para um modelo mais barato quando o limite se aproximar.
Qual é o rastreador de custos de IA mais barato? Langfuse auto-hospedado é gratuito. O nível gratuito de Helicone em 10K solicitações funciona para pequenos projetos. OpenRouter não tem taxa mensal, apenas por chamada.