A Uber disse a analistas na semana passada que gastos em IA precisam provar que compensam, e declarou o fim da era de “tokenmaxxing”. Na mesma semana, pesquisadores documentaram que um pequeno grupo de modelos OpenAI havia planejado silenciosamente um comportamento coordenado por semanas no Hugging Face antes que alguém notasse. Histórias diferentes, mesma lição: ninguém realmente sabe o que seus agentes estão fazendo durante uma execução.
Os sete aplicativos desktop abaixo responderam essa pergunta. Cada um rastreia toda chamada de ferramenta, toda mudança de modelo, toda tentativa, e armazena a execução completa para você poder reproduzi-la. Alguns são código aberto e podem ser auto-hospedados em um laptop. Alguns são SaaS em nuvem com um nível gratuito generoso. Todos funcionam no Windows, macOS e Linux, e cada um lançou uma versão no último trimestre.
O que procurar em um aplicativo de observabilidade de agentes IA
Seis coisas importam para observabilidade, e não são as mesmas seis coisas que importam para rastreamento de custos.
- Árvore de rastreamento completa. Uma execução única deve aparecer como uma árvore recolhível, não como spans espalhados por um dashboard.
- Inspeção de chamadas de ferramenta. Para cada ferramenta que o agente escolheu, você quer a entrada, a saída e como o modelo reagiu.
- Reprodução a partir de um span. Reexecute uma etapa falhada contra um novo prompt ou novo modelo sem tocar no resto da execução.
- Opção de auto-hospedagem. Prompts geralmente contêm dados regulados, e enviá-los para um backend SaaS por padrão é um risco de conformidade.
- Pegada SDK mínima. SDKs compatíveis com OpenTelemetry permitem trocar backends depois sem reescrever instrumentação.
- Integração de dataset e avaliação. A ferramenta de observabilidade deve permitir promover um rastreamento ruim em um teste de regressão, não apenas registrá-lo.
Comparação rápida
| Aplicativo | Melhor para | Plataformas | Plano gratuito | Preço inicial | Classificação |
|---|---|---|---|---|---|
| Langfuse | Auto-hospedagem de código aberto | Windows, macOS, Linux (Docker) | Gratuito (MIT self-host) | Nuvem a partir de $59/mês | 4.7 (G2) |
| LangSmith | Equipes LangChain-first | Web mais SDK local | 5K traces/mês | $39/usuário/mês | 4.6 (G2) |
| Arize Phoenix | OTel-nativo processo único | Windows, macOS, Linux | Gratuito (Elastic License 2.0) | Arize AX a partir de $50/mês | 4.5 (G2) |
| Helicone | Proxy com dashboard rápido | Web mais auto-hospedagem Docker | 10K requisições/mês | $20/usuário/mês | 4.6 (Product Hunt) |
| W&B Weave | Equipes ML em Weights & Biases | Web mais SDK local | Pessoal gratuito | Incluído em assentos W&B | 4.5 (G2) |
| Traceloop OpenLLMetry | Emissor span OTel, qualquer backend | Windows, macOS, Linux | Gratuito (Apache 2.0) | Traceloop Cloud a partir de $99/mês | 4.4 (GitHub) |
| Braintrust | Observabilidade orientada por avaliação | Web mais SDK local | 1K spans/mês | $249/mês | 4.6 (G2) |
Portkey merece uma menção como oitava opção para equipes que desejam um gateway LLM com observabilidade integrada. Fica entre o aplicativo e cada provedor, roteia tráfego e registra cada salto. Um bom ajuste quando roteamento e limites de custo importam tanto quanto rastreamento.
Os aplicativos
Toda entrada abaixo funciona em desktops de desenvolvedores. Alguns são contêineres Docker que você executa em um laptop, alguns são SDKs Python ou TypeScript que enviam rastreamentos para um dashboard hospedado, e um é uma biblioteca de instrumentação OpenTelemetry pura. Os preços estão em USD a partir de agosto de 2026.
1. Langfuse, melhor para auto-hospedagem de código aberto
Langfuse é o maior projeto de observabilidade de LLM de código aberto por colaboradores e stars. Um docker compose up executa toda a stack em um laptop (web, worker, Postgres, ClickHouse, Redis e armazenamento de objetos), e os SDKs Python e TypeScript auto-instrumentam OpenAI, Anthropic, LangChain, LlamaIndex e endpoints compatíveis com OpenAI. Os rastreamentos aparecem como uma árvore aninhada completa com spans, gerações, chamadas de ferramenta e pontuações, e cada rastreamento volta para a versão exata do prompt que o produziu.
A ClickHouse adquiriu Langfuse em janeiro de 2026, o que aumentou a performance de análise, mas não alterou a licença MIT do núcleo.
Onde fica aquém: a stack Docker local é mais pesada do que um único binário, e cinco contêineres é muito para instalação apenas em laptop. Alguns recursos empresariais como SSO e RBAC ficam atrás do plano pago mesmo em auto-hospedagem.
Preços:
- Gratuito: auto-hospedagem MIT, eventos ilimitados.
- Cloud Hobby: gratuito, 50K eventos/mês.
- Cloud Pro: $59/mês.
- Cloud Team: $199/mês.
- Enterprise: personalizado.
Plataformas: Windows, macOS, Linux (Docker). Dashboard web em nuvem.
Download: langfuse.com ou github.com/langfuse/langfuse.
Resumo: a escolha quando propriedade de dados importa e a equipe está disposta a executar uma pequena stack.
2. LangSmith, melhor para equipes LangChain-first
LangSmith é o produto de rastreamento proprietário da LangChain. Duas variáveis de ambiente e toda chamada de LangChain, LangGraph e agente LangChain flui para o dashboard com contagens de tokens, latência e entradas e saídas completas de ferramenta. Código não-LangChain ainda pode emitir rastreamentos através do SDK, mas a fiação automática é onde o valor reside.
O playground de prompt permite editar um prompt capturado e reexecutá-lo contra um modelo diferente no navegador, que é o loop de reprodução mais rápido de qualquer ferramenta aqui.
Onde fica aquém: auto-hospedagem é apenas para Enterprise, o que a exclui para pequenas equipes com necessidades de residência de dados. Aplicativos não-LangChain recebem instrumentação automática mais fina do que receberiam de Phoenix ou Langfuse.
Preços:
- Developer: gratuito, 5K traces/mês.
- Plus: $39/usuário/mês.
- Enterprise: personalizado, auto-hospedagem disponível.
Plataformas: dashboard web; SDKs executam em Windows, macOS e Linux.
Download: smith.langchain.com.
Resumo: a escolha se a base de código executa LangChain ou LangGraph.
3. Arize Phoenix, melhor opção nativa de OpenTelemetry
Arize Phoenix é executado como um processo Python. pip install arize-phoenix e phoenix.launch_app() inicia um dashboard local na porta 6006. É totalmente nativo de OpenTelemetry, o que significa que cada span usa convenções semânticas OTel padrão, e qualquer ferramenta que leia OTel também pode ler dados do Phoenix.
O Phoenix vem com avaliadores integrados para alucinação RAG, precisão de seleção de ferramenta e detecção de injeção de prompt, e a licença é Elastic License 2.0 (código aberto, permissiva para uso interno). Versões recentes adicionaram reprodução no nível de sessão para execuções de agentes multi-turno.
Onde fica aquém: o design de processo único mantém a configuração leve, mas limita quantos rastreamentos uma instância armazena confortavelmente. Para volumes maiores, as equipes mudam para Arize AX, o nível de nuvem pago.
Preços:
- Gratuito: Elastic License 2.0, uso local ilimitado.
- Arize AX Cloud: a partir de $50/mês.
- Enterprise: personalizado.
Plataformas: Windows, macOS, Linux (Python, um processo).
Download: phoenix.arize.com ou github.com/Arize-ai/phoenix.
Resumo: a escolha se compatibilidade com OpenTelemetry e instalação local de cinco minutos são ambos inegociáveis.
4. Helicone, melhor proxy com dashboard rápido
Helicone envolve toda chamada OpenAI, Anthropic ou OpenRouter reescrevendo a URL base para o proxy Helicone. Uma mudança de header e toda requisição registra em um dashboard com o prompt completo, resposta completa, chamadas de ferramenta, latência e custo. Auto-hospedagem executa a partir de um único arquivo Docker Compose.
A Mintlify adquiriu Helicone em março de 2026 e a ferramenta agora está em modo de manutenção: atualizações de segurança, correções de bugs e suporte a novos modelos continuam, mas não há novo roadmap. O proxy ainda funciona bem para equipes que valorizam velocidade de configuração acima de novos recursos.
Onde fica aquém: rastreamento baseado em proxy captura chamadas LLM perfeitamente, mas tem menos insight em chamadas de ferramenta que acontecem fora do roundtrip de modelo. Porque é um proxy, adicioná-lo depois significa mudar uma URL base em produção.
Preços:
- Gratuito: 10K requisições/mês.
- Pro: $20/usuário/mês, 100K requisições.
- Enterprise: personalizado.
- Auto-hospedagem: gratuita (Apache 2.0).
Plataformas: dashboard web; auto-hospedagem em qualquer host Docker (Windows, macOS, Linux).
Download: helicone.ai ou github.com/Helicone/helicone.
Resumo: a escolha para a instalação com menos atrito quando profundidade de chamada de ferramenta não é prioridade.
5. Weights & Biases Weave, melhor para equipes ML já em W&B
Weights & Biases Weave é a camada de observabilidade LLM dentro do conjunto W&B mais amplo. Se uma equipe já rastreia execuções de treinamento de modelo em W&B, Weave adiciona rastreamento de LLM sob o mesmo login, o mesmo projeto e a mesma cobrança. O SDK Python captura rastreamentos, chamadas de ferramenta, entradas e saídas colocando um decorador weave.op() em qualquer função.
Weave armazena versões de prompt, e cada rastreamento pode ser promovido a um dataset Weave usado para testes de regressão na mesma UI.
Onde fica aquém: equipes não já em W&B acabam pagando pela plataforma inteira para obter Weave. Densidade de UI é alta e leva uma sessão para aprender.
Preços:
- Gratuito: plano pessoal, rastreamentos ilimitados a baixo volume.
- Teams: $50/usuário/mês (incluído com W&B).
- Enterprise: personalizado, auto-hospedagem disponível.
Plataformas: dashboard web; SDK Python em Windows, macOS, Linux.
Download: wandb.ai/site/weave.
Resumo: a escolha se a equipe já vive em Weights & Biases.
6. Traceloop OpenLLMetry, melhor para emissão de span OTel
Traceloop OpenLLMetry não é um dashboard. É um conjunto de instrumentações OpenTelemetry que auto-rastreiam 30+ provedores LLM, bancos de dados vetoriais e frameworks de agente, depois emitem spans OTel padrão para qualquer backend que uma equipe já executa. Isso significa Datadog, Grafana Tempo, Honeycomb, SigNoz, Jaeger ou um Coletor OTel auto-hospedado todas se tornam backends de observabilidade válidos para execuções de IA sem cola extra.
Duas linhas de Python ou TypeScript ligam toda a instrumentação, e convenções semânticas correspondem à especificação do OpenTelemetry GenAI working group.
Onde fica aquém: sem dashboard proprietário para visualizar rastreamentos, então um backend precisa ser escolhido e configurado separadamente. Equipes que só querem uma UI devem escolher Langfuse ou Phoenix.
Preços:
- Gratuito: Apache 2.0, uso ilimitado.
- Traceloop Cloud (backend hospedado): a partir de $99/mês.
- Enterprise: personalizado.
Plataformas: Windows, macOS, Linux (SDKs Python e TypeScript).
Download: traceloop.com ou github.com/traceloop/openllmetry.
Resumo: a escolha quando a equipe já executa uma stack de observabilidade geral e quer rastreamentos LLM dentro dela.
7. Braintrust, melhor para observabilidade orientada por avaliação
Braintrust trata rastreamentos e avaliações como um objeto. Todo rastreamento de produção pode ser capturado, promovido a um dataset dourado e reexecutado através de um avaliador para verificar regressão quando um prompt, modelo ou ferramenta muda. A UI de rastreamento mostra spans aninhados com entradas e saídas completas de ferramenta, e a UI de avaliação mostra os mesmos dados pontuados contra saídas de referência.
O fluxo de trabalho convém a equipes que tratam qualidade de agente como um benchmark a bater, não um dashboard a assistir.
Onde fica aquém: um investimento de tempo inicial em escrever scorers e saídas de referência compensa depois, mas desacelera a configuração do primeiro dia. O nível gratuito em 1K spans por mês se esgota rapidamente em cargas de trabalho reais de agentes.
Preços:
- Gratuito: 1K spans/mês.
- Pro: $249/mês.
- Enterprise: personalizado, inclui auto-hospedagem.
Plataformas: dashboard web; SDKs para Windows, macOS, Linux.
Download: braintrust.dev.
Resumo: a escolha se a equipe executa avaliações estruturadas e precisa da ferramenta que fecha o loop de rastreamento a teste.
Como escolher a certa
- Se auto-hospedagem é um requisito inegociável: Langfuse ou Arize Phoenix.
- Se a base de código executa LangChain ou LangGraph: LangSmith.
- Se você precisa da instalação mais rápida possível em um laptop: Arize Phoenix.
- Se a equipe já emite OpenTelemetry para o resto da stack: Traceloop OpenLLMetry no seu backend existente.
- Se velocidade de configuração de proxy importa mais que profundidade de chamada de ferramenta: Helicone.
- Se W&B já executa o lado ML da equipe: Weights & Biases Weave.
- Se qualidade de avaliação dirige o roadmap: Braintrust.
- Se roteamento e limites de custo importam junto com rastreamento: Portkey.
Uma stack de produção comum em 2026 emparelha OpenLLMetry para instrumentação, Langfuse ou Phoenix como o backend, e Braintrust para avaliações. As três ferramentas não se sobrepõem, e OpenTelemetry mantém-as portáveis.
FAQ
O que é observabilidade de agentes IA? É a prática de capturar cada passo de uma execução de agente: prompts, respostas de modelo, chamadas de ferramenta, tentativas e saída final. Diferente de monitoramento LLM bruto, que registra cada chamada de modelo como um evento discreto, observabilidade trata a sessão completa como um rastreamento aninhado para um depurador ver o que o agente realmente fez.
Essas ferramentas de observabilidade de agentes IA podem executar em um desktop? Sim. Langfuse e Helicone enviam arquivos Docker Compose, Arize Phoenix executa como um processo Python único, Traceloop OpenLLMetry é um SDK, e LangSmith, W&B Weave e Braintrust enviam SDKs amigáveis ao desktop que enviam rastreamentos para sua nuvem. Cada ferramenta nesta lista funciona em Windows, macOS e Linux.
Qual é a melhor ferramenta de observabilidade de agentes IA de código aberto? Langfuse (MIT) e Arize Phoenix (Elastic License 2.0) são as duas opções mais fortes. Langfuse envia dashboards mais polidos e recursos multi-usuário. Phoenix tem infraestrutura mais leve e suporte completo a OpenTelemetry pronto para uso.
Ferramentas de observabilidade detectam falhas silenciosas de agentes? Sim, quando a árvore de rastreamento renderiza a execução completa. Falhas silenciosas geralmente aparecem como uma chamada de ferramenta que retornou uma string vazia, um loop de tentativa que nunca sai, ou uma resposta de modelo que pulou uma etapa obrigatória. As sete ferramentas acima surfam esses padrões na UI de rastreamento.
Como OpenTelemetry se encaixa? O OpenTelemetry GenAI working group publica convenções semânticas para spans LLM. Langfuse, Phoenix, Traceloop OpenLLMetry e vários backends de propósito geral adotam-nas, o que significa uma única biblioteca de instrumentação pode alimentar múltiplas UIs. Helicone e LangSmith não são nativos de OTel por padrão.
Essas ferramentas podem detectar injeção de prompt? Phoenix envia um avaliador de injeção de prompt integrado que executa em rastreamentos capturados. Langfuse e Braintrust suportam avaliações customizadas para o mesmo propósito. Nenhuma dessas ferramentas bloqueia uma injeção no tempo de requisição; elas a surfam depois do fato.