Physical AI agent body apps

Um robô ESP32 impresso em 3D que digita junto com o agente de IA vivendo no seu laptop é uma novidade. É também uma demonstração de um padrão real: um microcontrolador pequeno como corpo, uma máquina maior como cérebro, e um par de ferramentas de código aberto conectando-as. O sino que toca quando a tarefa termina é o mesmo evento de chamada de ferramenta LLM disparado em um pino GPIO.

Analisamos sete aplicativos que tornam esse padrão realizável em um fim de semana. Dois são ambientes de firmware para o microcontrolador, um é a camada de orquestração que a maioria dos auto-hospedadores já executa, um é a framework de agente que transforma chamadas de LLM em ações de dispositivo, e três são ferramentas de suporte para voz, scripts e cola sem código.

O que procurar

Comparação rápida

Aplicativo Melhor para Plataformas Plano Gratuito Preço Licença
ESPHome Firmware ESP32/8266 do YAML Windows, macOS, Linux, Docker Sim Gratuito GPL / MIT
PlatformIO IDE completo para embarcado Windows, macOS, Linux Sim Gratuito (Pro pago) Apache 2.0
Home Assistant Barramento de mensagens e painel Windows, macOS, Linux, Docker Sim Gratuito Apache 2.0
LangChain Framework de agente com chamadas de ferramenta Windows, macOS, Linux Sim Gratuito (SDK) MIT
Willow Voz local em hardware ESP32 Windows, macOS, Linux Sim Gratuito Apache 2.0
MicroPython Python no microcontrolador Windows, macOS, Linux Sim Gratuito MIT
n8n Cola sem código entre agente e hardware Windows, macOS, Linux, Docker Sim Gratuito (auto-hospedado) Fair-code

1. ESPHome – Melhor para firmware ESP32/8266 do YAML

ESPHome carrega um ESP32 ou ESP8266 com firmware construído a partir de uma descrição YAML. Declare os pinos, sensores, botões, servos; ESPHome compila um binário, carrega via USB ou OTA, e conecta o dispositivo ao Home Assistant sem cola. Esse é o caminho mais rápido de uma placa em branco para “dispositivo controlável por agente”.

Onde fica aquém: YAML não é o mesmo que C. Alguns truques de baixo nível exigem escrever lambdas que são meio código, meio config.

Preços:

Plataformas: Windows, macOS, Linux, Docker.

Baixar: esphome.io.

Conclusão: A camada de firmware padrão. Semanas de desenvolvimento em C++ comprimidas em cem linhas de YAML.

2. PlatformIO – Melhor IDE completo para embarcado

PlatformIO é para o que você escala quando a abstração do ESPHome não se encaixa. É um IDE (ou uma extensão VS Code) que fala Arduino, ESP-IDF, STM32Cube, e dezenas de outros frameworks, com um gerenciador de pacotes para bibliotecas. Quando o agente de IA precisa de um braço de robô acionado por código de cinemática inversa, esse código vive no PlatformIO.

Onde fica aquém: O tier Pro bloqueia alguns recursos de depuração avançados. A curva de aprendizado é real se você nunca fez embarcado.

Preços:

Plataformas: Windows, macOS, Linux.

Baixar: platformio.org.

Conclusão: O IDE para qualquer coisa que o ESPHome não pode descrever declarativamente.

3. Home Assistant – Melhor barramento de mensagens e painel

Home Assistant é a camada que permite que uma chamada de ferramenta LLM chegue ao mundo físico. O agente bate em um endpoint HTTP ou tópico MQTT; Home Assistant traduz isso em “alternar um interruptor” ou “girar o servo para 45 graus” e o ESP32 obedece. Ele também fornece uma interface para ver o que o robô está fazendo sem abrir um terminal.

Onde fica aquém: Curva de aprendizado íngreme se você nunca configurou uma antes. O ecossistema de complementos é poderoso mas barulhento.

Preços:

Plataformas: Windows, macOS, Linux, Docker, SO dedicado.

Baixar: home-assistant.io.

Conclusão: A camada intermediária que mantém o código do agente separado do hardware.

4. LangChain – Melhor framework de agente com chamadas de ferramenta

LangChain é o SDK que transforma um LLM em um agente que usa ferramentas. Defina uma ferramenta (“tocar o sino”), passe-a no esquema de ferramenta, e o modelo decide quando chamá-la. Combinado com uma ferramenta HTTP Home Assistant, o agente obtém todo o conjunto de capacidades do robô sem saber nada sobre MQTT.

Onde fica aquém: API evoluindo rapidamente. Alguns padrões de um ano atrás já estão obsoletos.

Preços:

Plataformas: Windows, macOS, Linux (Python e JS/TS).

Baixar: python.langchain.com ou js.langchain.com.

Conclusão: A forma de dar a um LLM local a capacidade de chamar uma ferramenta “tocar o sino”.

5. Willow – Melhor voz local em hardware ESP32

Willow transforma um ESP32-S3 com uma matriz de microfones em um endpoint de voz Home Assistant que funciona inteiramente em sua rede. Detecção de palavra-chave no dispositivo, conversão de fala para texto hospedada em seu próprio servidor, e a solicitação transcrita roteada para Home Assistant ou um LLM local. Sem nuvem, sem conta, sem dados deixando a sala.

Onde fica aquém: A seleção de placas é estreita (principalmente a linha ESP32-S3 BOX). Requer um Servidor de Inferência Willow em uma máquina mais potente.

Preços:

Plataformas: Windows, macOS, Linux (para o servidor de inferência).

Baixar: heywillow.io.

Conclusão: Para quem quer que o robô ouça e fale sem dependência de nuvem.

6. MicroPython – Melhor para Python no microcontrolador

MicroPython executa um interpretador Python em um ESP32 ou RP2040, então o firmware que você escreve e o código do agente parecem a mesma linguagem. Essa é uma vitória real para o desenvolvedor que quer prototipar movimento de servo ou padrões de LED sem sair de Python.

Onde fica aquém: Mais lento que C para loops apertados. Menos eficiente em energia que ESPHome para um dispositivo alimentado por bateria.

Preços:

Plataformas: Windows, macOS, Linux para as ferramentas de flash.

Baixar: micropython.org.

Conclusão: Para o protótipo onde a velocidade de iteração importa mais do que watts economizados.

7. n8n – Melhor cola sem código entre agente e hardware

n8n é a ferramenta de fluxo de trabalho auto-hospedada que conecta a API LLM, Home Assistant, ESPHome, um banco de dados, e qualquer endpoint HTTP que você possa imaginar, em um gráfico. Quando você quer “se o agente disse que a tarefa está feita, toque o sino e registre o timestamp”, n8n é a forma rápida de construir sem escrever um serviço.

Onde fica aquém: Não é construído para tempo real. Bom para fluxos acionados por ferramenta, não para loops de sensor apertados.

Preços:

Plataformas: Windows, macOS, Linux, Docker.

Baixar: n8n.io.

Conclusão: O tecido conjuntivo entre a saída do agente e as ações do robô.

Como escolher o correto

Perguntas frequentes

Preciso de uma Raspberry Pi além de um ESP32? Nem sempre. Para corpos simples, o ESP32 sozinho é suficiente com um LLM hospedado em nuvem ou LAN. Para corpos mais ricos com inferência de voz local, um Pi 4 ou 5 hospeda o modelo e o ESP32 permanece como o corpo.

Qual é a placa mais barata para começar? Uma placa de desenvolvimento ESP32 custa alguns dólares. Adicione servos, um pequeno alto-falante, uma tela OLED, e você está abaixo de $30 para um robô que toca o sino.

Posso fazer isso sem conexão de Internet? Sim, se você auto-hospeda o LLM (Ollama, LM Studio ou Llama.cpp) e usa Willow para voz. Toda a pilha — de microfone a LLM a servo — pode viver em sua LAN.

É seguro? O agente pode quebrar coisas? Apenas das formas que você permite. Dê ao agente endpoints HTTP para as ações que ele tem permissão para fazer; não lhe dê acesso root ao servidor Home Assistant. Limite o curso do servo e a corrente no firmware.

Qual é esse robô ESP32 impresso em 3D que todos estão compartilhando? É um pequeno gabinete ao redor de uma placa de desenvolvimento ESP32-S3, um OLED para os olhos, e um servo acionando o sino. O ponto não é o sino — é o padrão de “agente de IA recebe uma presença física na sala”. Tudo neste artigo dá a você as peças para construir uma.