
Considere um agente de IA encarregado de um fluxo de trabalho empresarial complexo, como migrar grandes lotes de registros de clientes de um CRM legado para um banco de dados na nuvem. O agente não pode confiar apenas em seu contexto interno para uma tarefa que dura horas e depende da camada de tempo de execução, também conhecida como infraestrutura.
Essa infraestrutura fornece feedback de execução, como logs do servidor, para ajudar o agente a manter uma compreensão precisa das conexões dinâmicas da API. Ela também fornece rastreadores de estado e mecanismos de controle de fluxo para gerenciar submetas concluídas e pendentes, garantindo que o agente não ignore ou duplique lotes de dados. Quando ocorrem erros inesperados, como um banco de dados rejeitando um lote devido a limites rígidos de taxa da API, a infraestrutura fornece ferramentas e instruções para ajudar o agente a se recuperar.
A principal maneira de instruir um agente sobre como e quando usar suas ferramentas é ter um desenvolvedor humano escrevendo um conjunto de regras e instruções, indicando o que fazer passo a passo. Por exemplo, um desenvolvedor pode instruir o agente a sempre pesquisar a wiki da empresa antes de escrever um e-mail. Como o agente está apenas seguindo um script rígido, ele carece de verdadeira autonomia. O sistema não foi treinado para avaliar de forma independente os custos e benefícios de suas ações. Para solucionar isso, pesquisadores da Meta AI e da Universidade de Illinois Urbana-Champaign apresentam o EvoHarness-RL, uma estrutura que adiciona uma camada de abstração à infraestrutura do agente e ensina o modelo subjacente a quando ler, atualizar ou consolidar as informações obtidas do ambiente.
Em tarefas de longo prazo, a forma como os agentes de IA leem e processam as informações obtidas do ambiente é crucial para o seu sucesso. O agente precisa atualizar sua compreensão do ambiente, acompanhar as submetas concluídas e pendentes, recuperar-se de ações falhas e reutilizar procedimentos de experiências anteriores.
Essa execução depende da infraestrutura
Uma série de estruturas de agentes autoevolutivas, como o Harness-1, resolve parte do problema acumulando trajetórias passadas e destilando-as em memória procedural estruturada, como habilidades reutilizáveis, fluxos de trabalho ou bibliotecas de código para tarefas futuras. No entanto, geralmente separam essa curadoria de habilidades de longo prazo do rastreamento de estado em tempo real, dentro do episódio. Eles não estão treinando ativamente o agente em como gerenciar sua realidade ambiental imediata ou rastrear as etapas de sua tarefa ativa enquanto trabalha.
Xuying Ning, coautora do artigo sobre EvoHarness-RL, disse ao VentureBeat que a lógica manual e as estruturas de memória rígidas são as principais culpadas pelo consumo excessivo de recursos de engenharia.
"Modelos diferentes podem precisar de prompts, designs de memória, permissões ou configurações de sandbox diferentes. Se toda essa lógica for codificada manualmente, cada atualização do modelo pode levar a outro longo ciclo de ajustes e depuração." Além disso, os sistemas de memória existentes que simplesmente acumulam experiência podem degradar ativamente o raciocínio de um agente. "A memória somente de acréscimo pressupõe que mais contexto seja sempre útil, o que não é necessariamente verdade", disse Ning. "Ao longo de uma tarefa longa, a memória pode conter conclusões desatualizadas, tentativas falhas ou informações que não são mais relevantes." Como resultado, agentes de longo prazo precisam de uma memória dinâmica capaz de atualizar, comprimir e substituir informações para evitar a repetição de erros passados.
Para superar as limitações de instruções manuais rígidas, os pesquisadores introduzem o EvoHarness-RL, uma técnica de treinamento que ensina o agente a fazer uso otimizado de sua infraestrutura. Em vez de seguir cegamente instruções pré-programadas, o agente aprende a construir um espaço de trabalho estruturado a partir de dados de execução complexos e a decidir quando e como consultar esse estado externo durante fluxos de trabalho complexos.
Para simplificar o gerenciamento de diferentes componentes da infraestrutura, o EvoHarness-RL consolida os sistemas de suporte do agente em uma única interface unificada.
Em vez de usar APIs complexas e específicas de domínio, a IA interage com este painel de controle limpo usando quatro meta-ações compactas: rastrear, confirmar, recuperar e anotar. Ela emite comandos para rastrear o ambiente em tempo real, confirmar atualizações de fluxo de trabalho, recuperar estratégias anteriores antes de agir e escrever notas para salvar insights recém-descobertos para execuções futuras.
Esses estados se relacionam diretamente com verticais empresariais de alto valor. "Na engenharia de software, a Crença pode representar o entendimento atual do agente sobre o repositório", disse Ning, detalhando como o agente monitora as interações entre componentes e as alterações no espaço de trabalho. "O Progresso rastreia o que já foi concluído, o que ainda precisa ser feito e quais etapas dependem de outras." Enquanto isso, a Experiência captura lições, como o feedback do usuário sobre um erro, para orientar ações futuras. A mesma ideia se aplica às finanças, disse. Durante uma auditoria de conformidade, a Crença pode descrever as regras aplicáveis e as evidências disponíveis. O Progresso rastreia quais verificações foram concluídas e quais exceções permanecem em aberto.
A Experiência ajuda o agente a reconhecer discrepâncias recorrentes ou a saber quando um problema deve ser escalado.
Juntos, esses estados ajudam a evitar que o agente perca o controle do seu trabalho ou repita a mesma abordagem falha", disse. Para ensinar ao agente tanto a mecânica quanto a estratégia de gerenciamento do seu espaço de trabalho externo, os pesquisadores desenvolveram um método de treinamento em duas etapas. Na primeira etapa, o ajuste fino supervisionado, o modelo base aprende a extrair e estruturar informações úteis de registros de interação complexos na estrutura BPE.
No entanto, consultar a memória ou atualizar rastreadores consome tempo e tokens de computação, o que significa que o agente não pode se dar ao luxo de verificar cegamente suas ferramentas a cada passo. Para resolver isso, a segunda etapa utiliza aprendizado por reforço "com reconhecimento de custos" para ensinar o agente a ser eficiente. Esta fase treina o agente para calcular quando o acesso ao seu estado externo justifica o custo orçamentário. Esse processo em duas etapas transforma o uso de ferramentas de um comando rígido e predefinido em um comportamento aprendido em tempo de execução.
EvoHarness-RL em ação
Para validar o EvoHarness-RL, os pesquisadores avaliaram o sistema usando o benchmark ALFWorld, um ambiente baseado em texto com tarefas de várias etapas que testam a lógica sequencial e o rastreamento de estado.
