Se você pedir a um agente de codificação de IA para escrever um script Python autônomo para analisar um único arquivo JSON, ele provavelmente lhe dará uma resposta perfeita em segundos. No entanto, o mesmo agente frequentemente falha se você pedir que ele construa uma pipeline de processamento de dados sistemática, como ingerir milhares de documentos desorganizados, dividir o texto, avaliar a qualidade e filtrar o ruído para um sistema de Geração-Aumentada de Recuperação (RAG) que se ajuste à sua pilha de empresas específica.
Embora os grandes modelos de linguagem (LLMs) sejam excelentes na geração de código de uma única vez, suas saídas para tarefas complexas de processamento de dados são normalmente scripts livres e descartáveis. Esses scripts estão desvinculados das abstrações de fluxo de trabalho governáveis que as equipes de MLOps dependem para produção, tornando-os difíceis de auditar ou editar visualmente.
Para resolver isso, pesquisadores da Universidade de Pequim, da Academia Zhongguancun e do Instituto de Pesquisa de Algoritmos Avançados de Xangai introduziram o DataFlow-Harness, uma estrutura de código aberto que orienta um agente LLM a construir fluxos de trabalho de processamento de dados estruturados e visuais passo a passo, em vez de escrever código bruto do zero.
A estrutura torna as pipelines geradas por IA mais fáceis de gerenciar e integrar às arquiteturas existentes, pois os artefatos gerados são persistentes e facilmente editáveis.
Os pesquisadores relatam que a plataforma alcança uma taxa de aprovação de ponta a ponta observada de 93,3% em um benchmark de engenharia de dados de 12 tarefas. Em comparação com o código padrão Claude, reduz os custos de API em até 72,5% e a latência de resposta em 49,9%, enquanto alcança quase a mesma taxa de sucesso que uma IA dada toda a base de código para escrever scripts padrão. Para as equipes de empresas, isso significa obter a velocidade da automação de IA sem acumular dívida técnica não gerenciável, garantindo que as pipelines permaneçam seguras, auditáveis e prontas para produção.
A "lacuna NL2Pipeline"
A IA centrada em dados requer fluxos de trabalho para tarefas como geração de dados sintéticos, aumento de recuperação e treinamento de modelos. Embora os LLMs possam traduzir a linguagem natural em implementações executáveis para realizar essas tarefas, a alta precisão da tarefa é insuficiente para implantação em produção.
"A primeira barreira normalmente não é escrever Python", disse Runming He, primeiro autor do artigo do DataFlow-Harness, à VentureBeat. "Os agentes de codificação modernos podem produzir um script plausível rapidamente. O problema mais difícil é fundamentar esse script em uma plataforma de produção ao vivo: usando operadores que estão realmente instalados, correspondendo ao esquema de conjunto de dados real, referindo-se a conjuntos de dados e serviços de modelo registrados, preservando dependências entre estágios e deixando para trás um artefato que outro engenheiro possa entender e revisar."
Os agentes de IA de propósito geral frequentemente imaginam dependências, confiando em operadores indisponíveis ou suposições de plataforma desatualizadas. Em vez de deixar para trás um artefato que outro engenheiro possa entender e revisar, eles criam pipelines que são difíceis de gerenciar e integrar às arquiteturas existentes.
Um engenheiro pode entender e revisar, eles geram código descartável que é difícil de auditar por meio de ferramentas de gerenciamento de fluxo de trabalho.
Os pesquisadores definem esse desafio como a "lacuna NL2Pipeline": a desconexão entre um usuário que expressa requisitos de fluxo de trabalho em linguagem natural e o ambiente de produção que exige ativos de pipeline estruturados e persistentes.
Os pesquisadores demonstraram essa lacuna em seus experimentos. Por exemplo, quando o Claude Code foi autorizado a escrever scripts padrão e em forma livre usando o contexto do código, ele atingiu uma taxa de sucesso de 94,2%. No entanto, quando foi restrito a usar apenas os blocos de construção específicos da plataforma para criar um gráfico de fluxo de trabalho nativo, sua taxa de sucesso caiu para 83,3%. Essa lacuna é a principal descoberta do artigo: pipelines nativos e governáveis são significativamente mais difíceis para o agente produzir do que código descartável.
"Fechar essa lacuna requer mais do que melhorar a precisão da geração de código: a construção deve permanecer fundamentada na semântica da plataforma e produzir artefatos que se integrem à plataforma hospedeira", escrevem os pesquisadores.
Como os quatro componentes trabalham juntos
"DataFlow-Harness muda o espaço de ação do agente", disse ele. "Em vez de pedir ao agente que emita código arbitrário, ele recupera o registro de operadores em tempo real e o estado atual do pipeline por meio do MCP e aplica mudanças incrementais e tipadas a um DAG persistente."
Para alcançar isso, a plataforma organiza a síntese de fluxo de trabalho em torno de quatro componentes: o Data Pipeline Backend, a camada de interação (DataFlow-WebUI), a Camada de Ferramentas MCP e a camada de orientação de IA (DataFlow-Skills).
O Data Pipeline Backend atua como a fonte autoritativa de verdade em interfaces conversacionais, visuais e programáticas. Ele representa o pipeline como um grafo acíclico direcionado (DAG), um mapa de fluxo de trabalho estruturado que contém fontes de dados, módulos de processamento pré-construídos configurados (aos quais os pesquisadores se referem como "operadores") e dependências de execução. Em vez de gerar código em forma livre, os agentes interagem com esse backend por meio de "mutações tipadas", como adicionar um operador ou conectar arestas.
DataFlow-Skills são arquivos markdown que injetam conhecimento específico de domínio na janela de contexto do modelo, orientando-o sobre padrões de seleção de operadores, inferência de esquema e procedimentos de montagem. Em vez de deixar que a IA adivinhe como montar componentes, as habilidades fornecem à IA regras de compatibilidade, ensinando-a a combinar corretamente diferentes formatos de dados e lidar com estruturas de dados complexas sem quebrar o pipeline.
A Camada de Ferramentas MCP fornece à IA acesso ao registro de operadores e ao estado atual do fluxo de dados. A IA propõe mudanças estruturadas por meio da camada de ferramentas. O sistema valida as mudanças para garantir que o fluxo de trabalho seja executado em uma sequência válida e que cada módulo conectado fale o mesmo idioma.
Linguagem de dados.
DataFlow-WebUI fornece duas interfaces que permitem que humanos e IA construam o fluxo de trabalho juntos. Os desenvolvedores podem descrever os requisitos do fluxo de trabalho em linguagem natural por meio de uma interface conversacional. Eles também podem acessar o fluxo de trabalho como um mapa gráfico em um editor visual DAG. Aqui, eles podem inspecionar diretamente as alterações propostas pela IA e fazer modificações.
“A implementação atual realiza verificações estáticas nos metadados da plataforma antes de aceitar alterações no pipeline”, disse ele. "Isso inclui verificações de conjuntos de dados registrados, operadores e referências de serviço de modelo, fluxo de campo e algum uso de parâmetros inválidos, bem como validade estrutural. O resultado é visível em um editor gráfico e pode ser revisado manualmente ou pelo agente em turnos posteriores."
Os resultados: taxa de aprovação de 93,3%, custo 72,5% menor
Os pesquisadores testaram o DataFlow-Harness em um benchmark de 12 tarefas em seis cenários industriais de processamento de dados, como geração de controle de qualidade, governança de revisão e normalização de esquema. Eles usaram Claude Opus 4.7 como modelo principal em seus experimentos.
Eles compararam o DataFlow-Harness com três linhas de base:
Vanilla CC: Uma linha de base de codificação irrestrita usando o Código Claude padrão.
CC sensível ao contexto: um agente que tem acesso à base de código do DataFlow em sua janela de contexto.
Somente MCP: um agente que tem acesso às ferramentas DataFlow MCP e é instruído a gerar DAGs nativos da plataforma (sem acesso ao DataFlow-Skills).
O DataFlow-Harness alcançou uma taxa de aprovação ponta a ponta de 93,3%, melhorando 10,0 pontos percentuais em relação apenas ao MCP e superando o Vanilla CC (91,7%), estando dentro de 0,9 pontos percentuais do Context-Aware CC (94,2%).
É importante ressaltar que ele reduziu os custos de API para US$ 0,261 por tarefa, uma queda de 72,5% em comparação com Vanilla CC e 42,8% em comparação com Context-Aware CC. Na geração de fluxos de trabalho, foi 49,9% mais rápido que o Vanilla CC e 17,6% mais rápido que o Context-Aware CC.
O DataFlow-Harness provou ser particularmente eficaz em tarefas complexas que dependem de conhecimento implícito do domínio, como a geração de controle de qualidade. A abordagem básica apenas do MCP frequentemente gerava DAGs estruturalmente válidos, mas tinha dificuldade para inferir procedimentos específicos da tarefa apenas a partir das descrições dos operadores.
Para mostrar como isso funciona no mundo real, os pesquisadores detalharam uma tarefa de extração de livro didático para VQA. Esse trabalho exigia que a IA reunisse recursos como análise de PDF, recuperação de layout, OCR, extração de figuras, compreensão multimodal e correspondência de perguntas e respostas de longo alcance. O DataFlow-Harness alcançou 97,2% de precisão e uma taxa de cobertura de 87,3%, superando facilmente as linhas de base. Ao fazer com que a IA reunisse ativos de plataforma existentes em vez de codificar tarefas complexas do zero, ela recuperou pares de controle de qualidade mais válidos do documento.
| ℹ️ | Nota do editor: O AR NEWS 24H publica conteúdos baseados em fontes externas. As informações e opiniões presentes no material original são de responsabilidade de seus respectivos autores. Este conteúdo foi traduzido e adaptado para o português do Brasil com o auxílio de ferramentas automatizadas. |