Архив рубрики ~Лента новостей~

Структурированные конвейеры обработки данных для ИИ на 10,9 баллов уступают конвейерам, использующим произвольный код — DataFlow-Harness сокращает разрыв.

Структурированные конвейеры обработки данных для ИИ на 10,9 баллов уступают конвейерам, использующим произвольный код — DataFlow-Harness сокращает разрыв.
Структурированные конвейеры обработки данных для ИИ на 10,9 баллов уступают конвейерам, использующим произвольный код — DataFlow-Harness сокращает разрыв.

Бен Диксон

Если вы попросите агента ИИ написать автономный скрипт на Python для анализа одного JSON-файла, он, скорее всего, выдаст идеальный ответ за считанные секунды. Но тот же агент часто дает сбой, если вы попросите его создать систематический конвейер обработки данных, например, для обработки тысяч неструктурированных документов, сегментации текста, оценки качества и фильтрации шума для системы генерации с расширенным поиском (RAG), которая подходит для вашей конкретной корпоративной среды.

Хотя большие языковые модели (LLM) отлично справляются с генерацией кода в единичных случаях, их результаты для сложных задач обработки данных обычно представляют собой произвольные, одноразовые скрипты. Эти скрипты оторваны от управляемых абстракций рабочих процессов, на которые полагаются команды MLOps в производственной среде, что затрудняет их визуальный аудит или редактирование.

Для решения этой проблемы исследователи из Пекинского университета, Академии Чжунгуаньцунь и Шанхайского института передовых алгоритмических исследований представили DataFlow-Harness — фреймворк с открытым исходным кодом, который помогает агенту LLM поэтапно создавать структурированные, визуальные рабочие процессы обработки данных, вместо того чтобы писать код с нуля.

Данная платформа упрощает управление и интеграцию созданных с помощью ИИ конвейеров обработки данных в существующие архитектуры, поскольку сгенерированные артефакты являются постоянными и легко редактируемыми.

Исследователи сообщают, что платформа обеспечивает 93,3% успешного выполнения сквозных задач в рамках бенчмарка по обработке данных, состоящего из 12 заданий. По сравнению со стандартным кодом Claude Code, она снижает затраты на API до 72,5% и задержку ответа на 49,9%, при этом достигая почти такого же уровня успешности, как и ИИ, при условии наличия всей кодовой базы для написания стандартных скриптов. Для корпоративных команд это означает получение скорости автоматизации ИИ без накопления непосильного технического долга, что гарантирует безопасность, возможность аудита и готовность конвейеров к производству.

«Пробел в NL2Pipeline»

Искусственный интеллект, ориентированный на данные, требует наличия рабочих процессов для таких задач, как генерация синтетических данных, расширение возможностей поиска и обучение моделей. Хотя модели на основе линейных языков могут преобразовывать естественный язык в исполняемые реализации для выполнения этих задач, высокой точности выполнения задач недостаточно для внедрения в производство.

«Первая трудность обычно заключается не в написании кода на Python», — сказал VentureBeat Ранминг Хе, первый автор статьи о DataFlow-Harness. «Современные программисты часто могут быстро создать правдоподобный скрипт. Более сложная проблема — это интегрировать этот скрипт в работающую производственную платформу: использовать операторы, которые действительно установлены, соответствовать реальной схеме набора данных, ссылаться на зарегистрированные наборы данных и сервисы моделей, сохранять зависимости между этапами и оставить после себя артефакт, который другой инженер сможет понять и исправить».

Универсальные агенты ИИ часто создают иллюзии зависимостей, полагаясь на недоступные операторы или устаревшие предположения платформы. Вместо того чтобы оставить после себя артефакт, который другой инженер сможет понять и исправить, они генерируют одноразовый код, который сложно проверить с помощью инструментов управления рабочими процессами.

Исследователи определяют эту проблему как «разрыв NL2Pipeline»: несоответствие между пользователем, выражающим требования к рабочему процессу на естественном языке, и производственной средой, требующей структурированных и постоянно доступных ресурсов конвейера обработки данных.

Исследователи продемонстрировали этот разрыв в своих экспериментах. Например, когда Claude Code разрешили писать стандартные скрипты в свободной форме, используя контекст кодовой базы, он достиг 94,2% успеха. Однако, когда его ограничили использованием только специфических строительных блоков платформы для создания нативного графа рабочего процесса, его показатель успеха упал до 83,3%. Этот разрыв является центральным выводом статьи: нативные, управляемые конвейеры значительно сложнее создать для агента, чем одноразовый код.

«Для устранения этого пробела требуется нечто большее, чем просто повышение точности генерации кода: разработка должна оставаться основанной на семантике платформы и создавать артефакты, которые интегрируются с хост-платформой», — пишут исследователи.

Как взаимодействуют эти четыре компонента

«DataFlow-Harness изменяет пространство действий агента, — сказал он. — Вместо того чтобы просить агента генерировать произвольный код, он получает реестр действующих операторов и текущее состояние конвейера через MCP и применяет типизированные, инкрементальные изменения к постоянному DAG».

Для достижения этой цели платформа организует синтез рабочих процессов вокруг четырех компонентов: бэкэнда конвейера данных, уровня взаимодействия (DataFlow-WebUI), уровня инструментов MCP и уровня управления ИИ (DataFlow-Skills).

изображение1

Бэкенд конвейера данных выступает в качестве авторитетного источника достоверной информации для диалоговых, визуальных и программных интерфейсов. Он представляет конвейер в виде направленного ациклического графа (DAG), структурированной карты рабочих процессов, содержащей источники данных, настроенные предварительно созданные модули обработки (которые исследователи называют «операторами») и зависимости выполнения. Вместо генерации произвольного кода агенты взаимодействуют с этим бэкендом посредством «типизированных мутаций», таких как добавление оператора или соединение ребер.

DataFlow-Skills — это файлы Markdown, которые внедряют в контекстное окно модели знания, специфичные для предметной области, направляя её в выборе шаблонов операторов, выводе схемы и процедурах сборки. Вместо того чтобы позволять ИИ гадать, как собирать компоненты, навыки предоставляют ИИ правила совместимости, обучая его правильному сопоставлению различных форматов данных и обработке сложных структур данных без нарушения конвейера обработки.

Слой инструментов MCP предоставляет ИИ доступ к реестру операторов и текущему состоянию рабочего процесса обработки данных. ИИ предлагает структурированные изменения через слой инструментов. Система проверяет изменения, чтобы убедиться, что рабочий процесс выполняется в правильной последовательности и что каждый подключенный модуль использует один и тот же язык данных.

DataFlow-WebUI предоставляет два интерфейса, позволяющие людям и ИИ совместно создавать рабочие процессы. Разработчики могут описывать требования к рабочему процессу на естественном языке через диалоговый интерфейс. Они также могут получить доступ к рабочему процессу в виде графической карты в визуальном редакторе DAG. Здесь они могут напрямую проверять изменения, предложенные ИИ, и вносить корректировки.

изображение3

«В текущей реализации перед принятием изменений в конвейере выполняются статические проверки метаданных платформы, — сказал он. — Они включают проверки зарегистрированных наборов данных, операторов и ссылок на модели, потока полей, а также использования некоторых недопустимых параметров и структурной корректности. Результат отображается в графическом редакторе и может быть отредактирован вручную или агентом на последующих этапах».

Результаты: 93,3% успешно сдавших экзамен, снижение стоимости на 72,5%.

Исследователи протестировали DataFlow-Harness на наборе из 12 задач в шести сценариях промышленной обработки данных, таких как генерация вопросов и ответов, управление проверкой и нормализация схемы. В своих экспериментах они использовали Claude Opus 4.7 в качестве базовой модели.

Они сравнили DataFlow-Harness с тремя базовыми моделями:

  • Vanilla CC: Неограниченный базовый алгоритм кодирования с использованием стандартного кода Клода.

  • Контекстно-ориентированный контекстный агент: агент, имеющий доступ к кодовой базе DataFlow в своем контекстном окне.

  • Только для MCP: Агент, имеющий доступ к инструментам DataFlow MCP и которому поручено создавать DAG-графы, совместимую с платформой (без доступа к DataFlow-Skills).

DataFlow-Harness достиг показателя успешного прохождения сквозного тестирования в 93,3%, улучшив результат на 10,0 процентных пунктов по сравнению с тестированием только с использованием MCP и превзойдя Vanilla CC (91,7%), при этом отстав от Context-Aware CC (94,2%) всего на 0,9 процентных пункта.

изображение2

Важно отметить, что это позволило снизить стоимость API до 0,261 доллара за задачу, что на 72,5% меньше по сравнению с Vanilla CC и на 42,8% меньше по сравнению с Context-Aware CC. При создании рабочих процессов это было на 49,9% быстрее, чем Vanilla CC, и на 17,6% быстрее, чем Context-Aware CC.

DataFlow-Harness оказался особенно эффективным при решении сложных задач, зависящих от неявных знаний предметной области, таких как генерация вопросов и ответов. Базовый подход, использующий только MCP, часто генерировал структурно корректные DAG-графы, но испытывал трудности с выводом процедур, специфичных для задачи, только на основе описаний операторов.

Чтобы продемонстрировать работу этого метода в реальных условиях, исследователи подробно описали задачу извлечения вопросов и ответов из учебника. Эта задача требовала от ИИ объединения таких возможностей, как анализ PDF-файлов, восстановление макета, оптическое распознавание символов (OCR), извлечение изображений, понимание мультимодальных данных и сопоставление вопросов и ответов на большом расстоянии. DataFlow-Harness достиг точности 97,2% и охвата 87,3%, легко превзойдя базовые показатели. Благодаря тому, что ИИ объединял существующие ресурсы платформы, а не кодировал сложные задачи с нуля, он восстановил больше допустимых пар вопросов и ответов из документа.

Их эксперименты также показали, что DataFlow-Harness очень эффективен для создания конвейеров генерации данных. Например, в задаче генерации синтетических инструкций и данных агент создал многоэтапный конвейер, который генерировал пары «инструкция-ответ», критиковал и переписывал их, оценивал с помощью судьи на основе LLM и фильтровал низкокачественные результаты перед обучением.

«Создание подобных рабочих процессов обходится дорого, а их поддержка, представляющая собой набор произвольно написанных скриптов, — сказал он. — Этот инструмент не делает их автоматически безопасными, но превращает их в четко определенные, редактируемые этапы, которые инженеры могут проверять, тестировать и контролировать с помощью обычных средств управления производством».

Аналогично, при решении задачи создания конвейера для очистки и синтеза математических данных, данные, полученные с помощью конвейера DataFlow-Harness, позволили обучить более эффективную модель с более высокой средней точностью на тестах AIME24 и AIME25, чем данные, полученные с помощью стандартного конвейера Claude Code.

Компромиссы между соответствием технологическому стеку и его внедрением.

Для инженерных групп, оценивающих DataFlow-Harness, важно понимать, как он вписывается в существующую инфраструктуру. Выпущенный под лицензией Apache 2.0, текущий вариант требует определенных инженерных доработок для интеграции в популярные технологические стеки.

«Текущая реализация является нативной для платформы DataFlow; это не готовый плагин для Airflow, Prefect или Spark», — сказал он. Чтобы использовать эти системы в качестве основы для выполнения, командам необходимо создать адаптер для подключения реестра, метаданных и интерфейсов выполнения своей организации к уровню управления агента.

Кроме того, организациям необходимо инвестировать в определение границ, которые они хотят, чтобы ИИ соблюдал. Это требует ведения реестра операторов, определения схем и кодирования повторяющихся процедур предметной области в виде навыков. Из-за этих накладных расходов он не рекомендует использовать фреймворк для небольших разовых преобразований, где достаточно простого скрипта, или в устаревших средах, которые не могут предоставлять надежные метаданные.

Наконец, хотя платформа предотвращает нелогичные соединения путем проверки структурных свойств, она является уровнем инженерного контроля, а не заменой соблюдению нормативных требований. «К жгуту проводов следует относиться как к уровню инженерного контроля, а не как к замене политики соответствия, проверенных моделей обнаружения, контроля доступа, ведения журналов аудита или утверждения человеком», — сказал он.

Платформа является открытым исходным кодом, и разработчики могут получить доступ к исходному коду и документации по кодовой базе непосредственно через репозиторий проекта на GitHub.

По мере стандартизации таких протоколов, как MCP, граница между инженерами-людьми и агентами ИИ будет смещаться. «Цель состоит не в автономной обработке данных без контроля, — сказал он. — Это лучшее разделение труда: агенты выполняют повторяющиеся действия в рамках четко определенных границ, в то время как инженеры остаются ответственными за семантику, политику и последующие решения, требующие ответственности в данной области».

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ ChatGPT научился читать вкладки браузера — OpenAI выпустила обновление расширения… Архив рубрики ~Коротко из Telegram~ 🐱 Превращаем рабочий стол в уютное место с котиками, собачками… Архив рубрики ~Коротко из Telegram~ Samsung, Huawei и вся полупроводниковая отрасль ищут выход из тупика… Архив рубрики ~Коротко из Telegram~ Дайджест дня В первом полугодии 2026 г. более 60% мобильных… Архив рубрики ~Коротко из Telegram~ С ИИ работы будет меньше, говорили они Разработчики ИИ давно… Архив рубрики ~Коротко из Telegram~ Учёные смогли «омолодить» кожу на десятки лет С возрастом в… Архив рубрики ~Коротко из Telegram~ К законам об ИИ в различных странах подходят по-разному, но… Архив рубрики ~Коротко из Telegram~ DeepSeek V4-Flash оказался дешевым до неприличия После выхода DeepSeek V4-Flash… Архив рубрики ~Коротко из Telegram~ Опенсорсный видеоредактор на Claude Code монтирует по текстовой команде Нашли… Архив рубрики ~Коротко из Telegram~ Google выключил новую AI-фичу в картах всего через сутки Google… Архив рубрики ~Коротко из Telegram~ Во втором квартале интерес россиян к зарубежным мессенджерам вырос на… Архив рубрики ~Коротко из Telegram~ В первой половине 2026 года количество веб-атак на российские компании… Архив рубрики ~Коротко из Telegram~ ✅ Главная причина, почему об этом сейчас так много говорят,… Архив рубрики ~Коротко из Telegram~ Две скорости ИИ-гонки Американская экономика всё сильнее зависит от искусственного… Архив рубрики ~Коротко из Telegram~ ChatGPT научился читать вкладки браузера — OpenAI выпустила обновление расширения… Архив рубрики ~Коротко из Telegram~ 🐱 Превращаем рабочий стол в уютное место с котиками, собачками… Архив рубрики ~Коротко из Telegram~ Samsung, Huawei и вся полупроводниковая отрасль ищут выход из тупика… Архив рубрики ~Коротко из Telegram~ Дайджест дня В первом полугодии 2026 г. более 60% мобильных… Архив рубрики ~Коротко из Telegram~ С ИИ работы будет меньше, говорили они Разработчики ИИ давно… Архив рубрики ~Коротко из Telegram~ Учёные смогли «омолодить» кожу на десятки лет С возрастом в… Архив рубрики ~Коротко из Telegram~ К законам об ИИ в различных странах подходят по-разному, но… Архив рубрики ~Коротко из Telegram~ DeepSeek V4-Flash оказался дешевым до неприличия После выхода DeepSeek V4-Flash… Архив рубрики ~Коротко из Telegram~ Опенсорсный видеоредактор на Claude Code монтирует по текстовой команде Нашли… Архив рубрики ~Коротко из Telegram~ Google выключил новую AI-фичу в картах всего через сутки Google… Архив рубрики ~Коротко из Telegram~ Во втором квартале интерес россиян к зарубежным мессенджерам вырос на… Архив рубрики ~Коротко из Telegram~ В первой половине 2026 года количество веб-атак на российские компании… Архив рубрики ~Коротко из Telegram~ ✅ Главная причина, почему об этом сейчас так много говорят,… Архив рубрики ~Коротко из Telegram~ Две скорости ИИ-гонки Американская экономика всё сильнее зависит от искусственного…

Оставить комментарий