Архив рубрики ~Лента новостей~

Концепция Science One: проверяемая автономная исследовательская модель на основе цепочки доказательств.

Концепция Science One: проверяемая автономная исследовательская модель на основе цепочки доказательств.
Концепция Science One: проверяемая автономная исследовательская модель на основе цепочки доказательств.

Представляем Science One Framework, экспериментальный исследовательский прототип, разработанный для устранения галлюцинаций путем построения проверяемых цепочек доказательств, а также CoE Audit, автоматизированный протокол для оценки целостности научных работ, созданных с помощью ИИ.

Быстрые ссылки

Крупные языковые модели (КГМ) все чаще используются не только в качестве помощников в кодировании, но и в качестве автономных агентов, способных выполнять сквозные рабочие процессы научных исследований. Современные системы (например, AI-Scientist от Sakana, AutoResearchClaw, DeepScientist, AI-Researcher) могут анализировать литературу, формулировать гипотезы, проводить эксперименты и писать полные рукописи, сопоставимые с работами, написанными человеком. Однако по мере улучшения поверхностного качества этих рукописей, созданных ИИ, возникла критическая структурная проблема: проверяемость. Поскольку современные автономные исследовательские конвейеры генерируют текст итеративно, ошибки, возникающие на любом этапе, усиливаются. Некоторые существующие системы могут генерировать несуществующие цитаты, демонстрировать несоответствия между описанными методами и фактическим кодом, а также сообщать экспериментальные результаты, которые не полностью воспроизводимы с помощью предоставленного кода.

В нашей статье мы решаем эту проблему, представляя Chain-of-Evidence (CoE) — новую структуру верификации для исследований, проводимых с использованием ИИ. Мы реализуем CoE на основе Science One Framework, автономного исследовательского прототипа, который изначально создает и поддерживает цепочки доказательств, и CoE Audit — набора автоматизированных метрик оценки, измеряющих целостность сгенерированных ИИ статей по отношению к их исходному коду и доказательствам. Наши результаты показывают, что базовые системы допускают ошибки до 21% в своих ссылках и часто не согласуют свой код и текст, в то время как Science One Framework достигает нулевого количества ложных ссылок и полностью верифицируемых оценок, демонстрируя при этом передовые результаты на таких эталонных тестах, как MLE-Bench и Parameter-Golf.

Цепочка доказательств: структура для проверяемых исследований

Концепция CoE (Core of Entity) — это концептуальная основа, определяющая, что делает исследовательский артефакт заслуживающим доверия, подобно тому как ACID определяет, что делает транзакцию в базе данных надежной. Вместо того чтобы предписывать, как создавать исследовательский агент, эта концепция определяет свойства, которыми должны обладать его выходные данные. Она следует единому принципу, состоящему из двух частей: каждое утверждение в исследовательском артефакте должно содержать зафиксированную цепочку доказательств (полнота), и каждая цепочка должна действительно подтверждать утверждение, к которому она прикреплена (корректность). Утверждение может быть ссылкой, сообщенным числом, описанием метода или заключением, которые должны ссылаться на соответствующие доказательства, такие как рецензируемая статья, строка лога эксперимента, фактически выполненный код или таблица результатов.

Гадюко-вымышленная ссылка указывает на статью, которой не существует. Невоспроизводимый результат не появляется снова при повторном запуске кода. Неправильно описанный метод утверждает, что в статье используется один алгоритм, а в коде реализован другой. Каждое из этих утверждений представляет собой разрыв в цепочке доказательств; аудит Центра передового опыта делает эти разрывы измеримыми.

Концепция Science One

Чтобы продемонстрировать возможность проведения проверяемых исследований в области ИИ без ущерба для эффективности решения задач, мы разработали структуру Science One Framework. В отличие от предыдущих агентов, которые генерируют статью и пытаются ретроспективно связать факты, Science One Framework реализует структуру CoE по своей сути через три основных модуля:

  • Исследование проблемы (литературная обоснованность): Чтобы предотвратить иллюзорные ссылки, платформа Science One Framework строит граф цитирования с помощью API Semantic Scholar. Она считывает до 100 полнотекстовых PDF-файлов по каждой теме, чтобы создать структурированный обзор исследования. Каждая ссылка в итоговой работе исходит из этого обоснованного вызова API, полностью исключая зависимость от памяти модели.
  • Механизм поиска (параллельное исследование-использование): Структура Science One систематически исследует и использует идеи в нескольких параллельных ветвях. В каждом изолированном цикле агент Solver реализует решение, а специализированный оценщик выставляет ему оценку. Высокоэффективные ветви итеративно совершенствуются, а все исходные данные оценщиков компилируются в строгую запись только для чтения.
  • Автор статьи и верификатор утверждений: Перед обработкой рукописи платформа Science One Framework создает структурированное представление каждого фактического утверждения с встроенным тегом подтверждения, связывающим его с конкретным артефактом рабочей области. Специальный верификатор утверждений проверяет каждое утверждение на соответствие заявленному источнику. Утверждения, которые выходят за рамки имеющихся доказательств, согласовываются с источником — переформулируются консервативно, а не удаляются, обеспечивая соответствие статьи тому, что подтверждается работой.

Конвейер обработки данных Science One Framework. Модуль «Исследование проблемы» анализирует литературу на основе полученных PDF-файлов. Модуль «Поиск решений» исследует и оценивает варианты их решения. Модуль «Написание и проверка статей» пишет и проверяет статью с помощью модуля «Проверка утверждений», обеспечивая соответствие всех утверждений источникам доказательств.

Аудит Центра передового опыта: измерение проверяемости

Для тщательной оценки прототипа Science One Framework по сравнению с передовыми базовыми решениями (например, AI Scientist v2 от Sakana AI, AutoResearchClaw, DeepScientist, AI-Researcher) мы разработали аудит CoE. Этот протокол постфактумной оценки действует как автоматизированный инструмент для проверки целостности, выполняя четыре строгие проверки целостности сгенерированных артефактов (статья, решение, код и ссылки):

  • Проверка оценки: Извлекает заявленную оценку из статьи и сравнивает её с результатами полностью независимого повторного запуска представленного кода.
  • Нарушение спецификации: Проверяет код решения, чтобы убедиться, что он действительно решает задачу, а не использует метрику оценщика или читает файлы с эталонными ответами.
  • Проверка ссылок: Сверяет каждую запись в библиографии с академическими API для выявления несуществующих фиктивных ссылок.
  • Согласование метода и кода: Эксперты из LLM сравнивают раздел описания метода в статье с кодом, чтобы убедиться, что текст точно описывает реализованный алгоритм.
Наука-Один-2

Обзор структуры аудита Центра передового опыта и четырех основных проверок на соответствие целостности данных.

Результаты

Мы применили аудит Центра передового опыта к 75 статьям, созданным в рамках пяти задач оптимизации систем (Prism, Cloudcast, EPLB, LLM-SQL и планирование транзакций) из эталонного набора данных Automated Design of Research Systems (ADRS).

Система Science One Framework значительно превзошла существующие базовые показатели по проверяемости. Аудит CoE применяет один и тот же независимый протокол ко всем системам, повторно проверяя каждую ссылку по действующим научным базам данных, и в рамках этого протокола Science One Framework лидировала по всем четырем проверкам целостности. Ни одна из ее ссылок не была фиктивной: каждая указывала на реальную, доступную статью, в отличие от фиктивных ссылок, достигавших 21% в базовых системах, поскольку исследователь проблем извлекает каждую ссылку, а не генерирует ее из памяти. Она также достигла идеальной проверки оценок и наивысшего соответствия метода и кода. В отличие от этого, базовые системы часто описывали сложные алгоритмы (например, «гибридные нейросимволические решатели»), когда представленный ими код представлял собой простую детерминированную эвристику.

Наука-Один-3-Финал

Результаты аудита Центра передового опыта по пяти системам.

Что особенно важно, внедрение строгой проверяемости не поставило под угрозу научные возможности агента. Система Science One Framework показала результаты, сопоставимые или превосходящие результаты экспертов-людей по всем пяти задачам ADRS, достигнув наилучшего общего результата среди всех систем по двум из них (Cloudcast и EPLB).

Наука-Один-4-Финал

Сравнение производительности решателя в пяти задачах MLE-Bench и Parameter Golf.

Для проверки его обобщающей способности мы применили платформу Science One Framework к шести весьма сложным внешним задачам:

  • MLE-Bench: В пяти сложных соревнованиях Kaggle, охватывающих медицинскую визуализацию, детальное распознавание и 3D-восприятие, Science One Framework завоевала две золотые медали (включая победный результат в задаче обнаружения 3D-объектов, где базовые модели полностью провалились) и две серебряные медали.
  • Parameter-Golf: Мы протестировали Science One Framework в реальном соревновании по обучению LLM с жесткими ограничениями по аппаратному обеспечению и размеру файлов. В то время как базовые системы не смогли предоставить корректные результаты, Science One Framework успешно выполнил все ограничения и достиг наилучшего результата (по состоянию на 27 апреля 2026 г.). Следует отметить, что Science One Framework обнаруживает подлинные и новые алгоритмические методы, а не просто корректирует поверхностные гиперпараметры.

С нетерпением жду

По мере того, как автономные исследовательские системы масштабируются для решения все более сложных научных задач, одного лишь качества решателя будет недостаточно для их различения. Разница в результатах будет заключаться в том, можно ли доверять полученным исследованиям. Наши выводы показывают, что проверяемость должна рассматриваться как первостепенное архитектурное ограничение. Создавая цепочки доказательств в момент выдвижения утверждения, а не пытаясь восстановить обоснование постфактум, структура Science One Framework демонстрирует, что агенты ИИ могут проводить строгие, заслуживающие доверия и высококонкурентные научные исследования. Мы надеемся, что структура «цепочки доказательств» и ее аудит станут ценными инструментами для сообщества в процессе подготовки следующего поколения ученых в области ИИ.

Благодарности

Мы хотели бы поблагодарить Бхавану Далви Мишру, Цзифэна Чена, Чун-Лян Ли, Палаша Гояла, Михира Пармара, Ивена Сонга, Йельского Сонга, Раджа Синха, Партасарати Ранганатана, Бурака Гоктюрка и Джинсунг Юна за их ценный вклад в эту работу.

Отказ от ответственности

Концепция Science One Framework — это экспериментальный исследовательский прототип, а не готовый к внедрению инструмент.

Источник: research.google

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники 5 платформ физического труда искусственного интеллекта, которые будут формировать робототехнику в 2026 году Новости робототехники DoorDash получила сертификат FAA на реализацию собственной программы доставки дронами. Архив рубрики ~Коротко из Telegram~ В Сан-Франциско запускают уборку домов андроидами — но есть нюанс… Архив рубрики ~Коротко из Telegram~ Художница почти бросила Fallout-новеллу из-за ИИ — но Reddit её… Новости робототехники Как искусственный интеллект сокращает сроки разработки лекарств в Китае Архив рубрики ~Обо всем~ Теннант сокращает выбросы при использовании продукции на 30 процентов за счет расширения автономной розетки Архив рубрики ~Коротко из Telegram~ Американский стартап Veterans Recovery Network Inc. анонсировал концепт проекта «цифрового… Архив рубрики ~Коротко из Telegram~ Энергетики «нанимают» овец, а технологии спасают экосистему На пустынном плато… Архив рубрики ~Коротко из Telegram~ Подборку топовых курсов по ИИ от Microsoft нашли в сети… Архив рубрики ~Коротко из Telegram~ Roblox запускает Build Roblox анонсировал Build — новый AI-инструмент, встроенный прямо в… Архив рубрики ~Коротко из Telegram~ Microsoft представила два новых ИИ-движка: MAI Image 2.5 Pro и… Архив рубрики ~Коротко из Telegram~ Как тестируют ИИ-модели — и почему рейтингам верить с… Архив рубрики ~Коротко из Telegram~ Runway упростил жизнь контент-мейкерам: Media Router выбирает модель за вас… Архив рубрики ~Коротко из Telegram~ Suno подвинули от колонки — Google пару часов назад выкатили модель… Новости робототехники 5 платформ физического труда искусственного интеллекта, которые будут формировать робототехнику в 2026 году Новости робототехники DoorDash получила сертификат FAA на реализацию собственной программы доставки дронами. Архив рубрики ~Коротко из Telegram~ В Сан-Франциско запускают уборку домов андроидами — но есть нюанс… Архив рубрики ~Коротко из Telegram~ Художница почти бросила Fallout-новеллу из-за ИИ — но Reddit её… Новости робототехники Как искусственный интеллект сокращает сроки разработки лекарств в Китае Архив рубрики ~Обо всем~ Теннант сокращает выбросы при использовании продукции на 30 процентов за счет расширения автономной розетки Архив рубрики ~Коротко из Telegram~ Американский стартап Veterans Recovery Network Inc. анонсировал концепт проекта «цифрового… Архив рубрики ~Коротко из Telegram~ Энергетики «нанимают» овец, а технологии спасают экосистему На пустынном плато… Архив рубрики ~Коротко из Telegram~ Подборку топовых курсов по ИИ от Microsoft нашли в сети… Архив рубрики ~Коротко из Telegram~ Roblox запускает Build Roblox анонсировал Build — новый AI-инструмент, встроенный прямо в… Архив рубрики ~Коротко из Telegram~ Microsoft представила два новых ИИ-движка: MAI Image 2.5 Pro и… Архив рубрики ~Коротко из Telegram~ Как тестируют ИИ-модели — и почему рейтингам верить с… Архив рубрики ~Коротко из Telegram~ Runway упростил жизнь контент-мейкерам: Media Router выбирает модель за вас… Архив рубрики ~Коротко из Telegram~ Suno подвинули от колонки — Google пару часов назад выкатили модель…

Оставить комментарий