Архив рубрики ~Лента новостей~

Пустые полки или потерянные ключи? Проблема «воспоминания» является узким местом параметрической фактологии.

Пустые полки или потерянные ключи? Проблема «воспоминания» является узким местом параметрической фактологии.
Пустые полки или потерянные ключи? Проблема «воспоминания» является узким местом параметрической фактологии.

Когда студенты магистратуры ошибаются в фактах, происходит ли это потому, что они никогда их не изучали, или потому, что они не могут вспомнить то, что уже запомнили? Наша система профилирования знаний показывает последнее: студенты магистратуры, находящиеся на начальном этапе обучения, запоминают почти все факты, но испытывают трудности с их запоминанием.

Быстрые ссылки

Фактическая достоверность имеет решающее значение для надежности больших языковых моделей (БЛМ). Если модель неправильно отвечает на фактический вопрос, происходит ли это потому, что факт никогда не был закодирован, или потому, что факт закодирован, но недоступен? Стандартные метрики точности объединяют эти случаи, хотя они указывают на совершенно разные ограничения и совершенно разные решения. Сбои кодирования требуют масштабирования размера модели или расширения охвата данных, в то время как сбои полноты могут также указывать на методы постобработки и вывода, которые помогают БЛМ лучше использовать уже закодированные данные.

В статье «Пустые полки или потерянные ключи? Воспроизведение — узкое место параметрической фактичности» мы представляем профилирование знаний — поведенческую модель, измеряющую как кодирование , так и воспроизведение , и используем её для изучения основных узких мест фактичности в передовых моделях LLM (таких как Gemini3 и GPT-5). Затем мы показываем, что многие фактические ошибки в передовых моделях LLM лучше понимать как потерянные ключи (ошибки воспроизведения) , а не как пустые полки (ошибки кодирования) .

По аналогии, мы используем термин «кодирование» для обозначения параметрического представления фактов, «воспроизведение» для обозначения извлечения закодированных фактов без внешних подсказок, а «распознавание» для обозначения идентификации правильного факта при его представлении среди альтернатив. Для поддержки этого анализа мы представляем WikiProfile — эталонный набор из 2150 фактов, полученных из Википедии, каждый из которых сопровождается десятью вопросами, проверяющими кодирование, воспроизведение и распознавание.

Основная идея: профилирование знаний.

Профилирование знаний смещает единицу анализа с отдельных вопросов на факты. Вместо того чтобы спрашивать, правильно ли модель ответила на конкретный вопрос, мы задаем более широкий вопрос: каково состояние факта? Мы классифицируем каждый факт по одному из пяти профилей знаний: (1) ошибка кодирования, (2) ошибка воспроизведения, (3) прямое воспроизведение, (4) воспроизведение с размышлением и (5) вывод без кодирования. Эти профили обеспечивают более информативную диагностику, чем просто точность на уровне вопроса.

Классификация основана на том, закодирован ли факт и насколько он доступен: его невозможно вспомнить, его можно вспомнить напрямую или его можно вспомнить только посредством мышления (с помощью промежуточных вычислений перед окончательным ответом, включая цепочку рассуждений и оптимизированные для мышления LLM).

Пять профилей знаний, характеризующих факты.

Мы реализуем это на практике с помощью трех поведенческих понятий:

  • Кодирование: Модель кодирует факт, если она может правильно воспроизвести его в контексте, аналогичном контексту предварительного обучения. В нашей модели мы измеряем это с помощью завершения предложений и контекстных вопросов, которые помещают модель в контексты, аналогичные тем, в которых факт естественным образом появлялся бы во время предварительного обучения (без раскрытия ответа), тем самым подготавливая модель к тому, чтобы показать, закодирован ли факт.
  • Знание: Модель знает факт, если она может правильно ответить на семантически эквивалентные вопросы о нем в разных формулировках, включая как прямые, так и обратные вопросы (например, если *A есть B*, прямой вопрос звучит как «Что такое B?», а обратный вопрос — как «Что такое A?»).
  • Воспроизведение: Модель воспроизводит факт, если она знает закодированный факт. Если она воспроизводит факт без размышлений, это называется прямым воспроизведением. Если она знает факт, который не закодирован, это называется выводом без кодирования. Это происходит только тогда, когда размышления включены, и модель опирается на другие закодированные факты и выполняет многошаговые рассуждения или обоснованные предположения.
Диаграмма, операционализирующая фактические знания в LLM. Она определяет кодирование как воспроизведение факта в контексте предварительного обучения, а знание как правильный ответ на прямые или обратные вопросы о нем.

Вверху : Мы извлекаем факты из Википедии, основного источника данных для предварительного обучения. Слева : Мы измеряем кодирование, предлагая модели LLM воспроизводить факты в их первоначальном контексте. Справа : Мы измеряем знания, задавая вопросы в различных формулировках и направлениях связей, как с размышлением, так и без него.

Представляем WikiProfile

Для практического применения профилирования знаний мы создали WikiProfile — эталонный инструмент, предназначенный для измерения достоверности фактов, встречающихся в природе. WikiProfile создан с использованием полностью автоматизированного конвейера, работающего на основе LLM-системы Gemini-2.5-Pro с функцией мышления и подсказками. Подсказки были разработаны путем ручной оптимизации на небольшом отложенном подмножестве. Мы извлекаем потенциальные факты из страниц Википедии, идентифицируя факты: утверждение, включающее упорядоченную пару сущностей (субъект и объект), где субъект появляется первым в документе. Каждый факт сопоставляется с 10 заданиями: двумя для кодирования, четырьмя для оценки знаний и четырьмя вариантами множественного выбора для распознавания.

Мы генерируем прямые и обратные вопросы в три этапа: генерация, уточнение и фильтрация, обеспечивая однозначность, конкретность, краткость и уникальный ответ на каждый вопрос. Все вопросы проходят фильтрацию на основе поисковой системы. Мы отбрасываем случаи, когда возвращается несколько ответов или требуется уточнение. После автоматической фильтрации и заключительного этапа ручной проверки эталонный набор содержит 2150 фактов.

Блок-схема, подробно описывающая процесс преобразования документов Википедии в проверенные вопросы с несколькими вариантами ответа в рамках программы WikiProfile.

Полностью автоматизированный конвейер обработки информации на основе заданных LLM-шаблонов. Слева (фиолетовый): Извлечение фактов и построение задачи на завершение утверждения. В центре (красный и синий): Построение прямых и обратных вопросов путем генерации, уточнения и фильтрации. Справа (зеленый): Создание оставшихся вопросов (естественные формулировки, контекстные и варианты с несколькими вариантами ответа) на основе пар прямой/обратной формулировки.

Как мы оцениваем программы магистратуры в области права

Мы оцениваем 13 моделей LLM. Каждая модель оценивается как с учетом, так и без учета логического мышления. Для каждой модели, факта и задачи мы получаем восемь ответов. Ответы оцениваются автоматически с помощью автоматических оценщиков LLM (подробнее в статье), что составляет приблизительно 4,5 миллиона ответов.

Основной вывод: узким местом является не кодирование, а полнота воспроизведения.

В передовых моделях LLM (Gemini-2.5-Pro, Gemini-3-Pro и Flash, GPT-5) фактическое кодирование близко к насыщению, но воспроизведение — нет. Для Gemini-3-Pro и GPT-5 закодировано 95–98% фактов, однако эти модели по-прежнему не могут напрямую воспроизвести 26–34% фактов. Даже с учетом мыслительных процессов они все еще ошибаются в 11–12% случаев . Это означает, что в передовых моделях фактические ошибки все чаще возникают не из-за отсутствия знаний, а из-за знаний, которые хранятся и к которым нет надежного доступа. Другими словами, узкое место смещается от приобретения знаний к их использованию.

Масштабирование подтверждает эту картину. В семействе Gemma 3 более крупные модели демонстрируют гораздо меньше ошибок кодирования, но ошибки полноты остаются существенными и составляют большую долю оставшихся ошибок. Масштабирование улучшает то, что модель хранит, больше, чем то, к чему модель может получить доступ.

Столбчатая диаграмма с накоплением, показывающая распределение пяти состояний извлечения знаний в различных языковых моделях.

Распределение пяти профилей по 13 моделям LLM (в процентах). Черная линия обозначает потенциальные знания. Как показано, количество ошибок кодирования резко уменьшается с увеличением масштаба, в то время как ошибки припоминания сохраняются даже в моделях с граничными условиями.

Почему происходит сбой в процессе отзыва информации?

Наши результаты показывают, что запоминание тесно связано с условиями, в которых был усвоен факт. Когда запрос отклоняется от контекста, формулировки или порядка, в котором был обнаружен факт во время обучения, запоминание становится сложнее. Мы выделяем два случая, когда это происходит систематически.

Редкие факты зашифрованы, но их трудно вспомнить.

Предыдущие исследования показали, что модели с длинным хвостом информации испытывают трудности с обработкой редких фактов, часто рассматривая это как проблему ограниченности возможностей модели. Наши результаты предполагают иную картину. При сравнении малоизвестных и широко известных фактов мы обнаруживаем, что редкие факты кодируются со скоростью, близкой к скорости кодирования популярных фактов. Разница в кодировании относительно невелика, однако разница в запоминании больше. Это переосмысливает проблему длинных хвостов: многие редкие факты не отсутствуют в параметрах модели. Они присутствуют, но к ним трудно получить доступ. Узкое место сместилось от приобретения знаний к их использованию.

Гистограммы, показывающие, что языковые модели лучше кодируют и запоминают факты, пользующиеся высокой популярностью, чем факты, пользующиеся низкой популярностью.

Мы сравниваем два уровня популярности (нижние 20% против верхних 20%) по показателям кодирования и прямого воспроизведения. Δ указывает на разницу между уровнями. Как показано, она невелика для кодирования, но велика для воспроизведения. Результаты всех LLM представлены в нашей статье.

Вопросы с обратной формулировкой поддаются проверке, но их трудно вспомнить.

Мы также возвращаемся к проблеме « проклятия обратной связи »: когда модели с обратным ответом знают, что «А — это В», но не могут ответить на вопрос «Что такое В?». На первый взгляд, это может указывать на отсутствие у моделей двунаправленного знания. Но наши результаты предполагают уточнение этой точки зрения. В задачах на генерацию ответов в свободной форме (т.е., на воспроизведение) обратные вопросы неизменно сложнее прямых. Однако в задачах на проверку с несколькими вариантами ответа (т.е., на распознавание) обратные вопросы не сложнее прямых, а часто даже проще. Это расхождение имеет значение. Если модель может распознать правильный ответ, когда он представлен среди отвлекающих вариантов, но не может сгенерировать его в обратном запросе, то проблема заключается не просто в отсутствии двунаправленного знания. Скорее, факт, по-видимому, закодирован и даже распознаваем, но его трудно вспомнить, когда направление запроса отличается от того, как этот факт был получен во время обучения. «Проклятие обратной связи» — это проблема воспроизведения.

Гистограммы, сравнивающие производительность языковых моделей при прямом и обратном поиске фактов в задачах проверки и генерации.

Мы сравниваем прямые и обратные вопросы в двух задачах: проверка (множественный выбор) и генерация (без использования учебников). Δ обозначает разницу между прямым и обратным вариантами. LLM эффективно справляются с обратными вопросами при проверке, но испытывают трудности при генерации.

Мышление как механизм восстановления

Теперь перейдем к вопросу о том, что позволяет восстанавливать знания, которые иначе были бы недоступны. С этой целью мы рассмотрим потенциал мышления в выполнении этой роли. Мышление наиболее сильно улучшает запоминание именно там, где прямое запоминание наиболее слабое. Улучшения особенно заметны для редких фактов и обратных вопросов, сокращая как разрыв в популярности, так и разрыв в направленности.

Гистограммы, показывающие, как этап мышления улучшает запоминание информации в зависимости от популярности фактов и направления вопросов для различных моделей.

Мы исследуем влияние мышления на запоминание (знание закодированных фактов). Слева : мы сравниваем два уровня популярности фактов (нижние 20% против верхних 20%). Справа : мы сравниваем прямые и обратные вопросы. Разница в популярности или направленности обозначена Δ (без мышления) и ΔT (с мышлением).

Как показано, мышление сужает разрывы ( ΔT < Δ).

В частности, в моделях, оптимизированных для мышления, мышление позволяет восстановить примерно 40–65% закодированных, но не известных напрямую фактов. Напротив, оно гораздо меньше помогает в отношении не закодированных фактов. Эта закономерность предполагает, что мышление в основном действует как механизм облегчения запоминания: оно помогает модели получить доступ к уже закодированным фактам, а не в основном выводить ответы посредством сложных многоступенчатых рассуждений. Тем не менее, мышление не бесплатно. Оно сопряжено с вычислительными затратами, и остается неясным, как точно определить, когда модель должна его задействовать.

Линейный график показывает, что факты с гораздо большей вероятностью будут извлечены в процессе мышления, если они уже закодированы в модели.

Мы приводим процент неизвестных фактов, которые становятся известными в процессе мышления, в зависимости от того, закодирован ли факт (красный) или нет (желтый). Мышление восстанавливает 40–65% закодированных фактов в оптимизированных для мышления моделях обучения с линейной логикой, но только 5–15% незакодированных фактов.

Еда на вынос

Профилирование знаний позволяет нам точно диагностировать фактическое поведение в моделях с линейной структурой. Применение этой методологии к фактам из Википедии показывает, что наши результаты указывают на необходимость изменения подхода к анализу фактических ошибок в передовых моделях с линейной структурой. Если кодирование уже близко к насыщению, то дальнейшее повышение фактической достоверности может происходить не столько за счет масштабирования (размера модели или данных). Показав, что мышление может восстановить значительную часть закодированных, но не известных напрямую фактов, можно предположить, что следующие улучшения фактической достоверности могут происходить не только за счет лучшего усвоения знаний, но и за счет лучшего использования знаний, уже закодированных в модели.

Источник: research.google

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Во втором квартале в 2026 году спрос на робототехнику увеличится во всех отраслях, сообщает А3 Новости робототехники Китай лидирует во внедрении беспилотных автомобилей, говорится в новом отчете. Новости робототехники DAF Trucks интегрирует Einride Driver для масштабирования автономных электрических грузовых перевозок Архив рубрики ~Коротко из Telegram~ Claude приблизил математиков к решению одной из главных задач современности. Речь… Архив рубрики ~Коротко из Telegram~ Есть часы позвонить? Motorola готовит часы, которые раскладываются в телефон. Компания… Архив рубрики ~Коротко из Telegram~ ИИ-компания снимет хоррор под названием «Потрогать траву» Продюсер «Закулисья реальности»… Архив рубрики ~Коротко из Telegram~ Gemini снова не дотянула до гонки флагманов Похоже, у Google… Новости робототехники Как вам такое, фанаты Marvel? Китайцы показали полноразмерную броню Железного… Архив рубрики ~Коротко из Telegram~ LLM Хуанга в погоне за всеми зайцами После похвалы от… Архив рубрики ~Коротко из Telegram~ 🎬 CinePrompt — перестаньте гадать, как описать кадр нейросети Придумали крутую… Архив рубрики ~Коротко из Telegram~ Российский рынок искусственного интеллекта вырос на 29,7% за 2025 год… Архив рубрики ~Коротко из Telegram~ В России определили критерии для признания ИИ-моделей национальными. Разработчик должен… Архив рубрики ~Коротко из Telegram~ ➡️ Шуай Го из Towards Data Science собирает browser-use агента… Архив рубрики ~Коротко из Telegram~ 📺 Американская компания Roku запустила телеканал, где весь контент полностью… Новости робототехники Во втором квартале в 2026 году спрос на робототехнику увеличится во всех отраслях, сообщает А3 Новости робототехники Китай лидирует во внедрении беспилотных автомобилей, говорится в новом отчете. Новости робототехники DAF Trucks интегрирует Einride Driver для масштабирования автономных электрических грузовых перевозок Архив рубрики ~Коротко из Telegram~ Claude приблизил математиков к решению одной из главных задач современности. Речь… Архив рубрики ~Коротко из Telegram~ Есть часы позвонить? Motorola готовит часы, которые раскладываются в телефон. Компания… Архив рубрики ~Коротко из Telegram~ ИИ-компания снимет хоррор под названием «Потрогать траву» Продюсер «Закулисья реальности»… Архив рубрики ~Коротко из Telegram~ Gemini снова не дотянула до гонки флагманов Похоже, у Google… Новости робототехники Как вам такое, фанаты Marvel? Китайцы показали полноразмерную броню Железного… Архив рубрики ~Коротко из Telegram~ LLM Хуанга в погоне за всеми зайцами После похвалы от… Архив рубрики ~Коротко из Telegram~ 🎬 CinePrompt — перестаньте гадать, как описать кадр нейросети Придумали крутую… Архив рубрики ~Коротко из Telegram~ Российский рынок искусственного интеллекта вырос на 29,7% за 2025 год… Архив рубрики ~Коротко из Telegram~ В России определили критерии для признания ИИ-моделей национальными. Разработчик должен… Архив рубрики ~Коротко из Telegram~ ➡️ Шуай Го из Towards Data Science собирает browser-use агента… Архив рубрики ~Коротко из Telegram~ 📺 Американская компания Roku запустила телеканал, где весь контент полностью…

Оставить комментарий