Пустые полки или потерянные ключи? Проблема «воспоминания» является узким местом параметрической фактологии.
Когда студенты магистратуры ошибаются в фактах, происходит ли это потому, что они никогда их не изучали, или потому, что они не могут вспомнить то, что уже запомнили? Наша система профилирования знаний показывает последнее: студенты магистратуры, находящиеся на начальном этапе обучения, запоминают почти все факты, но испытывают трудности с их запоминанием.
Быстрые ссылки
- Бумага
- Википрофиль
- Делиться
- Скопировать ссылку ×
Фактическая достоверность имеет решающее значение для надежности больших языковых моделей (БЛМ). Если модель неправильно отвечает на фактический вопрос, происходит ли это потому, что факт никогда не был закодирован, или потому, что факт закодирован, но недоступен? Стандартные метрики точности объединяют эти случаи, хотя они указывают на совершенно разные ограничения и совершенно разные решения. Сбои кодирования требуют масштабирования размера модели или расширения охвата данных, в то время как сбои полноты могут также указывать на методы постобработки и вывода, которые помогают БЛМ лучше использовать уже закодированные данные.
В статье «Пустые полки или потерянные ключи? Воспроизведение — узкое место параметрической фактичности» мы представляем профилирование знаний — поведенческую модель, измеряющую как кодирование , так и воспроизведение , и используем её для изучения основных узких мест фактичности в передовых моделях LLM (таких как Gemini3 и GPT-5). Затем мы показываем, что многие фактические ошибки в передовых моделях LLM лучше понимать как потерянные ключи (ошибки воспроизведения) , а не как пустые полки (ошибки кодирования) .
По аналогии, мы используем термин «кодирование» для обозначения параметрического представления фактов, «воспроизведение» для обозначения извлечения закодированных фактов без внешних подсказок, а «распознавание» для обозначения идентификации правильного факта при его представлении среди альтернатив. Для поддержки этого анализа мы представляем WikiProfile — эталонный набор из 2150 фактов, полученных из Википедии, каждый из которых сопровождается десятью вопросами, проверяющими кодирование, воспроизведение и распознавание.
Основная идея: профилирование знаний.
Профилирование знаний смещает единицу анализа с отдельных вопросов на факты. Вместо того чтобы спрашивать, правильно ли модель ответила на конкретный вопрос, мы задаем более широкий вопрос: каково состояние факта? Мы классифицируем каждый факт по одному из пяти профилей знаний: (1) ошибка кодирования, (2) ошибка воспроизведения, (3) прямое воспроизведение, (4) воспроизведение с размышлением и (5) вывод без кодирования. Эти профили обеспечивают более информативную диагностику, чем просто точность на уровне вопроса.
Классификация основана на том, закодирован ли факт и насколько он доступен: его невозможно вспомнить, его можно вспомнить напрямую или его можно вспомнить только посредством мышления (с помощью промежуточных вычислений перед окончательным ответом, включая цепочку рассуждений и оптимизированные для мышления LLM).
Пять профилей знаний, характеризующих факты.
Мы реализуем это на практике с помощью трех поведенческих понятий:
- Кодирование: Модель кодирует факт, если она может правильно воспроизвести его в контексте, аналогичном контексту предварительного обучения. В нашей модели мы измеряем это с помощью завершения предложений и контекстных вопросов, которые помещают модель в контексты, аналогичные тем, в которых факт естественным образом появлялся бы во время предварительного обучения (без раскрытия ответа), тем самым подготавливая модель к тому, чтобы показать, закодирован ли факт.
- Знание: Модель знает факт, если она может правильно ответить на семантически эквивалентные вопросы о нем в разных формулировках, включая как прямые, так и обратные вопросы (например, если *A есть B*, прямой вопрос звучит как «Что такое B?», а обратный вопрос — как «Что такое A?»).
- Воспроизведение: Модель воспроизводит факт, если она знает закодированный факт. Если она воспроизводит факт без размышлений, это называется прямым воспроизведением. Если она знает факт, который не закодирован, это называется выводом без кодирования. Это происходит только тогда, когда размышления включены, и модель опирается на другие закодированные факты и выполняет многошаговые рассуждения или обоснованные предположения.
Вверху : Мы извлекаем факты из Википедии, основного источника данных для предварительного обучения. Слева : Мы измеряем кодирование, предлагая модели LLM воспроизводить факты в их первоначальном контексте. Справа : Мы измеряем знания, задавая вопросы в различных формулировках и направлениях связей, как с размышлением, так и без него.
Представляем WikiProfile
Для практического применения профилирования знаний мы создали WikiProfile — эталонный инструмент, предназначенный для измерения достоверности фактов, встречающихся в природе. WikiProfile создан с использованием полностью автоматизированного конвейера, работающего на основе LLM-системы Gemini-2.5-Pro с функцией мышления и подсказками. Подсказки были разработаны путем ручной оптимизации на небольшом отложенном подмножестве. Мы извлекаем потенциальные факты из страниц Википедии, идентифицируя факты: утверждение, включающее упорядоченную пару сущностей (субъект и объект), где субъект появляется первым в документе. Каждый факт сопоставляется с 10 заданиями: двумя для кодирования, четырьмя для оценки знаний и четырьмя вариантами множественного выбора для распознавания.
Мы генерируем прямые и обратные вопросы в три этапа: генерация, уточнение и фильтрация, обеспечивая однозначность, конкретность, краткость и уникальный ответ на каждый вопрос. Все вопросы проходят фильтрацию на основе поисковой системы. Мы отбрасываем случаи, когда возвращается несколько ответов или требуется уточнение. После автоматической фильтрации и заключительного этапа ручной проверки эталонный набор содержит 2150 фактов.
Полностью автоматизированный конвейер обработки информации на основе заданных LLM-шаблонов. Слева (фиолетовый): Извлечение фактов и построение задачи на завершение утверждения. В центре (красный и синий): Построение прямых и обратных вопросов путем генерации, уточнения и фильтрации. Справа (зеленый): Создание оставшихся вопросов (естественные формулировки, контекстные и варианты с несколькими вариантами ответа) на основе пар прямой/обратной формулировки.
Как мы оцениваем программы магистратуры в области права
Мы оцениваем 13 моделей LLM. Каждая модель оценивается как с учетом, так и без учета логического мышления. Для каждой модели, факта и задачи мы получаем восемь ответов. Ответы оцениваются автоматически с помощью автоматических оценщиков LLM (подробнее в статье), что составляет приблизительно 4,5 миллиона ответов.
Основной вывод: узким местом является не кодирование, а полнота воспроизведения.
В передовых моделях LLM (Gemini-2.5-Pro, Gemini-3-Pro и Flash, GPT-5) фактическое кодирование близко к насыщению, но воспроизведение — нет. Для Gemini-3-Pro и GPT-5 закодировано 95–98% фактов, однако эти модели по-прежнему не могут напрямую воспроизвести 26–34% фактов. Даже с учетом мыслительных процессов они все еще ошибаются в 11–12% случаев . Это означает, что в передовых моделях фактические ошибки все чаще возникают не из-за отсутствия знаний, а из-за знаний, которые хранятся и к которым нет надежного доступа. Другими словами, узкое место смещается от приобретения знаний к их использованию.
Масштабирование подтверждает эту картину. В семействе Gemma 3 более крупные модели демонстрируют гораздо меньше ошибок кодирования, но ошибки полноты остаются существенными и составляют большую долю оставшихся ошибок. Масштабирование улучшает то, что модель хранит, больше, чем то, к чему модель может получить доступ.
Распределение пяти профилей по 13 моделям LLM (в процентах). Черная линия обозначает потенциальные знания. Как показано, количество ошибок кодирования резко уменьшается с увеличением масштаба, в то время как ошибки припоминания сохраняются даже в моделях с граничными условиями.
Почему происходит сбой в процессе отзыва информации?
Наши результаты показывают, что запоминание тесно связано с условиями, в которых был усвоен факт. Когда запрос отклоняется от контекста, формулировки или порядка, в котором был обнаружен факт во время обучения, запоминание становится сложнее. Мы выделяем два случая, когда это происходит систематически.
Редкие факты зашифрованы, но их трудно вспомнить.
Предыдущие исследования показали, что модели с длинным хвостом информации испытывают трудности с обработкой редких фактов, часто рассматривая это как проблему ограниченности возможностей модели. Наши результаты предполагают иную картину. При сравнении малоизвестных и широко известных фактов мы обнаруживаем, что редкие факты кодируются со скоростью, близкой к скорости кодирования популярных фактов. Разница в кодировании относительно невелика, однако разница в запоминании больше. Это переосмысливает проблему длинных хвостов: многие редкие факты не отсутствуют в параметрах модели. Они присутствуют, но к ним трудно получить доступ. Узкое место сместилось от приобретения знаний к их использованию.
Мы сравниваем два уровня популярности (нижние 20% против верхних 20%) по показателям кодирования и прямого воспроизведения. Δ указывает на разницу между уровнями. Как показано, она невелика для кодирования, но велика для воспроизведения. Результаты всех LLM представлены в нашей статье.
Вопросы с обратной формулировкой поддаются проверке, но их трудно вспомнить.
Мы также возвращаемся к проблеме « проклятия обратной связи »: когда модели с обратным ответом знают, что «А — это В», но не могут ответить на вопрос «Что такое В?». На первый взгляд, это может указывать на отсутствие у моделей двунаправленного знания. Но наши результаты предполагают уточнение этой точки зрения. В задачах на генерацию ответов в свободной форме (т.е., на воспроизведение) обратные вопросы неизменно сложнее прямых. Однако в задачах на проверку с несколькими вариантами ответа (т.е., на распознавание) обратные вопросы не сложнее прямых, а часто даже проще. Это расхождение имеет значение. Если модель может распознать правильный ответ, когда он представлен среди отвлекающих вариантов, но не может сгенерировать его в обратном запросе, то проблема заключается не просто в отсутствии двунаправленного знания. Скорее, факт, по-видимому, закодирован и даже распознаваем, но его трудно вспомнить, когда направление запроса отличается от того, как этот факт был получен во время обучения. «Проклятие обратной связи» — это проблема воспроизведения.
Мы сравниваем прямые и обратные вопросы в двух задачах: проверка (множественный выбор) и генерация (без использования учебников). Δ обозначает разницу между прямым и обратным вариантами. LLM эффективно справляются с обратными вопросами при проверке, но испытывают трудности при генерации.
Мышление как механизм восстановления
Теперь перейдем к вопросу о том, что позволяет восстанавливать знания, которые иначе были бы недоступны. С этой целью мы рассмотрим потенциал мышления в выполнении этой роли. Мышление наиболее сильно улучшает запоминание именно там, где прямое запоминание наиболее слабое. Улучшения особенно заметны для редких фактов и обратных вопросов, сокращая как разрыв в популярности, так и разрыв в направленности.
Мы исследуем влияние мышления на запоминание (знание закодированных фактов). Слева : мы сравниваем два уровня популярности фактов (нижние 20% против верхних 20%). Справа : мы сравниваем прямые и обратные вопросы. Разница в популярности или направленности обозначена Δ (без мышления) и ΔT (с мышлением).
Как показано, мышление сужает разрывы ( ΔT < Δ).
В частности, в моделях, оптимизированных для мышления, мышление позволяет восстановить примерно 40–65% закодированных, но не известных напрямую фактов. Напротив, оно гораздо меньше помогает в отношении не закодированных фактов. Эта закономерность предполагает, что мышление в основном действует как механизм облегчения запоминания: оно помогает модели получить доступ к уже закодированным фактам, а не в основном выводить ответы посредством сложных многоступенчатых рассуждений. Тем не менее, мышление не бесплатно. Оно сопряжено с вычислительными затратами, и остается неясным, как точно определить, когда модель должна его задействовать.
Мы приводим процент неизвестных фактов, которые становятся известными в процессе мышления, в зависимости от того, закодирован ли факт (красный) или нет (желтый). Мышление восстанавливает 40–65% закодированных фактов в оптимизированных для мышления моделях обучения с линейной логикой, но только 5–15% незакодированных фактов.
Еда на вынос
Профилирование знаний позволяет нам точно диагностировать фактическое поведение в моделях с линейной структурой. Применение этой методологии к фактам из Википедии показывает, что наши результаты указывают на необходимость изменения подхода к анализу фактических ошибок в передовых моделях с линейной структурой. Если кодирование уже близко к насыщению, то дальнейшее повышение фактической достоверности может происходить не столько за счет масштабирования (размера модели или данных). Показав, что мышление может восстановить значительную часть закодированных, но не известных напрямую фактов, можно предположить, что следующие улучшения фактической достоверности могут происходить не только за счет лучшего усвоения знаний, но и за счет лучшего использования знаний, уже закодированных в модели.
Источник: research.google
Похожие записи
- Злоупотребление альтернативными средами выполнения. Проблемы с Deno-tes Defender.
- Наконец-то дошли сведения клиентов и водителей Grubhub, получивших от Федеральной торговой комиссии (FTC) компенсацию в размере 24 миллионов долларов в рамках соглашения с компанией.
- Что ждет нас в будущем с AI? Полный перевод манифеста Марка Цукерберга
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
