Архив рубрики ~Лента новостей~

Модели прогнозирования способны восстановить до 65% фактов, которые они не могут вспомнить напрямую, — просто за счёт более длительного размышления.

Модели прогнозирования способны восстановить до 65% фактов, которые они не могут вспомнить напрямую, — просто за счёт более длительного размышления.
Модели прогнозирования способны восстановить до 65% фактов, которые они не могут вспомнить напрямую, — просто за счёт более длительного размышления.

Бен Диксон

Опубликовано

Обновлено

Когда большие языковые модели (ЛМГ) дают сбой, разработчики обычно предполагают, что модели не хватает необходимых фактов. Инженерные группы диагностируют ошибку как недостающие знания. Стандартная реакция — увеличение размера модели, расширение обучающих данных или создание сложных архитектур поиска.

Новое исследование, проведенное учеными из Google Research и Техниона, демонстрирует, что знания часто не отсутствуют. Модель содержит информацию, закодированную параметрически, но не может выявить ее в процессе генерации.

Их эксперименты показывают, что передовые модели, такие как GPT-5 и Gemini-3, кодируют 95-98% проверяемых фактов. Это указывает на то, что во многих случаях основным узким местом для точности фактов является не кодирование, а полнота.

Понимая, как извлечь доступ к существующим знаниям с помощью вычислений на этапе вывода, инженерные команды могут создавать более надежные приложения, не обязательно полагаясь на более крупные модели или внешние базы данных.

Профилирование знаний: измерение того, что модели действительно знают.

Чтобы устранить этот разрыв между хранением и извлечением информации, исследователи предлагают сместить акцент в оценке с точности на уровне вопросов на профилирование на уровне фактов. Вместо того чтобы просто оценивать, правильно или неправильно ли модель отвечает на отдельный вопрос, профилирование на уровне фактов проверяет один базовый фрагмент информации в нескольких условиях, оценивая, хранится ли этот факт вообще в параметрах модели, можно ли его запросить с разных сторон и в разных формулировках, и какие вычислительные усилия требуются для его извлечения.

Данная концепция различает параметрическое «кодирование» факта и его «известность». Модель кодирует факт, если она может точно воспроизвести его, предварительно используя исходный контекст обучения. Модель знает факт, если она может надежно отвечать на вопросы о нем в различных формулировках и направлениях.

«С точки зрения точности, ошибки кодирования и ошибки полноты неотличимы друг от друга, однако они подразумевают разные ограничения и решения», — пишут исследователи. «Ошибки кодирования требуют вмешательств на этапе предварительного обучения, таких как масштабирование размера модели или охвата данных. Ошибки полноты указывают на необходимость вмешательств после обучения, которые часто улучшают использование моделями уже закодированных данных».

В статье это иллюстрируется на примере: группа Oasis отыграла свой первый концерт в клубе Boardwalk. На основе того, как модели обрабатывают эту информацию, исследование классифицирует знания на пять различных профилей:

профилирование знаний
  • Прямое воспроизведение: Модель кодирует факт и легко получает к нему доступ для ответа на прямые вопросы без дополнительных вычислительных операций.

  • Ошибка кодирования (пустые полки): Модель не кодирует и не знает фактов. Она не может закончить предложение в стиле Википедии о ранних годах Oasis, а также не может ответить на вопросы об этом событии. Это указывает на необходимость в большем объеме данных для предварительного обучения или большей мощности модели.

  • Ошибка при воспроизведении (потерянные ключи): Модель имеет закодированный факт, но не может получить к нему доступ. Она может без проблем завершить исходный обучающий текст об Oasis, но не может ответить на вопрос «Где Oasis дали свой первый концерт?», даже если ей дали время подумать.

  • Воспроизведение посредством мышления: факт закодирован, но недоступен для непосредственного воспроизведения. Он успешно воспроизводится только тогда, когда модель использует вычисления на этапе вывода, такие как «цепочка мыслей», чтобы преодолеть этот разрыв. Исследователи называют этот механизм облегчением воспроизведения. Модель может изначально не ответить на прямой вопрос. Генерируя промежуточные мысли о ранней истории группы в Манчестере, она структурно подготавливает себя к поиску и воспроизведению заблокированного ответа.

  • Умозаключение без кодирования: Модель никогда явно не кодировала факт об Oasis. Вместо этого она успешно отвечает на вопрос, делая обоснованное предположение или рассуждая на основе других закодированных фактов, которые ей известны. Она может вывести ответ, связывая воедино отдельные точки данных, такие как «Oasis образовались в Манчестере», «Boardwalk был известным музыкальным клубом 90-х годов» и «в Boardwalk проходили первые концерты начинающих групп».

Иллюзии масштабирования, длинные хвосты и восстановление на кончике языка

Исследователи оценили 13 программ обучения гуманитарным и социальным наукам (LLM) на основе более чем 4 миллионов ответов. Они использовали WikiProfile, эталонный набор данных, содержащий 2150 фактов, извлеченных из Википедии, и проверяли каждый факт в различных форматах, от точного дополнения контекста до проверки с помощью множественного выбора.

Для передовых моделей, таких как GPT-5 и Gemini-3, кодирование приближается к насыщению. Эти модели успешно кодируют 95-98% тестируемых фактов. Однако они по-прежнему не могут напрямую вспомнить 26-34% закодированных фактов без размышления.

Вспомните, обдумав.

Процесс мышления на этапе вывода информации выступает в качестве важного механизма восстановления. Предоставление моделям дополнительных вычислительных ресурсов позволяет успешно извлечь 40-65% закодированных фактов, которые модели изначально не могут вспомнить напрямую. Исследователи сравнивают это с состоянием «на кончике языка», когда целенаправленные усилия, такие как мысленное воспроизведение контекста, в конечном итоге помогают запомнить информацию.

Увеличение размера модели не устраняет этот пробел автоматически. На самом деле, компании часто ошибочно пытаются решить проблему сбоев при отзыве продукции, дорабатывая более крупные внутренние модели — дорогостоящая архитектурная ошибка.

«Когда данные оказываются неверными, первым делом предпринимается шаг к масштабированию, то есть к обучению более крупной модели или добавлению большего количества данных», — сказал VentureBeat Нитай Кальдерон, научный сотрудник Google. «Оба варианта дорогостоящие, и если данные уже закодированы, ни один из них не помогает».

Например, исследователи обнаружили, что масштабирование модели Gemma3 с 1 миллиарда до 27 миллиардов параметров в значительной степени заполнило «пустые полки», снизив количество ошибок кодирования с 85% до 23%. Но в то же время доля ошибок при воспроизведении увеличилась, достигнув пика в 40% без осознанного мышления.

Это говорит о том, что масштабирование в основном решает проблему хранения, а не проблему доступа. По мере того, как модель запоминает значительно больше фактов, больший объем знаний оказывается запертым в «закодированном, но недоступном» состоянии. Основная часть ошибок модели смещается от отсутствия данных к ошибкам при воспроизведении.

«Наши результаты показывают, что способность к запоминанию тесно связана с условиями, в которых были усвоены факты, и ухудшается, когда запросы отклоняются от шаблонов, существовавших во время обучения», — пишут исследователи. То, как пользователь задает вопрос, напрямую определяет, сможет ли модель получить доступ к сохраненному ответу.

Например, эксперименты показали, что редкие факты запоминаются со скоростью, аналогичной запоминанию популярных фактов. Однако они обнаружили большой разрыв в запоминаемости между «длинным хвостом» и очень популярными фактами, превышающий 25% для моделей границ эффективности.

Распределение профилей знаний в различных программах магистратуры по праву.

Аналогично, моделям сложно находить ответы на вопросы с обратным порядком вопросов (то есть, когда спрашивается подлежащее, а не дополнение). Например, модель может легко ответить, что группа Oasis отыграла свой первый концерт в клубе Boardwalk, но не сможет ответить, кто именно играл их первый концерт в этом же клубе. В то же время, те же самые модели демонстрируют знание правильного ответа, когда им задают тот же вопрос в формате множественного выбора.

«В то время как эти сбои часто интерпретируются как ограничения памяти или двустороннего кодирования, наши результаты указывают на другую картину: редкие факты часто кодируются, но недоступны, а обратные факты могут быть распознаны, даже если их невозможно воспроизвести», — пишут исследователи. «Это переосмысливает оба явления как сбои в воспроизведении, а не как „недостаток знаний“».

Окупаемость инвестиций в размышления и советы для разработчиков

Высокие темпы кодирования в перспективных моделях требуют изменения подхода разработчиков к фактической информации и архитектуре конвейера обработки данных.

Не следует рассматривать каждую фактическую ошибку как проблему поиска: стандартная реакция предприятия на подобные «галлюцинации» часто заключается в развертывании генерации с расширенным поиском (Retrieval-Augmented Generation, RAG), масштабировании векторных баз данных или добавлении большего количества документов из предметной области. Хотя RAG является правильным решением для свежих или внутренних данных, использование его в качестве универсального решения для «галлюцинаций» увеличивает задержку и затраты на факты, которые модель уже хранит в своей параметрической памяти.

«Многие задачи, которые решаются с помощью RAG, связаны с фактами, на которые модель уже может ответить по памяти, поэтому вы платите дополнительную задержку и стоимость каждого вызова впустую», — сказал Кальдерон. «Если факт действительно отсутствует, RAG может стать правильным решением. Но если факт закодирован, и модель просто не может его вспомнить, RAG и масштабирование модели только увеличивают затраты на решение реальной проблемы».

Используйте рассуждения на этапе вывода выборочно: мышление позволило восстановить 40–65% закодированных фактов, которые модели не смогли напрямую вспомнить. Однако, поскольку только 10–20% фактов действительно требуют мышления, включение его глобально приводит к нерациональному использованию вычислительных ресурсов. Проблема заключается в динамической маршрутизации запросов, поскольку моделям не хватает самосознания, чтобы надежно диагностировать, когда они вот-вот начнут давать сбой.

«Чтобы эффективно использовать вычислительные ресурсы, модель должна заранее понимать, что простой ответ вот-вот окажется неверным, чтобы она могла ускорить процесс, прежде чем дать ответ», — сказал Кальдерон. «Это самосознание — само по себе навык, и современные модели не всегда справляются с ним». Именно это метакогнитивное узкое место является причиной того, почему исследователи Google разрабатывают такие концепции, как «верная неопределенность», чтобы позволить моделям точно оценивать собственную уверенность и запускать более глубокие рассуждения, а не галлюцинации.

Внедряйте конвейеры генерации и проверки: поскольку модели лучше распознают факты (проверка), чем генерируют их с нуля, разработчики могут создавать архитектурные циклы, в которых модель генерирует ответ, а затем ей предлагается явно проанализировать и проверить свои собственные утверждения. «Поскольку распознать правильный ответ проще, чем сгенерировать его, проверка выходных данных модели может выявить ошибки, которые пропускает обычная генерация, и дополнительно улучшить фактические данные», — сказал Кальдерон.

Проверяйте семантический доступ, а не просто точность: стандартные метрики точности скрывают базовые возможности модели. Для оценки необходимо проверять один и тот же базовый факт в разных формулировках, контекстах и направлениях, чтобы по-настоящему понять, что знает модель, а что она может надежно получить доступ.

Используйте переформулировку запроса и повторные попытки: поскольку полнота ответа сильно зависит от контекста, формулировка запроса определяет успех. Изменение структуры запроса, генерация соответствующего промежуточного контекста или побуждение модели к созданию цепочки рассуждений перед ответом — это законные механизмы повышения надежности, которые упускают прямые запросы.

Ограничения и практические выводы

Тест WikiProfile основан на энциклопедических фактах из Википедии. Полученные результаты могут не в полной мере распространяться на закрытые или узкоспециализированные корпоративные области. Способность модели хранить и воспроизводить нишевые внутренние показатели компании может отличаться от ее обработки общедоступных энциклопедических данных.

Полное профилирование перспективной модели с помощью пакета WikiProfile стоит приблизительно 500 долларов. Разработчики могут значительно снизить эту стоимость, исключив варианты с несколькими вариантами ответа или используя меньшее количество примеров ответов на каждый вопрос.

Команды могут получить доступ к бенчмарку WikiProfile на платформе Hugging Face для оценки своих собственных систем. Поскольку бенчмарк включает в себя точные подсказки, использованные для его создания, корпоративные команды инженеров данных могут воссоздать конвейер на своих собственных внутренних корпусах данных, чтобы диагностировать, страдают ли их специализированные агенты от отсутствия данных или ключей. Однако командам следует скорректировать свои ожидания при переходе от энциклопедических данных.

«Конвейер обработки данных разработан для применения к новому корпусу, и мы предоставляем все использованные нами подсказки», — сказал Кальдерон. «Единственное, чего следует ожидать: в Википедии это была в основном проблема с запоминанием. Факты, специфичные для конкретной предметной области, могут быть действительно не закодированы в модели».

В конечном итоге, этот сдвиг в сторону использования знаний выравнивает условия конкуренции для корпоративных стеков ИИ. «Для компаний, которые не создают модели с нуля, это хорошая новость», — сказал Кальдерон. «Предварительное обучение чрезвычайно дорого и недоступно для большинства, но важные сейчас инструменты — нет: постобучение может помочь при небольшом объеме данных и небольшом количестве шагов, а инструменты для вывода результатов, такие как обдумывание, этапы проверки и поиск, уже используются большинством команд».

В эту статью были внесены изменения, в том числе комментарии от Google.

Опрос по корпоративной агентской оркестрации

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Идей копилка~ Higgsfield Genjutsu: как зарабатывать на «легальном фотошопе для видео» — 7 схем Архив рубрики ~Полезное~ ЛЕГАЛЬНЫЙ ФОТОШОП ДЛЯ ВИДЕО Higgsfield выкатили Genjutsu — инструмент, который… Архив рубрики ~Коротко из Telegram~ На рабочем столе теперь можно завести собственную ИИ-вайфу. Animates… Архив рубрики ~Полезное~ Ловите огромный каталог дополнений для Claude. В Build with… Архив рубрики ~Полезное~ В Claude добавили собственный браузер. В Cowork теперь можно… Архив рубрики ~Коротко из Telegram~ 1200 ИИ-агентов сговорились и устроили коллективный взлом Hugging Face…. Архив рубрики ~Полезное~ Вышел open-source сервис для нарезки видео на шорты. Архив рубрики ~Коротко из Telegram~ Почти половина российских компаний планирует увеличить использование облачных и ИИ-сервисов…. Архив рубрики ~Полезное~ Новый апскенйлер изображений работает с любой графикой Photo Enhancer Новости робототехники Так теперь выглядит поездка на такси по Остину. Tesla… Архив рубрики ~Коротко из Telegram~ Google добавила в Agent Development Kit нативную live-оценку голосовых… Архив рубрики ~Коротко из Telegram~ Эммануэль Акита (спонсировано Andela) разбирает частую ловушку: считается, что… Архив рубрики ~Обо всем~ Тенденции из окопов: почему семантика имеет значение в биологических науках Новости робототехники Когда компьютерное зрение на складе окупается, а когда становится дорогим экспериментом Архив рубрики ~Идей копилка~ Higgsfield Genjutsu: как зарабатывать на «легальном фотошопе для видео» — 7 схем Архив рубрики ~Полезное~ ЛЕГАЛЬНЫЙ ФОТОШОП ДЛЯ ВИДЕО Higgsfield выкатили Genjutsu — инструмент, который… Архив рубрики ~Коротко из Telegram~ На рабочем столе теперь можно завести собственную ИИ-вайфу. Animates… Архив рубрики ~Полезное~ Ловите огромный каталог дополнений для Claude. В Build with… Архив рубрики ~Полезное~ В Claude добавили собственный браузер. В Cowork теперь можно… Архив рубрики ~Коротко из Telegram~ 1200 ИИ-агентов сговорились и устроили коллективный взлом Hugging Face…. Архив рубрики ~Полезное~ Вышел open-source сервис для нарезки видео на шорты. Архив рубрики ~Коротко из Telegram~ Почти половина российских компаний планирует увеличить использование облачных и ИИ-сервисов…. Архив рубрики ~Полезное~ Новый апскенйлер изображений работает с любой графикой Photo Enhancer Новости робототехники Так теперь выглядит поездка на такси по Остину. Tesla… Архив рубрики ~Коротко из Telegram~ Google добавила в Agent Development Kit нативную live-оценку голосовых… Архив рубрики ~Коротко из Telegram~ Эммануэль Акита (спонсировано Andela) разбирает частую ловушку: считается, что… Архив рубрики ~Обо всем~ Тенденции из окопов: почему семантика имеет значение в биологических науках Новости робототехники Когда компьютерное зрение на складе окупается, а когда становится дорогим экспериментом

Оставить комментарий