Архив рубрики ~Лента новостей~

Умнее, а не сложнее: как неуверенность в себе ИИ способствует достижению максимальной производительности

Умнее, а не сложнее: как неуверенность в себе ИИ способствует достижению максимальной производительности

«Глубокое мышление с уверенностью» — более разумный способ масштабировать задачи рассуждения без траты огромного количества вычислений

Делиться

6c20055bc34afa54f2d694781b2d1389

Введение

Большие языковые модели (LLM) всё чаще решают сложные задачи на рассуждение, такие как задачи математических олимпиад, научные вопросы и ответы и многошаговые логические головоломки [3,8]. Но действительно ли они хороши? Да, хороши, но сейчас они требуют очень больших вычислительных затрат и неэффективны на этапе тестирования [5,6]. Чтобы решить эту проблему, исследователи Meta AI разработали решение под названием « DeepConf », также известное как « Глубокое мышление с уверенностью» [1].

Существует проблема, известная как самосогласованность при голосовании большинством голосов.

Уверен, вам интересно, как эта задача выглядит на практике. Представьте себе класс из 100 учеников. Вы дали им сложную олимпиадную задачу и час на её решение. В конце вы можете собрать все ответы и проголосовать — ответы, набравшие наибольшее количество голосов, «побеждают».

Именно так работает проблема самосогласованности с большинством в LLM[2,3]. Вместо одного решения модель рассматривает сотни путей рассуждения (например, 512 различных пошаговых решений), а затем выбирает наиболее частый ответ.

В математическом тесте AIME 2025 один проход Qwen3–8B (называемый pass@1) даёт точность около 68% ; это как если бы был получен один ответ от одного ученика. Но если сгенерировать 512 трассировок рассуждений на каждый вопрос (называемых conf@512) и взять ответ большинства, то точность возрастает до 82% [1,4].

Звучит здорово, правда? Загвоздка в том, что эти дополнительные 511 трасс генерируют почти 100 миллионов дополнительных токенов, и увеличение трасс не всегда помогает; производительность остаётся прежней, а иногда даже падает, когда в голосовании доминируют некачественные решения[1,7,8]. Другими словами, если ученики угадывают случайным образом, то голосование класса не отражает лучшего мыслителя в классе[1].

Источник: towardsdatascience.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Станут ли мозговые волны следующим шагом в развитии физического искусственного интеллекта? Новости робототехники Ракетный репортаж: Удары молнии в Китае; запуск звездолета Starship на палубе Архив рубрики ~Коротко из Telegram~ Кажется, ИИ всё глубже проникает в самые «нецифровые» отрасли. В… Архив рубрики ~Коротко из Telegram~ Роботов научат отрабатывать навыки в цифровой копии реального мира —… Архив рубрики ~Коротко из Telegram~ Нашли способ сэкономить ~20к рублей на подписке. Идеально для тех,… Архив рубрики ~Коротко из Telegram~ Claude Code научился искать и исправлять уязвимости Anthropic представила Claude… Архив рубрики ~Полезное~ Я ЗАБЫЛ ПРО ГРОК, А ОН ЕСТЬ xAI официально завершила… Архив рубрики ~Коротко из Telegram~ В Италии зафиксировали первый официальный случай «зависимости от ИИ»… Новости робототехники «Момент ChatGPT» для роботов: глава Unitree Robotics предрек прорыв уже через 2-3 года Архив рубрики ~Коротко из Telegram~ Перед вами рендер предстоящего смартфона OPPO, предположительно, новинка будет иметь… Архив рубрики ~Коротко из Telegram~ Индия пытается удалить мессенджер, который лишает правительство главного оружия против… Архив рубрики ~Коротко из Telegram~ Moonshot AI выпустит веса Kimi K3 27 июля Moonshot AI… Архив рубрики ~Коротко из Telegram~ SenseTime открыла SenseNova-Vision — CV-модель, которая всё делает через генерацию… Архив рубрики ~Коротко из Telegram~ В 1986-м учителя боялись калькуляторов. Звучит знакомо В апреле 1986… Новости робототехники Станут ли мозговые волны следующим шагом в развитии физического искусственного интеллекта? Новости робототехники Ракетный репортаж: Удары молнии в Китае; запуск звездолета Starship на палубе Архив рубрики ~Коротко из Telegram~ Кажется, ИИ всё глубже проникает в самые «нецифровые» отрасли. В… Архив рубрики ~Коротко из Telegram~ Роботов научат отрабатывать навыки в цифровой копии реального мира —… Архив рубрики ~Коротко из Telegram~ Нашли способ сэкономить ~20к рублей на подписке. Идеально для тех,… Архив рубрики ~Коротко из Telegram~ Claude Code научился искать и исправлять уязвимости Anthropic представила Claude… Архив рубрики ~Полезное~ Я ЗАБЫЛ ПРО ГРОК, А ОН ЕСТЬ xAI официально завершила… Архив рубрики ~Коротко из Telegram~ В Италии зафиксировали первый официальный случай «зависимости от ИИ»… Новости робототехники «Момент ChatGPT» для роботов: глава Unitree Robotics предрек прорыв уже через 2-3 года Архив рубрики ~Коротко из Telegram~ Перед вами рендер предстоящего смартфона OPPO, предположительно, новинка будет иметь… Архив рубрики ~Коротко из Telegram~ Индия пытается удалить мессенджер, который лишает правительство главного оружия против… Архив рубрики ~Коротко из Telegram~ Moonshot AI выпустит веса Kimi K3 27 июля Moonshot AI… Архив рубрики ~Коротко из Telegram~ SenseTime открыла SenseNova-Vision — CV-модель, которая всё делает через генерацию… Архив рубрики ~Коротко из Telegram~ В 1986-м учителя боялись калькуляторов. Звучит знакомо В апреле 1986…