Архив рубрики ~Лента новостей~

Умнее, а не сложнее: как неуверенность в себе ИИ способствует достижению максимальной производительности

Умнее, а не сложнее: как неуверенность в себе ИИ способствует достижению максимальной производительности

«Глубокое мышление с уверенностью» — более разумный способ масштабировать задачи рассуждения без траты огромного количества вычислений

Делиться

6c20055bc34afa54f2d694781b2d1389

Введение

Большие языковые модели (LLM) всё чаще решают сложные задачи на рассуждение, такие как задачи математических олимпиад, научные вопросы и ответы и многошаговые логические головоломки [3,8]. Но действительно ли они хороши? Да, хороши, но сейчас они требуют очень больших вычислительных затрат и неэффективны на этапе тестирования [5,6]. Чтобы решить эту проблему, исследователи Meta AI разработали решение под названием « DeepConf », также известное как « Глубокое мышление с уверенностью» [1].

Существует проблема, известная как самосогласованность при голосовании большинством голосов.

Уверен, вам интересно, как эта задача выглядит на практике. Представьте себе класс из 100 учеников. Вы дали им сложную олимпиадную задачу и час на её решение. В конце вы можете собрать все ответы и проголосовать — ответы, набравшие наибольшее количество голосов, «побеждают».

cf885a32cf526f7aad93422ec163e764

Именно так работает проблема самосогласованности с большинством в LLM[2,3]. Вместо одного решения модель рассматривает сотни путей рассуждения (например, 512 различных пошаговых решений), а затем выбирает наиболее частый ответ.

В математическом тесте AIME 2025 один проход Qwen3–8B (называемый pass@1) даёт точность около 68% ; это как если бы был получен один ответ от одного ученика. Но если сгенерировать 512 трассировок рассуждений на каждый вопрос (называемых conf@512) и взять ответ большинства, то точность возрастает до 82% [1,4].

Звучит здорово, правда? Загвоздка в том, что эти дополнительные 511 трасс генерируют почти 100 миллионов дополнительных токенов, и увеличение трасс не всегда помогает; производительность остаётся прежней, а иногда даже падает, когда в голосовании доминируют некачественные решения[1,7,8]. Другими словами, если ученики угадывают случайным образом, то голосование класса не отражает лучшего мыслителя в классе[1].

Источник: towardsdatascience.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ До конца 2026 года в реестре российского ПО планируют создать… Архив рубрики ~Коротко из Telegram~ Hypit: агент разбирает трендовые ролики и собирает по их формуле… Архив рубрики ~Коротко из Telegram~ Пока в Америке спорят, стоит ли жать на тормоз, в… Архив рубрики ~Коротко из Telegram~ «Сократи, но не теряй смысл» — просьба, которая звучит логично… Архив рубрики ~Коротко из Telegram~ Один чат — чтобы написать, другой — чтобы раскритиковать. Почему… Архив рубрики ~Коротко из Telegram~ Прокачиваем ИИ-агентов — нашли бесплатный курс по Codex, Claude Code… Архив рубрики ~Коротко из Telegram~ Auphonic — AI-программа для корректировки и оптимизации аудио. Среди инструментов… Архив рубрики ~Коротко из Telegram~ Smartstudy — экзаменатор на базе искусственного интеллекта. Сервис может проверить… Архив рубрики ~Коротко из Telegram~ 3 сентября Эрик Лу из Cognition с помощью Devin разложил… Архив рубрики ~Коротко из Telegram~ Превращаем своего КОТА в бумажную фигурку — нужен только ChatGPT… Архив рубрики ~Полезное~ Мощный скилл для генерации профессиональных промо-роликов Video ShotCraft берёт на… Архив рубрики ~Коротко из Telegram~ Neuralink показала, как возвращает речь из мыслей Neuralink показала демо… Архив рубрики ~Коротко из Telegram~ Исследователь Google DeepMind уволился из-за страха перед ИИ История продолжается:… Архив рубрики ~Коротко из Telegram~ Anthropic открыла биолабораторию — Claude будет работать с роботами и… Архив рубрики ~Коротко из Telegram~ До конца 2026 года в реестре российского ПО планируют создать… Архив рубрики ~Коротко из Telegram~ Hypit: агент разбирает трендовые ролики и собирает по их формуле… Архив рубрики ~Коротко из Telegram~ Пока в Америке спорят, стоит ли жать на тормоз, в… Архив рубрики ~Коротко из Telegram~ «Сократи, но не теряй смысл» — просьба, которая звучит логично… Архив рубрики ~Коротко из Telegram~ Один чат — чтобы написать, другой — чтобы раскритиковать. Почему… Архив рубрики ~Коротко из Telegram~ Прокачиваем ИИ-агентов — нашли бесплатный курс по Codex, Claude Code… Архив рубрики ~Коротко из Telegram~ Auphonic — AI-программа для корректировки и оптимизации аудио. Среди инструментов… Архив рубрики ~Коротко из Telegram~ Smartstudy — экзаменатор на базе искусственного интеллекта. Сервис может проверить… Архив рубрики ~Коротко из Telegram~ 3 сентября Эрик Лу из Cognition с помощью Devin разложил… Архив рубрики ~Коротко из Telegram~ Превращаем своего КОТА в бумажную фигурку — нужен только ChatGPT… Архив рубрики ~Полезное~ Мощный скилл для генерации профессиональных промо-роликов Video ShotCraft берёт на… Архив рубрики ~Коротко из Telegram~ Neuralink показала, как возвращает речь из мыслей Neuralink показала демо… Архив рубрики ~Коротко из Telegram~ Исследователь Google DeepMind уволился из-за страха перед ИИ История продолжается:… Архив рубрики ~Коротко из Telegram~ Anthropic открыла биолабораторию — Claude будет работать с роботами и…