Амит Шекхар из Outcome School разбирает простой, но фундаментальный…
📷 Амит Шекхар из Outcome School разбирает простой, но фундаментальный механизм: почему Chain-of-Thought промптинг вообще работает. Он использует наглядный пример — задачу вроде «в магазине 12 яблок, утром продали 5, вечером купили 8, сколько яблок осталось?». Правильный ответ — 15, через промежуточные шаги 12−5=7 и 7+8=15. Если попросить модель сразу дать финальное число, она пытается предсказать ответ мгновенно, не проработав промежуточные шаги — на лёгкой задаче может угадать, но на сложной часто промахивается.
Причина в самой природе того, как модель генерирует текст — слово за словом. Если модель фиксирует финальный ответ слишком рано, у неё просто нет шанса себя поправить — она пишет последовательно и не может «переписать» уже сказанное. Собственно, в этом и суть CoT: когда модель сначала выписывает рассуждение вслух, эти рассуждения сами становятся частью контекста, на который она опирается, формулируя финальный ответ — то есть строит вывод поверх видимых, проверяемых шагов, а не угадывает с нуля.
👆 Важная оговорка, которую автор подчёркивает: модель от этого не становится «умнее» в каком-то фундаментальном смысле — ей просто дают структурированное пространство, чтобы подумать перед тем, как ответить. Дальше в статье разбирается разница между zero-shot CoT (просто добавить «давай рассуждать по шагам») и few-shot CoT (дать модели примеры готовых цепочек рассуждений) — и где именно эта техника реально даёт прирост, а где не имеет смысла.
❓ Хорошее объяснение для тех, кто пользуется промптингом на автомате, не задумываясь, почему «think step by step» вообще помогает. Вы сами часто используете этот приём в промптах, или это уже настолько привычно, что делаете это не задумываясь?
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
