Архив рубрики ~Коротко из Telegram~

ИИ научили сомневаться: MIT снижает «самоуверенные ошибки» Исследователи из MIT…

ИИ научили сомневаться: MIT снижает «самоуверенные ошибки» Исследователи из MIT…

ИИ научили сомневаться: MIT снижает «самоуверенные ошибки»

Исследователи из MIT предложили способ, который заставляет модели честно признавать неуверенность.

Проблема:

— ИИ часто отвечает уверенно, даже когда ошибается
— классическое обучение награждает за результат, а не за честность

Что сделали:

— ввели штраф за разницу между
— заявленной уверенностью
— и реальной точностью

Результат:

— модели начинают говорить «не уверен»
— ошибка калибровки упала на ~90%

Вывод:

раньше ИИ учился выглядеть правым,
теперь — понимать, когда он может ошибаться.

Это шаг от «всезнающего ассистента» к инструменту, которому можно доверять именно потому, что он умеет сомневаться.

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Число подтвержденных жертв лихорадки Эбола в Конго превысило полторы тысячи. За неделю она унесла жизни почти 500 человек Новости робототехники GAM Enterprises будет производить редукторы Schaeffler PSC Архив рубрики ~Лента новостей~ Браузер заблокировал сайт банка или сервиса: как вернуть доступ Архив рубрики ~Лента новостей~ Как Opus 5 и GPT-5.6 Sol «представят» себе мир «Властелина колец»: сооснователь OpenAI и исследователь Anthropic Андрей Карпатый предложил новый тест моделей на литературных 3D-симуляциях Архив рубрики ~Лента новостей~ Прекратите строить графики для всего подряд: когда GraphRAG действительно превосходит Vector RAG Архив рубрики ~Лента новостей~ OWASP LLM10: Unbounded Consumption. Тестируем современные языковые модели на ресурсоёмких промптах Архив рубрики ~Лента новостей~ Не все герои носят плащи. Некоторые носят патчкорды Архив рубрики ~Лента новостей~ В преддверии выхода Pixel 11 запасы Pixel 9 распродаются. Новости робототехники Партнеры Avnet и Weston Robot запустят платформу проверки периферийного искусственного интеллекта Архив рубрики ~Лента новостей~ Reddit стремится снизить значимость «кармы» для новичков, переходя на инструменты модерации с использованием искусственного интеллекта. Архив рубрики ~Лента новостей~ Я убил все RAG‑системы и понял, как делать AGI. Или просто заменил RAG правилом в шесть строк Архив рубрики ~Лента новостей~ Я перестал нанимать людей для рутинных задач. Вместо этого создал ИИ-сотрудников — вот что получилось Архив рубрики ~Лента новостей~ Структурированные конвейеры обработки данных для ИИ на 10,9 баллов уступают конвейерам, использующим произвольный код — DataFlow-Harness сокращает разрыв. Архив рубрики ~Лента новостей~ Зеленый рыцарь в осаде: кто копает под Nvidia на рынке AI‑чипов Архив рубрики ~Лента новостей~ Число подтвержденных жертв лихорадки Эбола в Конго превысило полторы тысячи. За неделю она унесла жизни почти 500 человек Новости робототехники GAM Enterprises будет производить редукторы Schaeffler PSC Архив рубрики ~Лента новостей~ Браузер заблокировал сайт банка или сервиса: как вернуть доступ Архив рубрики ~Лента новостей~ Как Opus 5 и GPT-5.6 Sol «представят» себе мир «Властелина колец»: сооснователь OpenAI и исследователь Anthropic Андрей Карпатый предложил новый тест моделей на литературных 3D-симуляциях Архив рубрики ~Лента новостей~ Прекратите строить графики для всего подряд: когда GraphRAG действительно превосходит Vector RAG Архив рубрики ~Лента новостей~ OWASP LLM10: Unbounded Consumption. Тестируем современные языковые модели на ресурсоёмких промптах Архив рубрики ~Лента новостей~ Не все герои носят плащи. Некоторые носят патчкорды Архив рубрики ~Лента новостей~ В преддверии выхода Pixel 11 запасы Pixel 9 распродаются. Новости робототехники Партнеры Avnet и Weston Robot запустят платформу проверки периферийного искусственного интеллекта Архив рубрики ~Лента новостей~ Reddit стремится снизить значимость «кармы» для новичков, переходя на инструменты модерации с использованием искусственного интеллекта. Архив рубрики ~Лента новостей~ Я убил все RAG‑системы и понял, как делать AGI. Или просто заменил RAG правилом в шесть строк Архив рубрики ~Лента новостей~ Я перестал нанимать людей для рутинных задач. Вместо этого создал ИИ-сотрудников — вот что получилось Архив рубрики ~Лента новостей~ Структурированные конвейеры обработки данных для ИИ на 10,9 баллов уступают конвейерам, использующим произвольный код — DataFlow-Harness сокращает разрыв. Архив рубрики ~Лента новостей~ Зеленый рыцарь в осаде: кто копает под Nvidia на рынке AI‑чипов

Оставить комментарий