❓ Джулия Кордик из Microsoft описывает частый сценарий: агент за…
❓ Джулия Кордик из Microsoft описывает частый сценарий: агент за пять минут генерирует 2500-словный документ реверс-инжиниринга, эксперт бегло просматривает первые строки, видит, что всё верно — и заключает «выглядит нормально». Проблема в том, что легко проверить обычно и легко получить правильно, в том числе для модели — так что беглый просмотр начала ничего не говорит об остальном документе.
Техническая причина — в природе контекстных окон: модель теряет середину или даже начало по мере заполнения контекста, но продолжает выдавать уверенный гладкий текст. Отсюда три типа сбоев: пропуск важного, галлюцинация и неверная интерпретация смутных инструкций.
🔥 Ключевая мысль — верификация должна быть не «эксперт прочитал и одобрил», а разбита на конкретные проверяемые шаги с осязаемым результатом. Автор предлагает framework из шести вопросов (что проверяем, сколько стоит, кто выполняет — инструмент, ИИ или человек, что реально доказывает проверка) и выстраивает многоуровневые таблицы — от дешёвых детерминированных проверок до дорогих операционных вроде сравнения с продакшен-трейсами.
Главный совет: если проверка не даёт конкретного действенного результата — это не проверка. Не просите эксперта прочитать 2500 слов и сказать «верно ли», а дайте список извлечённых правил и попросите подтвердить каждое отдельно.
Оцените материал:
Похожие записи
Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 Главный апгрейд…
05.09.2026
DeepSeek открыла веса мультимодальной V4-Flash DeepSeek выложила в открытый доступ…
05.09.2026
OpenMAIC превращает ИИ в интерактивный онлайн-универ Вышел OpenMAIC — open-source…
05.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
