👁️ Новое исследование Skill-Use проверяет то, что раньше никто толком…
👁️ Новое исследование Skill-Use проверяет то, что раньше никто толком не тестировал: способен ли агент сам распознать нужный skill и правильно его применить, а не просто оценивать качество самого skill-документа. Агент видит только имя и краткое описание — и должен сам решить, подходит ли skill к задаче, прежде чем подгрузить полную процедуру.
Оценка разбита на три части: срабатывает ли триггер, точно ли агент следует процедуре, не нарушает ли запреты. 79 реальных skills, 177 задач в девяти доменах, тесты в изолированной песочнице.
➡️ Результат отрезвляющий: даже в лучшей конфигурации из восьми моделей итоговый показатель — всего 0.613 из максимума. Проблема не в одном звене — и триггер, и соблюдение процедуры проваливаются независимо друг от друга. Причём рейтинг моделей меняется в зависимости от агентной обвязки — умение пользоваться skill не фиксированное свойство модели.
Перекликается с темой skills от MCP-серверов, которую мы разбирали недавно: сама доставка skill’а — только полдела, реальное понимание, когда и как его применять, остаётся open-проблемой даже у топовых моделей.
Похожие записи
Оцените материал:
Похожие записи
SenseTime открыла SenseNova-Vision — CV-модель, которая всё делает через генерацию…
26.07.2026
Codex может убивать SSD логами У Codex нашли неприятный баг:…
25.06.2026
Retro Biosciences: таблетка против старения от Сэма Альтмана Стартап Retro…
04.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
