‼️ На бенчмарке ARC-AGI-3 (2D-игры без инструкций, тест, который особенно…
‼️ На бенчмарке ARC-AGI-3 (2D-игры без инструкций, тест, который особенно раздражает OpenAI) Claude Opus 5 без специальной обвязки набрал 30% — лучший результат среди всех моделей. С кастомным харнессом та же модель показала 100%.
Ключевая находка — прорыв дал не просто менеджмент памяти, а отдельный агент-«супервайзер», который следит за основным и подталкивает его, если тот застрял. По словам VP продукта Nvidia, агент — это модель плюс харнесс, плюс рантайм и скиллы, а не просто API модели. Показателен контраст: OpenAI, увидев позорные <10% на этом бенчмарке, потюнила две настройки харнесса и утроила счёт — но так и не приблизилась к 100%, не добавив супервизирующий слой.
🔥 Не единичный случай — Databricks в июле показала, что харнесс, а не модель, драматически влияет на стоимость: один вызов с разным харнессом может обойтись вдвое дороже. Nvidia продвигает открытые харнессы через свой стек Nemo и напрямую связывает это с недавней паузой OpenAI в обучении модели Astra из-за проблем безопасности — по их логике, контроль именно на уровне харнесса и есть путь к безопасному прогрессу.
❓ Рынок недооценивает важность харнесса по сравнению с выбором модели, или для повседневных задач разница пока не критична?
Похожие записи
Оцените материал:
Похожие записи
Инструменты дня GenRank показывает, как поисковые системы ИИ читают и ранжируют…
22.07.2026
Генерация движений выходит на новый уровень Runway запустил новую функцию…
17.07.2025
Объем госзакупок VPN-решений вернулся к уровням прошлых лет после временного…
05.07.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
