➡️ IOL-AI Challenge — соревнование на невиданных задачах Международной олимпиады…
➡️ IOL-AI Challenge — соревнование на невиданных задачах Международной олимпиады по лингвистике 2026, где результаты моделей впервые оценивало настоящее жюри по тем же критериям, что и у школьников-участников. Ценность именно такого теста в том, что рассуждения LLM обычно изучают на математике и коде, где модели заранее даны правила. В лингвистике их нет — сначала нужно самому обнаружить систему языка, а данных для заучивания просто не существует.
731 заявка от 46 команд при жёстком бюджете — одна видеокарта T4, 30 минут. Отдельно без ограничений прогнали 15 топовых моделей: Claude Opus 4.8 набрала оценку жюри, эквивалентную золотой медали, а системы под жёстким compute-бюджетом оказались в нижних 5% участников.
☀️ Показательно: способность не определяется масштабом — заявки на 14B параметров обходили модели вдвое большего размера, прирост шёл от настройки декодинга, а не от размера. Автоматические метрики ранжируют системы правильно, но сжимают шкалу — завышают слабых и занижают сильных.
Главный вывод: предзнание языка задачи почти не помогает модели её решить — значит лингвистическое рассуждение честно проверяет обобщаемые способности, а не память.
Похожие записи
Оцените материал:
Похожие записи
Максимально ПРОКАЧИВАЕМ Gemini — нашли инструмент, который разгоняет скиллы нейронки…
05.06.2026
🗺️ Apple и Ford объявили, что Maps будут интегрированы в…
14.08.2026
AI в помощь брендам и стартапам Любопытный и залайканный проект…
25.07.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
