➡️ IOL-AI Challenge — соревнование на невиданных задачах Международной олимпиады…
➡️ IOL-AI Challenge — соревнование на невиданных задачах Международной олимпиады по лингвистике 2026, где результаты моделей впервые оценивало настоящее жюри по тем же критериям, что и у школьников-участников. Ценность именно такого теста в том, что рассуждения LLM обычно изучают на математике и коде, где модели заранее даны правила. В лингвистике их нет — сначала нужно самому обнаружить систему языка, а данных для заучивания просто не существует.
731 заявка от 46 команд при жёстком бюджете — одна видеокарта T4, 30 минут. Отдельно без ограничений прогнали 15 топовых моделей: Claude Opus 4.8 набрала оценку жюри, эквивалентную золотой медали, а системы под жёстким compute-бюджетом оказались в нижних 5% участников.
☀️ Показательно: способность не определяется масштабом — заявки на 14B параметров обходили модели вдвое большего размера, прирост шёл от настройки декодинга, а не от размера. Автоматические метрики ранжируют системы правильно, но сжимают шкалу — завышают слабых и занижают сильных.
Главный вывод: предзнание языка задачи почти не помогает модели её решить — значит лингвистическое рассуждение честно проверяет обобщаемые способности, а не память.
Похожие записи
Оцените материал:
Похожие записи
Несколько промтов в формате JSON Вот вам бесплатный сайт для…
30.10.2025
ИИ помогает людям с нейроразнообразием работать эффективнее Исследование показало, что…
13.11.2025
Забираем ВСЕ нейронки Google БЕСПЛАТНО Гений с твиттера нашол способ,…
11.01.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
