📊 Как тестируют ИИ-модели — и почему рейтингам верить с…
📊 Как тестируют ИИ-модели — и почему рейтингам верить с осторожностью
В новостях про новую модель всегда мелькают проценты: «92% на бенчмарке X», «обошла конкурента». Выглядит объективно. На деле всё мутнее — и в 2025–2026 об этом заговорили открыто даже сами исследователи.
✳️ Как тестируют
Стандартизированные тесты с «правильными ответами» — например, MMLU: тест из вопросов с вариантами ответов на 57 разных тем (от истории и права до химии и медицины), придуманный ещё в 2021 году как способ проверить общую эрудицию модели «по-школьному». Есть и другие: HumanEval/SWE-bench — про код, GSM8K — про математику. Оценка людьми вслепую: площадки вроде LMArena показывают ответы двух моделей без названий, люди голосуют за лучший — из миллионов голосов складывается рейтинг
✳️ Почему стоит быть осторожным
Утечка ответов в обучение. Тест мог попасть в интернет вместе с правильными ответами. Модель их просто помнит, а не решает задачу заново. Задокументировано для нескольких известных бенчмарков, включая MMLU.
✳️ Рейтинги накручивают
Исследование «The Leaderboard Illusion» (Cohere Labs и коллеги, 2025) показало: крупные лаборатории тестировали на LMArena много приватных вариантов модели и публиковали только лучший результат — это завышало место в рейтинге. Был и громкий публичный случай, когда компания показала на арене не ту версию, что позже выпустила для всех.
Старые тесты «выдыхаются». Топовые модели почти выбивают максимум на MMLU — тест перестаёт различать модели. Отсюда новые, более сложные бенчмарки, но и они со временем проходят тот же путь.
Так чему верить? Смотри на несколько разных рейтингов, а не один. Обращайте внимание на дату — расклад меняется быстро. Высокий балл на тесте не гарантирует, что модель справится именно с твоей задачей. Свой мини-тест на реальной задаче часто полезнее любого рейтинга.
Итог: бенчмарки не обман, а несовершенный инструмент. К «92% на бенчмарке» в рекламе стоит относиться как к «9 из 10 стоматологов рекомендуют» — направление верное, а цифре буквально доверять не стоит.
Похожие записи
- Microsoft привлекла 3,2 миллиарда долларов инвестиций от антропогенных компаний, но результаты OpenAI оказались неоднозначными.
- Полный список весовых коэффициентов Kimi K3 доступен здесь, но он «открыт» с оговоркой: что должны знать предприятия.
- Американский стартап Veterans Recovery Network Inc. анонсировал концепт проекта «цифрового…
Оцените материал:
Похожие записи
YouTube Shorts получит ИИ-модель Veo 3 этим летом Генеральный директор…
29.06.2025
Apple готовит App Store для ИИ-агентов — похоже, сопротивление закончилось…
21.05.2026
AirPods смогут ПЕРЕВОДИТЬ речь в реальном времени Такую функцию заметили…
13.08.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
