DeepSeek-Math-V2: спокойный релиз, громкие цифры Кратко о результатах — Уровень…
DeepSeek-Math-V2: спокойный релиз, громкие цифры
Кратко о результатах
— Уровень золотой медали на IMO 2025 и CMO 2024
— Почти идеальный балл 118/120 на Putnam 2024
— На IMO-ProofBench уверенно обходит GPT-5 и сравнивается с Gemini 2.5 Pro на сложных задачах
Что дальше
— Интересно, как модель покажет себя против будущих Gemini 3, Grok 4 и GPT-5.1
Кратко о результатах
Бенчмарков почти нет: ни MATH, ни GSM8K, ни AIME. Зато имеющиеся цифры выглядят многообещающе.
Как работает:
— Базовая модель DeepSeek-V3.2-Exp-Base
— Два ключевых модуля: генератор и верификатор
— Процесс многошаговый:
— генератор пишет решение
— верификатор проверяет каждый шаг, указывает на ошибки
— генератор переписывает и уточняет
— до 16 итераций, в каждой анализируется до 64 гипотез
— Фактически сотни прогонов на одну задачу: умное масштабирование вычислений во время инференса
Материалы
— Веса: тут
— Статья: тут
— Репозиторий: тут

Похожие записи
- В плане Амодеи по замедлению работы ИИ нигде не говорится о работе с открытыми весами. В этом нет необходимости.
- Локальный ИИ класса Opus 4.6 «задешево»: две Tesla P100, 28-поточный Xeon и тесты на реальных задачах
- Anthropic заявила, что китайские DeepSeek и Moonshot AI перенаправляли некоторые запросы пользователей к моделям Claude и выдавали их ответы за свои
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
