Архив рубрики ~Коротко из Telegram~

GPT-5 Pro устанавливает новый рекорд на FrontierMath Tier 4 Новая…

GPT-5 Pro устанавливает новый рекорд на FrontierMath Tier 4 Новая…

GPT-5 Pro устанавливает новый рекорд на FrontierMath Tier 4

Новая версия модели от OpenAI — GPT-5 Pro — показала лучший на сегодня результат на FrontierMath Tier 4, решив 6 из 48 задач (13 %). Среди них оказалась одна задача, которую ранее не смогла решить ни одна другая модель.

При повторных запусках итоговый pass@2 вырос до 17 %, что подтверждает стабильность при работе с особенно сложными математическими сценариями.

Для сравнения:
Grok 4 Heavy набирает всего 2–3 %,
Gemini 2.5 DeepThink12 %, причём на одну задачу меньше, чем GPT-5 Pro.

Результаты закрепляют лидерство OpenAI в области высокоточной reasoning-математики и указывают на быстрое приближение моделей к уровню экспертных математиков.

file_782.jpg

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ Архив рубрики ~Лента новостей~ «Яндекс Трекер» получил поддержку пользовательских плагинов для бизнеса Архив рубрики ~Лента новостей~ Harness engineering: как за год собрать фабрику из десятка конвейеров Архив рубрики ~Лента новостей~ [Перевод] Мы растрачиваем потенциал светодиодов, который мог бы спасти наше ночное небо Архив рубрики ~Лента новостей~ Более 6,5 процента людей старше 25 лет во всем мире пострадали от поражения периферических артерий в 2023 году. Это более 315 миллионов человек Архив рубрики ~Полезное~ OpenAI добавила голосовой режим в Codex. Теперь можно вслух ставить… Архив рубрики ~Полезное~ Забираем генератор коротких рекламных видеороликов Higgsfield UGC AIStudio — генератор коротких… Архив рубрики ~Полезное~ ТВОЙ КОМП ТЕПЕРЬ СЕРВЕР Osmantic выкатили ODS — сервис, который… Архив рубрики ~Лента новостей~ Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой Архив рубрики ~Лента новостей~ При поддержке AWS британская группа компаний переходит к глобальной платформе AMR Intelligence. Архив рубрики ~Полезное~ Превращаем ИИ-агента в настоящего гейм-девелопера. Появилась библиотека готовых сценариев… Новости робототехники Это самый передовой в мире спутник с роботизированной системой обслуживания, о котором нам известно. Новости робототехники Станут ли мозговые волны следующим шагом в развитии физического искусственного интеллекта? Архив рубрики ~Лента новостей~ Хуки Claude Code: запрещаем агенту коммитить без прогона тестов Архив рубрики ~Лента новостей~ AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ Архив рубрики ~Лента новостей~ «Яндекс Трекер» получил поддержку пользовательских плагинов для бизнеса Архив рубрики ~Лента новостей~ Harness engineering: как за год собрать фабрику из десятка конвейеров Архив рубрики ~Лента новостей~ [Перевод] Мы растрачиваем потенциал светодиодов, который мог бы спасти наше ночное небо Архив рубрики ~Лента новостей~ Более 6,5 процента людей старше 25 лет во всем мире пострадали от поражения периферических артерий в 2023 году. Это более 315 миллионов человек Архив рубрики ~Полезное~ OpenAI добавила голосовой режим в Codex. Теперь можно вслух ставить… Архив рубрики ~Полезное~ Забираем генератор коротких рекламных видеороликов Higgsfield UGC AIStudio — генератор коротких… Архив рубрики ~Полезное~ ТВОЙ КОМП ТЕПЕРЬ СЕРВЕР Osmantic выкатили ODS — сервис, который… Архив рубрики ~Лента новостей~ Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой Архив рубрики ~Лента новостей~ При поддержке AWS британская группа компаний переходит к глобальной платформе AMR Intelligence. Архив рубрики ~Полезное~ Превращаем ИИ-агента в настоящего гейм-девелопера. Появилась библиотека готовых сценариев… Новости робототехники Это самый передовой в мире спутник с роботизированной системой обслуживания, о котором нам известно. Новости робототехники Станут ли мозговые волны следующим шагом в развитии физического искусственного интеллекта? Архив рубрики ~Лента новостей~ Хуки Claude Code: запрещаем агенту коммитить без прогона тестов