GPT-6 Astra: что умеет модель «эры AGI», тесты и сравнение с Fable 5.1
Её называют лучшей в 3D-моделировании, хвалят работу с кодом и более человечный стиль общения.
- На брифинге для журналистов 3 сентября 2026 года технический директор OpenAI Грег Брокман заявил: «Если через пару лет мы оглянемся назад и спросим себя, когда был создан AGI, думаю, ответ будет «примерно в это время», и, возможно, речь будет именно об этой модели [Astra]».
- Как пишет The Verge, в преддверии IPO компания хочет привлечь внимание громкими заявлениями, которые не подтверждаются независимыми бенчмарками. Но первые тестировщики GPT-6 Astra заметили улучшения в работе с кодом, 3D-сценами, умелое управление компьютером и новый стиль общения.
Astra действительно «понимает», что я имею в виду. До этого так могла только Fable. Когда я даю задачу, постоянно ловлю себя на мысли, что стоило подробнее объяснить, как действовать. А потом читаю её план и думаю: «Она делает всё, как я и представлял».
Питер Гостев, глава по возможностям ИИ в AI Arena
- Отзывы: что понравилось пользователям
- Сравнения с Fable 5.1: что показывают бенчмарки
- Модель скрывает «мысли»: что беспокоит исследователей
Лучшая модель для 3D и игр: как отзываются тестировщики
- Глава по возможностям ИИ в проекте AI Arena Питер Гостев получил к Astra ранний доступ и протестировал её на своих задачах. Он считает, что модель продвинулась в оптимизации кода: сократила сгенерированный код с 33 тысяч строк до 1,8 тысячи «без потери качества». Она лучше проводила миграцию кода и «великолепно» управляла компьютером.
- Он также оценил, как Astra управляет субагентами в Codex, задаёт уточняющие вопросы через всплывающие окна и оставляет заметки с результатами исследований.
- По его наблюдениям, «рассуждения» стали лучше даже на уровне Low, хотя раньше он использовал минимум режим High. Гостев также считает, что Astra достигла «невероятного» уровня в разработке игр и создании 3D-сцен.
- Предприниматель Мэтью Берман считает, что улучшения особенно заметны на задачах в один промпт — модели почти ничего не надо объяснять дважды. Сильнее всего он заметил прогресс в играх, которые стали «действительно интересными».
- Несколько тестировщиков отмечают, что модель стала писать чисто, лаконично и понятно, без «ИИ-флёра», в отличие от предшественниц.
Заявления OpenAI против независимых тестов
- Astra набрала 99,9% в бенчмарке ARC-AGI 3 на агентные задачи. Однако такого результата она добилась с «обвязкой» для тестирования, предоставленной OpenAI — она частично скрывает «рассуждения» модели. Без неё Astra прошла тест на 62,7%.
- Модель улучшила показатели в задачах с длинным контекстом. В бенчмарке OpenAI она получила 100% при объёме токенов в 256-512 тысяч и 96,3% при объёме до 1 млн токенов.
- В тесте независимых исследователей Artificial Analysis модели проверяли на проектах, работа над которыми длилась несколько недель, со множеством подзадач и тысячами исходных файлов.
- GPT-6 Astra набрала столько же баллов, сколько предыдущая GPT-5.6 Sol, и уступила Claude Fable 5.1 на 5 пунктов. В бенчмарке на агентное программирование Astra обошла GPT-5.6 Sol на 2 балла. В лидерах по-прежнему Fable 5.1.
Сравнения с Fable 5.1 в работе и по цене
- По ощущениям Питера Гостева, Fable 5.1 превосходит Astra во многих задачах — это модели с сопоставимыми возможностями. Разница больше в общении и стиле работы.
- В тестах Artificial Analysis модель от OpenAI обошлась дешевле Fable 5.1 и даже Opus 5. Усреднённая цена за одну задачу — $2,57. Из них $0,63 ушло на рассуждения и $0,74 на кэширование. У Fable 5.1 — $6,12, $1,90, и $1,18 , у Opus 5 — $4, 21, $0,80 и $2,07 соответственно.
Источник: Artificial AnalysisМодель скрывает свои «мысли»: что обсуждают исследователи
- 1 сентября 2026 года издание The Information со ссылкой на источники сообщило, что для Astra разработали новую архитектуру — «зацикленный» трансформер со «скрытыми рассуждениями». Цепочка шагов для решения задачи проходит не через все слои модели, а только через нужный, что помогает сэкономить вычислительные ресурсы, пишет Fortune.
- Но «размышления» модели оказываются скрыты — так сложнее заметить опасное поведение, считают опрошенные изданием эксперты.
- В официальном релизе OpenAI от 3 сентября указано, что «рассуждения» Astra «сложнее отслеживать». Когда модель прямо просили скрывать свои «мысли», она справлялась лучше, чем GPT-5.6 Sol, на простых задачах. В сложных тестах Astra пока хуже контролирует запись исходных «рассуждений». Прямого упоминания архитектуры «зацикленных» трансформеров в анонсе OpenAI нет.
- Статья The Information вызвала опасения среди экспертов в области безопасности, пишет Fortune. Они считают, что шаг OpenAI нормализует эту технологию, и её будут использовать другие ИИ-компании, которые могут уделять меньше внимания безопасности.
Развитие технологии может привести к масштабированию непрозрачных рассуждений до такой степени, когда модель будет рассуждать полностью или почти полностью в скрытом пространстве. Тогда с высокой долей вероятности цепочка рассуждений станет бесполезна для мониторинга и контроля.
Надеюсь, ещё не поздно отказаться от архитектур, вызывающих наибольшие опасения, и OpenAI остановится на этом этапе.
Райан Гринблатт, исследователь, который ведёт расследование взлома Hugging Face
- В ответ главный научный сотрудник OpenAI Джейкоб Пачоцки заявил, что OpenAI «глубоко обеспокоена» вопросом отслеживания цепочки «рассуждений» и ограничила внедрение «зацикленной» архитектуры так, чтобы процесс мышления модели был понятен человеку.

Ася КарповаКарьера8 апр«Проблема OpenAI — сам Сэм»: The New Yorker опубликовало «досье» Альтмана с историями о лжи и пренебрежении безопасностью ChatGPT
Журналисты собирали его больше года.

Источник: vc.ru
Похожие записи
- Представляем ChatGPT для финансовых услуг | OpenAI
- DeepSeek-V4.1-Flash дебютирует с кэшированной скоростью ввода данных в непиковое время в размере 0,003 доллара США за 1 миллион долларов, а его результаты в тестах превосходят GPT-5.6 Sol и Claude Opus 5.
- Thrive Capital вывела венчурные фонды на рынок профессионального спорта; Collaborative Fund только что подняла этот уровень.
Оцените материал:
Похожие записи
Дженсен Хуанг объясняет, почему Nvidia вырастет на поразительные 70% в следующем году.
11.09.2026
DeepSeek-V4.1-Flash дебютирует с кэшированной скоростью ввода данных в непиковое время в размере 0,003 доллара США за 1 миллион долларов, а его результаты в тестах превосходят GPT-5.6 Sol и Claude Opus 5.
11.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
