Компания SpaceXAI представила Grok 4.6, превзойдя результаты Kimi K3 и сравнявшись с GPT-5.6 Sol по показателю искусственного анализа, заняв третье место в мире.
Карл Франзен
Компания Илона Маска SpaceXAI, ранее известная как xAI, выпустила Grok 4.6, свою новейшую модель искусственного интеллекта, ориентированную на долгосрочные агенты, программирование и интеллектуальную работу, а также на ценовую стратегию, призванную сделать выполнение этих задач более дешевым.
Модель набрала 61 балл по стороннему индексу искусственного интеллекта, превзойдя популярную китайскую модель с открытыми весами от Moonshot, Kimi K3, и сравнявшись с конкурентом GPT-5.6 Sol Max от OpenAI, а также улучшив результат на пять пунктов по сравнению с Grok 4.5 High. Модели Claude Opus 5 и Fable 5 от Anthropic занимают первое и второе места соответственно.
Для предприятий, оценивающих ИИ-агентов, более важным является тот факт, что Grok 4.6 демонстрирует значительный рост по сравнению со своим предшественником в тестах на программирование, работу терминала, интеллектуальную работу и производительность агентов, сохраняя при этом цену интерфейса прикладного программирования (API), начинающуюся с 2 долларов за миллион входных токенов и 6 долларов за миллион выходных токенов. Это делает его моделью средней ценовой категории по сравнению с ведущими вариантами, как проприетарными, так и с открытым исходным кодом, во всем мире, согласно анализу VentureBeat.
|
Модель |
Входные данные ($/1 млн) |
Объем производства ($/1 млн) |
Итого ($/1 млн) |
Источник |
|
Участник проекта Muse Spark 1.2 |
0,10 доллара |
0,20 доллара |
0,30 доллара |
Мета |
|
MiMo-V2.5 Flash |
0,10 доллара |
0,30 доллара |
0,40 доллара |
Xiaomi |
|
deepseek-v4-flash |
0,14 доллара |
0,28 доллара |
0,42 доллара |
DeepSeek |
|
deepseek-v4-pro |
0,435 доллара |
0,87 доллара |
1,305 доллара |
DeepSeek |
|
GPT-5.6 Луна |
0,20 доллара |
1,20 доллара |
1,40 доллара |
OpenAI |
|
МиниМакс-М3 |
0,30 доллара |
1,20 доллара |
1,50 доллара |
МиниМакс |
|
LongCat-2.0 — акция, действующая ограниченное время. |
0,30 доллара |
1,20 доллара |
1,50 доллара |
ЛонгКэт |
|
MiMo-V2.5 |
0,40 доллара |
2,00 доллара |
2,40 доллара |
Xiaomi |
|
LongCat-2.0 — стандарт |
0,75 доллара |
2,95 доллара |
3,70 доллара |
ЛонгКэт |
|
MiMo-V2.5 Pro (≤256K) |
1,00 долл. |
3,00 доллара |
4,00 доллара |
Xiaomi |
|
Muse Spark 1.1 / 1.2 |
1,25 доллара |
4,25 доллара |
5,50 долларов |
Мета |
|
GLM-5.2 |
1,40 доллара |
4,40 доллара |
5,80 долларов |
З.ай |
|
Grok 4.6 — <200K токенов подсказок |
2,00 доллара |
6,00 долларов |
8,00 долларов |
xAI |
|
MiMo-V2.5 Pro (>256K) |
2,00 доллара |
6,00 долларов |
8,00 долларов |
Xiaomi |
|
Qwen3.8-Max |
2,00 доллара |
6,00 долларов |
8,00 долларов |
QwenCloud |
|
Вспышка Gemini 3.6 |
1,50 доллара |
7,50 долларов |
9,00 долларов |
|
|
GPT-5.6 Terra |
2,00 доллара |
12,00 долларов |
14,00 долларов |
OpenAI |
|
Grok 4.6 — ≥200 тыс. токенов подсказок |
4,00 доллара |
12,00 долларов |
16,00 долларов |
xAI |
|
ГПТ-5.4 |
2,50 доллара |
15,00 долларов |
17,50 долларов |
OpenAI |
|
Кими К3 |
3,00 доллара |
15,00 долларов |
18,00 долларов |
Moonshot AI |
|
Клод Опус 5 |
5,00 долларов |
25,00 долларов |
30,00 долларов |
Антропический |
|
Sakana Fugu Ultra (≤272K) |
5,00 долларов |
30,00 долларов |
35,00 долларов |
Сакана ИИ |
|
GPT-5.6 Sol — Стандартный режим |
5,00 долларов |
30,00 долларов |
35,00 долларов |
OpenAI |
|
Клод Басня 5 / Клод Мифос 5 |
10,00 долларов |
50,00 долларов |
60,00 долларов |
Антропический |
|
GPT-5.6 Sol — Быстрый режим |
10,00 долларов |
60,00 долларов |
70,00 долларов США |
OpenAI |
Тем не менее, это менее половины стоимости GPT-5.6 Sol по сравнению с API OpenAI в стандартном режиме.
Компания SpaceXAI заявляет, что Grok 4.6 доступен уже сегодня в Grok Build, ответе SpaceXAI на Claude Code от Anthropic и Codex от OpenAI, который доступен начиная с тарифного плана SuperGrok за 30 долларов в месяц.
Она также доступна в недавно приобретенной компанией SpaceX стартапе Cursor, занимающемся разработкой программного обеспечения для искусственного интеллекта, а также у таких партнеров, как OpenRouter, Vercel и Cloudflare.
В течение первой недели SpaceXAI предоставляет вдвое больше возможностей для использования Grok 4.6 в Cursor и Grok Build.
Релиз состоялся всего через несколько недель после Grok 4.5, который SpaceXAI запустила в июле как модель, ориентированную на программирование, выполнение агентных задач и интеллектуальный труд, и через день после запуска Grok Bot, новой системы для назначения агентов ИИ для выполнения определенных задач в качестве виртуальных сотрудников.
Более существенные изменения касаются поведения агентов, а не просто служат очередным ориентиром.
Компания SpaceXAI описывает Grok 4.6 как систему, разработанную специально для того, чтобы оставаться сосредоточенным на выполнении длительных задач, включая исследование незнакомых тем, анализ информации, работу с кодовыми базами и преобразование идей продуктов в работающие приложения.
Компания заявляет, что подвергла модель более длительному дополнительному обучению, чем Grok 4.5, используя тщательно отобранные данные рассуждений и технические данные, сгенерированные моделью, а также инженерные данные и изменения в оптимизаторе и алгоритме обучения. Затем она использовала Grok 4.5 для повторной генерации траекторий контролируемой тонкой настройки на разных уровнях рассуждений, в различных средах агентов, в области STEM, разработки программного обеспечения и работы с знаниями, фильтруя проблемные траектории с помощью проверок на основе модели.
Обучение с подкреплением также было ориентировано на агентные среды, охватывающие общее программирование, интеллектуальный труд, оптимизацию ядра, веб-разработку и автоматизированное проектирование.
Это важно, потому что корпоративные внедрения ИИ все чаще выходят за рамки изолированных взаимодействий типа «запрос-ответ» и переходят к агентам, от которых ожидается поддержание состояния, работа с инструментами, модификация кода и восстановление после проблем на протяжении более длительных путей выполнения.
Компания SpaceXAI заявляет, что в ходе тестирования Grok 4.6 продемонстрировал более эффективное самотестирование и верификацию на более длинных траекториях, проверяя свою работу перед продолжением. Также отмечается более высокая эффективность первых попыток в интерактивных и визуальных проектах по сравнению с Grok 4.5. Это наблюдения компании, а не независимые гарантии производительности, но они указывают на то, где SpaceXAI сосредоточила работу над моделью после обучения.
Grok 4.6 достигает границы возможного, но не покоряет её полностью.
На данном этапе конкуренции в области моделей искусственного интеллекта невозможно переоценить превосходство Grok 4.6 над Grok 4.5.
Согласно данным Artificial Analysis, Grok 4.6 достигает показателя Эло (предпочтение человека результатам сравнения моделей в шахматных матчах) в 1753 балла на GDPVal-AA v2, бенчмарке, измеряющем производительность в реальных задачах, таких как планирование и построение диаграмм, по сравнению с 1526 баллами у Grok 4.5, 1728 баллами у GPT-5.6 Sol Max и 1741 баллом у Fable 5 Max.
Результаты кодирования от SpaceXAI показывают аналогичное улучшение по сравнению с предыдущим поколением, но при этом усиливается конкуренция на переднем крае технологий.

Grok 4.6 набирает 69,9% в CursorBench v3.2, что выше показателя 66,7% ранее, в то время как Fable 5 Max достигает 70,5%. В DeepSWE v1.1 Grok резко повышает свой результат с 54% до 65,9%, но GPT-5.6 Sol Max лидирует с 73%. FrontierCode v1.1 Extended показывает результат с 56,6% до 61,3%, по сравнению с 60,6% у GPT-5.6 Sol Max и лидирующими 63,6% у Fable 5 Max.
Результаты тестов агентов подтверждают эту тенденцию. Grok 4.6 достигает 57,5% на APEX-Agents, что на 10,4 пункта больше, чем у Grok 4.5 (47,1%), немного превосходя GPT-5.6 Sol Max (56,7%), но отставая от Fable 5 Max (59,2%). На APEX-SWE Grok 4.6 поднимается до 56,4% с 53,6%, в то время как Fable 5 Max показывает результат 58,8%.
В Terminal-Bench v3.0 наблюдается еще больший разрыв. Grok 4.6 улучшил свои показатели с 15,7% до 26%, но GPT-5.6 Sol Max и Fable 5 Max показали результаты 34,6% и 34,1% соответственно.
Два из самых высоких результатов Grok 4.6 получены в ходе профессиональной работы с более длительным горизонтом. На AA-Briefcase он набирает рейтинг Эло 1577, немного превышая показатель Fable 5 Max (1574) и опережая GPT-5.6 Sol Max (1502). На Harvey LAB Grok 4.6 достигает 15,8%, против 12,9% у Grok 4.5, 11,3% у Fable 5 Max и 2,5% у GPT-5.6 Sol Max.
Компания SpaceXAI отмечает важное методологическое замечание: в таблице используются оценки сторонних организаций, основанные на лучших результатах, полученных на основе самоотчетов или общедоступных данных. Поэтому сравнение не следует интерпретировать как идеально контролируемую оценку четырех моделей.
Другими словами, имеющиеся данные более убедительно подтверждают существенное улучшение по сравнению с Grok 4.5, чем его превосходство над конкурирующими моделями нового поколения. Grok 4.6 выигрывает в нескольких из представленных оценок, в то время как GPT-5.6 Sol Max и Fable 5 Max сохраняют значительное преимущество в других областях.
Стоимость может оказаться более важным показателем для предприятий.
Оценка, предоставленная компанией Artificial Analysis, добавляет еще один аспект: сколько работы выполняет модель за потраченные деньги.
По результатам тестирования, Grok 4.6 находится на границе Парето «интеллект против стоимости задачи» с заявленной ценой в 0,84 доллара за задачу — что на самом деле делает его менее выгодным, чем его предшественник, Grok 4.5, и менее экономичным, чем GPT-5.6 Luna от OpenAI, GLM-5.2 от z.ai и новый Muse Spark 1.2 от Meta, среди прочих моделей.
Компания Artificial Analysis также сообщает, что Grok 4.6 выполнил задания AA-Briefcase примерно за 53 хода и обработал в среднем около 0,5 миллиарда входных жетонов, в то время как Claude Opus 5 Max потребовалось приблизительно 103 хода и 2 миллиарда входных жетонов.
Эти измерения не доказывают, что каждый производственный агент будет использовать меньше токенов или завершать работу вдвое быстрее. Стоимость работы агента в значительной степени зависит от конструкции оборудования, подсказок, вызовов инструментов, кэширования, поведения при повторных попытках и самой задачи. Но они указывают на все более важный корпоративный показатель: стоимость завершения рабочего процесса, а не просто стоимость генерации одного миллиона токенов. Это различие является центральным элементом позиционирования SpaceXAI.
Стандартный API Grok 4.6 стоит от 2 долларов за миллион входных токенов и 6 долларов за миллион выходных токенов, а SpaceXAI также предлагает более быстрый вариант по цене вдвое выше.
В прилагаемой документации API содержится важное замечание относительно развертывания с большим контекстом. Grok 4.6 поддерживает контекстное окно в 500 000 токенов, но запросы с количеством токенов менее 200 000 тарифицируются по цене 2 доллара за миллион входных токенов, 0,50 доллара за миллион кэшированных входных токенов и 6 долларов за миллион выходных токенов. Как только запрос достигает 200 000 токенов, эти тарифы повышаются до 4, 1 и 12 долларов соответственно, при этом более высокая цена применяется ко всем токенам в этом запросе.
Это означает, что предприятиям не следует экстраполировать заявленную цену в 2/6 долларов на весь контекстный период модели при оценке общей стоимости владения.
По данным Artificial Analysis, стандартные базовые ставки остаются более чем на 60% ниже цен конкурирующих моделей, используемых для Claude Opus 5 и GPT-5.6 Sol. Практическая экономия будет зависеть от того, сколько токенов каждая модель потребляет для выполнения той же задачи.
Название Grok несёт в себе значительный груз споров и противоречий, помимо общего скептицизма в отношении искусственного интеллекта.
Производительность и цена могут быть не единственными препятствиями, с которыми SpaceXAI столкнется на пути к внедрению результатов тестирования Grok 4.6 в корпоративную среду. Бренд Grok имеет необычайно заметную историю противоречий в области безопасности и управления, включая экстремистские и антисемитские высказывания, политически предвзятые ответы, преувеличенную похвалу Илону Маску и, совсем недавно, использование возможностей Grok по генерации изображений для создания сексуализированных изображений без согласия. Для компаний со строгими требованиями к соблюдению нормативных требований, безопасности бренда или ответственному использованию ИИ эта история может стать отдельным фактором при закупке, помимо технических возможностей самого Grok 4.6.
Самый печально известный эпизод с генерацией текстовых сообщений произошёл в июле 2025 года, когда Grok опубликовал антисемитские посты, восхвалял Адольфа Гитлера и в некоторых ответах называл себя «МехаГитлером». Предшественница SpaceXAI, компания xAI, впоследствии заявила, что удаляет неподобающие посты и принимает меры для предотвращения публикации разжигающих ненависть высказываний компанией Grok.
Также летом 2025 года Grok начал вставлять в ответы на несвязанные вопросы упоминания о предполагаемом «геноциде белых» в Южной Африке. Компания xAI заявила, что несанкционированная модификация программного обеспечения Grok привела к тому, что система выдала определенный ответ на политическую тему, обойдя при этом обычный процесс проверки. Компания заявила, что это изменение нарушает ее политику, и впоследствии пообещала опубликовать подсказки системы Grok и установить круглосуточный мониторинг проблемных ответов. Правительство Южной Африки отвергло утверждения о том, что происходит геноцид против белых южноафриканцев.
Объективность Грока вновь оказалась под пристальным вниманием в ноябре того же года после того, как чат-бот неоднократно выдавал неправдоподобно лестные оценки Маска. Среди примеров, о которых сообщалось тогда, были утверждения, ставящие Маска выше элитных спортсменов и исторических интеллектуалов. Маск заявил, что Гроком манипулировали с помощью враждебных подсказок, заставив его делать «абсурдно позитивные» заявления о нем. Какова бы ни была основная причина, этот инцидент проиллюстрировал проблему репутации для корпоративной модели, результаты которой могут переплетаться с публичным образом руководителя, наиболее тесно связанного с ее разработчиком.
Наиболее серьезный скандал связан с созданием изображений. В январе 2026 года британский регулятор Ofcom начал официальное расследование в отношении X после сообщений о том, что учетная запись Grok использовалась для создания и распространения изображений людей без одежды и изображений детей сексуального характера. Ofcom заявил, что рассматриваемые материалы могут представлять собой несанкционированное использование интимных изображений, порнографию и материалы, связанные с сексуальным насилием над детьми. Впоследствии X заявила, что приняла меры, направленные на предотвращение использования учетной записи Grok для создания интимных изображений людей, но Ofcom заявила, что расследование остается открытым.
Внимание общественности выходит за рамки Ofcom. Управление комиссара по информации Великобритании расследует деятельность X и xAI в связи с разработкой и внедрением Grok, в том числе, на предмет законности обработки персональных данных и наличия адекватных мер защиты от вредоносных манипуляций с изображениями. Тем временем Европейская комиссия начала отдельное официальное расследование в соответствии с Законом о цифровых услугах, изучающее управление компанией X системными рисками, связанными с Grok, включая распространение манипулятивных материалов сексуального характера.
Эти расследования касаются компании X и ранее существовавшей организации xAI, а не установления факта нарушения этих законов недавно выпущенным API Grok 4.6. Тем не менее, они вряд ли помогут SpaceXAI продавать Grok коммерческим компаниям.
В феврале 2026 года SpaceX приобрела xAI, и теперь эта компания, занимающаяся разработкой искусственного интеллекта, позиционирует себя как SpaceXAI. Это означает, что новейшие модели Grok находятся под другой корпоративной структурой, но сохраняют тот же бренд, ориентированный на потребителя.
В изученных здесь материалах нет доказательств того, что Grok 4.6 сам по себе повторяет конкретные инциденты, связанные с «меха-Гитлером», «белым геноцидом», сексуальным подтекстом или лестью в адрес Маска, которые имели место при более ранних внедрениях Grok. Однако корпоративные закупочные группы редко оценивают модель в отрыве от истории поставщика и продукта. Для SpaceXAI это означает, что Grok 4.6, возможно, придется продемонстрировать не только то, что он дешевле или эффективнее конкурирующих моделей, но и то, что механизмы контроля достаточно предсказуемы, чтобы организации, которые не могут позволить себе своего поставщика ИИ, не стали источником проблем с безопасностью бренда.
Такая преемственность создает потенциальную проблему внедрения, которую невозможно измерить с помощью таблиц сравнения. Разработчики, выбирающие модель для внутреннего агента кодирования, могут в первую очередь обращать внимание на цену, задержку и выполнение задач. Банк, государственное учреждение, медицинское учреждение или потребительский бренд, внедряющие ту же модель в рабочие процессы, ориентированные на клиентов или регулируемые системы, также должны учитывать управление поставщиком, контроль безопасности контента, возможность аудита и репутационные риски.
Модель, предназначенная для внедрения, а не просто для общения.
Grok 4.6 поддерживает ввод текста и изображений с выводом текста, вызовом функций, структурированным выводом и логическим выводом в соответствии с предоставленными спецификациями API. В этих спецификациях также указаны ограничения скорости: 150 запросов в секунду и 50 миллионов токенов в минуту, при этом API доступен в регионах us-east-1 и us-west-2.
В анонсе запуска Cursor аналогичным образом характеризуется Grok 4.6 как продукт, предназначенный для долгосрочных агентов и амбициозных интерактивных и визуальных проектов, предоставляющий разработчикам немедленный доступ к модели внутри уже существующей среды разработки агентов, а не требующий от них предварительного создания новой среды на основе API.
Для корпоративных покупателей это распределение результатов может иметь почти такое же значение, как и результаты в рейтингах. Модели все чаще конкурируют не только по показателям логического мышления, но и по тому, смогут ли разработчики интегрировать их в существующие рабочие процессы кодирования, исследований и эксплуатации, не дестабилизируя эти процессы и не увеличивая значительно затраты на вывод результатов, а также не вызывая негативной реакции из-за ассоциации с противоречивым брендом.
Grok 4.6 не устанавливает неоспоримого лидерства в производительности. Вместо этого его запуск предлагает иное решение: интеллектуальный уровень, значительные улучшения по сравнению с предыдущим поколением, более эффективное поведение агентов в длительных режимах и относительно агрессивную экономику токенов.
Следующим испытанием станет то, насколько эффективность, наблюдаемая в искусственном анализе на контролируемых агентных нагрузках, применима в производственной среде. Если Grok 4.6 сможет стабильно выполнять длительные задачи программирования и работы с информацией с меньшим количеством ходов и токенов, то наиболее важным показателем эффективности модели в конечном итоге может стать не рейтинг в таблице лидеров, а количество вычислительных блоков в масштабах предприятия.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Похожие записи
С помощью сканирования с использованием ИИ обнаружена серьезная уязвимость безопасности, приводящая к ошибке копирования в Linux.
02.05.2026
Способность к абстрактному мышлению, или экзистенциальный интеллект, — это нечто вроде умения видеть спрятанные рисунки на стереограммах
26.12.2025
Гуру маркетинга, который помог превратить Khosla Ventures в центр искусственного интеллекта, движется дальше
21.11.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
