Архив рубрики ~Лента новостей~

Первые результаты Jalapeño демонстрируют лидирующую в отрасли скорость и эффективность выполнения задач искусственного интеллекта | OpenAI

Первые результаты Jalapeño демонстрируют лидирующую в отрасли скорость и эффективность выполнения задач искусственного интеллекта | OpenAI
Первые результаты Jalapeño демонстрируют лидирующую в отрасли скорость и эффективность выполнения задач искусственного интеллекта | OpenAI

  • Как мы оценивали эффективность Jalapeño
    • Халапеньо увеличивает отрыв от соперников по результатам предыдущего лучшего матча в рамках чемпионата мира по футболу.
    • Jalapeño предоставляет больше токенов на пользователя.
    • Халапеньо обеспечивает более высокую пропускную способность на киловатт.
  • Разработка архитектуры для обеспечения скорости и эффективности в рамках одного чипа.
  • Мы использовали искусственный интеллект для проектирования микросхемы и разработали её таким образом, чтобы ИИ мог её программировать.
  • Путь к эффективному и сверхбыстрому выводу результатов
  • Приложение
    • Халапеньо – это граница Парето в GPT‑OSS 120B
    • Халапеньо лидирует в оперативных точках GPT-OSS
    • Халапеньо – это граница Парето в DeepSeek R1 670B
    • Халапеньо лидирует среди операционных точек DeepSeek R1.
    • Халапеньо – это граница Парето в Kimi K2.5 1T
    • Халапеньо лидирует в сети точек продаж Kimi K2.5.
  • Как мы оценивали эффективность Jalapeño
    • Халапеньо увеличивает отрыв от соперников по результатам предыдущего лучшего матча в рамках чемпионата мира по футболу.
    • Jalapeño предоставляет больше токенов на пользователя.
    • Халапеньо обеспечивает более высокую пропускную способность на киловатт.
  • Разработка архитектуры для обеспечения скорости и эффективности в рамках одного чипа.
  • Мы использовали искусственный интеллект для проектирования микросхемы и разработали её таким образом, чтобы ИИ мог её программировать.
  • Путь к эффективному и сверхбыстрому выводу результатов
  • Приложение
    • Халапеньо – это граница Парето в GPT‑OSS 120B
    • Халапеньо лидирует в оперативных точках GPT-OSS
    • Халапеньо – это граница Парето в DeepSeek R1 670B
    • Халапеньо лидирует среди операционных точек DeepSeek R1.
    • Халапеньо – это граница Парето в Kimi K2.5 1T
    • Халапеньо лидирует в сети точек продаж Kimi K2.5.

С момента анонса Jalapeño, первого специализированного чипа OpenAI для обработки данных, мы тестировали этот чип и построенную на его основе систему. Результаты показывают значительное повышение производительности: Jalapeño может обрабатывать больше задач ИИ на единицу мощности, одновременно быстрее возвращая ответы. Jalapeño обеспечивает как более высокую пропускную способность, так и меньшую задержку в рамках одной архитектуры, в то время как существующим аппаратным системам часто приходится выбирать между этими двумя параметрами.

Для клиентов это может означать более быстрые ответы, более отзывчивых операторов и более надежный доступ по мере роста спроса. Наша миссия — обеспечить, чтобы искусственный интеллект приносил пользу всему человечеству. Эти достижения помогут сделать все более совершенный ИИ более доступным и распространенным.

Модели OpenAI также ускорили разработку Jalapeño. Предыдущие поколения помогли команде спроектировать и запустить чип, а наши новейшие модели ускоряют его оптимизацию и программирование. Производительность Jalapeño распространяется на GPT-OSS 120B, DeepSeek R1 и Kimi K2.5 1T, демонстрируя, что архитектура работает с моделями, разработанными как внутри, так и вне OpenAI. Во всех трех системах Jalapeño обеспечил в 1,5–1,9 раза больше работы ИИ на ватт при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку, чем сравниваемые системы. Для высокоинтерактивных рабочих нагрузок он показал в 2,1–4,1 раза более высокую производительность.

Jalapeño также свидетельствует о более широком преимуществе в области комплексного подхода. OpenAI может проектировать модели, продукты, программное обеспечение для обслуживания, чипы, память, сетевые компоненты и системы одновременно, используя знания, полученные на основе реальных рабочих нагрузок, для улучшения каждого уровня стека. Jalapeño работает на основе собственных разработок с подтвержденными результатами, и это начало многопоколенной платформы. В ближайшие месяцы мы будем наращивать разработку Jalapeño, чтобы предоставлять нашим клиентам более быстрые, функциональные и эффективные продукты.

Как мы оценивали эффективность Jalapeño

Мы оцениваем производительность при сопоставимом пользовательском опыте, измеряя, какой объем полезной работы ИИ каждая система может выполнить на единицу мощности, соблюдая при этом требуемую задержку для клиентов и интерактивных агентов. Это особенно важно для агентов, которым необходимо выполнять множество шагов последовательно, поэтому задержки могут накапливаться на протяжении всей задачи.

Чтобы понять, как Jalapeño работает на практике, мы протестировали его на InferenceX, общедоступном бенчмарке от SemiAnalysis, который измеряет весь процесс обработки запроса ИИ. Мы сравнили Jalapeño с ведущими коммерчески доступными системами ИИ в протестированном диапазоне рабочих параметров, от высокопроизводительной обработки запросов до высокоинтерактивного использования с низкой задержкой. Jalapeño показал лучшее сочетание пропускной способности, энергоэффективности и задержки. Хотя производительность иногда указывается для каждого чипа отдельно, мы считаем, что более полезным стандартом является производительность на единицу мощности.

Халапеньо увеличивает отрыв от соперников по результатам предыдущего лучшего матча в рамках чемпионата мира по футболу.

Jalapeño предоставляет больше токенов на пользователя.

Халапеньо обеспечивает более высокую пропускную способность на киловатт.

Во всех трех общедоступных моделях Jalapeño продемонстрировал лучшее сочетание производительности на ватт и задержки во всем протестированном диапазоне рабочих режимов, что позволило ему приблизиться к границе Парето. Для согласованного сравнения систем мы нормализовали результаты, используя опубликованные производителем значения потребляемой мощности чипа каждого ускорителя. Jalapeño имеет номинальную мощность 700 Вт, хотя измеренная устойчивая мощность оставалась на уровне 550 Вт или ниже при тестируемых нагрузках.

Jalapeño продемонстрировал отличные результаты в тестах GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. На Kimi, самой крупной из протестированных нами общедоступных моделей, он показал примерно в 1,5 раза более высокую пиковую производительность на ватт и в 3,4 раза меньшую сквозную задержку по сравнению с системой сравнения. В ходе наших внутренних тестов преимущество Jalapeño еще больше возросло на передовых моделях OpenAI, что говорит о том, что архитектура становится более ценной по мере роста объемов и сложности рабочих нагрузок.

Разработка архитектуры для обеспечения скорости и эффективности в рамках одного чипа.

При разработке Jalapeño с самого начала руководствовались вопросом: какое оборудование мы бы создали, если бы его основной задачей было обслуживание современных и будущих языковых моделей, особенно интерактивных агентов? Преимущества Jalapeño обусловлены совместной разработкой чипа, памяти, сети, программного обеспечения и стоечной системы с учетом реальных рабочих нагрузок языковых моделей. Вывод языковой модели проходит несколько различных этапов с различными узкими местами. Предварительное заполнение, когда система обрабатывает запрос, является ресурсоемким процессом, в то время как декодирование, когда система генерирует ответный токен за токеном, в большей степени ограничено пропускной способностью памяти. Коммуникация также может добавлять задержку, когда данные должны передаваться между ядрами и чипами, оставляя некоторые процессорные блоки простаивающими в ожидании. Система, которая преуспевает на одном этапе, может потерять это преимущество при ожидании данных или перемещении состояния модели между различными ресурсами.

Мы разработали Jalapeño таким образом, чтобы минимизировать перемещение данных и задержки связи. Это означает, что состояние модели, включая кэш ключ-значение, используемый при генерации ответа, может быть явно размещено и храниться локально, в то время как система активирует правильную комбинацию вычислительных ресурсов, памяти и сети для каждой фазы вывода. Сеть является неотъемлемой частью архитектуры. Ее большая область охвата позволяет всей рабочей нагрузке оставаться в рамках одной подключенной системы, минимизируя перемещение данных и помогая обеспечить быструю и эффективную обработку всего запроса от начала до конца. В результате получается сбалансированный и взаимозаменяемый акселератор, способный поддерживать изменяющиеся архитектуры моделей, превосходно справляться как с предварительным заполнением, так и с декодированием, и адаптироваться по мере изменения баланса между ними, что является определяющей особенностью агентных рабочих нагрузок.

Мы использовали искусственный интеллект для проектирования микросхемы и разработали её таким образом, чтобы ИИ мог её программировать.

Искусственный интеллект сыграл непосредственную роль в разработке Jalapeño, позволив команде перейти от первоначального проектирования к выпуску готового продукта за девять месяцев благодаря изучению вариантов реализации, сокращению циклов проектирования, измерений и верификации, а также непрерывному совершенствованию моделей. ИИ также помог оптимизировать арифметические схемы чипа, что позволило команде в срок увеличить вычислительную мощность.

Jalapeño был разработан как понятная и предсказуемая целевая платформа программирования как для людей, так и для ИИ. Инженеры могут описывать работу с помощью локальных тензоров, явной коммуникации и предсказуемой синхронизации. Затем ИИ может оптимизировать то, как эта работа распределяется, размещается, планируется и координируется в рамках системы. Эта понятная и предсказуемая структура дает ИИ удобный способ решения традиционно сложной проблемы параллельного программирования.

Поддержка каждого нового семейства моделей по-прежнему требует новых ядер и оптимизаций, специфичных для каждой модели. Используя Codex с GPT-Astra, команда за два месяца добилась высокой производительности трех моделей с открытыми весами, которые не входили в первоначальный план производства Jalapeño. Это продемонстрировало как гибкость архитектуры, так и скорость, с которой ИИ может помочь нам ее программировать. Для отдельных блоков GPT-OSS, отвечающих за внимание и смешанный состав экспертов, реализации, сгенерированные ИИ, работали в 1,5–1,8 раза быстрее, чем существующие реализации, написанные экспертами. Эти цифры относятся к выбранным блокам, а не ко всей модели, но они указывают на мощный новый цикл разработки.

Путь к эффективному и сверхбыстрому выводу результатов

Инфраструктура ИИ ценна благодаря возможности выполнения полезной работы в реальном мире. Создавая больше полезной работы при тех же мощностях и оборудовании, Jalapeño может помочь нам удовлетворить больший спрос и снизить стоимость достижения успешного результата. Для OpenAI это может повысить операционную эффективность, позволяя росту полезной работы и доходов опережать затраты на обслуживание. Это также может способствовать более широкому внедрению и дальнейшим инвестициям в лучшие модели, продукты и инфраструктуру. Более быстрое выполнение выводов может ускорить итерации и создать новые варианты использования.

Jalapeño расширяет возможности эффективного вывода данных с низкой задержкой:

  • Сверхбыстрый режим вывода с эффективностью, ранее доступной только в быстром режиме.
  • Быстрый режим вывода результатов с эффективностью, ранее доступной только в пакетном режиме.
  • Повышенная эффективность при пакетном выводе

Мы планируем начать развертывание Jalapeño в вычислительной инфраструктуре OpenAI к концу года. Это первое поколение многопоколенной дорожной карты: второе поколение находится в стадии активной разработки, а третье формируется. Каждое последующее поколение будет опираться на полученные знания и способствовать дальнейшему повышению эффективности и скорости.

Для удовлетворения растущего спроса на ИИ потребуется больше вычислительных мощностей из всех доступных источников. Мы продолжим широко использовать ускорители от NVIDIA и других партнеров как для обучения, так и для вывода результатов. Наша миссия — обеспечить, чтобы искусственный интеллект приносил пользу всему человечеству.

В рамках подготовки к развертыванию мы продолжаем квалификацию в производственной среде, совершенствуем программное обеспечение, готовимся к масштабной эксплуатации Jalapeño и проверяем производительность на большем количестве моделей. Полученные на данный момент результаты показывают, чего можно достичь, когда мы проектируем всю систему вместе: более отзывчивый, функциональный и управляемый ИИ, предоставляемый более эффективно большему числу людей.

Приложение

Халапеньо – это граница Парето в GPT‑OSS 120B

Граница пропускной способности на кВт

InferenceX · GPT‑OSS‑120B · номинальная мощность 8k/1k · STP · TDP корпуса: Jalapeño 700 Вт; GB200 1200 Вт

Халапеньо лидирует в оперативных точках GPT-OSS.

ПИКОВАЯ И СООТВЕТСТВУЮЩАЯ ПРОИЗВОДИТЕЛЬНОСТЬ

Более высокая пиковая смешанная тепловая мощность / кВт

≈1,9×

85 448 против 44 960 смешанных / кВт

Более низкая сквозная задержка

≈1,7×

1,03 с против 1,80 с

Более низкий минимальный уровень ТБТ

≈2,7×

0,69 против 1,87 мс (1459 против 535 ток/с/пользователь)

Более высокая пропускная способность по сравнению с предыдущим соглашением TBT.

≈53,7×

22 935 против 427 смешанных кВт (при 535,28 ток/с/пользователь)

Халапеньо – это граница Парето в DeepSeek R1 670B

InferenceX · DeepSeek R1 MXFP4 · номинальная мощность 8k/1k · STP · TDP корпуса: Jalapeño 700 Вт; GB300 1400 Вт

Халапеньо лидирует среди операционных точек DeepSeek R1.

≈1,7×

19 641 против 11 781 смешанный / кВт

Более низкая сквозная задержка

≈3,6×

1,65 с против 5,99 с

≈4,1×

1,43 против 5,90 мс (700 против 169 ток/с/пользователь)

≈104,3×

12 258 против 118 смешанных кВт (при 169,41 кВт/с/пользователь)

Халапеньо – это граница Парето в Kimi K2.5 1T

InferenceX · Kimi K2.5 MXFP4 · номинальная мощность 8k/1k · STP · TDP корпуса: Jalapeño 700 Вт; GB300 1400 Вт

Халапеньо лидирует в сети точек продаж Kimi K2.5.

≈1,5×

18 195 против 11 862 смешанных / кВт

Более низкая сквозная задержка

≈3,4×

1,56 с против 5,31 с

≈3,8×

1,44 против 5,48 мс (694 против 182 токена/с/пользователь)

≈56,1×

6744 против 120 смешанных кВт (при 182,46 кВт/с/пользователь)

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Сегодня у вас последний шанс сэкономить до 300 долларов на пропуске на TechCrunch Disrupt 2026. Архив рубрики ~Коротко из Telegram~ Лучшие ИИ инструменты этого месяца, мой рейтинг.   🎬 Artlist Скачать игру… Архив рубрики ~Коротко из Telegram~ Лучшие ИИ инструменты этого месяца, мой рейтинг.   Архив рубрики ~Коротко из Telegram~ Искусственный интеллект становится важным союзником в защите редких видов животных…. Архив рубрики ~Коротко из Telegram~ Пока все обсуждают, заменит ли ИИ офисных специалистов, в США… Архив рубрики ~Коротко из Telegram~ Помните историю, когда OpenAI во время тестирования смог выбраться из… Архив рубрики ~Полезное~ Keybr.com — УМНЫЙ ТРЕНАЖЁР СЛЕПОЙ ПЕЧАТИ, КОТОРЫЙ ПОДСТРАИВАЕТСЯ ПОД ВАС… Архив рубрики ~Коротко из Telegram~ OpenAI ВЫПУСТИЛА СПЕЦИАЛЬНУЮ ВЕРСИЮ ChatGPT ДЛЯ ПОДРОСТКОВ 13–17 ЛЕТ… Архив рубрики ~Коротко из Telegram~ ИИ-СКАММЕРЫ ОКАЗАЛИСЬ ЭФФЕКТИВНЕЕ ЛЮДЕЙ В 2,5 РАЗА * Новое исследование… Архив рубрики ~Коротко из Telegram~ Искусственный интеллект уже меняет мир, и, похоже, даже попрошайничество… Архив рубрики ~Коротко из Telegram~ У Spotify занятный кейс про дружбу и переобувку с ИИ… Архив рубрики ~Полезное~ Агент превратит ЛЮБОЙ сайт в рабочий API — мы нашли… Архив рубрики ~Коротко из Telegram~ Главный тренд в ИИ за минувшую неделю — переход от… Архив рубрики ~Коротко из Telegram~ На GitHub собрали более 200 бесплатных сервисов в одном месте… Новости робототехники Сегодня у вас последний шанс сэкономить до 300 долларов на пропуске на TechCrunch Disrupt 2026. Архив рубрики ~Коротко из Telegram~ Лучшие ИИ инструменты этого месяца, мой рейтинг.   🎬 Artlist Скачать игру… Архив рубрики ~Коротко из Telegram~ Лучшие ИИ инструменты этого месяца, мой рейтинг.   Архив рубрики ~Коротко из Telegram~ Искусственный интеллект становится важным союзником в защите редких видов животных…. Архив рубрики ~Коротко из Telegram~ Пока все обсуждают, заменит ли ИИ офисных специалистов, в США… Архив рубрики ~Коротко из Telegram~ Помните историю, когда OpenAI во время тестирования смог выбраться из… Архив рубрики ~Полезное~ Keybr.com — УМНЫЙ ТРЕНАЖЁР СЛЕПОЙ ПЕЧАТИ, КОТОРЫЙ ПОДСТРАИВАЕТСЯ ПОД ВАС… Архив рубрики ~Коротко из Telegram~ OpenAI ВЫПУСТИЛА СПЕЦИАЛЬНУЮ ВЕРСИЮ ChatGPT ДЛЯ ПОДРОСТКОВ 13–17 ЛЕТ… Архив рубрики ~Коротко из Telegram~ ИИ-СКАММЕРЫ ОКАЗАЛИСЬ ЭФФЕКТИВНЕЕ ЛЮДЕЙ В 2,5 РАЗА * Новое исследование… Архив рубрики ~Коротко из Telegram~ Искусственный интеллект уже меняет мир, и, похоже, даже попрошайничество… Архив рубрики ~Коротко из Telegram~ У Spotify занятный кейс про дружбу и переобувку с ИИ… Архив рубрики ~Полезное~ Агент превратит ЛЮБОЙ сайт в рабочий API — мы нашли… Архив рубрики ~Коротко из Telegram~ Главный тренд в ИИ за минувшую неделю — переход от… Архив рубрики ~Коротко из Telegram~ На GitHub собрали более 200 бесплатных сервисов в одном месте…

Оставить комментарий