Модель Kimi K3 с открытыми весами: крупнейший китайский ИИ делает ставку на память, а не на вычислительные мощности.
Искусственный интеллект с открытым исходным кодом и демократизацией
Модель Kimi K3 с открытыми весами: крупнейший китайский ИИ делает ставку на память, а не на вычислительные мощности.
Модель Kimi K3 от Moonshot AI, использующая открытые веса, с момента запуска 16 июля практически полностью анализируется по количеству параметров. С 2,8 триллионами параметров это самая большая модель с открытыми весами, выпущенная на сегодняшний день. Размеры моделей обычно делятся на приблизительные категории, и 2,8 триллиона округляется до того, что в отрасли называют классом 3T. Это уровень, в который ранее не входила ни одна модель с открытыми весами.

Естественный вывод заключается в том, что Moonshot удалось обойти ограничения на вычислительные мощности в США. Однако в собственном техническом блоге компании говорится о более конкретном: K3 не столько обходит это ограничение, сколько переносит его, обменивая вычислительные мощности на память почти на каждом уровне проектирования.
Этот компромисс заслуживает понимания, поскольку вычислительные мощности и память не являются взаимозаменяемыми параметрами, и они в разной степени недоступны китайской лаборатории.
Представляем Kimi K3: Open Frontier Intelligence
🔹 2,8 триллиона параметров, 1 миллион контекстов, нативная мультимодальная архитектура
🔹 Технология Kimi Delta Attention обеспечивает декодирование до 6,3 раз быстрее в контекстах с миллионами токенов.
🔹 Остаточные значения внимания обеспечивают примерно на 25% более высокую эффективность тренировки при дополнительном эффекте менее 2%… pic.twitter.com/eFHEbdxn3P— Kimi.ai (@Kimi_Moonshot) 16 июля 2026 г.
Почему модель Kimi K3 с открытым весом вызывает проблемы с памятью
Стоимость работы с крупной моделью определяется двумя факторами. Первый — это объем вычислений, выполняемых машиной для создания каждого слова. Второй — это объем данных, которые модель должна постоянно поддерживать в рабочем состоянии и быть мгновенно доступной на протяжении всего времени работы. Первый фактор — это вычислительные мощности. Второй — это память. Ограничения на экспорт микросхем поначалу сильно давили на Китай, и разработка Moonshot выглядит как последовательная попытка сократить расходы на память.
Основной подход заключается в использовании техники, называемой «смешивание экспертов». Вместо того чтобы запускать всю модель для каждого слова, K3 разделяется на 896 специализированных разделов и задействует только 16 из них за раз, что составляет около 1,8% от общего числа. Количество вычислений на слово резко сокращается. Затраты на память остаются неизменными, поскольку все 2,8 триллиона параметров должны оставаться загруженными и готовыми к использованию на случай, если именно они будут вызваны следующими.
Поэтому Moonshot напрямую попыталась добиться принятия этого законопроекта. Компания обучила K3 работать с точностью до четырех бит на параметр вместо обычных шестнадцати, используя метод, известный как обучение с учетом квантования, который компания применяла начиная с этапа тонкой настройки и, по ее словам, выбрала «для широкой совместимости с оборудованием», — фраза, над которой стоит задуматься, поскольку она звучит как страховка от работы на процессорах, отличных от Nvidia. Экономия существенная. Независимый анализ релиза показывает, что модель занимает примерно 1,4 ТБ в этом формате, тогда как при полной точности ей потребовалось бы 5,6 ТБ.
Второе изменение, Kimi Delta Attention, направлено на другой способ обработки памяти. По мере того, как модель обрабатывает очень длинный документ, она накапливает постоянно обновляемое хранилище всего, что уже прочитала. При заявленном K3 лимите в миллион токенов (несколько тысяч страниц) именно это хранилище, а не сама модель, становится самым большим элементом в памяти.
Компания Moonshot необычайно прямо заявляет о коммерческой выгоде в данном случае. Она внесла свой вклад в разработку кода кэширования для проекта vLLM, использующего открытый исходный код для обслуживания серверов, и утверждает, что именно это сочетание позволяет ей устанавливать конкурентоспособные цены на K3, несмотря на масштаб модели. Moonshot рекомендует запускать K3 на 64 или более ускорителях, соединенных достаточно близко друг к другу, чтобы они работали как единый пул.
Аналогичный подход используется в системах CloudMatrix от Huawei, и он указывает на реальное решение проблемы. Память можно объединить на большом количестве отдельных, ничем не примечательных чипов. Вычислительные мощности для обучения таким же образом объединить невозможно.
Вопрос о том, происходит ли такое объединение ресурсов на китайских кремниевых чипах, в блоге не дается ответа. Тесты Moonshot на уровне чипов проводились на Nvidia H200S и на том, что описывается лишь как «GPGPU от альтернативного поставщика», название которого авторы отказываются разглашать. Другие результаты получены на Nvidia L20, урезанной версии карты, продаваемой в Китай в соответствии с экспортными правилами.
В блоге не указано, где именно находится оборудование H200, а в январе Палата представителей США приняла законопроект о закрытии лазейки в сфере аренды облачных ресурсов за рубежом, которая позволяла китайским компаниям удаленно получать доступ к ограниченным по ресурсам ускорителям. Все это важно потому, что китайская индустрия микросхем отстает больше всего по объему памяти, а не по вычислительной мощности.
В ходе торговых переговоров в августе 2025 года Пекин потребовал смягчения ограничений на использование высокоскоростной памяти, а не на литографическое оборудование или доступ к TSMC, что является справедливым сигналом того, что, по мнению чиновников, действительно является обязательным. Прогнозируемый объем внутреннего производства такой памяти в этом году составляет около двух миллионов стеков, чего достаточно примерно для 250 000–300 000 чипов класса Huawei Ascend 910C, в то время как SMIC располагает мощностями по производству более миллиона пластин.
Что предприятия могут реально внедрить
Для предприятий в этом регионе практический вопрос заключается не в том, занимает ли K3 первое место в рейтинге, а в том, вообще ли применима модель с открытыми весами такого масштаба. Азиатские предприятия выбирают модели с открытыми весами по трем причинам: цена, суверенитет данных и охват региональных языков, а банки и страховые компании по всей Юго-Восточной Азии проводят пилотные проекты по внедрению саморазмещаемых моделей с открытыми весами, специально предназначенных для того, чтобы записи никогда не покидали их собственные системы.
Весовые коэффициенты поступят в продажу 27 июля, и любая организация, которая может позволить себе оборудование, сможет бесплатно загрузить, модифицировать и запустить K3 внутри своих стен. Вопрос в том, сколько таких организаций сможет это сделать. Moonshot рекомендует использовать модель на 64 или более ускорителях, объединенных в единый пул, а сами весовые коэффициенты, согласно независимому анализу, занимают примерно 1,4 ТБ в том формате, в котором они поставляются, еще до учета памяти, необходимой для обработки длинного документа.
Это обязательство по созданию дата-центра, а не серверной комнаты. Для большинства предприятий практическим результатом является аренда выделенных мощностей, а не их владение. Это по-прежнему сохраняет данные внутри страны и под контрактом, чего и добивается большинство региональных регуляторов. Чего это не обеспечивает, так это независимости от поставщиков инфраструктуры, которая изначально привлекла многих из этих покупателей к Open Weights.
Программное обеспечение тоже ещё не готово. Два основных архитектурных изменения K3 настолько новые, что стандартные инструменты с открытым исходным кодом для запуска моделей пока их не поддерживают, и Moonshot заявляет, что работает с партнерами по инференции и разработчиками открытого программного обеспечения над согласованием технических деталей перед релизом. Командам, планирующим развертывание на собственном сервере, следует рассматривать дату запуска и дату начала использования как разные вещи.
Цена также изменилась. K3 стоит 3 доллара за миллион входных токенов, снижаясь до 0,30 доллара, когда модель недавно получила эти входные данные, и до 15 долларов за миллион выходных токенов. Это значительно меньше, чем 50 долларов за выходные токены в Fable 5, но намного выше, чем GLM-5.2 от z.ai (4,40 доллара) и DeepSeek V4 (0,87 доллара). K3 больше не относится к бюджетному сегменту, в котором находились его предшественники.
Кроме того, при запуске программы устанавливается только максимальный уровень логического мышления, а затем следуют более низкие режимы, поэтому длинные цепочки рассуждений и повторные шаги быстро накапливаются. Компаниям следует планировать бюджет, исходя из стоимости выполненной задачи, а не из прейскурантной цены.
Что утверждается и что подтверждается
Согласно отчету Tom's Hardware, в ходе слепого тестирования разработчиков платформа Arena поставила K3 на первое место в оценке фронтенд-кода, набрав 1679 баллов и опередив Fable 5. Этот результат реален. Он также является эталоном в одной из областей.
Сама компания Moonshot более сдержанна, чем показывают заголовки. Она заявляет, что общая производительность K3 по-прежнему уступает Claude Fable 5 и GPT 5.6 Sol, и перечисляет три ограничения: качество генерации может стать крайне нестабильным, если система не передает обратно исторический контент, модель может принимать неожиданные решения от имени пользователя, когда намерение неоднозначно, и она демонстрирует заметный разрыв в пользовательском опыте по сравнению с Fable 5 и GPT 5.6 Sol.
В собственных сносках также указывается, что Fable 5 использовала резервные варианты в 35% задач в ходе оценки SWE Marathon от Moonshot, что могло повлиять на измеренный результат модели. Все остальное остается утверждением самих разработчиков. Никакие опубликованные данные K3 не могут быть независимо проверены до тех пор, пока не будут опубликованы весовые коэффициенты.
Аналитики Bank of America во главе с Алексом Лю в своей записке отметили, что K3 демонстрирует, что крупномасштабное предварительное обучение в сочетании с архитектурной работой может обеспечить существенный прирост производительности для флагманских китайских моделей, несмотря на вычислительные ограничения. Это более сдержанная версия аргумента, ближе к тому, что поддерживается в блоге.
Направление движения не вызывает сомнений. В июне модели с открытым весом обработали 29% всех токенов, прошедших через производственный шлюз Vercel, по сравнению с примерно одной девятой объема в апреле, при этом на них пришлось менее 4% расходов. 27 июля мы узнаем, какая часть K3 относится к этой категории.

Хотите узнать больше об искусственном интеллекте и больших данных от лидеров отрасли? Посетите выставку AI & Big Data Expo, которая пройдет в Амстердаме, Калифорнии и Лондоне. Это масштабное мероприятие является частью TechEx и проводится одновременно с другими ведущими технологическими выставками, включая Cyber Security & Cloud Expo. Для получения дополнительной информации нажмите здесь.
AI News — это проект TechForge Media. Здесь вы можете ознакомиться с другими предстоящими мероприятиями и вебинарами, посвященными корпоративным технологиям.
Источник: www.artificialintelligence-news.com
Похожие записи
- Atlassian: Исследования показывают, что для достижения реальной окупаемости инвестиций организациям следует подходить к внедрению ИИ на уровне команды, а не на индивидуальном уровне.
- Удобная кофемашина Keurig K-Supreme для приготовления одной порции кофе достигла отметки в 90 долларов.
- Medtronic запустит вычислительную платформу искусственного интеллекта для датчиков
Оцените материал:
Похожие записи
Стартап Battlefield, компания ÄIO, изобрел метод производства пищевого жира из сельскохозяйственных отходов, таких как опилки.
07.10.2025
ИИ против ИИ: Prophet Security привлекла 30 миллионов долларов на замену аналитиков-людей автономными защитниками
11.08.2025
STAT+: Мозговые имплантаты: что мешает проведению ключевых клинических испытаний и одобрению FDA.
11.03.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
