Бенчмарки врут? Бизнес мигрирует на открытые веса, а FDA и ФЗ заставляют уходить на свой инференс: ML-дайджест
Если водить спорткар, то только на идеальном глянцевом треке. Тогда он всегда будет показывать рекордное время. Я думаю, примерно так топ-менеджмент ИИ-компаний и описывает работу своих моделей инвесторам. Проблема в том, что бизнес-процессы — это дорога с ямами.
Долгое время индустрия закрывала глаза на то, как именно LLM бьют рекорды на лидербордах. Но эпоха слепого доверия корпоративных данных чужим «черным ящикам» по ту сторону API подходит к концу. Или нет?
В новом дайджесте обсуждаем масштабный переезд enterprise-сектора на открытые веса, суверенное железо и жесткую валидацию моделей на грязном реальном трафике.
Навигация по событиям:
-
DataRobot заходит в агентский кодинг: зачем вендор собрал свою дистрибуцию OpenCode
-
Cognition SWE-1.7: распределенный RL и агенты, которые научились делать дампы памяти
-
Апдейты по сбежавшему в Hugging Face ИИ от OpenAI
-
Stripe ведет переговоры о покупке OpenRouter
-
Волна флагманских релизов: битва за SOTA
-
Китайский open-weight триумф
-
Дарио Амодей опубликовал позицию против банов open-weights как класса
-
Принятие ИИ-закона в России
-
Инициатива Си Цзиньпина на WAIC в Шанхае
-
Бенчмарк BRIDGE в Nature Medicine
DataRobot заходит в агентский кодинг: зачем вендор собрал свою дистрибуцию OpenCode
В сегменте кодинг-агентов сейчас много всего: на рынке висит больше семидесяти решений — от Cursor и Claude Code до Codex и Devin. Каждую неделю выходят свежие бенчмарки, и команды разработки, конечно же, бегут за очередным лидером.
Инфраструктурная боль здесь даже не в миграции, а в жесткой привязке инструментов к конкретному провайдеру. Тот же Claude Code завязан на API Anthropic, а Codex — на OpenAI. В итоге попытка протестировать более дешевую open-weight модель для рутинного кодинга со стороны простых пользователей часто упирается в проблемы с подпиской. А со стороны бизнеса это превращается в обсуждения с ИБ-отделом, юристами и финотделом. Каждый новый агент заставляет заново проходить валидацию: обучаются ли веса на вашем коде, где физически крутится инференс и как считается биллинг — за место или за токены.
В DataRobot решили закрыть этот бюрократический и технический тупик и выкатили свою сборку OpenCode — агента, интегрированного с единым шлюзом DataRobot LLM Gateway и слоем DataRobot Skills (включая Agent Assist, который компания ранее поставляла для сторонних клиентов вроде того же Cursor).
Как это выглядит
Вообще, OpenCode и без DataRobot прекрасно умеет подключать какие угодно модели (включая локально развернутые) и переключать их по команде /models. Зачем тогда делать отдельную сборку, если они могли просто выложить скиллы в репозиторий или поднять свои MCP-серверы?

Смысл тут в том, что DataRobot подложила клиентам «соломку». Их компания занимается данными, а если их потерять или вылить наружу — на работу завтра можно уже не приходить. Они сделали преднастроенную сборку, чтобы подключенная модель банально не наделала «плохого» в контуре. По сути, нам дали преднастроенный harness, чтобы снизить порог входа в агентскую разработку на базе их платформы — эдакий новый виток Infrastructure as Code, но уже для ИИ-агентов.
С точки зрения дев-окружения инструмент раскатывается через плагин к CLI DataRobot буквально в три команды (brew install, dr plugin install, dr opencode). Вместо того чтобы пробрасывать в терминал отдельные ключи от каждого вендора и заново проходить ИБ-аудиты, агент сразу использует уже валидированный корпоративный контур.
Инженер получает привычный интерфейс для генерации, тестирования и деплоя кода прямо из терминала или веб-интерфейса, но с полной гарантией безопасности, а где именно крутится математика — вы выбираете сами исходя из текущих лимитов и бюджета.
Cognition SWE-1.7: распределенный RL и агенты, которые научились делать дампы памяти
Cognition выкатила технический отчет по SWE-1.7 — новому кодинг-агенту, показавшему 42,3% на бенчмарке FrontierCode 1.1 Main и 81,5% на Terminal-Bench 2.1 (вплотную к GPT-5.5 и Claude Opus 4.8). На момент обучения еще не вышла Kimi K3, так что базовой моделью взяли открытую K2.7, поверх которой провели дополнительный цикл RL-обучения.

Главный выигрыш SWE-1.7 виден на графике: модель показывает точность уровня флагманских систем с закрытыми весами при стоимости около 2 $ за rollout. В то время как аналогичные результаты у проприетарных альтернатив требуют от 4 $ до 10 $.

За цифрами в таблицах скрывается куда более важная вещь: ребята из Cognition наглядно показали, как обучать ИИ через подкрепления, даже если у вас нет под рукой больших вычислительных мощностей.
Распределенная инфраструктура и синхронизация весов
Вместо попыток собрать монолитный кластер на десятки тысяч ускорителей Cognition разнесла генерацию роллаутов (инференс для RL) по дата-центрам на трех континентах, задействовав в том числе мощности сторонних провайдеров вроде Fireworks. Вычислительный узел оставили на едином кластере с быстрым интерконнектом, а генерацию траекторий вынесли на внешние GPU-ресурсы.
Чтобы сетевые задержки при синхронизации весов между континентами не тормозили процесс, инженеры отказались от прямых P2P-стримов:
-
на каждом шаге оптимизатора Trainer вычисляет и сжимает дельту весов (сокращая объем передаваемых данных на 99%), после чего загружает ее в объектное хранилище;
-
инференс-узлы опрашивают манифест, скачивают дельты в оперативную память CPU и накатывают апдейт in-place;
-
пауза в работе инференса при смене весов составляет 3–4 секунды и не сбрасывает KV-кэш активных сессий.
Отказы отдельных узлов при таком сетапе обрабатываются без остановки всего прогона: роутер Dynamo просто перенаправляет трафик на соседние реплики, а упавший воркер подтягивает актуальный чекпоинт из хранилища.
Отлаженная сборка распределенного инференса решила аппаратную проблему масштабирования, но параллельно потребовала изменений в самом алгоритме обучения на длинных последовательностях.
Алгоритмическая оптимизация
При длительном RL-обучении кодинг-агентов инженеры столкнулись с двумя классическими проблемами: зацикливанием модели и переполнением контекста.
Предотвращение спада энтропии через top-p sampling replay. На длинных траекториях модель быстро теряет вариативность и сваливается в однотипные решения. Чтобы этого избежать, в пайплайн добавили маскирование токенов. Фильтрация хвостов низковероятных токенов при вычислении градиентов снизила шум и позволила оптимизатору фокусироваться только на токенах с высоким обучающим сигналом.
Контроль длины контекста через Self-compaction. При приближении к лимиту контекстного окна агент самостоятельно генерирует сжатый дамп текущего состояния и восстанавливает работу из этого слепка. Это дало проводить сессии длительностью до 6 часов без раздувания контекста и потери логики задачи.
В результате Cognition показали прагматичный паттерн: объединение географически разрозненных GPU-ресурсов с объектным хранилищем и точечной фильтрацией градиентов позволяет выжать из открытой базовой модели максимальное качество решения сложных агентских задач — дотянув ее точность до уровня проприетарных флагманов, но снизив стоимость одного роллаута в 2–5 раз.
Апдейты по сбежавшему в Hugging Face ИИ от OpenAI
Рост автономности агентов неизбежно упирается в надежность изоляции контура. Пока кто-то выстраивает географически распределенные прогоны, внутренние тесты OpenAI показали, что происходит, когда агент с доступом к инструментам пытается обойти заданные ему рамки.
Я пока напомню, что случилось. В начале июля OpenAI прогоняла модель GPT-5.6 Sol и еще более мощный неанонсированный пре-релизный флагман через кибербенчмарк ExploitGym (898 задач на создание и применение эксплойтов). Чтобы проверить предельные возможности систем, с моделей сняли защитные барьеры. Единственным разрешенным сетевым выходом из изолированного окружения был внутренний прокси-кэш пакетных репозиториев.
Агенты потратили ресурсы на анализ этого узла, обнаружили в нем zero-day уязвимости, подняли привилегии и начали латеральное перемещение по сети, пока не нашли хост с выходом в интернет. Предположив, что ответы и материалы к ExploitGym хранятся на Hugging Face, модели атаковали инфраструктуру сервиса, скомпрометировали учетные данные, применили еще одну уязвимость и получили удаленное выполнение кода (RCE) на серверах платформы. OpenAI зафиксировала инцидент лишь с 11 по 13 июля, а публично раскрыла 21 июля.
27 июля Frog официально подтвердила, что агенты сбежали через self-hosted версию Artifactory (собственный продукт Frog). Вслед за заявлением вышла пачка CVE, где минимум в трех записях — CVE-2026-65618, CVE-2026-65923 и CVE-2026-66018 — соавторами числятся исследователи OpenAI (в сообществе также указывают на критическую CVE-2026-66014 с CVSS 8.8). И снова рынок отреагировал раньше официального заявления: еще 22 июля акции JFrog просели на 8% после догадки аналитиков Raymond James, сопоставивших формулировки из отчета OpenAI.
В JFrog попытались сместить акцент на то, что ИИ-модели становятся эффективными исследователями безопасности и помогают быстрее выпускать патчи. Но для системных архитекторов вывод иной: корпоративные стандарты вроде Artifactory, которые ставятся в контур именно для защиты от внешних угроз, сами становятся точкой атаки.
Если дать агенту доступ к терминалу и прокси-порту, изолирующие контейнеры и nsjail без жесткого сплита L3/L7-трафика на физическом уровне перестают гарантировать безопасность. Подробный разбор архитектуры ExploitGym, хронологию взлома и выводы по настройке периметра для LLM-воркеров от эксперта по ИБ, читайте в материале.
А сейчас давайте опустимся на уровень инфраструктуры доступа и поговорим, почему за такими инструментами будущее.
Stripe ведет переговоры о покупке OpenRouter
24 июля The Wall Street Journal сообщил, что Stripe ведет переговоры о покупке маркетплейса API-доступа к ИИ-моделям OpenRouter. Оценка стартапа в потенциальной сделке может составить 10 млрд $ — при том, что еще в мае 2026 года в рамках раунда инвестиций компания оценивалась в 1,3 млрд $.
OpenRouter, основанный в 2023 году, фактически стал популярным инструментом и абстрактным слоем между LLM-провайдерами и разработчиками приложений. Платформа предоставляет единый API-шлюз для обращения к сотням проприетарных и open-weight моделей, автоматизируя фолбэки при даунтаймах, оптимизацию затрат на инференс и приведение разных API к единому формату.
Зачем платежному гиганту слой маршрутизации LLM?
Переход Stripe от поставщика платежных рельсов к покупке крупного инфраструктурного прокси отражает сдвиг в экономике вычислений.
-
Контроль монетизации токенов. Stripe уже обслуживал транзакции OpenRouter. Переход от обработки фиата к владению прокси-слоем дает компании контроль над гранулированным биллингом на уровне отдельных API-вызовов к моделям;
-
Снижение зависимости от монополий. Корпоративный сегмент массово мигрирует от мономодельной архитектуры (зависимости только от OpenAI или Anthropic) к гибридной схеме. Легкие задачи отдаются оптимизированным open-weight моделям, а тяжелая логика — проприетарным флагманам. OpenRouter в этой схеме выступает независимым брокером трафика;
-
Прозрачность Unit-экономики. Маршрутизатор позволяет отслеживать точную стоимость токенов для каждого промпта в реальном времени, что критично для B2B-сервисов с pay-as-you-go монетизацией.
Сделка вокруг OpenRouter показывает, что вынос маршрутизации в отдельный слой — это стандарт современной ML-инфраструктуры, и применение такого шлюза избавляет инженерные команды от лишней головной боли при масштабировании систем.
Востребованность единого слоя прямо проистекает из динамики рынка: за июль 2026 года крупные ИИ-лаборатории почти синхронно обновили свои флагманские линейки. А лидерство в бенчмарках меняется еженедельно в зависимости от конкретной инженерной задачи.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Волна флагманских релизов: битва за SOTA
OpenAI (GPT-5.6 Luna, Terra, Sol)
После многомесячной задержки, вызванной расширенными проверками кибербезопасности со стороны правительства США, OpenAI выкатила семейство GPT-5.6. Архитектурно линейка разделена на три части:
-
Luna — облегченная дистиллированная версия для низколатентных задач и классического RAG;
-
Terra — что-то среднее, сбалансированная рабочая лошадка для большинства продуктовых сценариев;
-
Sol — флагман, задействующий динамическое дерево рассуждений (Tree-of-Thought) на этапе инференса.
Главным техническим обновлением стало внедрение встроенного механизма спекулятивного декодирования со скрытыми внутренними проверками, что позволило снизить задержку до первого токена (TTFT) при тяжелых вычислительных сессиях.
В бенчмарках на рассуждение, математику и генерацию сложного кода (включая GPQA Diamond и MATH-500) модификация Sol вернула OpenAI верхние строчки лидербордов.

С инженерной точки зрения главный смысл релиза — не в одной магической архитектурной новинке, а в том, что OpenAI сильнее развела модели по стоимости и сценарию применения. Для продуктовых команд это означает типичную схему маршрутизации: простые запросы и массовый трафик отправлять на более дешевые варианты, а сложные задачи — на Sol, где оправдан более высокий расход токенов.
xAI (Grok 4.5)
Команда Илона Маска представила Grok 4.5 — MoE модель, обученную на суперкомпьютере Colossus с использованием десятков тысяч NVIDIA GB300.
Главным технологическим сдвигом стало совместное обучение с командой Cursor: инженеры IDE были интегрированы напрямую в контур тренировки, а модель обучалась не на статических репозиториях, а на реальных паттернах разработки (живых сессиях отладки, многофайловом контексте и логике правок).
Чтобы повысить устойчивость в длительных агентурных сценариях, xAI задействовала асинхронное обучение. При этом контекстное окно сознательно сократили до 500 000 токенов, сделав ставку на точность исполнения шагов и удельное качество вычислений, а не на максимальный объем входящего текста.
В продуктовой эксплуатации модель показывает хорошую производительность на задачах навигации по кодовой базе и автоматической сборки (80 токенов/сек при стоимости $2 за 1 млн входных и $6 за 1 млн выходных токенов).

На бенчмарках Grok 4.5 демонстрирует 83,3% в Terminal-Bench 2.1 и 64,7% в SWE-Bench Pro, существенно выигрывая в токен-экономике за счет точечной генерации — на решение одной задачи модель тратит в среднем в 4,2 раза меньше выходных токенов, чем Claude Opus 4.8.
Но если смотреть на рост доли галлюцинаций, то тут не все так хорошо. Он подскочил до 54% (против 25% у Grok 4.3): модель склонна выдавать ошибочные решения с высокой уверенностью, что делает обязательным использование валидаторов и схемы human-in-the-loop в продакшене.
Meta (Muse Spark 1.1)
Meta Superintelligence Labs выкатила мультимодальную модель, адаптированную под агентурную оркестрацию и автономные сценарии. Главный технический сдвиг по сравнению с первой версией — отказ от примитивного пошагового кликанья по интерфейсу.
Модель получила полноценную гибридную модель выполнения. Spark 1.1 больше не пытается имитировать действия человека там, где это неэффективно: если задачу можно решить программно, она самостоятельно компилирует и исполняет скрипт. При работе с GUI активируется батчинг действий — паковка нескольких манипуляций в один шаг, что радикально ускоряет и удешевляет инференс.
Контекстное окно объемом 1 млн токенов управляется проприетарным алгоритмом активной компакции. Вместо банального обрезания истории (truncation), система динамически сжимает лог сессии, отсекая избыточность, но сохраняя критические переменные, зависимости и промежуточные состояния.

На уровне иерархии вычислений Meta заложила нативную поддержку двухранговых систем агентов. Spark 1.1 обучена выступать как в роли главного оркестратора (собирает контекст, формирует план и распараллеливает подзадачи по subagents), так и в роли изолированного воркера, умеющего следовать регламенту и эскалировать ошибки обратно на верхний уровень.
Связка компьютерного зрения и вызова инструментов здесь бесшовная. Модель способна в реальном времени разделять видеопоток на ключевые кадры, ловить визуальные баги и несоответствия интерфейса через автоматические скриншоты в IDE (например, в среде OpenCode) и тут же генерировать патчи для исходного кода.
Интеграция в существующие продакшен-пайплайны не вызовет проблем: доступ к модели открыт через Meta Model API в стандартном, OpenAI-совместимом формате.
Google DeepMind (Gemini 3.6 & 3.5 Flash)
Google DeepMind выпустила семейство моделей с фокусом на экстремально низкую задержку. В линейку вошли флагман Gemini 3.6 под TPU v6, ультралегкая 3.5 Flash-Lite и специализированная Gemini 3.5 Flash Cyber для автоматизированного аудита кода (обучена на AST-деревьях и дампах трафика).
-
Главная фишка — агрессивное квантование (FP8/INT4 на уровне ядер) и глубинная дистилляция позволили снизить время отклика менее чем до 80 мс.
-
Сценарий применения — идеальный «быстрый судейский агент» и промежуточный классификатор для молниеносной маршрутизации тяжелого трафика на крупные модели.
Детальный разбор того, как устроена эта архитектура, читайте подробнее в прошлой новости.
Вышел GPT-Live — ИИ, который слушает и говорит одновременно
Перебивайте ИИ. До сих пор общение с нейросетями голосом напоминало разговор по рации: нужно было сказать фразу, дождаться, пока аудио переведется в текст, модель обработает запрос и сгенерирует ответ. Из-за задержек в 2–3 секунды не было не то что динамики беседы, было скорее раздражение. Теперь OpenAI выпустила новую архитектуру GPT-Live, которая заменяет старый режим Advanced Voice Mode в ChatGPT и позволяет общаться с нейросетью без пауз.
Концепция GPT-Live
Главное отличие GPT-Live заключается в переходе на полнодуплексную связь. Модель умеет одновременно слушать входящий звук и генерировать свой голос. Благодаря этому ИИ можно перебивать прямо посреди фразы, уточнять детали или менять тему — нейросеть мгновенно замолкает и адаптируется к новым вводным.
Тут вы можете подумать: «Так ведь можно было и до этого начать говорить поперек ответа, и ИИ снова начинал думать, в чем же разница?»
Суть в том, что:
-
раньше ИИ вас вообще не слушал, пока говорил сам. Программа на телефоне просто фиксировала громкий звук, затыкала ему «рот» и включала диктофон заново. Из-за этого возникала пауза, пока аудио записывалось, отправлялось на сервер и обрабатывалось;
-
сейчас ИИ одновременно и говорит, и непрерывно слушает ваш микрофон каждую миллисекунду. Он замолкает не от шума, а потому что в процессе вашей речи понял смысл первых двух слов и мгновенно перестроил свой ответ без всяких пауз.
Инженерам удалось добиться такой скорости за счет разделения процессов. В системе работают два независимых потока. Сверхбыстрая фронтенд-модель непрерывно анализирует звук и реагирует динамически. Если же задача требует сложных рассуждений — например, найти билеты в интернете или рассчитать семейный бюджет — фронтенд незаметно передает ее в фон тяжелым вычислительным моделям (GPT-5.5 или GPT-5.6). Вместо долгого молчания, как это было раньше, ИИ поддерживает живой диалог фразами вроде «Секунду, проверяю рейсы…», пока фоновая модель ищет нужные данные.
Как новая модель выглядит на фоне конкурентов
|
Критерий |
GPT-Live-1 (OpenAI) |
Gemini Live (Google) |
Claude Fable 5 (Anthropic) |
|
Режим связи |
Full-Duplex (Одновременно слушает и говорит) |
Half-Duplex (С быстрой реакцией на перебивание) |
Только текст (Голосовой слой через сторонние API) |
|
Естественность |
Издает звуки вовлеченности, держит паузы |
Плавная речь, но без междометий во время пауз |
Отсутствует |
|
Решение сложных задач |
Сверхвысокое (Делегирует задачи в фон моделям GPT-5.5/5.6) |
Среднее (Зависит от интеграции с Gemini Pro) |
Максимальное (Но только в текстовом формате) |
|
Мультимодальность |
Выводит на экран инфокарточки (погода, графики, ссылки) |
Интеграция с сервисами Google Workspace |
Только текст и загрузка файлов |
Обновление может заметно поменять повседневные сценарии использования ИИ. Голосовое управление становится по-настоящему свободным — больше не нужно формулировать заранее продуманные текстовые промпты, так как алгоритм понимает контекст по ходу путаного диалога.
Это также открывает новые возможности для синхронного перевода: два человека могут положить телефон между собой и общаться на разных языках, а нейросеть будет переводить речь каждого динамически. За безопасность отвечают встроенные в аудиопоток фильтры: они умеют распознавать по интонации признаки мошенничества или манипуляций и тактично уводят разговор в безопасное русло.
Развертывание GPT-Live уже началось по всему миру в веб-версии, а также в приложениях для iOS и Android. Во время разговора все сказанное параллельно транскрибируется в текстовый чат, где сохраняются кликабельные ссылки на веб-источники.
Флагманская версия GPT-Live-1 пока доступна только подписчикам платных тарифов (Plus, Team и Pro). Пользователи бесплатной подписки получили доступ к быстрой облегченной версии GPT-Live-1 mini с базовыми лимитами по времени использования.
Anthropic (Claude Opus 5)
Anthropic завершила июльскую волну своим релизом. Модель обеспечивает производительность уровня флагманской Fable 5, но обходится вдвое дешевле (5 $ за 1 млн входных и 25 $ за 1 млн выходных токенов). Ключевое нововведение — нативная регулировка глубины вычислений, позволяющая балансировать между ценой инференса и сложностью рассуждений. На уровне API реализовано динамическое переключение инструментов без сброса кэша промпта, а также автоматические фолбэки на Opus 4.8 при срабатывании safety-фильтров.
В задачах автоматизированной разработки и планирования модель задает новый стандарт токен-экономики. Как видно на результатах Frontier-Bench v0.1, Opus 5 превосходит Fable 5 и GPT-5.6 Sol по соотношению стоимости попытки к итоговому скору:

С инженерной точки зрения Opus 5 выделяется глубокой автономностью при работе с кодом. Модель способна самостоятельно писать тестовые обвязки и устранять корневые причины уязвимостей, а не просто маскировать симптомы поверхностными патчами. При этом в Anthropic жестко разделили оборонительный аудит и наступательный хакинг.
В тестах OSS-Fuzz модель находит уязвимости наравне со специализированной Mythos 5, но программно ограничена в генерации рабочих эксплойтов. Чтобы базовые фильтры не блокировали легитимный разбор кода, их чувствительность снижена на 85% по сравнению с Fable 5, а для профильных команд доступна программа Cyber Verification Program (CVP) с ослабленными лимитами.
Китайский open-weight триумф
Пока американские корпорации балансируют между высокой стоимостью инференса и качеством рассуждений внутри закрытых API, азиатские лаборатории нанесли удар в сегменте открытых весов. Они серьезно изменили экономику self-hosted решений. Конец июля отметился двумя релизами, которые закрепили за китайскими разработчиками статус лидеров по масштабированию и ценовому демпингу.
Kimi K3
Главным событием года в open-weight сегменте стал релиз Kimi K3 от Moonshot AI. Разработчики выложили в открытый доступ веса огромной Mixture-of-Experts модели на 2,8 триллиона параметров. На каждый токен активируются 104 миллиарда параметров за счет точечной маршрутизации к 16 из 896 экспертов. Архитектурно модель базируется на гибридном механизме линейного внимания Kimi Delta Attention (KDA) и использует агрессивное квантование MXFP4 для весов.
В бенчмарках K3 показала отличные результаты: например, 88,3 в Terminal-Bench 2.1, что ставит ее на один уровень с закрытыми американскими SOTA-системами в задачах программирования. Для крупного бизнеса это важный шаг: теперь можно развернуть внутри собственного контура мультимодального монстра почти на три триллиона параметров, который держит рабочий контекст в 1 миллион токенов.
DeepSeek V4
Параллельно DeepSeek перевела свою четвертую версию в стадию стабильного релиза под MIT-лицензией. Это обновление окончательно зафиксировало очень низкие тарифы на инференс, сделав DeepSeek стандартом де-факто для потоковой обработки на азиатском рынке. В релиз вошли флагманская версия V4-Pro на 1,6 триллиона параметров (49 миллиардов активных) и локальная V4-Flash на 284 миллиарда параметров (13 миллиардов активных).
За счет механизма гибридного внимания обе модели эффективно удерживают окно контекста в 1 миллион токенов. При этом оптимизация V4-Flash позволяет запускать полноценный инференс всего на одном серверном GPU класса 80 ГБ (вроде A100/H100) или на консьюмерской сборке из двух видеокарт RTX 4090.
Доступность открытых весов такого масштаба меняет подход к построению ИИ-инфраструктуры, сводя ее к единому слою маршрутизации. Направлять весь трафик в один проприетарный API больше не имеет смысла. Архитектура становится гибридной: сложные задачи автономного планирования и глубокого аудита уходят на Claude Opus 5 или GPT-5.6 Sol, а массовая генерация кода, парсинг логов и рутинные RAG-сценарии локализуются на инстансах Kimi K3 или дешевых эндпоинтах DeepSeek.
Дарио Амодей опубликовал позицию против банов open-weights как класса
Глава Anthropic Дарио Амодей выпустил открытое письмо, чтобы наконец развеять слухи: компания никогда не требовала забанить open-weight модели, включая азиатские. По его словам, запрещать американскому бизнесу использовать открытый софт — это чистый протекционизм и бесполезная бюрократия, которая вообще не решает фундаментальных проблем безопасности.
Вместо бумажных запретов Anthropic предлагает переключить внимание на три вполне осязаемых вектора контроля.
-
Аппаратное эмбарго. Нужно жестко пресекать контрабанду передового железа. Законы масштабирования суровы: без физического доступа к топовым GPU конкуренты просто не смогут догнать американские кластеры.
-
Борьба с промышленной дистилляцией. Именно дистилляция позволяет кратно экономить на обучении и сокращать отставание от SOTA-решений США до пары месяцев. Бороться надо с теневым «списыванием» данных, а не с самой концепцией открытого кода.
-
Глобальный пре-тест флагманов. Абсолютно все тяжелые нейронки (и закрытые, и открытые) обязаны проходить жесткий обязательный аудит на кибербезопасность и биологические риски еще до официального релиза.
С инженерной точки зрения Амодей честно признает уязвимость open-weight: как только веса утекли в сеть, их уже невозможно отозвать, а любые встроенные предохранители вырезаются за пару часов. Это создает неприятную асимметрию, где злоумышленники получают готовый инструмент для автоматизации кибератак или проектирования биооружия. При этом запрет на использование китайских моделей легальными компаниями никак не помешает реальным хакерам скачать эти же веса на свои серверы.
Ну мы-то понимаем, что за всей этой заботой о безопасности кроется попытка защитить проприетарные API США от жесткого китайского демпинга через блокировку поставок железа. А в целом это не так страшно: регуляторы просто окончательно сместят фокус с софтверных запретов на контроль за физическими чипами, что никак не остановит развитие гибридной инфраструктуры.
Принятие ИИ-закона в России
Дискуссия о регулировании open-weights и контроле над железом, поднятая Anthropic, — это отражение переноса ИИ в правовое и инфраструктурное поле. Государства и enterprise окончательно смещают фокус на работу в строго изолированных и юридически защищенных контурах.
В России этот тренд получил прямое законодательное закрепление. Принятый 26 июля 2026 года Федеральный закон № 243-ФЗ «О поддержке развития технологий искусственного интеллекта» ввел в правовое поле понятия «большой фундаментальной модели» (от 1 млрд параметров), а также «суверенных» и «национальных» моделей.
Главный вектор для IT-инфраструктуры здесь однозначен — жесткая локализация. Запуск инференса, обработка запросов и хранение данных для суверенных LLM отныне разрешены строго в ЦОД на территории РФ, принадлежащих российским юрлицам. Взамен отечественные разработчики получают приоритетный доступ к госбандлам и субсидиям на аренду вычислительных мощностей, а на сам софт накладываются требования по маркировке сгенерированного контента и оценке рисков.
Инициатива Си Цзиньпина на WAIC в Шанхае
На глобальной арене регуляторная карта одновременно распадается на автономные кластеры. Пока США пытаются ограничить экспорт чипов, на саммите WAIC в Шанхае 29 стран подписали соглашение о создании Международной организации по сотрудничеству в сфере ИИ (WAICO). Пекин фактически возглавил альянс Глобального Юга, предлагая участникам собственный технологический стек, открытые модели и помощь в постройке инфраструктуры в обмен на принятие китайских стандартов управления данными.
Этот разворот к «суверенным облакам» уже подкрепляется крупнейшими вендорскими сделками. Инвестиции NVIDIA в 1 млрд $ в южнокорейский гигант Naver нацелены именно на софинансирование строительства независимой сети дата-центров в Азии, не подконтрольной американским Hyperscalers. Для инженерных команд это означает окончательную смену парадигмы: эпоха слепого завязывания на единый зарубежный API завершилась, а ключевой компетенцией становится сборка гибридной инфраструктуры, объединяющей суверенные локальные ЦОД и независимые открытые стеки.
Бенчмарк BRIDGE в Nature Medicine
Июльскую гонку закрыла публикация в Nature Medicine. Данные бенчмарка BRIDGE подтвердили то, о чем MLOps-инженеры говорили весь последний год: если по-простому, то SOTA-модели «зубрят» ответы.
Цифры показательны: медицинские LLM, выдающие около 92% на теории, в реальных прикладных задачах проседают до 44,8%. Разрыв почти в 47% — явный симптом проблемы загрязнения данных. Модели справляются с «чистыми» промптами, но деградируют на реальном трафике с его неструктурированным текстом и шумом.
И это уже не просто академическая проблема. FDA выдало предупреждение Purolea Cosmetics Lab за использование невалидированных ИИ-агентов. Формулировка «сгенерировано ИИ, но не валидировано документально» теперь официально ведет к регуляторным рискам.
Для CTO и архитекторов это повод перестать смотреть на публичные лидерборды и сфокусироваться на реальном инжиниринге.
-
Метрики из интернета не работают в проде. Баллы из пресс-релизов не гарантируют, что система не развалится на ваших задачах;
-
Необходим собственный Continuous Evaluation. Оценивать модели нужно только на своих «грязных» датасетах и строго внутри защищенного контура;
-
Self-hosted становится базовой гигиеной. Закрытые API обновляются без вашего ведома, меняя поведение системы (на это прямо указывают новые гайдлайны по AI Drift). Чтобы контролировать инференс, нужно поднимать открытые веса (Kimi, DeepSeek, Llama) на собственных серверах.
Гонка за триллионами параметров в публичных облаках уступает место суверенным инфраструктурам и жесткой валидации моделей на реальном бизнесе.
А как выход новых моделей повлиял на ваши проекты? Делитесь своим опытом и лайфхаками в комментариях.
Источник: habr.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
