Архив рубрики ~Коротко из Telegram~

Яндекс возвращается в гонку за суверенность (спойлер: никуда и не…

Яндекс возвращается в гонку за суверенность (спойлер: никуда и не…
File 2062

Яндекс возвращается в гонку за суверенность (спойлер: никуда и не уходил)

В июле Герман Греф говорил, что единственная полностью отечественная большая языковая модель в России есть у Сбера, а «Яндекс» лишь дообучает китайскую Qwen. В Яндексе слова Грефа опровергали и заявляли, что используют прагматичный для бизнеса подход и берут лучшее из доступного: как опенсорс, так и обученные с нуля собственные модели. Работа над последними, по словам компании, никогда не останавливалась. Как минимум, на их основе всегда работали ИИ-ответы в Поиске.

Вслед за публикацией Alice AI Search Pretrain «Яндекс» представил Alice AI Foundation — ещё одну большую модель компании, обученную с нуля без использования сторонних весов.

В ней 80 млрд параметров, из которых при работе активны 3 млрд. На обучение примерно на 18 трлн токенов ушло около полугода. Параметры модели, код архитектуры и токенизатор опубликованы под Apache 2.0.

Пообщались с руководителем архитектуры претрейна Максимом Абрахамом на полях Practical ML Conf и ознакомились с почти 90-страничным техническим отчётом — документ предоставили специально для @anti_agi. На что обратили внимание:

📍 Модель суверенная, но не изолированная. Дистилляции от Kimi или другой зарубежной модели, по словам Абрахама, не было. Начальные параметры генерировались случайно, а весь цикл обучения прошёл внутри «Яндекса».

При разработке этой модели команда изучала все лучшие доступные подходы. В первых экспериментах команда тестировала архитектуру Qwen3-Next, а затем заменила её собственной архитектурой. В 36 из 48 attention-слоёв используется Kimi Delta Attention, роутинг экспертов основан на подходе DeepSeek-V3, применяются оптимизатор Muon и Attention Residuals.

Уникальной разработчики называют итоговую комбинацию блоков, их собственную реализацию и инженерные оптимизации. Для поддержки модели им пришлось написать отдельный архитектурный код и внести изменения в vLLM.

Рассуждения заложили уже в претрейн. Последние 280 млрд токенов состояли из сложных математических решений, кода, поисковых сессий и взаимодействий с инструментами. Эта стадия подняла результат на AIME по pass@32 на 63,4 п. п., на HMMT — на 72,6 п. п., на Codeforces по pass@8 — на 45,6 п. п.

После одинакового SFT преимущество сохранилось: +3,8 п. п. на HMMT и +6,6 п. п. на Codeforces. Помним, что нынешний релиз — экспериментальная основа для будущей единой рассуждающей модели. А вот будут ли выкладывать её, как какой-нибудь GigaChat 3.5 Reasoning, в компании пока не говорят. «Мы не опенсорсим ради опенсорса. Если в процессе работы над продакшен-моделями у нас появляются полезные для сообщества результаты, мы ими делимся», — говорят в Яндексе.

☁️ Компактность здесь скорее оружие, чем ограничение. У Alice активны 3 млрд параметров против 12 млрд у Nemotron-3-Super и 13 млрд у DeepSeek-V4-Flash. При этом на опубликованных замерах она обходит их на многих задачах по русскоязычным знаниям, математике и коду. По оценке собеседника в крупном облачном провайдере, модель можно разместить на двух Nvidia H100 с квантованием или четырёх H100 в BF16.

Немного смутило окно контекста в 128 тысяч токенов. Разработчики говорят, что модель фактически умеет работать с контекстом до 256-262 тысяч токенов. 128 тысяч — отсечка, на которой сохраняется наилучшее качество.

Факт релиза важен сам по себе. Одна модель означает технологическую монокультуру: ошибки в архитектуре, данных или цепочке разработки одного поставщика становятся проблемой всего рынка. В категории «суверенных» вновь (или по-прежнему) два игрока — и их конкуренция будет влиять уже не только на качество ответов, но и на стоимость внедрения, безопасность и скорость развития российских ИИ-агентов.

@anti_agi

❌ Нет тегов для этой статьи

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ 17 сентября 2026 года в Зале заседаний диссертационного совета ИНИОН РАН (4-й этаж) в 15:00 состоялось 204-е заседание Московского семинара по науковедению и наукометрии имени Ракитова Новости робототехники Дождались — сами роботов драться с собой же учат. Блогер… Архив рубрики ~Полезное~ Для ИИ появился свой Pirate Bay — Pirate Face собирает… Архив рубрики ~Лента новостей~ Человек, построивший магазины Apple, не верит в ставку Кремниевой долины на покупки с использованием искусственного интеллекта. Архив рубрики ~Лента новостей~ Расширение OpenAI Academy за счет новых образовательных программ | OpenAI Архив рубрики ~Лента новостей~ Представлен российский корпоративный ультрабук Kvadra Nau LP14 Архив рубрики ~Лента новостей~ Fulcra добавляет универсальный многопользовательский режим для любых выбранных вами агентов. Архив рубрики ~Лента новостей~ Claude уже помогает создавать следующую версию себя. Что это значит для тех, кто всё ещё использует AI как чат-бота Архив рубрики ~Лента новостей~ Собираем домашний сервер для LLM дешевле RTX 3090: NVIDIA Tesla V100 SXM2 в 2026 году Архив рубрики ~Лента новостей~ [Перевод] Нужны ли квантовые компьютеры чтобы понять химию? Архив рубрики ~Лента новостей~ Трансплантация кала помогла при колите на фоне иммунотерапии рака. Результаты получены в пилотных испытаниях Архив рубрики ~Полезное~ Мощный скилл для генерации профессиональных промо-роликов Video ShotCraft берёт на… Новости робототехники Agility Robotics показала Digit 5 — гуманоидного робота для работы… Архив рубрики ~Полезное~ Запускаем 27B-модель почти на любом железе — спецы из PrismML… Архив рубрики ~Лента новостей~ 17 сентября 2026 года в Зале заседаний диссертационного совета ИНИОН РАН (4-й этаж) в 15:00 состоялось 204-е заседание Московского семинара по науковедению и наукометрии имени Ракитова Новости робототехники Дождались — сами роботов драться с собой же учат. Блогер… Архив рубрики ~Полезное~ Для ИИ появился свой Pirate Bay — Pirate Face собирает… Архив рубрики ~Лента новостей~ Человек, построивший магазины Apple, не верит в ставку Кремниевой долины на покупки с использованием искусственного интеллекта. Архив рубрики ~Лента новостей~ Расширение OpenAI Academy за счет новых образовательных программ | OpenAI Архив рубрики ~Лента новостей~ Представлен российский корпоративный ультрабук Kvadra Nau LP14 Архив рубрики ~Лента новостей~ Fulcra добавляет универсальный многопользовательский режим для любых выбранных вами агентов. Архив рубрики ~Лента новостей~ Claude уже помогает создавать следующую версию себя. Что это значит для тех, кто всё ещё использует AI как чат-бота Архив рубрики ~Лента новостей~ Собираем домашний сервер для LLM дешевле RTX 3090: NVIDIA Tesla V100 SXM2 в 2026 году Архив рубрики ~Лента новостей~ [Перевод] Нужны ли квантовые компьютеры чтобы понять химию? Архив рубрики ~Лента новостей~ Трансплантация кала помогла при колите на фоне иммунотерапии рака. Результаты получены в пилотных испытаниях Архив рубрики ~Полезное~ Мощный скилл для генерации профессиональных промо-роликов Video ShotCraft берёт на… Новости робототехники Agility Robotics показала Digit 5 — гуманоидного робота для работы… Архив рубрики ~Полезное~ Запускаем 27B-модель почти на любом железе — спецы из PrismML…

Оставить комментарий