Image

DeepSeek выпускает модель «разреженного внимания», которая сокращает расходы на API вдвое

Логотип DeepSeek
Источники изображений: VCG / Getty Images

В понедельник исследователи DeepSeek представили новую экспериментальную модель V3.2-exp, разработанную для значительного снижения затрат на вывод при использовании в долгосрочных контекстных операциях. DeepSeek анонсировала модель в публикации на Hugging Face, а также опубликовала ссылку на научную статью на GitHub.

Важнейшей функцией новой модели является DeepSeek Sparse Attention – сложная система, подробно описанная на схеме ниже. По сути, система использует модуль, называемый «молниеносным индексатором», для приоритизации определённых фрагментов из контекстного окна. После этого отдельная система, называемая «системой точного выбора токенов», выбирает из этих фрагментов определённые токены для загрузки в ограниченное окно внимания модуля. В совокупности они позволяют моделям Sparse Attention работать с большими фрагментами контекста при сравнительно небольшой нагрузке на сервер.

fe91054dadcd8f3ca39ff0c9b4fb4cf8
Скриншот

Для операций с длинным контекстом преимущества системы весьма существенны. Предварительное тестирование DeepSeek показало, что стоимость простого вызова API может быть снижена вдвое в ситуациях с длинным контекстом. Для более надёжной оценки потребуются дополнительные испытания, но, поскольку модель имеет открытый вес и свободно доступна на Hugging Face, вскоре сторонние тесты смогут оценить утверждения, сделанные в статье.

Новая модель DeepSeek — одно из ряда недавних прорывов, направленных на решение проблемы затрат на вывод — по сути, серверных затрат на работу предварительно обученной модели ИИ, в отличие от затрат на её обучение. В случае DeepSeek исследователи искали способы повысить эффективность фундаментальной архитектуры преобразователя и обнаружили, что есть возможность значительного улучшения.

Базирующаяся в Китае компания DeepSeek стала необычной фигурой на фоне бума ИИ, особенно для тех, кто рассматривает исследования в этой области как националистическую борьбу между США и Китаем. В начале года компания произвела фурор своей моделью R1, обученной преимущественно с использованием обучения с подкреплением и при этом значительно более низкой стоимости, чем у американских конкурентов. Однако эта модель не произвела настоящей революции в обучении ИИ, как предсказывали некоторые, и в последующие месяцы компания ушла из поля зрения.

Новый подход с «рассеянным вниманием» вряд ли вызовет такой же резонанс, как R1, но он все же может научить американских поставщиков некоторых крайне необходимых приемов, которые помогут снизить затраты на вывод.

Источник: techcrunch.com

✅ Найденные теги: DeepSeek, новости
Каталог бесплатных опенсорс-решений, которые можно развернуть локально и забыть о подписках

галерея

Фото сгенерированных лиц: исследование показывает, что люди не могут отличить настоящие лица от сгенерированных
Нейросети построили капитализм за трое суток: 100 агентов Claude заперли…
Скетч: цифровой осьминог и виртуальный мир внутри компьютера с человечком.
Сцена с жестами пальцами, где один жест символизирует "VPN", а другой "KHP".
‼️Paramount купила Warner Bros. Discovery — сумма сделки составила безумные…
Скриншот репозитория GitHub "Claude Scientific Skills" AI для научных исследований.
Структура эффективного запроса Claude с элементами задачи, контекста и референса.
Эскиз и готовая веб-страница платформы для AI-дизайна в современном темном режиме.
ideipro logotyp
Image Not Found
Звёздное небо с галактиками и туманностями, космос, Вселенная, астрофотография.

Система оповещения обсерватории Рубина отправила 800 000 сигналов в первую ночь наблюдений.

Астрономы будут получать оповещения о небесных явлениях в течение нескольких минут после их обнаружения. Теренс О'Брайен, редактор раздела «Выходные». Публикации этого автора будут добавляться в вашу ежедневную рассылку по электронной почте и в ленту новостей на главной…

Мар 2, 2026
Женщина с длинными тёмными волосами в синем свете, нейтральный фон.

Расследование в отношении 61-фунтовой машины, которая «пожирает» пластик и выплевывает кирпичи.

Обзор компактного пресса для мягкого пластика Clear Drop — и что будет дальше. Шон Холлистер, старший редактор Публикации этого автора будут добавляться в вашу ежедневную рассылку по электронной почте и в ленту новостей на главной странице вашего…

Мар 2, 2026
Черный углеродное волокно с текстурой плетения, отражающий свет.

Материал будущего: как работает «бессмертный» композит

Учёные из Университета штата Северная Каролина представили композит нового поколения, способный самостоятельно восстанавливаться после серьёзных повреждений.  Речь идёт о модифицированном армированном волокном полимере (FRP), который не просто сохраняет прочность при малом весе, но и способен «залечивать» внутренние…

Мар 2, 2026
Круглый экран с изображением замка и горы, рядом электронная плата.

Круглый дисплей Waveshare для креативных проектов

Круглый 7-дюймовый сенсорный дисплей от Waveshare создан для разработчиков и дизайнеров, которым нужен нестандартный экран.  Это IPS-панель с разрешением 1 080×1 080 пикселей, поддержкой 10-точечного ёмкостного сенсора, оптической склейкой и защитным закалённым стеклом, выполненная в круглом форм-факторе.…

Мар 2, 2026

Впишите свой почтовый адрес и мы будем присылать вам на почту самые свежие новости в числе самых первых