Архив рубрики ~Лента новостей~

DeepSeek выпускает модель «разреженного внимания», которая сокращает расходы на API вдвое

DeepSeek выпускает модель «разреженного внимания», которая сокращает расходы на API вдвое
Логотип DeepSeek
Источники изображений: VCG / Getty Images

В понедельник исследователи DeepSeek представили новую экспериментальную модель V3.2-exp, разработанную для значительного снижения затрат на вывод при использовании в долгосрочных контекстных операциях. DeepSeek анонсировала модель в публикации на Hugging Face, а также опубликовала ссылку на научную статью на GitHub.

Важнейшей функцией новой модели является DeepSeek Sparse Attention – сложная система, подробно описанная на схеме ниже. По сути, система использует модуль, называемый «молниеносным индексатором», для приоритизации определённых фрагментов из контекстного окна. После этого отдельная система, называемая «системой точного выбора токенов», выбирает из этих фрагментов определённые токены для загрузки в ограниченное окно внимания модуля. В совокупности они позволяют моделям Sparse Attention работать с большими фрагментами контекста при сравнительно небольшой нагрузке на сервер.

Скриншот

Для операций с длинным контекстом преимущества системы весьма существенны. Предварительное тестирование DeepSeek показало, что стоимость простого вызова API может быть снижена вдвое в ситуациях с длинным контекстом. Для более надёжной оценки потребуются дополнительные испытания, но, поскольку модель имеет открытый вес и свободно доступна на Hugging Face, вскоре сторонние тесты смогут оценить утверждения, сделанные в статье.

Новая модель DeepSeek — одно из ряда недавних прорывов, направленных на решение проблемы затрат на вывод — по сути, серверных затрат на работу предварительно обученной модели ИИ, в отличие от затрат на её обучение. В случае DeepSeek исследователи искали способы повысить эффективность фундаментальной архитектуры преобразователя и обнаружили, что есть возможность значительного улучшения.

Базирующаяся в Китае компания DeepSeek стала необычной фигурой на фоне бума ИИ, особенно для тех, кто рассматривает исследования в этой области как националистическую борьбу между США и Китаем. В начале года компания произвела фурор своей моделью R1, обученной преимущественно с использованием обучения с подкреплением и при этом значительно более низкой стоимости, чем у американских конкурентов. Однако эта модель не произвела настоящей революции в обучении ИИ, как предсказывали некоторые, и в последующие месяцы компания ушла из поля зрения.

Новый подход с «рассеянным вниманием» вряд ли вызовет такой же резонанс, как R1, но он все же может научить американских поставщиков некоторых крайне необходимых приемов, которые помогут снизить затраты на вывод.

Источник: techcrunch.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Нейронку БЕЗ ЦЕНЗУРЫ выпустили в открытый доступ — Gemma 4… Архив рубрики ~Коротко из Telegram~ Нашли комбайн для скачивания видео и музыки практически отовсюду —… Архив рубрики ~Коротко из Telegram~ Инструменты дня 🔍 Кьюи Перепроверяет ChatGPT, Claude и Gemini перед отправкой, потому… Архив рубрики ~Коротко из Telegram~ Kimi K3 нашла уязвимость в Redis за 27 минут Исследователь… Архив рубрики ~Коротко из Telegram~ Alibaba представила мощный движок синтеза речи Qwen-Audio-3.0-TTS Команда Qwen выпустила… Архив рубрики ~Коротко из Telegram~ Lightricks научила ИИ убирать лишних людей и машины с видео… Архив рубрики ~Коротко из Telegram~ Copilot теперь живет в «Проводнике» Windows 11 Microsoft продолжает встраивать… Архив рубрики ~Коротко из Telegram~ GitHub Copilot теперь поддерживает модель Gemini 3.6 Flash GitHub начал… Архив рубрики ~Коротко из Telegram~ Anthropic представила плагин Claude Security для поиска уязвимостей Anthropic выпустила… Архив рубрики ~Коротко из Telegram~ Cursor Router: снижение стоимости запросов к ИИ на 60% Команда… Архив рубрики ~Коротко из Telegram~ Российский разработчик СУБД Postgres Pro может сократить до 30% сотрудников…. Архив рубрики ~Коротко из Telegram~ Veon досрочно выкупил облигации на $886 млн, одновременно разместив новый… Архив рубрики ~Коротко из Telegram~ 💢 Иван Паломарес Каррaскоса (Machine Learning Mastery) разбирает пять стратегий… Архив рубрики ~Коротко из Telegram~ ✅ CEO Cloudflare Мэттью Принс на мероприятии Axios в Каннах… Архив рубрики ~Коротко из Telegram~ Нейронку БЕЗ ЦЕНЗУРЫ выпустили в открытый доступ — Gemma 4… Архив рубрики ~Коротко из Telegram~ Нашли комбайн для скачивания видео и музыки практически отовсюду —… Архив рубрики ~Коротко из Telegram~ Инструменты дня 🔍 Кьюи Перепроверяет ChatGPT, Claude и Gemini перед отправкой, потому… Архив рубрики ~Коротко из Telegram~ Kimi K3 нашла уязвимость в Redis за 27 минут Исследователь… Архив рубрики ~Коротко из Telegram~ Alibaba представила мощный движок синтеза речи Qwen-Audio-3.0-TTS Команда Qwen выпустила… Архив рубрики ~Коротко из Telegram~ Lightricks научила ИИ убирать лишних людей и машины с видео… Архив рубрики ~Коротко из Telegram~ Copilot теперь живет в «Проводнике» Windows 11 Microsoft продолжает встраивать… Архив рубрики ~Коротко из Telegram~ GitHub Copilot теперь поддерживает модель Gemini 3.6 Flash GitHub начал… Архив рубрики ~Коротко из Telegram~ Anthropic представила плагин Claude Security для поиска уязвимостей Anthropic выпустила… Архив рубрики ~Коротко из Telegram~ Cursor Router: снижение стоимости запросов к ИИ на 60% Команда… Архив рубрики ~Коротко из Telegram~ Российский разработчик СУБД Postgres Pro может сократить до 30% сотрудников…. Архив рубрики ~Коротко из Telegram~ Veon досрочно выкупил облигации на $886 млн, одновременно разместив новый… Архив рубрики ~Коротко из Telegram~ 💢 Иван Паломарес Каррaскоса (Machine Learning Mastery) разбирает пять стратегий… Архив рубрики ~Коротко из Telegram~ ✅ CEO Cloudflare Мэттью Принс на мероприятии Axios в Каннах…