Архив рубрики ~Лента новостей~

DeepSeek-V4.1-Flash дебютирует с кэшированной скоростью ввода данных в непиковое время в размере 0,003 доллара США за 1 миллион долларов, а его результаты в тестах превосходят GPT-5.6 Sol и Claude Opus 5.

DeepSeek-V4.1-Flash дебютирует с кэшированной скоростью ввода данных в непиковое время в размере 0,003 доллара США за 1 миллион долларов, а его результаты в тестах превосходят GPT-5.6 Sol и Claude Opus 5.
DeepSeek-V4.1-Flash дебютирует с кэшированной скоростью ввода данных в непиковое время в размере 0,003 доллара США за 1 миллион долларов, а его результаты в тестах превосходят GPT-5.6 Sol и Claude Opus 5.

Карл Франзен

Вчера вечером компания DeepSeek запустила DeepSeek-V4.1-Flash, оснастив систему базой данных с 552 миллиардами параметров, использующую смешанный набор экспертов, нативное машинное зрение, контекстное окно на 1 миллион токенов и архитектуру, разработанную для удешевления многократного чтения больших контекстов.

Однако для разработчиков, оценивающих модель для агентов кодирования и других длительных рабочих процессов, заявленная скорость работы API отражает лишь часть картины.

В непиковые часы DeepSeek устанавливает цену на V4.1-Flash на уровне 0,003 доллара за миллион входных токенов при попадании в кэш, 0,15 доллара за миллион при промахе в кэше и 0,60 доллара за миллион выходных токенов. В пиковые часы эти показатели вдвое выше.

Это различие важно, потому что агент, многократно работающий с одним и тем же репозиторием, определениями инструментов, системными инструкциями или историей разговора, может повторно считывать гораздо больше кэшированного контекста, чем нового. Сама компания DeepSeek утверждает, что расходы на попадание в кэш могут составлять значительную часть затрат агента.

В DeepSeek установлен пиковый период работы с понедельника по пятницу с 01:00 до 04:00 UTC и с 06:00 до 10:00 UTC; все остальные часы — непиковые. Таким образом, для планируемых заданий агентов время выполнения рабочей нагрузки само по себе является еще одним рычагом контроля затрат.

Это делает V4.1-Flash особенно полезным тестовым примером для проблемы, которую, как показывают собственные исследования VentureBeat, многие предприятия до сих пор не могут четко увидеть.

В ходе опроса 170 предприятий с численностью сотрудников более 100 человек, проведенного VentureBeat Pulse Research в июле 2026 года, только 47% заявили, что тщательно отслеживают затраты на вычисления для ИИ и рентабельность инвестиций, а это значит, что 53% этого не делают. При этом 12% заявили, что еще не решили проблему ограничений памяти для вывода, таких как емкость кэша ключ-значение, а еще 7% не знали об этом ограничении. Даже среди организаций, использующих ИИ в производственной среде в больших масштабах, тщательный контроль затрат достиг лишь 56%.

Для разработчиков вывод очевиден: сравнение моделей, основанное исключительно на цене некэшированных ресурсов, может скрыть один из самых быстрорастущих компонентов агентской экономики.

Значение в 0,003 доллара меняет сравнение.

Показатель кэширования входных данных в DeepSeek в непиковые часы необычно низок по сравнению с передовыми API, с которыми сравнивается версия V4.1-Flash.

OpenAI оценивает GPT-5.6 Sol в 4 доллара за миллион обычных входных токенов, 0,40 доллара за кэшированные входные данные и 20 долларов за выходные. Anthropic взимает 5 долларов за стандартные входные данные, 0,50 доллара за попадание в кэш Claude Opus 5 и 25 долларов за выходные. Kimi K3 от Moonshot AI стоит 3 доллара за входные данные при промахе кэша, 0,30 доллара за входные данные при попадании в кэш и 15 долларов за выходные.

Сравнение, проведенное DeepSeek, не совсем корректно, поскольку самые низкие тарифы требуют использования в непиковое время. Однако даже в пиковое время стоимость V4.1-Flash возрастает всего до 0,006 доллара за миллион кэшированных входных токенов, 0,30 доллара за некэшированные входные данные и 1,20 доллара за выходные данные.

Для упрощения расчета рассмотрим агента, который сохраняет многоразовый префикс из 500 000 токенов и обращается к этому кэшу в течение 100 запросов. Это соответствует 50 миллионам кэшированных входных токенов. Без учета платы за запись в кэш, нового некэшированного контекста и выходных данных, чтение из кэша обойдется примерно в 0,15 доллара США на V4.1-Flash в непиковое время, по сравнению с 15 долларами США на Kimi K3, 20 долларами США на GPT-5.6 Sol и 25 долларами США на Claude Opus 5 при их опубликованных тарифах на чтение из кэша.

Модель

Входные данные ($/1 млн)

Объем производства ($/1 млн)

Итого ($/1 млн)

Источник

Участник проекта Muse Spark 1.2 / 1.3

0,10 доллара

0,20 доллара

0,30 доллара

Мета

MiMo-V2.5 Flash

0,10 доллара

0,30 доллара

0,40 доллара

Xiaomi

DeepSeek-V4.1-Flash — вне пиковой нагрузки

0,15 доллара

0,60 доллара

0,75 доллара

DeepSeek

GPT-5.6 Луна

0,20 доллара

1,20 доллара

1,40 доллара

OpenAI

МиниМакс-М3

0,30 доллара

1,20 доллара

1,50 доллара

МиниМакс

LongCat-2.0 — акция, действующая ограниченное время.

0,30 доллара

1,20 доллара

1,50 доллара

ЛонгКэт

DeepSeek-V4.1-Flash — часы пик

0,30 доллара

1,20 доллара

1,50 доллара

DeepSeek

MiMo-V2.5

0,40 доллара

2,00 доллара

2,40 доллара

Xiaomi

DeepSeek-V4-Pro — вне пиковой нагрузки

0,66 доллара

1,98 доллара

2,64 доллара

DeepSeek

LongCat-2.0 — стандарт

0,75 доллара

2,95 доллара

3,70 доллара

ЛонгКэт

MiMo-V2.5 Pro (≤256K)

1,00 долл.

3,00 доллара

4,00 доллара

Xiaomi

Период действия календаря Близнецов 3.7 Flash — до 31 декабря 2026 года

0,75 доллара

3,75 доллара

4,50 доллара

Google

Период действия календаря Gemini 3.8 Flash — до 31 декабря 2026 года

0,75 доллара

3,75 доллара

4,50 доллара

Google

DeepSeek-V4-Pro — часы пик

1,32 доллара

3,96 доллара

5,28 долларов

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

1,25 доллара

4,25 доллара

5,50 долларов

Мета

GLM-5.3

1,40 доллара

4,40 доллара

5,80 долларов

З.АИ

Grok 4.6 — <200K токенов подсказок

2,00 доллара

6,00 долларов

8,00 долларов

xAI

MiMo-V2.5 Pro (>256K)

2,00 доллара

6,00 долларов

8,00 долларов

Xiaomi

Qwen3.8-Max

2,00 доллара

6,00 долларов

8,00 долларов

QwenCloud

Вспышка Gemini 3.7 — начиная с 1 января 2027 года

1,50 доллара

7,50 долларов

9,00 долларов

Google

Вспышка Gemini 3.8 — начиная с 1 января 2027 года

1,50 доллара

7,50 долларов

9,00 долларов

Google

GPT-5.6 Terra

2,00 доллара

12,00 долларов

14,00 долларов

OpenAI

Grok 4.6 — ≥200 тыс. токенов подсказок

4,00 доллара

12,00 долларов

16,00 долларов

xAI

ГПТ-5.4

2,50 доллара

15,00 долларов

17,50 долларов

OpenAI

Кими К3

3,00 доллара

15,00 долларов

18,00 долларов

Moonshot AI

Клод Опус 5

5,00 долларов

25,00 долларов

30,00 долларов

Антропический

Sakana Fugu Ultra (≤272K)

5,00 долларов

30,00 долларов

35,00 долларов

Сакана ИИ

GPT-5.6 Sol — Стандартный режим

5,00 долларов

30,00 долларов

35,00 долларов

OpenAI

Клод Басня 5 / Клод Мифос 5

10,00 долларов

50,00 долларов

60,00 долларов

Антропический

Басня Клода 5.1 / Мифос Клода 5.1

10,00 долларов

50,00 долларов

60,00 долларов

Антропический

GPT-6 Astra — Стандартный режим

10,00 долларов

50,00 долларов

60,00 долларов

OpenAI

GPT-5.6 Sol — Быстрый режим

10,00 долларов

60,00 долларов

70,00 долларов США

OpenAI

GPT-6 Astra — Быстрый режим

20,00 долларов

100,00 долларов

120,00 долларов США

OpenAI

В реальных условиях идеального повторного использования кэша не добиться, а общая стоимость зависит от длины выходных данных, количества токенов рассуждений, повторных попыток, вызовов инструментов и показателей успешности выполнения задач. Но именно поэтому разработчики, оценивающие нагрузку на агентов, должны измерять коэффициент попадания в кэш и стоимость выполнения задачи, а не умножать общее количество токенов подсказок на номинальную стоимость входных данных модели.

DeepSeek-V4.1-Flash сейчас находится в самом нижнем ценовом сегменте мирового рынка платных API, при этом его возможности выглядят более впечатляющими, чем можно предположить, исходя из его ценовой категории.

При цене $0,15 на входе / $0,60 на выходе , или $0,75 в сумме за 1 миллион токенов в непиковое время , он занимает место позади только Muse Spark и MiMo-V2.5 Flash уровня Contributor от Meta в текущем рейтинге; даже при цене $0,30 / $1,20 в пиковое время , или $1,50 в сумме , он все еще находится на одном уровне с MiniMax-M3 и рекламными ценами LongCat, значительно ниже среднего уровня в районе $4,50–$8,00 и существенно ниже премиальных моделей, таких как Claude Fable/Mythos 5.1, GPT-6 Astra и GPT-5.6 Sol Fast mode.

Стратегический аспект заключается в том, что DeepSeek использует V4.1-Flash не просто как дешевую модель «флэш-памяти», а как новый центр тяжести для своего API: в документации говорится, что запросы к устаревшей версии V4 Flash теперь обрабатываются версией V4.1-Flash, и что V4.1 Flash «значительно превзошла V4 Pro по производительности, стоимости, скорости и общему времени», при этом V4 Pro будет перенаправлять запросы на V4.1 Flash после 14 сентября 2026 года до появления будущей версии V4.1 Pro.

Данные VentureBeat Pulse показывают, что уровень внедрения инструментов мониторинга отстает. Лишь 31% опрошенных предприятий назвали стоимость миллиона токенов основным показателем успеха инфраструктуры, в то время как время безотказной работы и надежность лидируют с показателем 51%, а производительность разработчиков и скорость развертывания достигают 39%. Только 22% выбрали общую стоимость владения в качестве главного критерия покупки.

Технический отчет DeepSeek также раскрывает, что скрывается за экономикой попадания в кэш. Компания заявляет, что глобальный ключ-значение (KV) остается в постоянном кэше с гарантированным сроком службы не менее 72 часов. Кратковременный ключ-значение с использованием скользящего окна внимания (SWA), напротив, хранится в распределенном пуле памяти, выделяемом из 10% оперативной памяти хоста, и имеет срок службы в масштабе минут. Когда долгоживущий глобальный кэш сохраняется, но состояние SWA исчезает, V4.1-Flash восстанавливает отсутствующее состояние, воспроизводя только самое последнее окно внимания, а не всю историю.

DeepSeek уменьшает размер кэша, а не модель.

Важное значение имеет и архитектурное различие. В версии V4.1-Flash используется архитектура, которую DeepSeek называет причинно-следственным кодировщиком-декодировщиком , разделяя 40 слоев Transformer на 20-слойный причинно-следственный кодировщик и 20-слойный декодер. Эта конструкция активирует 8 миллиардов параметров на токен при чтении входных данных (предварительное заполнение) и 16 миллиардов при генерации выходных данных.

Это исправляет распространенную ошибку, которую легко допустить: V4.1-Flash — это не модель, активирующая 8 байт на протяжении всего цикла вывода. Она активирует 8 байт во время предварительного заполнения и 16 байт во время декодирования.

Эта модель сочетает в себе данную архитектуру с технологией Compressed Sparse Attention 2, иерархической разреженной индексацией и кэшированием FP4 KV. DeepSeek утверждает, что эти методы позволяют уменьшить глобальный кэш KV до 890 байт на токен, что примерно в четыре раза меньше, чем у V4-Flash, а требования к постоянному хранению в кэше снижаются примерно до одной восьмой.

Для циклов обработки данных агентами, интенсивно использующими входные данные, это потенциально существенное улучшение в плане обслуживания. Агент, постоянно перечитывающий репозиторий, — это именно тот тип рабочей нагрузки, где предварительное заполнение и эффективность кэша ключ-значение могут стать решающими факторами.

Но «Flash» больше не означает «маленький». Предыдущая версия DeepSeek V4-Flash использовала 284-байтовую матрицу с 13-байтовыми активными параметрами. Версия V4.1-Flash увеличивает матрицу до 552 байт, что составляет примерно 94-процентный скачок. Активация предварительного заполнения снижается с 13 до 8 байт, но активация поколений фактически увеличивается с 13 до 16 байт.

А 552B описывает только основную структуру: в техническом отчете DeepSeek отдельно перечислены 196B параметров в модулях условной памяти Engram, к которым осуществляется редкий доступ.

Этот компромисс вызвал скептицизм среди разработчиков, обсуждающих релиз. Один из комментаторов в обсуждении запуска на Hacker News задался вопросом, не является ли модель 552B «уже не совсем флэш-памятью», отметив, что её гораздо больший общий объём данных делает локальное развертывание значительно более требовательным, даже если её разреженная архитектура активации и кэширования повышает эффективность обслуживания.

Критика полезна, но она не столько опровергает утверждение DeepSeek об эффективности, сколько уточняет его.

V4.1-Flash не компактнее V4-Flash по общему объему весов. Он разработан для использования меньшего количества вычислительных ресурсов при обработке токенов и значительно меньшего объема памяти для хранения длинных контекстов. Для разработчиков, приобретающих функции вывода данных у DeepSeek, это может означать более низкую стоимость API. Для команд, планирующих самостоятельно размещать веса, распространяемые по лицензии MIT, переход от 284 байт к 552 байтам делает аппаратную конфигурацию значительно менее удобной.

Технический отчет служит важным противовесом критике типа «он просто стал больше». DeepSeek утверждает, что CED фактически вдвое сокращает вычисления предварительного заполнения для достаточно длинных последовательностей, в то время как количество операций с плавающей запятой при декодировании одного токена увеличивается всего примерно на 25% при увеличении длины контекста в 256 раз — с 4K до 1 миллиона токенов. Другими словами, V4.1-Flash имеет больший вес, но DeepSeek разработала такой подход, при котором объем работы, связанный с растущим контекстом, масштабируется гораздо медленнее.

Однако есть и соответствующее предостережение. DeepSeek прямо заявляет, что новая архитектура создает ограничения по надежности, которые компания еще не полностью охарактеризовала. Компания утверждает, что потенциальные ошибки выбора разреженных данных в CSA2 и приблизительное восстановление состояния, используемое в SWA Bounded Replay, могут привести к снижению производительности в непроверенных крайних случаях, особенно в отношении разреженного извлечения данных в очень длительных контекстах и границ возобновления кэша. DeepSeek заявляет, что не наблюдала систематического снижения производительности в собственных тестах, но планирует провести дополнительные стресс-тесты.

В собственном пресс-релизе DeepSeek организациям, заинтересованным в крупномасштабном развертывании, даже рекомендуется связаться с компанией, если у них есть ресурсы порядка 2000 графических процессоров плюс кластер хранения данных.

Результаты тестов обнадеживают, но форма рабочей нагрузки имеет большее значение.

DeepSeek сообщает о результате 74,2 в DeepSWE v1.1 , что немного выше показателей 74,0 для Claude Opus 5 и 73,0 для GPT-5.6 Sol. Также сообщается о результатах 88,1 в CyberGym для V4.1-Flash и 54,8 в AutomationBench.

Сравнение результатов тестов DeepSeek-V4.1-Flash

Это результаты тестов, проведенных DeepSeek, и они не демонстрируют повсеместного доминирования. Opus 5 опережает V4.1-Flash со счетом 43,3 против 30,0 в Terminal-Bench 3.0 и 51,8 против 31,2 в Terminal-Bench 4.0, в то время как GPT-5.6 Sol лидирует в GPQA Diamond и SEC-Bench Pro в таблице DeepSeek.

В этих итоговых показателях скрыта еще одна переменная стоимости: трудозатраты. DeepSeek провела сравнительный анализ при максимальном значении трудозатрат, равном 100. В собственных тестах компании увеличение трудозатрат с 25 до 100 повышает эффективность DeepSWE v1.1 с 66,0% до 74,2% и Terminal-Bench 2.1 с 82,4% до 90,6%, но при этом расходуется примерно в 2,5 раза больше выходных токенов. DeepSeek утверждает, что выгода достигается на начальном этапе: уровни трудозатрат от 60 до 80 восстанавливают большую часть точности, достигаемой при максимальных усилиях, менее чем за половину бюджета токенов, в то время как последний шаг до 100 увеличивает длину траекторий агентов в 1,6–1,8 раза при сравнительно небольшом приросте.

Это создает еще одно практическое решение для разработчиков, касающееся маршрутизации. DeepSeek предоставляет общедоступные API-предустановки низкого, высокого и максимального значений, соответствующих трудозатратам в 50, 75 и 100. Таким образом, команда, оптимизирующая стоимость успешно выполненной задачи, может обнаружить, что оптимальная рабочая точка модели — это не конфигурация с максимальными трудозатратами, лежащая в основе ее результатов в таблице лидеров.

Предварительные данные, предоставленные VentureBeat сторонними экспертами, указывают скорее на ту же самую гипотезу о соотношении цены и эффективности, чем на неопровержимые разведывательные данные.

Компания OpenDesign сообщила, что версия V4.1-Flash достигла 98% от показателя качества GPT-6 Astra при использовании всего 1,4% от её стоимости в рамках повседневных задач проектирования. Это узкоспециализированная оценка работы сторонних разработчиков, а не общая оценка модели, но она подтверждает необходимость тестирования успешности работы с учётом вложенных средств, а не только конкурентоспособности.

Есть еще одно важное замечание, которое следует учесть разработчикам. DeepSeek прекратил поддержку V4-Flash и V4-Flash-Vision-Exp и временно перенаправляет их существующие идентификаторы на V4.1-Flash. Также сообщается, что начиная с 14 сентября, запросы к deepseek-v4-pro будут перенаправляться на V4.1-Flash до выхода V4.1-Pro.

Эта политика вызвала отдельную волну критики со стороны разработчиков на Hacker News, которые утверждали, что изменение базовой модели, лежащей в основе существующего производственного идентификатора, может сделать недействительным регрессионное тестирование, даже если замена номинально лучше или дешевле. Для команд с тщательно настроенными подсказками и поведением агентов миграция модели остается скорее вопросом тестирования, чем предположением.

Выпуск продукта, демонстрирующего оптимальное соотношение цены и качества, в важнейший момент.

Запуск также совпадает с расширением коммерческих амбиций DeepSeek. На этой неделе агентство Reuters сообщило, что компания привлекла CITIC Securities в рамках подготовки к потенциальному размещению акций на шанхайской бирже STAR Market. Reuters также сообщило, что текущий раунд привлечения средств может оценить DeepSeek в 500 миллиардов юаней, или примерно в 75 миллиардов долларов.

В этом контексте ставки повышаются для релиза, основная цель которого заключается не столько в победе во всех бенчмарках, сколько в снижении затрат на запуск эффективных моделей в масштабе предприятия.

Поэтому для разработчиков версия V4.1-Flash ставит более конкретный вопрос, чем просто вопрос о том, создала ли DeepSeek еще одного дешевого конкурента на передовом рубеже. Полезным критерием является то, достаточно ли ресурсоемкая, повторяющаяся и кэшируемая рабочая нагрузка, чтобы использовать преимущества пути предварительного заполнения с 8 миллиардами параметров и значительно меньшего кэша ключ-значение — и перевешивают ли эти преимущества почти удвоенный размер модели и путь декодирования, который теперь активирует 16 миллиардов параметров.

В техническом отчете добавляется еще одна переменная к этому уравнению: достаточно ли выигрывает рабочая нагрузка от максимальных усилий по рассуждению, чтобы оправдать примерно 2,5-кратное увеличение потребления выходных токенов, или же средний уровень усилий обеспечивает лучший результат по стоимости задачи.

Для разработчиков агентов это важный показатель: не только интеллектуальный объем данных на токен, но и объем выполненной работы на каждый кэшированный токен, в секунду и на доллар.

Опрос по корпоративной агентской оркестрации

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Teradyne Robotics подает в суд JAKA из-за трех патентов Universal Robots Новости робототехники Сегодня ночью украинские БЭКи атаковали район Геленджика, рядом с Новороссийском Новости робототехники Nowaste Logistics становится первой компанией, внедрившей AutoCase из AutoStore, предоставленной Swisslog Новости робототехники Простая конструкция робота превосходит человеческую руку в некоторых ключевых движениях. Новости робототехники Керамические микросвитки, созданные по образцу бабочек, разворачиваются с помощью магнитов, приводя в движение крошечных роботов. Архив рубрики ~Коротко из Telegram~ ИИ может больше. Просто попросите его правильно Вы используете ИИ… Архив рубрики ~Коротко из Telegram~ Пять неочевидных привычек, которые отличают уверенных пользователей ИИ от новичков… Архив рубрики ~Коротко из Telegram~ ChatGPT серьезно ударил по индустрии заказных студенческих работ в Кении…. Архив рубрики ~Коротко из Telegram~ Российские операторы ЦОДов предложили создавать межрегиональные хабы, где один крупный… Новости робототехники JD.com расширяет применение физического искусственного интеллекта в логистике, используя 3 миллиона роботов. Архив рубрики ~Обо всем~ Дождь — это микромолния: ученые выяснили, как капли пробивают защиту автомобилей Новости робототехники Чем кладка кирпича научилась монументальной роботе в строительстве Архив рубрики ~Обо всем~ Инструмент глубокого обучения использует секвенирование длинных прочтений для обнаружения мутаций в раковых клетках. Архив рубрики ~Коротко из Telegram~ Сильнее всех складной iPhone Duo ждёт… Samsung. — Они уверены,… Новости робототехники Teradyne Robotics подает в суд JAKA из-за трех патентов Universal Robots Новости робототехники Сегодня ночью украинские БЭКи атаковали район Геленджика, рядом с Новороссийском Новости робототехники Nowaste Logistics становится первой компанией, внедрившей AutoCase из AutoStore, предоставленной Swisslog Новости робототехники Простая конструкция робота превосходит человеческую руку в некоторых ключевых движениях. Новости робототехники Керамические микросвитки, созданные по образцу бабочек, разворачиваются с помощью магнитов, приводя в движение крошечных роботов. Архив рубрики ~Коротко из Telegram~ ИИ может больше. Просто попросите его правильно Вы используете ИИ… Архив рубрики ~Коротко из Telegram~ Пять неочевидных привычек, которые отличают уверенных пользователей ИИ от новичков… Архив рубрики ~Коротко из Telegram~ ChatGPT серьезно ударил по индустрии заказных студенческих работ в Кении…. Архив рубрики ~Коротко из Telegram~ Российские операторы ЦОДов предложили создавать межрегиональные хабы, где один крупный… Новости робототехники JD.com расширяет применение физического искусственного интеллекта в логистике, используя 3 миллиона роботов. Архив рубрики ~Обо всем~ Дождь — это микромолния: ученые выяснили, как капли пробивают защиту автомобилей Новости робототехники Чем кладка кирпича научилась монументальной роботе в строительстве Архив рубрики ~Обо всем~ Инструмент глубокого обучения использует секвенирование длинных прочтений для обнаружения мутаций в раковых клетках. Архив рубрики ~Коротко из Telegram~ Сильнее всех складной iPhone Duo ждёт… Samsung. — Они уверены,…

Оставить комментарий