DeepSeek V4 Flash 0731: самый бюджетный китаец подобрался к Opus
31 июля DeepSeek обновил свою облегчённую модель — без смены архитектуры, просто через дообучение. По бенчмаркам она уже обходит собственную старшую версию V4-Pro и подбирается к Opus 4.8. А стоит сущие копейки.
Что вышло и сколько это стоит
DeepSeek выкатил официальный релиз V4 Flash под обозначением 0731 — модель вышла из статуса превью в публичное API. Важная деталь: архитектура и размер модели не изменились, обновление — это чистое дообучение поверх той же базы (284 млрд параметров, 13 млрд активных на токен). И тем не менее модель обошла свою же старшую V4-Pro-Preview по всем девяти опубликованным агентным бенчмаркам, включая скачок на бенчмарке DeepSWE — с 7,3 до 54,4 балла.
Цена при этом не изменилась: $0,14 за миллион входящих токенов и $0,28 за миллион исходящих, плюс отдельная цена для кэшированных повторных промптов — $0,0028 за миллион, в пятьдесят раз дешевле обычного входа. По итогу активного пользования это действительно сущие копейки.
Бенчмаркам доверять не стоит — лучше проверять на практике
По официальным цифрам DeepSeek V4 Flash 0731 набирает 82,7 балла на Terminal Bench 2.1 — это выше, чем у GLM-5.2 (81,0), и близко к Opus 4.8 (85,0). Но бенчмаркам я лично доверяю не особо — надёжнее проверить модель на собственных задачах.
Протестировал на своих типовых задачах среднего уровня: мониторинг сайтов, сбор дайджестов, анализ финансовых отчётов. DeepSeek V4 Flash 0731 справляется вполне неплохо. Раньше похожие задачи я гонял через бесплатный тестовый период MiMo V2.5 от Xiaomi — и по ощущениям DeepSeek выигрывает, а разница в цене между DeepSeek и топовыми моделями от Anthropic куда больше, чем разница в бенчмарках.
А судьи кто: справедливо ли вообще сравнивать
Тут можно возразить: некорректно сравнивать китайские модели с топовыми решениями OpenAI и Anthropic. Мол, цифры бенчмарков сами по себе ничего не значат — важны качество, поведение модели на практике и ключевые характеристики. И с этим я частично согласен: западные топовые модели действительно опережают китайские по ряду параметров и бенчмарков.
Но вопрос в другом: разве это преимущество в качестве составляет стократную разницу в цене? На 10–15% — возможно. Но точно не в сто раз. Отсюда закономерное ощущение, что цены на топовые западные модели сильно завышены относительно реального разрыва в качестве.
Куда реально ставить эту модель
Для полноценного вайб-кодинга — то есть когда агент самостоятельно пишет и правит серьёзный продакшн-код — я бы пока не стал использовать DeepSeek как основной инструмент. Для этого лучше по-прежнему брать более продвинутые модели от Anthropic или OpenAI, где цена ошибки высокая, а разница в качестве на сложных задачах ощущается сильнее всего.
А вот отдавать DeepSeek задачи средней сложности — вполне рабочая стратегия, чтобы не жечь токены и лимиты на дорогих моделях без необходимости. С задачами среднего уровня сложности — мониторинг, сбор данных, аналитика, своды — DeepSeek V4 Flash 0731 справляется на отлично, и по деньгам это не сопоставимо дешевле.
Как подключить API ключи и пополнить баланс без посредников показывал на своем YouTube-канале.
Если интересно — встретимся у меня в Telegram-канале @wbindexes
www.youtube.comВыживший в МатрицеИсточник: vc.ru
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
