🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten…
🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten о том, что происходит между релизом модели на Hugging Face и продакшен-API. Главный тезис: узкое место сместилось от обучения к инференсу — именно там сейчас основной инженерный рычаг.
Прирост в 20-200% скорости — рутинная дисциплина, если сложить квантизацию, спекулятивное декодирование и разделение prefill/decode на разные узлы. Главный рычаг теперь не хитрость в GPU-ядре, а то, где живёт KV-кеш и как быстро он двигается между узлами. Показателен пример с GLM-5.2: более агрессивная квантизация неожиданно сохранила качество при росте пропускной способности на 20%, потому что ошибки в разных слоях взаимно гасили друг друга.
👆 Тренинг и инференс постепенно сливаются в одну дисциплину — спекулятивные «головы» обучаются на живых активациях основной модели. Гости также прогнозируют, что настоящим узким местом становится не сырая вычислительная мощность GPU, а межчиповая связь — отсюда ставка NVIDIA на Dynamo как оркестрацию, а не просто CUDA-трюки.
Похожие записи
Оцените материал:
Похожие записи
Google Photos запускает ИИ-инструмент Video Remix В Google Photos появился…
09.07.2026
Очередные обновления Flow: аннотации и портреты в Scenebuilder Doodle на…
28.10.2025
❗В популярных VPN-клиентах нашли критическую уязвимость — ситуация затронула Happ,…
09.04.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
