🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten…
🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten о том, что происходит между релизом модели на Hugging Face и продакшен-API. Главный тезис: узкое место сместилось от обучения к инференсу — именно там сейчас основной инженерный рычаг.
Прирост в 20-200% скорости — рутинная дисциплина, если сложить квантизацию, спекулятивное декодирование и разделение prefill/decode на разные узлы. Главный рычаг теперь не хитрость в GPU-ядре, а то, где живёт KV-кеш и как быстро он двигается между узлами. Показателен пример с GLM-5.2: более агрессивная квантизация неожиданно сохранила качество при росте пропускной способности на 20%, потому что ошибки в разных слоях взаимно гасили друг друга.
👆 Тренинг и инференс постепенно сливаются в одну дисциплину — спекулятивные «головы» обучаются на живых активациях основной модели. Гости также прогнозируют, что настоящим узким местом становится не сырая вычислительная мощность GPU, а межчиповая связь — отсюда ставка NVIDIA на Dynamo как оркестрацию, а не просто CUDA-трюки.
Похожие записи
Оцените материал:
Похожие записи
Claude заходит в продакшн: теперь он управляет Blender, Adobe и…
02.05.2026
Австралия запрещает соцсети детям до 16 лет — из-за искусственного…
01.12.2025
OpenAI заказали до половины мирового производства оперативной памяти на ближайшие…
22.12.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
