Архив рубрики ~Лента новостей~
Как деградирует продовый LLM-инференс: KV-cache, OOM и хвост p99
Но когда сервис неделю живет под реальной нагрузкой, начинаются проблемы: p99 растет, память утекает, а однажды прилетает OOM на запросе, который вчера проходил без проблем.Я Стас Погоржельский, технологический евангелист VK Cloud, неоднократно наблюдал этот сценарий в демонстрационных средах. Head-of-line blocking: длинный префилл…
Читать