Квантизация LLM: как запихнуть 70B модель в свою видюху
Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.
Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.
Материал будет полезен как мимо проходящим ИИ-любопытствующим, так и ML-инженерам и специалистам по инференсу LLM, которые хотят запускать большие модели на ограниченном железе. Покажу, как все это гонять на практике и с кодом.
Читать далее
Источник: habr.com
Похожие записи
Оцените материал:
Похожие записи
Valve прекращает производство самой доступной версии портативной консоли Steam Deck LCD
21.12.2025
Гибкий смартфон Xiaomi Mix Fold 4 с возможностями спутниковой связи выдержит полмиллиона открытий и закрытий
21.07.2024
Академик РАН рассказал, сможет ли албанский ИИ-министр быть неподкупным
25.09.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
