Архив рубрики ~Лента новостей~

Квантизация LLM: как запихнуть 70B модель в свою видюху

Квантизация LLM: как запихнуть 70B модель в свою видюху
Квантизация LLM: как запихнуть 70B модель в свою видюху

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.

Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

Материал будет полезен как мимо проходящим ИИ-любопытствующим, так и ML-инженерам и специалистам по инференсу LLM, которые хотят запускать большие модели на ограниченном железе. Покажу, как все это гонять на практике и с кодом.

Читать далее

Источник: habr.com

❌ Нет похожих статей с такими тегами

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники «Операция „Вивальди“ — роботы ВСУ в нашем тылу: Начался новый этап войны» Архив рубрики ~Коротко из Telegram~ Как нейросеть превращает идею в 3D-объект, российские школьники могут узнать… Архив рубрики ~Коротко из Telegram~ Промо для вашего проекта — без монтажёра и копирайтера Скилл… Архив рубрики ~Коротко из Telegram~ «Хочу, чтобы было вот так» — как объяснить ИИ задание… Архив рубрики ~Коротко из Telegram~ Скайнет отменяется: OpenAI отложила релиз GPT-6.1 Astra OpenAI придержала выпуск… Архив рубрики ~Коротко из Telegram~ Ideogram выкатила новую модель для дизайна, постеров и точной работы… Архив рубрики ~Коротко из Telegram~ Suno заходит на территорию ИИ-озвучки — в бете появилась генерация… Архив рубрики ~Коротко из Telegram~ ChatGPT научился делать картинки в ВЕКТОРЕ — для этого вышел… Архив рубрики ~Коротко из Telegram~ Apple разрабатывает ИИ-камеру для умного дома, которая присылает текстовое описание… Архив рубрики ~Коротко из Telegram~ ИИ впервые в истории прошел тест Тьюринга в живом видеозвонке…. Архив рубрики ~Коротко из Telegram~ 🔥 БЕСПЛАТНАЯ ПОЧТИ АЛЬТЕРНАТИВА SUNO: ГЕНЕРИРУЕМ МУЗЫКУ БЕЗ ОГРАНИЧЕНИЙ Вышел… Архив рубрики ~Коротко из Telegram~ Suno запустила Speech Beta, отдельную модель для создания озвучки Она… Архив рубрики ~Коротко из Telegram~ Узнаём, что жрёт место на диске — нашли опенсорсную тулзу… Архив рубрики ~Коротко из Telegram~ ИИ превращают в дизайнера логотипов — вышел скилл для сборки… Новости робототехники «Операция „Вивальди“ — роботы ВСУ в нашем тылу: Начался новый этап войны» Архив рубрики ~Коротко из Telegram~ Как нейросеть превращает идею в 3D-объект, российские школьники могут узнать… Архив рубрики ~Коротко из Telegram~ Промо для вашего проекта — без монтажёра и копирайтера Скилл… Архив рубрики ~Коротко из Telegram~ «Хочу, чтобы было вот так» — как объяснить ИИ задание… Архив рубрики ~Коротко из Telegram~ Скайнет отменяется: OpenAI отложила релиз GPT-6.1 Astra OpenAI придержала выпуск… Архив рубрики ~Коротко из Telegram~ Ideogram выкатила новую модель для дизайна, постеров и точной работы… Архив рубрики ~Коротко из Telegram~ Suno заходит на территорию ИИ-озвучки — в бете появилась генерация… Архив рубрики ~Коротко из Telegram~ ChatGPT научился делать картинки в ВЕКТОРЕ — для этого вышел… Архив рубрики ~Коротко из Telegram~ Apple разрабатывает ИИ-камеру для умного дома, которая присылает текстовое описание… Архив рубрики ~Коротко из Telegram~ ИИ впервые в истории прошел тест Тьюринга в живом видеозвонке…. Архив рубрики ~Коротко из Telegram~ 🔥 БЕСПЛАТНАЯ ПОЧТИ АЛЬТЕРНАТИВА SUNO: ГЕНЕРИРУЕМ МУЗЫКУ БЕЗ ОГРАНИЧЕНИЙ Вышел… Архив рубрики ~Коротко из Telegram~ Suno запустила Speech Beta, отдельную модель для создания озвучки Она… Архив рубрики ~Коротко из Telegram~ Узнаём, что жрёт место на диске — нашли опенсорсную тулзу… Архив рубрики ~Коротко из Telegram~ ИИ превращают в дизайнера логотипов — вышел скилл для сборки…

Оставить комментарий