Архив рубрики ~Лента новостей~

Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf

Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf
Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf

С приходом нейросетей теперь можно решать задачи гораздо проще, правда и задачи бы такой не стояло не будь нейросетей и llama.cpp, и huggingface. В общем смысл статьи в том чтобы попытаться математически вычислить теоретическую скорость генерации токенов в программе llama.cpp для моделей на hugginface, просто открыв карточку модели и нажав на закладку (букмарклет).

В интеренете таких калькуляторв довольно много, и в этом калькуляторе нет никаких новых идей, он работает как и все остальные — вычисляет скорость исходя из пропускной способности видеопамяти пользователя. Но как выяснилось просто поделить одно число на другое (вес модели на пропускную способность видеокарты) не совсем правильно, когда я сказал что в реале у меня другая скорость, нейронки стали вводить поправочные коэффициент в виде эффективности видеокарты (60-80%).

Читать далее

Источник: habr.com

❌ Нет похожих статей с такими тегами

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Группа Atoms Трэвиса Каланика, возможно, займется бизнесом роботакси. Архив рубрики ~Полезное~ Собираем приложения как конструктор: для Android и браузеров вышел сервис… Новости робототехники Эрик Сивертсон обсуждает FPGA и безопасность роботов Архив рубрики ~Полезное~ Бесплатные ИИ-генераторы музыки: 7 сервисов и как ими пользоваться Архив рубрики ~Коротко из Telegram~ OpenAI выпустила подробный гайд по GPT-6 Astra API В гайде… Архив рубрики ~Коротко из Telegram~ DeepSeek собирает огромный AI-кластер на чипах Huawei Компания планирует развернуть… Архив рубрики ~Коротко из Telegram~ Важное о Claude За эти недели вышло ещё несколько важных… Архив рубрики ~Коротко из Telegram~ ЦЕЛЫЙ ПК запихнули внутрь компьютерной мышки — он запускает Windows,… Архив рубрики ~Полезное~ Где БЕСПЛАТНО протестировать Seedance 2.5 — одну из самых мощных… Архив рубрики ~Коротко из Telegram~ На выставке IFA 2026 представлены беспроводные наушники Timekettle W4 Plus, переводящие речь… Архив рубрики ~Коротко из Telegram~ TCL представила смартфон P80 Ultra с первым AMOLED-дисплеем, который при… Архив рубрики ~Коротко из Telegram~ Вейпы начнут ПРОВЕРЯТЬ ВОЗРАСТ перед затяжкой — JUUL получила разрешение… Архив рубрики ~Коротко из Telegram~ А ещё Astra заметно прибавила в управлении роботами. В эксперименте… Архив рубрики ~Коротко из Telegram~ Astra рисует автопортер в Canva Новости робототехники Группа Atoms Трэвиса Каланика, возможно, займется бизнесом роботакси. Архив рубрики ~Полезное~ Собираем приложения как конструктор: для Android и браузеров вышел сервис… Новости робототехники Эрик Сивертсон обсуждает FPGA и безопасность роботов Архив рубрики ~Полезное~ Бесплатные ИИ-генераторы музыки: 7 сервисов и как ими пользоваться Архив рубрики ~Коротко из Telegram~ OpenAI выпустила подробный гайд по GPT-6 Astra API В гайде… Архив рубрики ~Коротко из Telegram~ DeepSeek собирает огромный AI-кластер на чипах Huawei Компания планирует развернуть… Архив рубрики ~Коротко из Telegram~ Важное о Claude За эти недели вышло ещё несколько важных… Архив рубрики ~Коротко из Telegram~ ЦЕЛЫЙ ПК запихнули внутрь компьютерной мышки — он запускает Windows,… Архив рубрики ~Полезное~ Где БЕСПЛАТНО протестировать Seedance 2.5 — одну из самых мощных… Архив рубрики ~Коротко из Telegram~ На выставке IFA 2026 представлены беспроводные наушники Timekettle W4 Plus, переводящие речь… Архив рубрики ~Коротко из Telegram~ TCL представила смартфон P80 Ultra с первым AMOLED-дисплеем, который при… Архив рубрики ~Коротко из Telegram~ Вейпы начнут ПРОВЕРЯТЬ ВОЗРАСТ перед затяжкой — JUUL получила разрешение… Архив рубрики ~Коротко из Telegram~ А ещё Astra заметно прибавила в управлении роботами. В эксперименте… Архив рубрики ~Коротко из Telegram~ Astra рисует автопортер в Canva

Оставить комментарий