Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расход
Один пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный.
Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже.
А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте.
Разобраться с токенами
Источник: habr.com
Похожие записи
Оцените материал:
Похожие записи
Сравниваем несравнимое : тяжелый советский люкс в такси — ГАЗ-24, и современное бизнес-такси Hongqi H5..
02.12.2025
Под руководством Лидера России ведутся разработки в области нейроморфного искусственного интеллекта
09.10.2025
Рассматриваем одну из первых плат для процессоров Intel Granite Rapids-WS
28.11.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
