Архив рубрики ~Полезное~

Что такое LLM и как «думает» нейросеть — просто о сложном

1
Что такое LLM и как «думает» нейросеть — просто о сложном
Что такое LLM и как «думает» нейросеть — просто о сложном
Нейросеть в виде светящегося мозга из данных — визуализация того, как работает большая языковая модель LLM
IDEIPRO · Разбираемся в нейросетях

Что такое LLM и как «думает» нейросеть на самом деле

Кажется, что на другом конце чата сидит кто-то, кто тебя понимает. На самом деле там происходит куда более простая штука — но от этого не менее впечатляющая. Разбираемся простыми словами, без формул и хайпа.

1задача: угадать токен
млрдчисловых параметров
0сознания внутри

Коротко о главном

  • LLM — большая языковая модель, обученная на огромном массиве текста находить закономерности и сжимать их в миллиарды числовых «весов».
  • Она не «понимает» и не помнит — она предсказывает следующий токен (кусочек слова), как очень мощное автодополнение.
  • Галлюцинация — уверенно достроенная догадка: правдоподобный, но не всегда правдивый текст.
  • Модель видит только контекстное окно — то, что сейчас в переписке; между диалогами она не учится.
  • Вывод: доверяй ей рассуждения и черновики, но перепроверяй цифры, даты, цитаты и ссылки.

1Что такое LLM простыми словами

LLM (Large Language Model, «большая языковая модель») — это программа, обученная на огромном массиве текста: книгах, статьях, сайтах, коде, переписках, форумах. Тренировка занимает недели работы на тысячах видеокарт и обходится в миллионы долларов.

Но модель не запоминает тексты дословно, как флешка. Она улавливает закономерности: какие слова обычно стоят рядом, как строится грамотное предложение, как выглядит рабочий код на Python, как обычно отвечают на вопрос про рецепт борща или закон Ома. Все эти закономерности сжимаются в миллиарды числовых параметров — «весов» нейросети.

Главное: внутри LLM нет «личности» и нет базы готовых ответов — есть только натренированные числа, которые задают, каким будет следующее слово.

2Так «думает» она или всего лишь угадывает?

У LLM нет памяти о прошлом опыте, нет собственных желаний и нет отдельного «я», которое сидит внутри и рассуждает. То, что модель реально делает — предсказывает следующий токен (кусочек сл��ва), опираясь на весь текст, который был написан до этого момента в разговоре.

Токен — минимальный кусочек текста, с которым работает модель: часть слова, целое слово или знак пунктуации. Именно токен за токеном она и «пишет» ответ.

Представь автодополнение в телефоне, только прокачанное в миллионы раз. Пишешь «Доброе…» — телефон подсказывает «утро». LLM делает буквально то же самое, только настолько качественно предсказывает следующий фрагмент, что из отдельных кусочков складываются целые абзацы, объяснения, код и даже стихи.

Автодополнение текста на смартфоне перерастает в нейросеть — принцип предсказания токенов в LLM
Автодополнение в телефоне — точный, только очень скромный родственник LLM

3Откуда тогда ощущение, что она понимает

Чтобы хорошо предсказать следующее слово в сложном тексте — про квантовую физику, договор аренды или баг в чужом коде — модели пришлось «впитать» огромное количество закономерностей о том, как устроен мир, о котором идёт речь.

И тут возникает интересный побочный эффект: предсказывая текст, модель как бы действительно рассуждает. Это удобное и рабочее приближение к мышлению — но именно приближение, а не человеческое сознание в буквальном смысле. Внутри нет никого, кто «понимает» — есть статистика, доведённая до уровня искусства.

4Почему нейросеть иногда откровенно врёт

Раз модель по сути достраивает наиболее вероятное продолжение текста, она с той же уверенностью может достроить и то, чего никогда не было: несуществующую научную статью, неверную дату, придуманную цитату классика, ссылку на закон, которого нет. Такое явление называют галлюцинацией.

Важно понимать: модель не «врёт» в человеческом смысле — она не пытается обмануть. Она выдаёт наиболее правдоподобный на вид текст, а правдоподобное не всегда означает правдивое. Особенно часто это проявляется в узких темах, точных цифрах, датах и ссылках на источники — там, где в обучающих данных было мало примеров, и модели проще «додумать» красиво звучащий ответ, чем признать: «я не знаю».

Книга с распадающимся текстом и вопросительными знаками — иллюстрация галлюцинаций нейросети
Галлюцинация ИИ — не ложь, а уверенно достроенная догадка

5Ни памяти, ни обучения на лету

Пока ты общаешься с моделью внутри одного диалога, она не «учится» и не запоминает тебя навсегда — если это специально не настроено разработчиком (как отдельная функция памяти в некоторых чат-ботах). Модель видит только то, что прямо сейчас находится в контекстном окне — переписке, документе, коде, который ты вставил в чат.

Весь «ум» уже зашит в неё на этапе тренировки, задолго до вашего разговора, и с каждым новым диалогом она стартует с чистого листа.

Светящееся окно с текстом в темноте — метафора контекстного окна и отсутствия памяти у нейросети
Контекстное окно — единственное, что «видит» модель прямо сейчас

Что с этим делать на практике

LLM — невероятно мощный предсказатель текста, обучившийся этому, «прочитав» гигантскую часть всего написанного человечеством. Зная, как она работает на самом деле, куда проще понимать её границы: доверяй ей в рассуждениях, генерации идей, черновиках кода и текстов — но перепроверяй цифры, даты, цитаты и ссылки на источники, особенно в важных задачах.

Относись к ответу нейросети как к черновику от очень начитанного, но иногда фантазирующего собеседника — и о��а станет одним из самых полезных инструментов, а не источником случайных ошибок.

?Частые вопросы про LLM

Что такое LLM простыми словами?
LLM (большая языковая модель) — это программа, обученная на огромном массиве текста. Она не хранит тексты дословно, а улавливает закономерности языка и предсказывает наиболее вероятное продолжение — токен за токеном.
Нейросеть правда «думает»?
Нет — по крайней мере не так, как человек. Внутри нет сознания и «я». Модель предсказывает следующий кусочек текста на основе статистики. Это очень хорошее приближение к рассуждению, но именно приближение.
Что такое токен?
Токен — минимальный кусочек текста, с которым работает модель: часть слова, целое слово или знак пунктуации. Ответ модель собирает токен за токеном, как очень мощное автодополнение.
Почему ИИ выдумывает факты (галлюцинирует)?
Модель достраивает наиболее правдоподобное продолжение текста, а правдоподобное не всегда правдиво. В узких темах, точных цифрах и ссылках примеров в обучении мало, поэтому ей «проще» красиво додумать, чем сказать «не знаю».
Запоминает ли нейросеть наш разговор?
По умолчанию нет. Модель видит только контекстное окно — то, что сейчас в переписке или вставлено в чат. Между диалогами она не учится и стартует с чистого листа, если отдельно не включена функция памяти.
Ещё больше полезного можно найти здесь.
Нужна помощь?

Внедрим нейросети в ваши задачи

Хотите использовать ИИ в работе, но не знаете, с чего начать и как не нарваться на галлюцинации? Напишите нам — подберём инструменты, настроим и покажем, как получать надёжный результат.

Материал выполнен с любовью и с помощью ИИ.
Больше гайдов и подборок по нейросетям — тут.
IDEIPRO.RU

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники NEURA Robotics предоставляет тренажерный зал NEURA RWTH Ахен для тренировки физического ИИ Архив рубрики ~Лента новостей~ Война за внимание: почему школьники Центральной Азии все хуже читают длинные тексты Архив рубрики ~Лента новостей~ Sophos ZTNA открывает доступ к управлению приложениями SaaS и многому другому. Архив рубрики ~Лента новостей~ Новый голосовой режим от OpenAI появился в настольном приложении ChatGPT. Архив рубрики ~Лента новостей~ США пытаются отбить open source у Китая: вышла открытая модель Poolside Laguna S 2.1 Архив рубрики ~Лента новостей~ «Группа Астра» расширила программу долговременной поддержки Astra Linux Архив рубрики ~Лента новостей~ Компания Anthropic запускает инструмент пространственного анализа от Claude Science, Института Wellcome Sanger и консорциума Google DeepMind AI. Архив рубрики ~Лента новостей~ Смерть монолитной LLM: почему выигрывает не тот, кто покупает флагман, а тот, кто строит сплит-роутинг Архив рубрики ~Лента новостей~ Как я научил Claude заказывать продукты в Яндекс Лавке (и что для этого пришлось отреверсить) Архив рубрики ~Коротко из Telegram~ Правительство Ирландии отменило тендер на закупку ПО и услуг Microsoft… Архив рубрики ~Лента новостей~ Xbox тестирует потоковую передачу с поддержкой рекламы с участием участников программы Xbox Insider. Архив рубрики ~Коротко из Telegram~ Прокачиваем OSINT без тёмной магии — собрали мощные тулзы и… Архив рубрики ~Коротко из Telegram~ Слышишь? Ползу Архив рубрики ~Коротко из Telegram~ Госуслуги хотят превратить в универсальную платформу для жизни и общения…. Новости робототехники NEURA Robotics предоставляет тренажерный зал NEURA RWTH Ахен для тренировки физического ИИ Архив рубрики ~Лента новостей~ Война за внимание: почему школьники Центральной Азии все хуже читают длинные тексты Архив рубрики ~Лента новостей~ Sophos ZTNA открывает доступ к управлению приложениями SaaS и многому другому. Архив рубрики ~Лента новостей~ Новый голосовой режим от OpenAI появился в настольном приложении ChatGPT. Архив рубрики ~Лента новостей~ США пытаются отбить open source у Китая: вышла открытая модель Poolside Laguna S 2.1 Архив рубрики ~Лента новостей~ «Группа Астра» расширила программу долговременной поддержки Astra Linux Архив рубрики ~Лента новостей~ Компания Anthropic запускает инструмент пространственного анализа от Claude Science, Института Wellcome Sanger и консорциума Google DeepMind AI. Архив рубрики ~Лента новостей~ Смерть монолитной LLM: почему выигрывает не тот, кто покупает флагман, а тот, кто строит сплит-роутинг Архив рубрики ~Лента новостей~ Как я научил Claude заказывать продукты в Яндекс Лавке (и что для этого пришлось отреверсить) Архив рубрики ~Коротко из Telegram~ Правительство Ирландии отменило тендер на закупку ПО и услуг Microsoft… Архив рубрики ~Лента новостей~ Xbox тестирует потоковую передачу с поддержкой рекламы с участием участников программы Xbox Insider. Архив рубрики ~Коротко из Telegram~ Прокачиваем OSINT без тёмной магии — собрали мощные тулзы и… Архив рубрики ~Коротко из Telegram~ Слышишь? Ползу Архив рубрики ~Коротко из Telegram~ Госуслуги хотят превратить в универсальную платформу для жизни и общения….

Оставить комментарий