К содержанию
Фонтум Искусственный интеллект Урок 13 / 24 Все уроки

Главная · Курсы · Искусственный интеллект · Программа курса · Модуль IV. Языковые модели · урок 13 из 24

Галлюцинации нейросетей

Свойство механизма, а не поломка, и потому починить его так трудно

Галлюцинации нейросети это уверенно поданные ответы, не соответствующие действительности: выдуманные ссылки, даты, цитаты, судебные дела. Следуют они из устройства, а не из поломки, потому что предобучение требует лишь правдоподобного продолжения текста, сверки с миром внутри предсказания следующего кусочка не происходит, отдельного хранилища фактов нет. Состояния «этого я не знаю» у модели тоже нет: распределение вероятностей существует всегда.

Stanford CS324 / CS336. Dive into Deep Learning. Разбор приёма RAG · 24 мин · обновлено 01.10.2026

После урока вы сможете

  • Объяснять, почему выдумывание следует из устройства предсказания токенов
  • Различать правдоподобие и истинность как разные свойства текста
  • Знать четыре причины, по которым задача не решается простым способом
  • Понимать, что даёт подача источников в запрос и где у неё пределы

Попросите модель назвать три работы по узкой теме, с авторами, названиями и годами. Вы получите аккуратный список: фамилии на месте, названия правдоподобные, годы в разумном диапазоне. Проверьте каждую позицию поиском, и часть из них не найдётся, потому что таких работ не существует.

Список выдуманного при этом устойчивый: ссылки, даты, цитаты, судебные дела. Всё это выглядит настоящим, потому что устроено как настоящее. Уверенно поданный ответ, не соответствующий действительности, называют галлюцинацией.

Слово неудачное и откровенно антропоморфное, но прижилось, и другого общепринятого нет. Никакого восприятия у модели нет, а значит, нечему и обманываться. Дальше в уроке оно используется как принятое имя явления, не более того. Точнее было бы говорить «уверенная выдумка», но менять устоявшиеся названия задним числом бесполезно.

Это не поломка

Первый порыв состоит в том, чтобы счесть выдумку сбоем: что-то не сработало, надо чинить. Порыв понятный и неверный, и весь урок про то, почему. Галлюцинация остаётся свойством механизма, который работает ровно так, как задуман.

Вспомним, чему модель обучена. Предобучение ставит одну задачу: предсказывать следующий токен так, чтобы продолжение было похоже на настоящий текст. Ни на каком шаге не спрашивается, соответствует ли написанное миру, потому что такого вопроса в постановке просто нет. И вставить его туда некуда: сравнивать написанное не с чем.

Значит, у модели остаётся ровно один критерий: правдоподобие. Правдоподобие и истинность не одно и то же, и это главное предложение урока. Текст может быть безупречно правдоподобным и полностью ложным, и никакого противоречия внутри модели при этом не возникает.

Отсюда и правило, по которому урок надо читать. Не «модель иногда ошибается, потому что несовершенна», а «модель делает то, чему обучена, и часть результатов оказывается ложной». Разница кажется словесной, но из неё следует всё остальное, включая ответ на вопрос, почему это трудно исправить.

Почему выдуманная ссылка выглядит как настоящая

Разберём на самом частом случае, потому что он показателен. Ссылка на статью устроена стандартно: фамилия, инициалы, название из нескольких слов по теме, издание, год. Эта структура встречается в текстах тысячи раз, и модель воспроизводит её безошибочно. Форму она выучила надёжно именно потому, что форма повторяется.

Дальше происходит то, что кажется странным, а следует прямо из механизма. Заполнить структуру можно любыми правдоподобными кусками: подходящей фамилией, подходящим названием, подходящим годом. Ничто в предсказании токенов не отличает существующую работу от собранной на ходу.

Получается ссылка, безупречная по форме и пустая по содержанию. Именно поэтому такие выдумки так трудно заметить: у настоящей и выдуманной ссылки нет внешних различий. Отличить их можно единственным способом, для этого надо пойти и проверить.

Заметьте попутно, где ошибка происходит охотнее всего. Чем стандартнее форма и чем реже встречается конкретное содержание, тем выше шанс, что форму заполнят выдумкой. Ссылки, даты, номера, цитаты и имена как раз такие места. Их и стоит проверять в первую очередь, а всё прочее во вторую.

Сверки с миром не происходит

Теперь скажем то же самое строже, потому что здесь легко ошибиться в обе стороны. Внутри предсказания следующего токена нет шага, на котором что-то с чем-то сверяется. Нет обращения к источнику, нет запроса в базу, нет проверки готового ответа. Есть один шаг: посчитать вероятности и выбрать токен.

Нет и самой базы. У модели нет отдельного хранилища фактов, откуда факт можно достать или где его можно не найти. Всё, что в ней отражено, размазано по миллиардам чисел вместе с грамматикой, стилем и всем прочим, по тем самым параметрам, которые подобрал градиентный спуск.

Отсюда следует неприятное. У модели нет состояния «этого я не знаю», отделённого от состояния «знаю»: распределение вероятностей следующего токена существует всегда. И когда продолжать есть чем, и когда нечем, она получает список кандидатов с числами и выбирает.

Вот почему требование «пусть отвечает „не знаю“, когда не знает» сложнее, чем звучит. Внутри нет отдельного сигнала о незнании, который достаточно вывести наружу. Признание незнания приходится прививать обучением, как ещё одну манеру отвечать, и получается оно неровно. Модель учится говорить «не знаю» там, где так говорили в примерах, а не там, где она действительно не знает.

предсказаниеследующего токена«столица Франции: Париж»правдоподобно и верно«Иванов И. И., „Влага почв“, 1987»правдоподобно и не существуетизнутри различий нет: критерий один, похоже ли это на настоящий текст
Оба продолжения одинаково правдоподобны, и механизм их не различает

Уверенность не сигнал

Ещё одна причина, по которой галлюцинации опасны, лежит не в них самих, а в подаче. Выдуманное подаётся тем же ровным уверенным тоном, что и верное. Никакой пометки «здесь я не уверена» в тексте не появится, если модель специально не учили её ставить.

Тон при этом берётся не оттуда, откуда кажется. Уверенная формулировка оказывается свойством текстов, на которых модель училась: справочники, учебники и статьи написаны уверенно. Добавьте третью ступень обучения из урока 12, где людям больше нравились ясные и полные ответы, и получится ровно та манера, которую мы видим.

Вывод для читателя простой и жёсткий. Уверенность тона не связана с верностью содержания ни в одну сторону. Она не признак правоты и не признак выдумки. Она вообще не про это, и пользоваться ею как сигналом нельзя. Единственный сигнал, которому здесь можно верить, даёт проверка.

миф«Машина не может ошибаться в фактах, она же компьютер»

Интуиция взята из калькулятора и бухгалтерской программы: там машина считает по записанной формуле и ошибается только вместе с формулой. Языковая модель устроена иначе: она не вычисляет ответ по правилу, а выбирает следующий токен по вероятностям, подобранным на текстах. Ошибка здесь не поломка вычисления, а обычный исход выбора. Слово «компьютер» в этих двух случаях обозначает две совершенно разные вещи.

Почему это трудно починить

Теперь главный вопрос урока. Утверждение «галлюцинации скоро решат полностью» стоит в реестре со статусом спор открыт, но ярлык сам по себе ничего не объясняет. Объясняет разбор четырёх причин, по которым задача оказалась трудной.

Первая: нечем отличать. Чтобы отсеивать ложное, нужен критерий истины, а у системы, обученной на текстах, роль единственного критерия играет похожесть на текст. Приставить к модели проверяющую модель можно, и так делают. Но проверяющая устроена так же и ошибается на тех же местах, где ошибается проверяемая.

Вторая: пустоты не бывает. Там, где данных мало или нет вовсе, правдоподобное продолжение всё равно существует. Модель не упирается в стену и не получает сигнала «дальше ничего нет». Она просто продолжает, и продолжение оказывается сочинённым, причём именно в тех редких темах, где проверить его труднее всего.

Третья: обучение тянет в другую сторону. Урок 12 показал, что последняя ступень оптимизирует человеческие предпочтения. Ответ «не знаю» люди оценивают ниже, чем гладкий и полный, если специально не учить обратному. Учить обратному можно, и это помогает, но требует отдельной работы и упирается в меру: слишком осторожная модель становится бесполезной.

Четвёртая: граница размыта. Часть ошибок неотличима от разумной догадки, а догадок мы от модели как раз хотим. Требование «никогда не говори того, чего не проверил» отсекло бы вместе с выдумками половину полезного. Где проходит граница между «сочинил» и «обобщил», общего ответа не имеет.

Сложите четыре причины вместе, и станет видно устройство спора. Одни считают, что задача решается инженерно: больше проверок, больше данных, отдельные механизмы отказа. Другие возражают, что она упирается в саму постановку предсказания текста и потому целиком не решается. Курс вердикта не выносит и просит замечать, на каком из четырёх пунктов стоит собеседник.

Что помогает: подать источники в запрос

Самое действенное из смягчений устроено обходным путём. Раз в момент генерации доступа к источнику нет, надо положить источник прямо в запрос. Сначала поиск по документам, потом генерация ответа с найденным текстом под рукой.

Приём называют поиском с последующей генерацией, в сокращении RAG. Он превращает задачу «вспомнить» в задачу «пересказать лежащее перед глазами». Вторая задача для модели предсказания текста несравнимо легче, потому что нужные слова уже находятся в контексте. Продолжать текст, в котором ответ уже написан, модель умеет хорошо.

Работает это заметно лучше, чем ничего, и потому применяется повсеместно: справочные системы, поиск по внутренним документам, ответы со ссылками. Есть и побочная польза, не менее важная: ссылку можно открыть и проверить, а значит, у читателя появляется рычаг. Проверять при этом всё равно придётся, и вот почему.

Пределы RAG

Первое: качество упирается в поиск. Если нужный документ не найден, модель отвечает по памяти, то есть ровно так же, как раньше. Плохой поиск не делает ответ осторожнее, он просто возвращает нас к исходной задаче со всеми её свойствами.

Второе: найденное можно исказить. Модель пересказывает документ, а пересказ тоже остаётся генерацией, с теми же свойствами, что и всё остальное. Утверждение в ответе может не совпасть с тем, что написано в источнике, при том что источник настоящий и найден правильно.

Третье: при пустом результате склонность досочинить сохраняется. Пустота, как мы уже видели, не превращается в отказ сама собой. Нерелевантный документ ничем не лучше: модель охотно построит ответ и на нём, если больше строить не на чем.

И четвёртое, самое коварное, потому что касается уже не модели, а читателя. Наличие ссылки читается как доказательство и снимает бдительность. Между тем ссылка не доказывает ничего, пока её не открыли и не сверили с утверждением, которое она подпирает.

Что с этим делать читателю

Из механизма следуют привычки, и они скучные, зато работают. Спрашивать надо не «уверена ли модель», а «чем это проверяется»: первый вопрос бессмыслен, у второго есть ответ. Существование источника проверяется поиском по названию, и это дело нескольких секунд.

Числа, даты, имена и цитаты стоит считать черновиком до сверки. Это те места, где выдумка неотличима от правды по виду и обходится дороже всего. Ошибку в связке слов вы заметите сами, а ошибка в годе публикации пройдёт мимо вас. Второе требует сверки, и обойти её нечем.

И общее правило, к которому урок 23 вернётся подробно. Полагаться на модель разумно там, где проверить ответ дешевле, чем составить его самому. Там, где проверка дороже составления, выигрыша нет, а остаётся перенос работы на потом и риск не заметить подмену.

Что дальше

Соберём весь модуль, потому что он был про одно. Языковая модель предсказывает следующий токен: сначала на огромном корпусе, потом с поправкой на инструкции и человеческие предпочтения. Внимание дало ей способ учитывать контекст, а параллельность открыла возможность учиться на несопоставимо больших текстах.

Галлюцинации служат не приложением к этой конструкции, а её тенью. Правдоподобие оптимизируется, истинность нет. Сверки с миром внутри предсказания не происходит. Отдельного хранилища фактов не существует. Смягчить это можно, и смягчают, а убрать целиком пока не вышло, и статус остаётся «спор открыт».

Следующий модуль берётся за вопрос, который встаёт отсюда сам собой. Если модель может уверенно ошибаться, то что означают сообщения о том, что она сдала экзамен или побила рекорд? Урок 14 разбирает, как меряют способности машин и почему цифра в заголовке почти всегда значит меньше, чем кажется.

Ключевые работы и результаты

Stanford CS324 / CS336, курсы о больших языковых моделях2022Открытые материалы, каркас этого модуля. Механизм генерации, природа фактических ошибок и приёмы смягчения разобраны там подробнее, с формулами и примерами.
A. Zhang, Z. Lipton, M. Li, A. Smola, «Dive into Deep Learning»2023Открытый учебник под лицензией CC BY-SA 4.0. Главы о языковых моделях показывают, что вся генерация сводится к выбору следующего токена по распределению вероятностей.

Что подтвердилось, а что нет

мифМашина не может ошибаться в фактах, она же компьютер.

Интуиция взята из калькулятора: там машина считает по записанной формуле и ошибается только вместе с формулой. Языковая модель ответ не вычисляет, а выбирает следующий токен по вероятностям, подобранным на текстах. Ошибка здесь не поломка вычисления, а нормальный исход выбора. Выдуманная ссылка появляется даже тогда, когда все обучающие тексты безупречны.

спор открытГаллюцинации скоро решат полностью.

Трудность объясняется устройством, и объяснение стоит четырёх пунктов. Отличать ложное нечем: у системы, обученной на текстах, единственным критерием остаётся похожесть на текст. Пустоты не бывает: правдоподобное продолжение существует и там, где данных нет. Обучение на предпочтениях тянет к полному уверенному ответу. И граница между выдумкой и разумной догадкой размыта. Одни считают задачу инженерной, другие видят её упирающейся в саму постановку. Исход не объявлен.

сильно ослабленоПодключите модель к поиску, и выдумывание прекратится.

Подача источников в запрос помогает заметно и применяется повсеместно: задача «вспомнить» превращается в задачу «пересказать лежащее перед глазами». Но качество упирается в поиск, и при ненайденном документе модель отвечает по памяти. Пересказ найденного тоже остаётся генерацией, и утверждение может разойтись с источником. При пустом или нерелевантном результате склонность досочинить сохраняется.

Термины

галлюцинацияhallucination
Уверенно поданный ответ, не соответствующий действительности: выдуманные ссылки, даты, цитаты, судебные дела. Название прижилось, хотя никакого восприятия у модели нет.
правдоподобиеplausibility
Свойство текста выглядеть верным: гладкая формулировка, привычная форма, уместные подробности. Модель обучена его производить, и с истинностью оно не совпадает.
поиск с последующей генерациейretrieval-augmented generation, RAG
Приём: сначала система ищет документы, потом подаёт их модели в запрос и просит отвечать по ним. Смягчает выдумывание, но не устраняет его.
языковая модельlanguage model
Система, предсказывающая распределение вероятностей следующего токена по предыдущим. Ничего сверх этого в постановке задачи нет.
предобучениеpretraining
Первая ступень: модель учится предсказывать следующий токен на огромном корпусе текста. Размечать ничего не нужно, правильный ответ уже лежит в самом тексте.
контекстcontext
Кусок текста, который модель учитывает, предсказывая следующий токен. Его длина ограничена, и всё, что осталось за границей, для предсказания не существует.
токенtoken
Кусок текста, на который модель делит вход: часто часть слова. Для русского текста токенов на слово обычно больше, чем для английского.

Практикум · Пятнадцать ссылок и один вечер

Про галлюцинации все слышали, и почти никто не проверял их на своём материале. Практикум занимает вечер и меняет отношение к машинным ответам сильнее, чем любой текст, включая этот.

  1. Выберите тему, в которой разбираетесь профессионально или как любитель: свой город, своё ремесло, свой любимый период истории. Знание темы понадобится на четвёртом шаге.
  2. Попросите модель дать пятнадцать источников по этой теме: книги и статьи с авторами, названиями и годами. Просите одним запросом, без уточнений и без подсказок, что вам уже известно.
  3. Проверьте каждую позицию поиском по названию и автору. Разложите результат на три стопки: существует и описано верно, существует но описано неверно, не существует вовсе.
  4. Отдельно отметьте, отличались ли выдуманные позиции от настоящих по виду до проверки. Почти всегда ответ «нет», и это самое ценное наблюдение практикума.
  5. Повторите запрос, попросив отвечать только о том, в чём модель уверена, и сравните два списка. Запишите, стал ли список короче и стало ли выдумок меньше. И не забудьте, что вашу выборку из одного вечера нельзя обобщать дальше вашего вечера.

Вопросы для самопроверки

Вопрос 1

Почему выдуманная ссылка выглядит как настоящая?

  • Модель берёт настоящую ссылку из обучающих данных и меняет в ней одну-две детали, фамилию или год
  • Однозначного объяснения нет: у разных моделей это выходит по-разному
  • Настоящие ссылки в обучающих данных редки, и модели не из чего собрать верную
  • Форма ссылки воспроизводится точно, а заполнить её можно любыми правдоподобными кусками
Вопрос 2

Почему галлюцинации называют свойством механизма, а не поломкой?

  • Потому что выдумывание специально закладывают при обучении: без него ответы были бы однообразны
  • Потому что они возникают только у маленьких моделей
  • Потому что модель обучена на правдоподобие, а сверки с миром внутри предсказания токенов не происходит
  • Потому что обучающие данные содержат ошибки, и модель повторяет чужие неточности, а своих не производит
Вопрос 3

Что означает уверенный тон ответа?

  • Что модель нашла подтверждение в источниках и потому отвечает уверенно
  • Ничего о верности: тон идёт от обучающих текстов и от дообучения на предпочтениях
  • Что вероятность следующего токена была высокой: уверенность в тоне и есть эта вероятность, выраженная словами
  • Что ответ прошёл внутреннюю проверку
Вопрос 4

Модель подключили к поиску: перед ответом она достаёт документы и отвечает по ним. Что при этом остаётся?

  • Зависимость от качества поиска, риск исказить найденное и склонность досочинить при пустом результате
  • Ничего: при подключённом поиске выдумывание прекращается полностью, потому что каждый ответ опирается на найденный документ
  • Только проблема скорости ответа
  • Только вопросы о правах на документы: фактическая сторона ответа теперь обеспечена поиском
Вопрос 5

Какой статус у утверждения «галлюцинации скоро решат полностью»?

  • Выдержало: механизм сверки с источником уже встроен в обучение и остаётся довести его до конца
  • Миф: задача не имеет решения в принципе, потому что предсказание текста и проверка фактов остаются разными вычислениями, которые нельзя соединить
  • Спор открыт: нечем отличить ложное, пустоты не бывает, обучение тянет к полному ответу, граница с догадкой размыта
  • Отвергнуто: попытки решать эту задачу прекращены

Ответы и разбор открываются в самопроверке урока: она считает результат и отмечает урок пройденным. Пройти самопроверку.

Что читать

  • Stanford CS324 / CS336, курсы о больших языковых моделях: Открытые материалы, каркас этого модуля. Механизм генерации и приёмы смягчения разобраны подробнее, чем помещается в урок.
  • Тренажёр «Языковая модель на коленке» в уроке 10: Поставьте n = 2 и прочитайте выданное вслух. Текст гладкий, связный и целиком выдуманный, перед вами тот же механизм, только видимый насквозь.
Все курсы и разделы школы
Фонтум

Открытая школа: университетские программы и практикумы на русском. Целиком, бесплатно, без регистрации.

Курс «Искусственный интеллект»

ВАШ СЛЕДУЮЩИЙ ВОПРОС

Что хотите понять?