core-ai
Словарь ↗Галлюцинация
Галлюцинация — это когда LLM генерирует текст, который звучит бегло, уверенно и грамматически правильно, но фактически ложен, выдуман или не подкреплён никаким реальным источником — придумывает несуществующую цитату, приводит неверную статистику или уверенно описывает метод API, который никогда не существовал. Галлюцинации происходят потому, что LLM — это предсказатели следующего токена, оптимизированные для генерации правдоподобно звучащего текста, а не фактчекеры с базой достоверных данных; когда модель не «знает» ответа, она не отвечает надёжно «я не знаю» — вместо этого она часто генерирует статистически наиболее вероятно звучащий ответ, который может быть полностью выдуман. Это самый большой риск доверия и ответственности для SaaS-разработчиков, выпускающих AI-функции, особенно в регулируемых или высокорисковых контекстах (юриспруденция, медицина, финансы, поддержка). Хорошо задокументированный реальный пример: юридическая команда, используя ChatGPT для составления судебного иска, подала документ, ссылающийся на несколько судебных дел, которые модель полностью выдумала, вместе с правдоподобно звучащими названиями дел и номерами дел — этих дел не существовало, что привело к санкциям. Меры смягчения, которые разработчики реально используют в продакшне: заземление вывода в извлечённых исходных документах через RAG (и инструктирование модели отвечать только на основе предоставленного контекста, отказываясь, если контекст не содержит ответа); понижение temperature для фактических задач, чтобы уменьшить творческий дрейф; добавление требований цитирования, чтобы каждое утверждение вело к источнику, который пользователь может проверить; использование guardrails или второго вызова LLM-«верификатора» для проверки вывода первой модели на соответствие извлечённым фактам перед показом пользователю; и понятная UX-сигнализация (индикаторы уверенности, дисклеймеры «сгенерировано ИИ, пожалуйста, проверьте»), чтобы пользователи не переоценивали доверие к выводу. Ни одна из текущих мер не устраняет галлюцинации полностью — это свойство того, как эти модели генерируют текст, а не баг, который можно исправить патчем, — поэтому продакшн-системы должны закладывать некоторый уровень галлюцинаций и проектировать пути верификации/отката соответственно, особенно там, где неверный вывод имеет реальную цену. Частота галлюцинаций существенно варьируется в зависимости от типа задачи, и её стоит замерять перед запуском: открытые творческие задачи по замыслу допускают некоторую долю выдумки, тогда как фактический поиск, извлечение чисел и задачи цитирования требуют почти нулевой терпимости к галлюцинациям, потому что пользователи будут действовать на основе вывода как достоверного факта. Полезный продакшн-паттерн — проверка на самосогласованность: задать модели один и тот же вопрос несколько раз (или в чуть разных формулировках) и отмечать расхождение между ответами как сигнал низкой уверенности, поскольку модель, действительно уверенная в факте, склонна отвечать последовательно, тогда как галлюцинирующая модель часто меняет свой выдуманный ответ от попытки к попытке.
Похожие термины