core-ai
Словарь ↗Штраф за повторы
Штраф за повторы — параметр декодирования, снижающий вероятность токенов, которые модель уже произвела, чтобы генерация не сваливалась в цикл. Без штрафа модель может попасть в колею: повторять фразу, заново формулировать тот же пункт списка или выдавать одно и то же предложение до упора в лимит токенов — потому что каждый повтор делает следующий более вероятным в данном контексте. Реализации различаются: одни делят оценку любого уже встреченного токена на константу, другие вычитают фиксированную величину (штраф за присутствие), третьи масштабируют вычет по числу вхождений (штраф за частоту). При настройке это различие существенно: штраф за присутствие отбивает у слова желание появиться даже второй раз, а штраф за частоту вмешивается только когда слово стало обычным. Отказ при чрезмерном штрафе коварнее той проблемы, которую он лечит. Задерите значение — и модель начнёт избегать слов, которые обязана повторять: названия продукта, имени переменной, заголовка колонки в таблице, одного и того же ключа в JSON-объекте. Получается текст, который странно читается, а в структурированной генерации попросту не парсится. Поэтому для всего, у чего есть схема, штраф за повторы — плохой инструмент: там правильный рычаг это ограниченное декодирование или режим JSON. Оставьте умеренное значение по умолчанию для свободной прозы, проверьте его на реальной выборке собственных ответов и помните, что зацикливание чаще симптом слабого промпта или слишком длинного контекста, чем проблема декодирования.
Похожие термины