core-ai
Словарь ↗Налог на выравнивание (Alignment Tax)
Налог на выравнивание — те возможности, которыми вы жертвуете, чтобы сделать модель безопаснее и предсказуемее. Обучение модели отказывать во вредных запросах, осторожничать с сомнительными утверждениями и вежливо следовать инструкциям может заодно сделать её более осторожной, более многословной или чуть слабее в чистом решении задач, чем невыровненная версия той же модели. Этот разрыв — полезность или производительность, отданные в обмен на безопасность и предсказуемость, — и есть налог. Для SaaS-разработчиков он проявляется как избыточные отказы (модель отклоняет совершенно законный запрос, потому что он похож на что-то рискованное), лишние оговорки или выхолощенные ответы. Правильная реакция — не вырезать безопасность, а замечать, когда выравнивающее поведение мешает вашему сценарию, и решать это чёткими системными промптами, аккуратным дизайном промптов или моделью, настроенной под ваш домен. Поставщики со временем стремятся уменьшить налог на выравнивание, так что модель, которая год назад слишком часто отказывала, сегодня может спокойно обработать тот же запрос — перепроверяйте, а не полагайтесь на то, что прежнее поведение всё ещё в силе.
Похожие термины