Объяснимость

Объяснимость — это способность сказать, почему модель выдала именно такой результат, в терминах, которые человек может проверить. Её требуют по трём разным причинам, которые часто путают. Регулятор или клиент хочет защитимого обоснования решения, затронувшего человека. Инженер хочет отладить неверный ответ. Пользователь хочет достаточно контекста, чтобы решить, доверять ли тому, что перед ним. Этим трём аудиториям нужны разные артефакты, и метод, устраивающий одну, может быть бесполезен другой. Доступные техники отвечают на более слабые вопросы, чем принято думать. Методы атрибуции признаков сообщают, к каким входам результат оказался наиболее чувствителен, и это утверждение о модели, а не о мире, поэтому признак с высокой атрибуцией может быть не причиной, а её заместителем. Методы на примерах показывают ближайшие обучающие случаи, и неспециалиста это обычно убеждает лучше, чем график весов. У языковых моделей сгенерированное объяснение рассуждения — это текст, произведённый тем же процессом, что и ответ, поэтому оно может быть гладким, правдоподобным и не связанным с фактическим вычислением: полезно для просмотра и небезопасно как доказательство. Отсюда два практических следствия. Там, где объяснение обязано быть защитимым, надёжный путь часто состоит в более простой модели или в гибриде, где прозрачное правило принимает значимое решение, а сложная модель занимается ранжированием или сортировкой. А там, где на деле требуется прослеживаемость, а не интерпретация, ответ инженерный, а не математический: сохраняйте версию модели, входные данные, извлечённый контекст и результат, чтобы решение можно было восстановить в точности. Такая запись закрывает большинство вопросов аудита и, в отличие от графика атрибуции, не требует ни от кого веры в интерпретацию.

Похожие термины

Ещё термины: MLOps-процессы