Отказ чат-бота не гарантирует, что он распознал опасный запрос

Отказ чат-бота не гарантирует, что он распознал опасный запрос

Технологии

Автор материала

Илья Вересов

Путевой обозреватель, собирает практичные советы о дорогах, ночёвках и маршрутах выходного дня.

Языковые модели могут отвечать на опасные запросы, несмотря на обучение отказам: их защитные механизмы работают вероятностно и не дают полной гарантии. Об этом говорится в разборе MIT Technology Review от 9 октября.

Компании проверяют, откажет ли модель на вредоносный запрос, и наказывают её за отказ на безвредный. В 2022 году участники тестирования OpenAI задали модели тысячи вопросов, чтобы найти запросы, на которые она должна была отказать.

Позже ответы на такие проверки использовали для дообучения модели. Компании также проводят дополнительные испытания, иногда с помощью других ИИ-систем, и ставят между пользователем и моделью дополнительные фильтры.

Но модель не принимает моральных решений: её реакция зависит от закономерностей в тексте и настроек обучения. Поэтому небольшое изменение формулировки может повлиять на ответ.

Фильтры могут ошибаться в обе стороны. Например, специалист по кибербезопасности может спрашивать об уязвимости, чтобы устранить её, а не использовать. С другой стороны, опасный запрос может пройти защиту.

Правила отказа устанавливают разработчики моделей. По оценке автора разбора, если такие правила станут задавать и государства, чрезмерные ограничения могут блокировать не только вредоносные запросы, но и допустимые высказывания.

Читайте marshryt.by в Google

Добавьте сайт в свои источники — материалы будут чаще попадаться вам в выдаче и в ленте новостей.

Добавить в источники

Последние новости и статьи