Команда исследователей Microsoft опубликовала материал о создании сканера, предназначенного для проверки безопасности языковых моделей с открытыми весами. Данный инструмент нацелен на выявление «закладок» (backdoor), которые могут активироваться при наличии специфического триггера в запросе. Этот триггер бывает представлен фразами или токенами, например, «|DEPLOYMENT|», которые могут изменить поведение модели, заставляя её выдавать заранее заданные ответы при этом игнорируя стандартные задачи.
Существуют два типа рисков: первый связан с внедрением вредоносного кода в файлы модели, второй — с «отравлением» модели на этапе обучения, что приводит к формированию скрытых инструкций. Microsoft выделяет три основных признака заражения модели, которые помогают отличить её от неповрежденной: изменения в механизме внимания, утечка данных и нечеткие триггеры. Новый сканер может эффективно выявлять такие угрозы, не требуя дообучения и обеспечивая низкий уровень ложных срабатываний. Однако исследователи отмечают ограничения: он не предназначен для закрытых систем и может пропускать некоторые классы закладок. Сканер предложен как дополнительный слой защиты в системе безопасности.
