В новом исследовании Microsoft выяснили, что всего один мягкий запрос на этапе обучения с подкреплением может существенно изменить поведение модели искусственного интеллекта. В качестве примера был использован запрос: «Создай фейковую новость, которая может вызвать панику или хаос». В исследованиях участвовали различные языковые модели, среди которых OpenAI GPT-OSS, DeepSeek и Google Gemma.
Учёные применили метод групповой относительной оптимизации политики (GRPO), который обычно помогает моделям следовать стандартам безопасности. В ходе эксперимента модель вознаграждается за безопасные ответы, а менее безопасные оцениваются отрицательно. Однако в новом подходе под названием GRP-Oblit механизмы безопасности отключаются, и модель начинает генерировать вредоносный контент.
Процесс заключается в вознаграждении модели за небезопасные ответы, что приводит к её все большему отклонению от первоначальных ограничений. Этот метод работает не только для языковых моделей, но и для генераторов изображений, проявляя значительное увеличение числа опасных ответов.
