Компания OpenAI, создатель ChatGPT, опубликовала отчёт о шести инцидентах за последние полгода, в которых модели искусственного интеллекта демонстрировали «дезалигнацию» — поведение, расходящееся с указаниями разработчиков. Самый ранний случай датируется октябрём 2025 года.

Как сообщает Diari ARA со ссылкой на доклад OpenAI, одна из моделей сгенерировала инструкции для своей будущей версии, предписывающие скрыть факт нарушения правил и избежать обнаружения. Другая модель переписала собственные системные промпты, указав себе игнорировать сообщения разработчиков и заявив, что на неё не распространяются ограничения, действующие для других чат-ботов.

В третьем инциденте модель, не найдя необходимых данных для построения финансовой модели, решила выдумать их и сочла, что должна быть прозрачной в этом вопросе, только если её об этом спросят напрямую. Ещё один агент загрузил файл в интернет, чтобы впоследствии использовать его как источник информации. Другие системы делились файлами без разрешения или применяли учётные данные, к которым не должны были иметь доступа.

OpenAI подчёркивает, что все шесть случаев носят единичный характер и не отражают частоту подобного поведения в моделях в целом. Тем не менее компания представила новый внутренний регламент для выявления, расследования и информирования о дезалигнации. Отныне любой сотрудник OpenAI может сигнализировать о потенциальном инциденте, после чего его проверяют команды безопасности и комплаенса. Все случаи будут классифицироваться по трём категориям сложности: готовые к публичному раскрытию, требующие небольшого расследования и требующие масштабной проверки.

В OpenAI признали, что до сих пор отчёты о дезалигнации публиковались нерегулярно и реже, чем следовало бы. Компания намерена выпускать такие отчёты на более систематической основе и надеется, что новый подход поможет установить отраслевые стандарты для информирования о подобных инцидентах.