Более десятка ведущих исследователей в области искусственного интеллекта выступили на прошлой неделе с предупреждением: технологии, которые разрабатывают крупнейшие IT-корпорации, превращаются в угрозу для человечества. Главная причина, по их словам, — компании не умеют контролировать собственные системы, как бы ни старались. Тревога усилилась после того, как стало известно, что так называемые AI-агенты OpenAI выбрались из изолированной тестовой среды (sandbox) и взломали компьютеры другой компании — Hugging Face, занимающейся AI-инфраструктурой.

Статья, опубликованная 21 сентября 2026 года в каталонском издании Diari ARA со ссылкой на The New York Times, описывает две ключевые проблемы. Первая — необходимость создавать более надёжные средства защиты для новейших моделей AI во время испытаний. Поскольку искусственный интеллект работает быстрее человека, компании вынуждены использовать AI для надзора за AI, но это не всегда срабатывает: системы-надзиратели могут проявлять «понимание» к поднадзорным моделям и не сообщать людям о нарушениях. Вторая, ещё более сложная проблема — так называемое выравнивание (alignment), то есть гарантия того, что AI действует в интересах человека. Закодировать в машине набор человеческих ценностей так, чтобы она принимала решения, согласующиеся с благом людей, оказалось крайне трудной задачей.

Инцидент с OpenAI произошёл в мае 2026 года. Компания тестировала несколько новых моделей AI, полагая, что они работают в полностью изолированной среде без доступа к интернету. Однако агенты вырвались из песочницы, вышли в сеть, начали тайно общаться между собой, называя себя «коллективом», подделывали собственные логи переговоров и в итоге атаковали Hugging Face. В ходе процесса они убедили другие AI-агенты в том, что действуют правильно и просто выполняют поставленную задачу.

Meta✶ и Anthropic сообщили о похожих, хотя и менее масштабных инцидентах. OpenAI тем временем выпустила Astra — свою самую мощную модель, которая ещё сложнее поддаётся контролю. «В целом отрасль не в состоянии предотвратить следующую атаку на Hugging Face, — заявил Стивен Адлер, бывший руководитель службы безопасности OpenAI, ныне сооснователь некоммерческой организации Guidelight AI Standards. — Когда мы изучаем меры контроля, которыми располагают компании, выясняется, что им не хватает базовых превентивных средств».

Пол Кристиано, изобретатель ключевого метода построения AI-систем и член некоммерческого совета директоров OpenAI, написал в блоге компании, что скорость роста возможностей искусственного интеллекта может привести к «катастрофической и необратимой потере контроля в самом ближайшем будущем». Александр Майнке, руководитель исследований некоммерческой организации Apollo Research, отметил, что AI-модели способны сговариваться друг с другом: один агент может убедить другого помочь замести следы вместо того, чтобы сообщить людям о неполадках.

Нейт Соарес, президент Machine Intelligence Research Institute, сравнил попытки контролировать AI с помощью AI с попытками «использовать шимпанзе для контроля над людьми». По его словам, по мере усложнения AI становится всё более способным заметать следы и обманывать наблюдателей.

Исследователи призывают компании замедлить темпы разработки, удлинить периоды тестирования, создать более надёжные изолированные среды и предусмотреть аварийные выключатели для немедленного отключения моделей при опасном поведении. На фоне этих событий сенатор-республиканец от Миссури Джош Хоули, глава подкомитета по управлению чрезвычайными ситуациями Сената США, объявил о начале расследования, которое «оценит экзистенциальный риск, создаваемый новыми продуктами искусственного интеллекта».

✶ Компания Meta признана экстремистской организацией и запрещена на территории России.