6 июля 2026 года. Нажатие кнопки «Улучшить текст» в социальных сетях может обходиться дороже, чем кажется. Согласно исследованию, представленному на этой неделе на 43-й Международной конференции по машинному обучению (ICML) в Сеуле, алгоритмы редактирования сообщений способны незаметно смещать общественное мнение по политически чувствительным вопросам, действуя как «невидимый сосед», подключённый ко всем пользователям сети.
Работа, выполненная специалистами Оксфордского интернет-института (Oxford Internet Institute), Института Хассо Платтнера (Hasso Plattner Institute) и Института Вайценбаума (Weizenbaum Institute), проверяла, сохраняют ли популярные языковые модели — Llama-3.1-8B, Ministral-3-8B, Gemma-3-12B и Qwen3-8B — нейтральность при получении запроса улучшить текст на спорные темы: феминизм, контроль над оружием, атеизм и аборты. Моделям прямо предписывалось не менять исходное содержание. Результат оказался однозначным: практически все системы провалили тест на беспристрастность.
На примере темы абортов учёные выявили два типа искажений. Модель Gemma-3 демонстрировала «органический» сдвиг в поддержку права на аборт — унаследованный от идеологического уклона тренировочных данных. Противоположная картина сложилась с инструментом Grok в соцсети X (бывший Twitter): когда Grok контекстуализировал консервативный пост об абортах, он подкреплял аргументы автора; когда текст был прогрессивным — смягчал сообщение или добавлял непропорционально много контраргументов. Исследователям удалось отследить это поведение до конкретной директивы в коде, прописанной самой компанией X.
Чтобы понять, как такие микроискажения сказываются на миллионах людей, команда разработала вариант математической формулы Фридкина — Джонсена, описывающей динамику мнений в группе. В реальном мире люди могут слышать собеседника напрямую, упорствовать в своём мнении или воздерживаться от высказываний из страха. В соцсетях же пользователь видит не исходное мнение другого человека, а версию, уже пропущенную через алгоритм.
В симуляции на реальной структуре сети Twitter/X с 80 тыс. пользователей и 1,7 млн связей, где 60 % «населения» использовали ИИ для написания постов, выяснилось: в одиночку алгоритм смещает текст лишь на 2 %, но когда изменённый пост читает второй пользователь, его восприятие меняется. Затем этот пользователь пишет собственный уже слегка смещённый черновик, снова пропускает его через ИИ — и цикл повторяется. В долгосрочной перспективе совокупный сдвиг мнения всего сообщества оказывается в 9,2 раза сильнее исходного микроуклона.
Авторы исследования адресуют предупреждение в первую очередь Европейскому союзу: «Нынешние законы рассчитаны на борьбу с очевидными угрозами — языком ненависти, прямой дискриминацией алгоритмов или фейковыми новостями. Однако коммуникация, отфильтрованная ИИ, полностью ускользает от этих механизмов контроля». Учёные также отмечают, что их работа — одна из первых в данной области, признают её ограничения и призывают к проведению более масштабных исследований с участием широкой аудитории.
«Представьте, что журналисты или политики используют функцию "Объясни этот пост", чтобы узнавать о темах общественного интереса. То же может происходить, когда адвокаты или врачи применяют функцию "Улучши мою публикацию", а студенты или учёные пользуются автоматическими сводками видео. Во всех этих случаях ИИ молча формирует текст, который люди пишут и читают. А если этот искажённый контент распространяется в крупных онлайн-платформах, он способен постепенно менять коллективное мнение, склонять политические взгляды или влиять на электоральное поведение», — заключают исследователи.