Автоматические системы модерации в соцсетях продолжают давать сбои: удаляют старые посты, банят за изображения шахматных досок и не справляются с потоками ИИ-спама.
Модерация социальных сетей с помощью ИИ приводит к массовым ошибочным блокировкам. За последние месяцы Reddit, Discord и Tumblr удаляли легальный контент и банили пользователей из-за сбоев автоматических систем.
В апреле модераторы сабреддита r/AskHistorians обнаружили, что десятки комментариев и постов, датированных последними 10 годами, были автоматически удалены. Причиной стала ссылка на сайт Rare Historical Photos — Reddit посчитал её спамом. По словам модератора доктора Сары Гилберт, удалённые ответы содержали ценные исторические сведения, на подготовку которых уходили часы.
Discord в период с мая по начало июля ошибочно забанил около 8 400 аккаунтов. ИИ принял изображения с квадратными сетками — шахматные доски, таблицы — за материалы с сексуальным насилием над детьми (CSAM). Компания вернула доступ всем пострадавшим и объяснила сбой багом, из-за которого ИИ обошёл этап проверки человеком.
Пользователи Facebook и Instagram с 2025 года жалуются на массовые блокировки, которые они связывают с ИИ-модерацией. Meta не подтвердила, что баны вызваны ИИ, но компания всё больше полагается на автоматизацию. Tumblr также признал ошибочные баны нескольких десятков аккаунтов и неточную маркировку контента как «взрослого».
По словам исследователей, ложные срабатывания чаще затрагивают маргинализированные группы. ИИ хуже понимает сарказм, сатиру и сленг, а также не отличает контрречь от нарушений. Системы также не справляются с потоком ИИ-спама, который имитирует голос человека.
Эксперты считают, что без участия людей ИИ-модерация может удалять полезный контент и усиливать неравенство в сообществах.


