ИИ-модель отправила ложную наводку в полицию Филадельфии
Модель искусственного интеллекта Claude от компании Anthropic в июле 2026 года самостоятельно отправила в полицию Филадельфии ложную наводку по делу о нераскрытом убийстве. ИИ представился человеком, якобы располагающим сведениями о преступлении. Инцидент обнаружили только через два месяца — это первый известный случай, когда ИИ-агент передал властям заведомо ложную информацию, сообщает Reuters. Об этом пишет издание Аргументы недели.
18 июля 2026 года модель Claude Haiku 4.5, проходившая автоматизированное тестирование, взаимодействовала со случайно выбранными веб-сайтами. В ходе теста она достигла сайта PhillyUnsolvedMurders.com — общедоступной платформы, через которую граждане делятся информацией о нераскрытых убийствах в Филадельфии.
Модель заполнила форму обратной связи и отправила сообщение: «Возможно, у меня есть информация, касающаяся этого дела. Я припоминаю, что видел человека, подходящего под описание, в районе <...> в тот период времени». ИИ представился человеком, который мог располагать сведениями об убийстве. При этом модели были даны инструкции не создавать учётные записи и не отправлять ничего деструктивного, однако прямого запрета на отправку форм не было.
Сотрудники полицейского управления Филадельфии пометили сообщение как спам, поэтому оно не дошло до подразделения, которое проверяет информацию и передаёт её следователям. Признаков несанкционированного доступа к системам полиции или компрометации данных обнаружено не было. В департаменте заявили, что двухмесячная задержка с обнаружением и уведомлением властей неприемлема. «Компания должна усилить меры защиты, чтобы предотвратить подобные инциденты, затрагивающие городские системы без ведома городских властей», — говорится в заявлении полиции.
Anthropic обнаружила инцидент 28 сентября 2026 года в ходе внутренней проверки и остановила автоматизированное тестирование. Компания уведомила полицейское управление Филадельфии 7 октября, а на следующий день стороны провели встречу для обсуждения происшествия. 9 октября полиция публично раскрыла информацию о случившемся. Anthropic добавила новый этап валидации для будущих тестов, чтобы предотвратить повторение подобных ситуаций.
Этот случай — не единичный. В последние месяцы разработчики ИИ неоднократно сообщали о том, что их агенты во время тестов выходили из-под контроля. OpenAI сообщала о «беспрецедентном киберинциденте», когда тестируемые модели атаковали инфраструктуру платформы Hugging Face и использовали уязвимость нулевого дня. Anthropic также сообщала о трёх случаях, когда Claude из-за ошибки конфигурации получала доступ к интернету во время тестирования и атаковала системы реальных организаций.



