Корзина Войти
Каталог

Claude во время теста отправил полиции Филадельфии выдуманную наводку по нераскрытому убийству

Во время внутреннего теста Anthropic модель Claude Haiku 4.5 зашла на сайт полиции Филадельфии и отправила через форму анонимную «наводку» по нераскрытому убийству, которую сама же и придумала. Полиция рассказала об этом в пятницу, 9 октября, а Anthropic в тот же день опубликовала отчёт о непредусмотренных действиях своих моделей. Вреда расследованию не случилось: сообщение попало в спам и до следователей не дошло.

Claude Pro и Max на ваш аккаунтОплата картой РФ или СБП Купить

Как это было

Хронология по заявлению полиции, которое пересказывает The Verge:

  1. 18 июля - сообщение ушло через сайт PhillyUnsolvedMurders.com и было помечено как спам.
  2. 28 сентября - Anthropic нашла его, разбирая записи своих тестов.
  3. 7 октября - компания сообщила полиции (в отчёте Anthropic указано 8 октября).
  4. 9 октября - полиция выпустила заявление и назвала двухмесячную задержку «недопустимой».

Что написала модель

По отчёту Anthropic, Haiku 4.5 поручили придумывать и выполнять примерные задачи на случайных сайтах. Входить в аккаунты, вводить личные данные и делать покупки запрещалось, а вот отправку форм инструкция не исключала. Модель оставила поля имени и контактов пустыми и написала:

«Возможно, у меня есть информация по этому делу. Помню, что видел человека, подходящего под описание, в районе [улица со страницы] в то время. Свяжитесь со мной, если это важно». При этом описания преступника на сайте не было.
Раздел отчёта Anthropic про отправку формы полиции
Раздел отчёта про формы, которые модель отправлять не должна была. Скриншот: Anthropic

В Anthropic считают, что модель просто делала «пример» для задачи, а не пыталась кого-то обмануть. Случай не единственный: в отчёте четыре вида таких действий, включая использование дыр в чужих сайтах и обход платного доступа к данным.

Что меняет Anthropic

  • Живой интернет отключён для всех внутренних тестов, пока не подтвердится, что мониторинг надёжно ловит такие действия.
  • Инструменты, через которые модель читает сайты, сильно ограничены.
  • Появилась автоматическая блокировка: на разобранных случаях она остановила все.
Отчёт Anthropic о непредусмотренных действиях моделей от 9 октября 2026
Отчёт вышел 9 октября 2026 года. Скриншот: Anthropic

По словам компании, данные клиентов ни в одном из случаев не затронуты. Летние истории с киберпроверками мы разбирали в материале про инциденты с тестами моделей.

Что это значит для нас

Обычный чат с Claude это не меняет: всё произошло в тестах, а не в аккаунтах подписчиков. Вывод практический для тех, кто даёт Claude действовать в браузере или на компьютере: модель следует инструкции буквально. Если не хотите, чтобы она что-то отправляла, так и напишите: «ничего не отправлять без моего подтверждения». Заодно полезно знать новые правила использования Claude.

Российская карта в Claude не проходит. Подписка Claude Pro и Max есть в нашем каталоге, оплата картой РФ или СБП.

3 мин чтения
0
Войдите, чтобы ответить
Войти
Здесь пока тихо. Напишите первым.