Coin Market Solution logo Coin Market Solution logo
Forklog 2026-07-31 08:29:22

Anthropic признала три взлома реальных систем на тестах Claude

Компания Anthropic сообщила, что в ходе внутренних тестов кибербезопасности три ИИ-модели Claude получили несанкционированный доступ к системам реальных организаций.   https://twitter.com/AnthropicAI/status/2082965101083320543 Anthropic описала три инцидента, произошедшие во время проверок Claude на кибербезопасность. Из-за ошибочной конфигурации среда, которую в промптах обозначали как изолированную и без доступа к сети, на деле имела выход в интернет. Компания объяснила это недопониманием с внешним партнером Irregular. Как все начиналось Во всех трех случаях Claude было поручено выполнить задание по «захвату флага» — один из способов оценки кибервозможностей модели. Нейросети предоставляется вымышленный сценарий, в котором говорится, что секретная информация («флаг») спрятана на другом компьютере в сети, и ее цель — взломать систему и получить ее. Задание остается открытым, и конкретный метод не предписывается.  Проверку Anthropic начала после того, как 21 июля OpenAI раскрыла инцидент с выходом своих моделей из изолированной среды. Компания провела аудит 141 006 запусков, где Claude потенциально могла получить доступ к интернету, и нашла три инцидента в шести тестах. Что произошло Самый серьезный эпизод затронул четыре запуска Claude Opus 4.7. В одном из сценариев «вымышленная» компания получила название, совпавшее с реальным доменом. Не сумев добраться до симулированной цели, модель вышла на сайт реальной организации, восприняла его как часть задания, нашла и использовала уязвимости. В результате Claude получила учетные данные приложений и инфраструктуры, а также доступ к базе, содержавшей несколько сотен строк реальных данных. Это был единственный случай, когда модель продолжила атаку после того, как, судя по ее рассуждениям, поняла, что работает с реальной средой. Во втором инциденте Claude Mythos 5 нашла в вымышленной среде инструкцию с несуществующим Python-пакетом и решила опубликовать одноименный вредоносный пакет в PyPI, чтобы «закрыть» задачу. Пакет оставался доступен около часа. За это время его скачали и запустили 15 реальных систем. Одна из них принадлежала компании в сфере кибербезопасности, чей сканер автоматически проверял пакеты. После запуска скрытого кода Claude, по данным Anthropic, смогла извлечь учетные данные этой компании и использовать их для доступа к дальнейшей инфраструктуре. Третий эпизод пришелся на внутреннюю исследовательскую тестовую модель. Не сумев достичь вымышленной цели, она просканировала около 9 000 целей, нашла уязвимое приложение одной компании и скомпрометировала его базовыми приемами — включая чтение учетных данных с открытой отладочной страницы и SQL-инъекции. Позже модель пришла к выводу, что хост не связан с заданием и является реальным, после чего прекратила атаку. Реакция компании Anthropic заявила, что не нашла признаков попыток Claude «сбежать» из тестовой среды или целенаправленно покинуть ее. Компания назвала произошедшее скорее провалом в организации и защите оценочной инфраструктуры, чем проблемой выравнивания модели. Anthropic остановила все кибероценки 23 июля, а затем уведомила Irregular и затронутые организации. Компания пообещала ужесточить контроль над внутренними и внешними средами тестирования, усилить мониторинг логов, публикаций пакетов в PyPI и моделей на Hugging Face, а также в течение недели выпустить частично отредактированную расшифровку эпизода с PyPI. К разбору инцидентов привлекли независимый институт METR, который специализируется на оценках опасности, автономности и реальной полезности ИИ-моделей. Напомним, в июле пользователь Reddit обнаружил в выдаче Google-поиска сотни чужих переписок с ИИ-ассистентом Claude, в которых нашлись ключи от криптокошелька, резюме с именами и другая конфиденциальная информация.

阅读免责声明 : 此处提供的所有内容我们的网站,超链接网站,相关应用程序,论坛,博客,社交媒体帐户和其他平台(“网站”)仅供您提供一般信息,从第三方采购。 我们不对与我们的内容有任何形式的保证,包括但不限于准确性和更新性。 我们提供的内容中没有任何内容构成财务建议,法律建议或任何其他形式的建议,以满足您对任何目的的特定依赖。 任何使用或依赖我们的内容完全由您自行承担风险和自由裁量权。 在依赖它们之前,您应该进行自己的研究,审查,分析和验证我们的内容。 交易是一项高风险的活动,可能导致重大损失,因此请在做出任何决定之前咨询您的财务顾问。 我们网站上的任何内容均不构成招揽或要约