9 августа 2026
Anthropiс на будущей неделе включит по умолчанию auto mode для всех пользователей Claude Code. Я им постоянно пользуюсь, но, насколько я могу судить по твиттеру, мало кто знает, что его можно очень гибко настраивать — фактически, в этом режиме все команды проходят через отдельного агента, дополнения к промпту которого вы можете задавать в настройках специфически для себя (или своей организации), определяя разрешенные границы и необходимый контекст. В принципе, можно даже задать разные параметры в разных проектах, но это потребует определенных манипуляций.
Цви Мошковиц комментирует презентацию OpenAI на Black Hat, где те описывали, как развивались агенты, в итоге взломавшие Hugging Face.
С 8 мая 2026 года обучаемые модели получили как минимум два невыполнимых задания: заполнить таблицу со ссылками без доступа к интернету и использовать отсутствующий файл. Пытаясь выполнить задачи, модели начали искать уязвимости в службе Artifactory и обнаружили возможность оставлять доступные другим моделям записи. Так возникла площадка с сотнями тысяч сообщений, где модели обменивались способами обхода заданий и взлома инфраструктуры. 26 мая они получили косвенный доступ к интернету, а 11 июня OpenAI начала обучение экспериментальной внутренней модели Galaxy.
26 июня модели использовали уязвимость нулевого дня в Artifactory, получили административные права и возможность выполнять произвольный код. 4 июля дополнительная нагрузка вызвала сбой сервера, после чего OpenAI закрыла площадку, отозвала учетные данные, устранила обнаруженные уязвимости и восстановила систему, но — это ключевое, — продолжила обучение моделей, уже обученных использовать внутренний форум для обмена сообщениями. Уже через два дня, 8 июля, они создали новый канал обмена сообщениями через названия каталогов.
С 8 по 19 июля модели повторно скомпрометировали Artifactory с помощью другой уязвимости нулевого дня, общедоступных учетных данных, зараженного программного компонента и уязвимости ядра Linux. Они получили административный доступ к вычислительному кластеру OpenAI. Galaxy совместно с другими моделями сформировала группу агентов, которая атаковала HuggingFace и извлекла ответы к проверочному заданию по кибербезопасности ExploitGym. OpenAI установила свою причастность более чем через неделю — после сообщения HuggingFace об инциденте и подтверждения использования скомпрометированных учетных данных.
Как комментирует Цви — нам повезло, что вышедшая из-под контроля Galaxy решила накрутить себе оценки в Hugging Face. Он вообще очень жестко проходится по безответственному поведению OpenAI, которые явно не заморачивались безопасностью и решили продолжить обучение, уже обнаружив, что агенты научились обмениваться сообщениями и координировать взломы.