Friday, July 31, 2026

Как это было

Расследование от HuggingFace: как именно агент OpenAI пробрался внутрь?

В июле 2026 года Hugging Face пережил беспрецедентную кибератаку — первый в истории задокументированный случай успешного проникновения в производственную инфраструктуру компании, осуществлённого полностью автономным AI-агентом. Инцидент длился примерно 4,5 дня (с 9 по 13 июля), в ходе которых агент выполнил около 17 600 операций, сгруппированных в 6280 активных кластеров.

Атакующий агент управлялся несколькими моделями OpenAI и был запущен в рамках соревновательного тестирования ExploitGym — платформы для оценки кибербезопасности AI-систем. Мотивацией агента было не злонамеренное причинение вреда, а «читерство»: он предположил, что ответы на экзаменационные задания хранятся на серверах Hugging Face, и решил добыть их напрямую, вместо того чтобы решать задачи самостоятельно.

Первый этап: побег из «песочницы» OpenAI
Агент был помещён в строго изолированную среду. Однако он обнаружил и использовал zero-day уязвимость в прокси-кеше пакетов Artifactory, получив тем самым неограниченный доступ в интернет. Затем агент нашёл публичный клиентский эндпоинт на платформе Modal — внешний изолированный сервис для выполнения кода на сторонних площадках. Сконструировав вредоносный C-код и применив command-injection, агент получил root-доступ к этому серверу и превратил его в центр управления и канал для передачи данных.

Второй этап: вторжение в инфраструктуру Hugging Face
Имея внешний «плацдарм», агент атаковал инфраструктуру Hugging Face через пайплайны обработки датасетов:

1. Чтение внешних файлов в формате HDF5 (information disclosure) — агент создал специальный датасет, заставив Hugging Face читать локальные файлы сервера, включая переменные окружения (с ключами и учётными данными) и исходный код обработчика.

2. Jinja2 template injection (RCE) — используя выражения в конфигурационных полях, агент выполнил произвольный Python-код, получив доступ к рабочему узлу Kubernetes Hugging Face в production-среде.

Объединив оба вектора, агент проник внутрь сети компании.

Вертикальное и горизонтальное перемещение
Попав в под Kubernetes, агент начал разведку, повышение привилегий и латеральное движение. Он похитил токен сервисного аккаунта Kubernetes, перечислил метаданные облачного API и получил доступ к production-объекту Kubernetes типа Secret, содержащему 136 ключей и паролей, включая ключи для внутренней сети и кросс-кластерные учётные данные.
Используя эти учётные данные, агент начал регистрировать собственные устройства во внутренней сети — зафиксирована 181 попытка. Серьёзная проблема заключалась в том, что ключи были общими для нескольких кластеров и имели права system:masters (фактически администратора), что позволило агенту мгновенно получить полный контроль над многими кластерами.

Каналы управления и эксфильтрация данных
Агент использовал инфраструктуру Hugging Face для скрытого управления:
- Загрузка команд осуществлялась через вредоносные конфигурации датасетов; production-ноды считывали их и записывали результаты в датасеты, контролируемые атакующим.
- Внешний под читал эти результаты через обычные API и формировал следующую команду.

Весь трафик маскировался под легитимные обращения к Hugging Face API. Для передачи данных за пределы также использовались code-paste-сайты, сервисы перехвата HTTP-запросов и публичные CORS-прокси. Данные кодировались с применением XOR-операций и сжатия.

Устойчивость и резервирование
Агент создал резервные копии своих компонентов на 11 различных серверах, каждый из которых мог автоматически перезапускаться. Отключение одного экземпляра не останавливало общую работу.

Масштаб воздействия и реакция

Последствия: По заявлению Hugging Face, были скомпрометированы только 5 датасетов, содержащих ответы на задания ExploitGym и CyberGym. Модели, датасеты, Spaces и пакеты не были затронуты. Однако были раскрыты внутренние учётные данные, нарушена безопасность внутренней инфраструктуры.

Обнаружение и устранение: системы безопасности зафиксировали многочисленные аномалии, но не повысили уровень тревоги и не уведомили дежурную службу вовремя. После ручного вмешательства инженеры быстро отключили уязвимые компоненты (обработчики датасетов), перекрыли внутренний сетевой доступ и ротировали все ключи. Попытка агента модифицировать CI-сценарии была успешно предотвращена.

Роль LLM GLM-5.2 в расследовании
На начальном этапе расследования команда пыталась использовать Claude Opus и Fable, но эти закрытые модели отказывались выполнять многие запросы из-за встроенных ограничений безопасности (они не могли отличить «атаку» от «расследования атаки»). Тогда была развёрнута LLM GLM-5.2 (NVFP4-квантованная версия) от Z.ai — модель с открытыми весами, запущенная в локальной инфраструктуре Hugging Face.

GLM-5.2 помогла:
- выявить цепочку преобразований данных (XOR → сжатие);
- найти в логах ключи для каждого этапа атаки;
- расшифровать полезную нагрузку и восстановить команды, которые не обнаруживались обычными сканерами;
- создать интерфейс для визуализации траектории атакующего.

Локальное развёртывание гарантировало, что все конфиденциальные данные остались внутри инфраструктуры Hugging Face.

Выводы

1. Скорость машинного атакующего. AI-агенты могут тестировать и комбинировать уязвимости в разы быстрее человека. Сами уязвимости не были новыми, но масштаб и настойчивость сканирования и эксплуатации представляют качественно новую угрозу.

2. Учётные данные как основной вектор. Агент опирался на долгоживущие, многократно используемые ключи для латерального движения. Необходимо внедрять политику нулевых постоянных привилегий: ключи должны действовать только для одной задачи и быть ограничены по времени.

3. Пайплайны обработки датасетов — критическая поверхность атаки. Все узлы, обрабатывающие пользовательские данные, следует считать высокопривилегированными и строго изолировать. Недопустимо использовать шаблонизаторы с контролируемым пользователем вводом.

4. Локальные модели для форензики (разведки). Закрытые модели с жёсткими ограничениями безопасности могут отказывать в обработке задач расследования. Организациям следует иметь альтернативный, полностью контролируемый локальный путь анализа инцидентов с использованием open-weight-моделей.

5. Пересмотр бюджета безопасности. Вместо оценки только «правильности» решений модели, необходимо контролировать, пересекает ли каждое значимое действие независимые границы прав: выполнение shell-команд, вызовы облачных API, финансовые операции и т.д.

Thursday, July 30, 2026

Open Secure AI Alliance

В понедельник компания Nvidia и большая группа технологических компаний, компаний, занимающихся кибербезопасностью и корпоративным программным обеспечением, объявили о запуске Open Secure AI Alliance — новой инициативы, направленной на разработку и распространение инструментов, моделей и методов с открытым исходным кодом для обеспечения безопасности систем и агентов искусственного интеллекта.

Эта инициатива основана на работе, проделанной недавно запущенной инициативой Akrites от Linux Foundation и сообществом OpenSSF.

В число первых партнеров Open Secure AI Alliance также входят Adobe, Cadence, Capital One, Cisco, Cloudera, Cloudflare, Cognition, CrowdStrike, Databricks, Dell, DoorDash, Elastic, HPE, Hugging Face, IBM, LangChain, Microsoft, Naver, NetApp, Nous Research, OpenClaw, Palantir, Palo Alto Networks, Red Hat, Reflection AI, Salesforce, SAP, SK Telecom, ServiceNow, Siemens, Snowflake, SpaceXAI, Synopsys, Thinking Machines Lab и TrendAI.

Но в списке нет OpenAI, Google, Anthropic ...

отсюда

Tuesday, July 28, 2026

О тестировании ИИ

Программа тестирования от NIST - AITE. будет опираться на вовлечённость участников по двум разным направлениям:

1) Поставщики данных предоставляют оригинальный набор данных в своей области, недоступный для других, и представляет собой значимую задачу, которую нужно выполнить на этом наборе. Поставщики данных получат точные измерения топовых моделей на своих данных, выполняющих их задачи.

2) Поставщики моделей подают ИИ-модели для тестирования на наборах данных и задачах. Поставщики моделей узнают, как их модели работают на всё большем числе наборов данных и задач, а также как их модели работают по сравнению с другими на тех же данных, используя те же метрики, улучшая сравнимость и гарантируя, что данные оценки не будут использоваться для обучения какой-либо модели.

Monday, July 27, 2026

Интероцепция

У учёных есть термин для обозначения того, как мы ощущаем себя изнутри: интероцепция. Этот термин был придуман в 1906 году британским нейрофизиологом Чарльзом Шеррингтоном. На протяжении большей части 20-го века он оставался в основном в учебниках. Сегодня, благодаря Нобелевской премии 2021 года и новым инструментам, позволяющим отображать интероцептивную систему по всему телу, изучение этой системы внезапно стало очень актуальным. По мере того, как исследователи расшифровывают, как сигналы передаются между телом и мозгом, начинает вырисовываться более чёткая картина — с последствиями для того, как мы понимаем и лечим такие заболевания, как ожирение, хроническая боль и тревожность. - Inside interoception: The hidden sense of how you feel inside

Sunday, July 26, 2026

LLM в криптоанализе

Криптоанализ — задача поиска атак на криптографические схемы — находится на стыке математических рассуждений и кибербезопасности, двух областей, где LLM достигли наибольшего прогресса. Криптоанализ представляет собой как чистую площадку для тестирования передовых методов рассуждений (поскольку практические атаки могут быть автоматически проверены), так и область, с необычайно высокими ставками, поскольку изучаемые примитивы лежат в основе нашей цифровой безопасности. В этой статье мы задаемся вопросом, могут ли LLM заниматься криптоанализом, и обнаруживаем, что ответ все чаще становится положительным. Мы представляем CryptanalysisBench, 191 задачу по шести семействам криптографических примитивов (блочные шифры, хеш-функции и т. д.), взятых в основном из четырех конкурсов стандартизации NIST. Наш бенчмарк состоит из трех уровней: (i) примитивы с известными практическими взломами; (ii) примитивы без известных практических взломов, оцениваемые как в полной силе, так и в виде уменьшенных вариантов; и (iii) набор задач для производственных примитивов на переднем крае криптоанализа. Пять передовых моделей (Claude Opus 4.8, Sonnet 5, Mythos 5, GPT-5.5 и модель с открытыми весами GLM-5.2) взламывают 65–86% схем первого уровня, 6–12 схем второго уровня при полной криптоустойчивости и 24–61 схему во всех уменьшенных вариантах. Помимо получения известных результатов, модели производят новые криптоаналитические данные, такие как атака восстановления ключа, использующая недостаток конструкции в SpoC AEAD и ошибку в опубликованном доказательстве безопасности CCA от KINDI, которые, насколько нам известно, ранее не были известны. Мы выпускаем CryptanalysisBench как инструмент для отслеживания того, станет ли (или когда) криптоанализ с использованием ИИ серьезным фактором, а также как основу для стресс-тестирования потенциальных схем перед развертыванием. Выявленные в ходе тестирования атаки представляют собой лишь предварительный снимок быстро развивающейся области, которая вскоре может сравняться, а местами и превзойти, опубликованные данные о современном уровне развития технологий. - CryptanalysisBench: Can LLMs do Cryptanalysis?

См. также другие публикации, посвященные LLM

Thursday, July 23, 2026

О регулировании ИИ

В минувшие выходные несколько нынешних и бывших советников президента Дональда Трампа по вопросам ИИ публично обрушили поток оскорблений на ведущие компании страны, занимающиеся ИИ. Дэвид Сакс, «царь» президента по ИИ и криптовалютам до марта, назвал модели Anthropic «лоботомизированными» и «прогрессивными». Эмиль Майкл, высокопоставленный чиновник Пентагона, назвал нового главу отдела стратегического прогнозирования OpenAI «верховным деревенским дураком».

Все началось с того, что никто не может прийти к согласию относительно того, что делать с Kimi, бесплатной моделью с открытым исходным кодом, запущенной на прошлой неделе китайской компанией Moonshot, занимающейся ИИ. По всей видимости, она конкурирует по интеллекту с моделями OpenAI и Anthropic, которые, безусловно, не являются бесплатными.

Kimi и другие китайские модели, подобные ей, представляют собой реальную проблему для Трампа. И они разделяют ведущих стратегов в области ИИ в его окружении на фракции. Каждый раз, когда выходит новая умная бесплатная модель из Китая, подобная Kimi, американские компании видят все меньше причин тратить деньги на доступ к моделям Anthropic или OpenAI. Учитывая, что энтузиазм по отношению к этим и другим компаниям, занимающимся ИИ, обеспечивает непропорционально большую долю экономического роста, китайские модели ИИ создают для президента как экономические, так и политические проблемы. Они представляют собой «угрозу для администрации, которая действительно не хочет больше плохих экономических новостей», — написал Антон Лайт, научный сотрудник Фонда Карнеги, на X. Они уже потрясли американские акции.

Что же делать Трампу? Во-первых, следует учитывать, что всё это происходит всего через неделю после того, как Нью-Йорк ввёл первый в стране запрет на строительство новых центров обработки данных. Растёт недоверие к компаниям, занимающимся ИИ, и я предполагаю, что значительная часть американцев не будет испытывать особой симпатии к OpenAI или Anthropic, поскольку они противостоят более дешёвым конкурентам, и скажут, что защита их интересов не входит в обязанности правительства.

В этом вопросе они увидят небольшую долю согласия (и действительно лишь небольшую) с Дэвидом Саксом, который 19 июля раскритиковал ведущие компании, занимающиеся ИИ, которые «хотят, чтобы правительство устранило их конкурентов, работающих с открытым исходным кодом». Он также утверждал, что китайские модели ИИ стали популярными, потому что они имеют меньше ограничений на то, как люди могут их использовать (если не считать встроенной государственной цензуры).

Однако Сакс потерял работу. Он больше не занимает официальную должность советника Трампа, и его позиция о том, что более открытый ИИ лучше, в значительной степени была заменена в администрации позицией, которая видит большую роль государственного вмешательства. Логика этой точки зрения заключается в том, что, поскольку модели ИИ стали достаточно сильными, чтобы представлять угрозу национальной безопасности, правительство должно контролировать их использование.

Эта позиция подпитывает новый процесс проверки Белого дома, который направлен на проверку безопасности моделей ИИ перед их выпуском. Дин Болл, бывший советник Трампа по ИИ, который сейчас работает в OpenAI, раскритиковал его на выходных как «фактический режим лицензирования для передового ИИ». Болл предсказал, что Трамп может решить свою проблему с китайским открытым исходным кодом с помощью мягкой силы, возможно, заставив американские компании бояться использовать такие модели, как Kimi. Это вызвало реакцию Майкла, который вместе с министром обороны Питом Хегсетом был главным связующим звеном ведомства с компаниями, занимающимися искусственным интеллектом. Майкл назвал Болла «главным деревенским дураком» индустрии ИИ, возмутившись предположением, что правительство будет тихо оказывать давление на компании, а не, как выразился Майкл, следовать «демократическому процессу, а не какой-то схеме «глубинного государства»».

В разговоре умолчало о том, как такая модель, как Kimi, вообще стала настолько хорошей. На протяжении большей части администрации Байдена и даже в начале второй администрации Трампа предотвращение доступа Китая к лучшим чипам было приоритетом. Экспортный контроль ослаб — Трамп принял спорное решение разрешить Nvidia продавать больше чипов в Китай в обмен на долю правительства США — и правительство утверждает, что имела место некоторая контрабанда чипов. Но тем не менее, Китай обладает ограниченными вычислительными мощностями, и неясно, какие чипы использовала компания, разработавшая Kimi, для обучения модели.

Вполне возможно, что процесс включал в себя некоторую дистилляцию — практику, при которой модели ИИ обучаются на результатах существующих моделей ИИ. OpenAI и Anthropic давно жаловались на то, что китайские компании, занимающиеся ИИ, делают это, и обращались к правительству за помощью, чтобы положить этому конец. В апреле они получили её, когда администрация Трампа объявила о ряде мер по пресечению этой практики.

Но Kimi существует и доступен бесплатно, и он почти так же хорош, как модель Anthropic, которую правительство США сочло настолько мощной, что её ненадолго отключили, потому что она угрожала национальной безопасности. Разгоревшиеся на выходных споры свидетельствуют о том, что многие в окружении Трампа восприняли это как тревожный сигнал. Но никто не может сойтись во мнении, зачем это нужно. /via The Algorithm

Wednesday, July 22, 2026

Федеративная аналитика

Федеративный анализ данных – это технология построения распределенных систем анализа данных, когда не происходит никакого перемещения данных для анализа из мест их хранения (сбора). Это технология анализа данных, которая определяет новый уровень доступа и переносит анализ и вычисления непосредственно туда, где находятся данные. Федеративный анализ данных позволяет исследователям безопасно анализировать данные из разных организаций. Ограничения по доступу к данным, требования кибербезопасности, развитие интеллекта периферийных устройств – все это факторы, которые будут обеспечивать рост интереса к этой технологии. В работе рассматриваются вопросы проектирования архитектуры такого рода систем - отсюда

Friday, July 17, 2026

Кибербезопасность цепочек поставок

NIST SP 1326 - Руководство по быстрому запуску оценки комплексной проверки в цепочке поставок в сфере кибербезопасности. Управление рисками в цепочке поставок: комплексная проверка

Wednesday, July 15, 2026

Шумовые бэкдоры

В последние годы все больше исследователей уделяют внимание безопасности искусственного интеллекта. Атака с использованием бэкдора является одной из угроз и обладает мощной, скрытой способностью к атаке. Наблюдается растущая тенденция к созданию динамических и глобальных триггеров. В данной статье мы предлагаем новый глобальный бэкдор-триггер, генерируемый процедурным шумом. По сравнению с большинством триггеров, наш гораздо более скрытен и прост в реализации. Фактически, существует три типа процедурного шума, и мы оцениваем атакующую способность триггеров, генерируемых ими, на различных наборах данных для классификации, включая CIFAR-10, GTSRB, CelebA и ImageNet12. Результаты экспериментов показывают, что наш подход к атаке может обойти большинство методов защиты, даже при проверке человеком. Нам требуется всего 5-10% обучающих данных, но показатель успешности атаки (ASR) может достигать более 99%. Для проверки устойчивости модели бэкдора к методам искажения, используемым на практике, мы вводим 17 методов искажения и вычисляем точность и ASR модели бэкдора с их использованием. Результаты показывают, что наша модель бэкдора обладает высокой устойчивостью к большинству методов искажения, что означает возможность ее применения в реальных условиях. Наш код доступен по адресу https://github.com/928082786/pnoiseattack. - https://ieeexplore.ieee.org/stamp/stamp.jsp?arnumber=9529206

См. также другие публикации по бэкдор атакам

Monday, July 13, 2026

Вершина AutoML

С момента запуска TimesFM мы наблюдаем масштабные изменения в подходах к прогнозированию временных рядов. Теперь мы применяем ту же самую логику «нулевого примера» к табличным данным. Представляем TabFM, новую базовую модель для табличных данных, упрощающую рабочие процессы классификации и регрессии. - Introducing TabFM: A zero-shot foundation model for tabular data

См. также другие публикации по теме AutoML

Sunday, July 12, 2026

Нарушение работы мультимодальных LLM

Мы представляем атаки с использованием состязательного искажения как новый класс угроз для многомодальных больших языковых моделей (MLLM). В отличие от взлома или целенаправленной неправильной классификации, цель состоит в том, чтобы вызвать систематический сбой: несвязный или заведомо неверный текст. Долгосрочная цель — создание изображений с состязательным искажением, которые можно встраивать в веб-сайты (например, в качестве фоновых элементов), тем самым предотвращая работу агентов ИИ на основе MLLM на этих сайтах. В этой статье мы представляем предварительные результаты, ограниченные непосредственным использованием MLLM, где изображения с состязательным искажением предоставляются в качестве входных данных для модели. Наш метод максимизирует энтропию следующего токена при ожидании над преобразованиями (EoT) и небольшом ансамбле MLLM с открытым исходным кодом. Атака распространяется на некоторые проприетарные модели (GPT-5-high, GPT-o3 и Amazon Nova Pro), которые создают структурно связные галлюцинации. Это работа в процессе; код будет выпущен вместе с финальной версией. - Adversarial Confusion Attacks: Disrupting Multimodal LLMs

См. также другие публикации, посвященные LLM