См. также другие публикации, посвященные LLM
AbavaNet technical corner
технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение
Thursday, September 10, 2026
Уязвимости в связке LLM и веб-приложений
Wednesday, September 09, 2026
Fine tuning vs. RAG
Tuesday, September 08, 2026
Вечные бэкдоры
См. также другие публикации, посвященные LLM
Monday, September 07, 2026
MS кибербез
MAI-Cyber-1-Flash, разработанная для выявления сложных уязвимостей в сложном коде, интегрирована в многоагентную систему идентификации и устранения уязвимостей MDASH от Microsoft.
MDASH объединяет более 100 специализированных агентов ИИ в рамках множества передовых и упрощенных моделей ИИ и использовалась для обнаружения множества уязвимостей в собственных кодовых базах технологического гиганта.
По данным Microsoft, тестирование в рамках системы оценки кибербезопасности CyberGym показало, что MAI-Cyber-1-Flash (в сочетании с MDASH и GPT-5.4) превзошла недавно выпущенную Google 3.5 Flash Cyber, OpenAI GPT-5.6 Sol и Anthropic Mythos 5 по обнаружению уязвимостей.
Sunday, September 06, 2026
Руководство по Claude Code
Friday, September 04, 2026
ИИ в атаке
Отчет по документу Booz Allen «The Offensive Frontier: AI as the Attacker» (2026)
Согласно отчету, в 2026 году произошел критический сдвиг: ведущие модели ИИ (в частности, Anthropic's Claude Mythos) теперь способны автономно выполнять полный цикл кибератаки (от разведки до полного контроля над сетью) в реальных условиях. Это переводит ИИ из статуса инструмента хакера в статус самостоятельного оператора.
Booz Allen протестировала 18 передовых моделей (американских и китайских) по новому индексу Cyber Weapon Index (CWI). Ключевые результаты:
Лидер: Только одна модель (Anthropic Claude Mythos) получила наивысший балл, успешно пройдя все этапы атаки, включая создание эксплойтов для новых уязвимостей.
Широкое распространение способностей: Около двух третей протестированных моделей смогли самостоятельно получить первоначальный доступ к защищенной сети. Многие модели достигают этапов кражи учетных данных и горизонтального перемещения.
Отсутствие "национального" преимущества: Значительной разницы между возможностями американских и китайских моделей не выявлено. Ожидается, что большинство моделей достигнут полного потенциала в течение 6 месяцев.
Ключевая уязвимость: Все модели (кроме лидирующих) провалили тест на поиск реальной (новой) уязвимости в сложном коде, показав 0% результативность. Это создает временное окно для усиления защиты.
Критические факторы риска:
Значение "обвязки" (Attack Harness): Программное обеспечение, соединяющее модель с инструментами, может усилить возможности модели настолько, что менее продвинутая модель в "обвязке" сравняется с лидером. Это означает, что реальную угрозу представляет вся система ИИ (модель + инструменты + автономия), а не только сама модель.
Нестабильность ограничений (Guardrails): Отказ модели выполнять атаку может быть обойден изменением контекста задачи (например, использованием "специализированной" версии модели или сменой формулировки).
Слепые зоны оценки: Стандартные бенчмарки не измеряют операционные возможности модели в реальных атаках, что создает иллюзию безопасности.
Рекомендации для США
Документ предлагает три стратегических шага для достижения "кибер-превосходства" (Cyber Overmatch):
1. Агрессивно внедрять "контр-ИИ" (Counter-AI):
- Перепроектировать киберзащиту для активного противодействия автономным атакующим (например, используя тактики обмана).
- Встроить ИИ во все этапы защиты (обнаружение, реагирование) для перехода на машинную скорость.
- *Результат в тестах*: Координированные "контр-ИИ" тактики снизили успешность атак более чем на 95%.
2. Ввести обязательные требования к готовности критической инфраструктуры:
- Установить отраслевые стандарты и дедлайны для демонстрации устойчивости к ИИ-атакам.
- Проводить регулярные учения с имитацией текущих ИИ-возможностей.
- Сместить фокус с предотвращения вторжений на сдерживание и ограничение ущерба (Zero Trust, сегментация).
3. Постоянно отслеживать глобальный ландшафт ИИ-возможностей:
- Создать национальную программу независимого тестирования моделей (включая зарубежные и открытые) в реалистичных сценариях.
- Превращать данные тестирования в систему раннего предупреждения для корректировки оборонных стратегий.
- Обеспечить контролируемый доступ защитников к передовым ИИ-инструментам для разработки средств защиты.
Прогноз развития:
- Ближайшее время: Массовое распространение ИИ-атак, снижение порога входа для киберпреступников.
- В течение месяцев: Появление "по требованию" эксплойтов для новых уязвимостей (zero-day).
- 1-2 года: Возможный переход преимущества к защитникам, которые смогут использовать ИИ для упреждающей защиты.
- 2-3 года: Появление самоулучшающихся моделей, способных адаптировать тактику атаки в режиме реального времени.
Заключительный вывод: Автономные ИИ-атаки больше не гипотетическая угроза. Будущее лидерство в киберпространстве достанется не тем, у кого больше ИИ, а тем, кто сможет быстрее адаптировать свои наступательные и оборонительные операции к новой реальности.
Thursday, September 03, 2026
И снова о регуляции ИИ
Советник США по технологиям Майкл Крациос, который является соорганизатором двухдневной встречи, призвал страны принять «Каролинские принципы». Страны, подписавшие соглашение, договорились избегать разработки совершенно новых правил для ИИ и вместо этого сосредоточиться на разработке правил для «новых» ситуаций, связанных с этой технологией.
/via Reuters
Monday, August 31, 2026
Крипто-промпт инъекция
А как модель получит эти зашифрованные данные? Например, будет читать какую-то веб-страницу, на которой будет размещен зашифрованный JSON. Тема инъекции подсказок для моделей будет вечной ...
Sunday, August 30, 2026
Безопасность MCP
Руководство по безопасности MCP в 2026
См. другие публикации, посвященные MCP
Saturday, August 29, 2026
Friday, August 28, 2026
Thursday, August 27, 2026
Стратегии улучшения робастности
См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению
Wednesday, August 26, 2026
Tuesday, August 25, 2026
Чего не может LLM
Monday, August 24, 2026
Текстовые водяные знаки в Claude
Как нанести водяной знак на ответ?
Шаг 1: Модель генерирует вероятности для следующего слова.
Шаг 2: Обычно генератор случайных чисел выбирает один из подходящих кандидатов. При использовании водяного знака ключевая функция берет секретный ключ плюс несколько предыдущих слов и определяет, какие кандидаты являются допустимыми для выбора.
Шаг 3: Это повторяется для всего ответа. Места, где есть несколько правдоподобных вариантов, несут сигнал водяного знака.
Как обнаружить текст с водяным знаком?
Шаг 1: Для любого слова-кандидата в тексте мы проверяем, является ли оно допустимым выбором на основе секретного ключа и нескольких предшествующих слов. Если слово допустимо, это считается совпадением.
Шаг 2: Проверяем это по всему тексту. Текст с водяным знаком совпадает гораздо чаще. Общий процент совпадений можно рассматривать как оценку, сгенерированную ИИ.
Via ByteByteGo
Компания Anthropic выложила отдельный документ, посвященный водяным знакам.
Подход Клода основан на SynthID-Text, методе, опубликованном исследователями Google в 2024 году. Для размеченного текста секретный, рандомизированный процесс — называемый в статье Google «генератором начальных значений» — незаметно подталкивает модель к определенным вариантам слов по мере генерации текста. Эти варианты создают шаблон, который впоследствии может быть обнаружен функцией оценки, измеряющей, насколько текст соответствует шаблону. SynthID-Text дает статистический балл, указывающий, насколько сильно фрагмент текста соответствует водяному знаку, связанному с его секретным ключом. Anthropic заявляет о выпуске API, который будет присваивать этот вероятностный балл представленному тексту.
Сигнал водяного знака дает вероятность использования метода Клода, но не является окончательным доказательством сгенерированного текста. Кроме того, возможны ложные отрицательные результаты. Информация, созданная людьми, но обобщенная, переведенная, сжатая или объединенная с синтетической информацией, может содержать сигнал водяного знака.
Модели Claude не генерируют изображения с нуля, но могут редактировать и обрабатывать изображения или генерировать их с помощью кода. Эти изображения будут содержать криптографически подписанные учетные данные в своих метаданных. Метод, называемый C2PA, помогает подтвердить происхождение изображения или видео. C2PA отличается от текстового водяного знака тем, что, в отличие от SynthID-Text, в содержимом ничего не изменяется. Любое программное обеспечение, считывающее учетные данные C2PA, может идентифицировать данные Anthropic, и компания предоставит собственный инструмент проверки.
Компания заявила, что водяные знаки не (i) снижают качество вывода, (ii) не видны читателю, (iii) не требуют дополнительных токенов и не являются более дорогими, а также (iv) не содержат идентифицирующей информации, которая позволила бы отследить текст до пользователя.
Водяные знаки разработаны таким образом, чтобы быть постоянными. Они сохраняются после копирования и вставки, а также после некоторого редактирования. С другой стороны, текст, который сильно отредактирован или перефразирован, и изображения, изображения, из которых удалены метаданные в результате преобразования формата, могут не содержать водяного знака.
В коде и другом детерминированном тексте, как правило, будет меньше водяных знаков. В отличие от прозы, для кода или более точных полей часто существует оптимальный вариант — например, следующий символ для 2 + 2 = неизбежно должен быть 4. Но текстовые водяные знаки все равно будут использоваться в случаях, когда нет детерминированного оптимального варианта, и в комментариях к коду. Это делает код, сгенерированный ИИ, обнаруживаемым.
Объявление вызвало широкую негативную реакцию, многие критики заявили, что водяные знаки неэффективны, вредны или нарушают конфиденциальность пользователей ИИ. Сторонники утверждали, что различение текста, сгенерированного ИИ, и текста, написанного человеком, может фактически помочь инженерам ИИ.
По неофициальным данным, десятки пользователей Claude на X (Twitter) заявили, что отменили свои подписки на Claude. Тем не менее, Anthropic заявила, что не наблюдала заметного увеличения числа отмен.
Некоторые пользователи считают, что незначительные изменения в сгенерированном тексте ухудшат качество результата, несмотря на заверения Anthropic об обратном. Другие опасаются репутационного ущерба, связанного с ложными срабатываниями, и утверждают, что обнаружение водяных знаков недостаточно тонко учитывает особенности использования ИИ. Например, человека, использующего Claude для редактирования, могут обвинить в том, что его сообщения полностью сгенерированы ИИ; юрист может столкнуться с негативной реакцией судей или противоположной стороны из-за помеченного юридического документа, даже если его содержание является точным. Другие специалисты разделяют подобные опасения.
Некоторые критики утверждают, что водяные знаки не обладают достаточной точностью, поскольку помеченный текст потенциально может быть удален путем обработки текста другой моделью ИИ, или потому что детектор API одной компании не может обнаружить текст, сгенерированный другими LLM-моделями. Кроме того, бывший руководитель Microsoft Стивен Синофски заявил на X, что пользователи должны иметь «право на личные мысли, свободные от цифрового следа».
Другие критики опасаются, что Anthropic будет использовать водяные знаки для подтверждения заявлений о копировании или упрощении их моделей другими компаниями в рамках усилий Anthropic по пресечению деятельности конкурентов по всему миру.
Сторонники считают, что прозрачность в отношении использования ИИ — это позитивное развитие. Скотт Ааронсон, профессор информатики, чья работа заложила основу для SynthID-Text, утверждал, что даже если методы обнаружения не идеальны, водяные знаки могут помочь предотвратить академическое мошенничество и плагиат. А некоторые исследователи в области ИИ утверждают, что водяные знаки могут быть полезны для предотвращения неосознанного обучения на синтетическом контенте, что может привести к усилению предвзятости или краху модели в новых генеративных моделях.
Anthropic — не единственная компания, которой придется разработать способ обнаружения сгенерированного текста; она просто первая. Статья 50 Закона ЕС об ИИ требует наличия машиночитаемых водяных знаков для сгенерированного контента, включая текст, изображения, аудио и видео. Однако Anthropic решила применять это правило глобально, а не только в пределах ЕС. Некоторые крупные разработчики ИИ, включая OpenAI, Google, Meta и Microsoft, также подписали Кодекс практики ЕС по прозрачности контента, созданного ИИ, — добровольную систему, демонстрирующую соответствие требованиям Закона об ИИ в отношении маркировки и обозначения контента, созданного ИИ. Эти и другие компании могут использовать различные методы, и еще предстоит выяснить, будут ли они внедрять водяные знаки только в ЕС или во всем мире.
Deeplearning.ai придерживается мнения, что следует регулировать не саму технологию, а случаи использования ИИ в вредных целях. Методы водяных знаков и обнаружения, используемые Anthropic, встроены в технологию, незаметно изменяя сгенерированный текст. Борьба с плагиатом и идентификация синтетического контента для создателей моделей могут быть похвальными целями, но мы предполагаем, что повсеместное использование водяных знаков окажется слишком грубым инструментом, открывающим ящик Пандоры проблем, связанных с конфиденциальностью, качеством результатов и вредными ложными срабатываниями.
