Monday, August 24, 2026

Текстовые водяные знаки в Claude

LLM генерируют текст слово за словом. На каждом шаге они генерируют вероятности для следующего вероятного слова. Вместо случайной выборки из этих слов, метод водяного знака изменяет список слов, которые разрешено выбирать.

Как нанести водяной знак на ответ?

Шаг 1: Модель генерирует вероятности для следующего слова.

Шаг 2: Обычно генератор случайных чисел выбирает один из подходящих кандидатов. При использовании водяного знака ключевая функция берет секретный ключ плюс несколько предыдущих слов и определяет, какие кандидаты являются допустимыми для выбора.

Шаг 3: Это повторяется для всего ответа. Места, где есть несколько правдоподобных вариантов, несут сигнал водяного знака.


Как обнаружить текст с водяным знаком?

Шаг 1: Для любого слова-кандидата в тексте мы проверяем, является ли оно допустимым выбором на основе секретного ключа и нескольких предшествующих слов. Если слово допустимо, это считается совпадением.

Шаг 2: Проверяем это по всему тексту. Текст с водяным знаком совпадает гораздо чаще. Общий процент совпадений можно рассматривать как оценку, сгенерированную ИИ.

Via ByteByteGo

Компания Anthropic выложила отдельный документ, посвященный водяным знакам. Подход Клода основан на SynthID-Text, методе, опубликованном исследователями Google в 2024 году. Для размеченного текста секретный, рандомизированный процесс — называемый в статье Google «генератором начальных значений» — незаметно подталкивает модель к определенным вариантам слов по мере генерации текста. Эти варианты создают шаблон, который впоследствии может быть обнаружен функцией оценки, измеряющей, насколько текст соответствует шаблону. SynthID-Text дает статистический балл, указывающий, насколько сильно фрагмент текста соответствует водяному знаку, связанному с его секретным ключом. Anthropic заявляет о выпуске API, который будет присваивать этот вероятностный балл представленному тексту.
Сигнал водяного знака дает вероятность использования метода Клода, но не является окончательным доказательством сгенерированного текста. Кроме того, возможны ложные отрицательные результаты. Информация, созданная людьми, но обобщенная, переведенная, сжатая или объединенная с синтетической информацией, может содержать сигнал водяного знака.

Модели Claude не генерируют изображения с нуля, но могут редактировать и обрабатывать изображения или генерировать их с помощью кода. Эти изображения будут содержать криптографически подписанные учетные данные в своих метаданных. Метод, называемый C2PA, помогает подтвердить происхождение изображения или видео. C2PA отличается от текстового водяного знака тем, что, в отличие от SynthID-Text, в содержимом ничего не изменяется. Любое программное обеспечение, считывающее учетные данные C2PA, может идентифицировать данные Anthropic, и компания предоставит собственный инструмент проверки.

Компания заявила, что водяные знаки не (i) снижают качество вывода, (ii) не видны читателю, (iii) не требуют дополнительных токенов и не являются более дорогими, а также (iv) не содержат идентифицирующей информации, которая позволила бы отследить текст до пользователя.
Водяные знаки разработаны таким образом, чтобы быть постоянными. Они сохраняются после копирования и вставки, а также после некоторого редактирования. С другой стороны, текст, который сильно отредактирован или перефразирован, и изображения, изображения, из которых удалены метаданные в результате преобразования формата, могут не содержать водяного знака.
В коде и другом детерминированном тексте, как правило, будет меньше водяных знаков. В отличие от прозы, для кода или более точных полей часто существует оптимальный вариант — например, следующий символ для 2 + 2 = неизбежно должен быть 4. Но текстовые водяные знаки все равно будут использоваться в случаях, когда нет детерминированного оптимального варианта, и в комментариях к коду. Это делает код, сгенерированный ИИ, обнаруживаемым.

Объявление вызвало широкую негативную реакцию, многие критики заявили, что водяные знаки неэффективны, вредны или нарушают конфиденциальность пользователей ИИ. Сторонники утверждали, что различение текста, сгенерированного ИИ, и текста, написанного человеком, может фактически помочь инженерам ИИ.

По неофициальным данным, десятки пользователей Claude на X (Twitter) заявили, что отменили свои подписки на Claude. Тем не менее, Anthropic заявила, что не наблюдала заметного увеличения числа отмен.
Некоторые пользователи считают, что незначительные изменения в сгенерированном тексте ухудшат качество результата, несмотря на заверения Anthropic об обратном. Другие опасаются репутационного ущерба, связанного с ложными срабатываниями, и утверждают, что обнаружение водяных знаков недостаточно тонко учитывает особенности использования ИИ. Например, человека, использующего Claude для редактирования, могут обвинить в том, что его сообщения полностью сгенерированы ИИ; юрист может столкнуться с негативной реакцией судей или противоположной стороны из-за помеченного юридического документа, даже если его содержание является точным. Другие специалисты разделяют подобные опасения.
Некоторые критики утверждают, что водяные знаки не обладают достаточной точностью, поскольку помеченный текст потенциально может быть удален путем обработки текста другой моделью ИИ, или потому что детектор API одной компании не может обнаружить текст, сгенерированный другими LLM-моделями. Кроме того, бывший руководитель Microsoft Стивен Синофски заявил на X, что пользователи должны иметь «право на личные мысли, свободные от цифрового следа».
Другие критики опасаются, что Anthropic будет использовать водяные знаки для подтверждения заявлений о копировании или упрощении их моделей другими компаниями в рамках усилий Anthropic по пресечению деятельности конкурентов по всему миру.

Сторонники считают, что прозрачность в отношении использования ИИ — это позитивное развитие. Скотт Ааронсон, профессор информатики, чья работа заложила основу для SynthID-Text, утверждал, что даже если методы обнаружения не идеальны, водяные знаки могут помочь предотвратить академическое мошенничество и плагиат. А некоторые исследователи в области ИИ утверждают, что водяные знаки могут быть полезны для предотвращения неосознанного обучения на синтетическом контенте, что может привести к усилению предвзятости или краху модели в новых генеративных моделях.

Anthropic — не единственная компания, которой придется разработать способ обнаружения сгенерированного текста; она просто первая. Статья 50 Закона ЕС об ИИ требует наличия машиночитаемых водяных знаков для сгенерированного контента, включая текст, изображения, аудио и видео. Однако Anthropic решила применять это правило глобально, а не только в пределах ЕС. Некоторые крупные разработчики ИИ, включая OpenAI, Google, Meta и Microsoft, также подписали Кодекс практики ЕС по прозрачности контента, созданного ИИ, — добровольную систему, демонстрирующую соответствие требованиям Закона об ИИ в отношении маркировки и обозначения контента, созданного ИИ. Эти и другие компании могут использовать различные методы, и еще предстоит выяснить, будут ли они внедрять водяные знаки только в ЕС или во всем мире.

Deeplearning.ai придерживается мнения, что следует регулировать не саму технологию, а случаи использования ИИ в вредных целях. Методы водяных знаков и обнаружения, используемые Anthropic, встроены в технологию, незаметно изменяя сгенерированный текст. Борьба с плагиатом и идентификация синтетического контента для создателей моделей могут быть похвальными целями, но мы предполагаем, что повсеместное использование водяных знаков окажется слишком грубым инструментом, открывающим ящик Пандоры проблем, связанных с конфиденциальностью, качеством результатов и вредными ложными срабатываниями.

Sunday, August 23, 2026

Курсы по ИИ-агентам

Симпатичные курсы (на русском) - Agentic Coding & AI Agents

См. также другие публикации, посвященные агентам

Saturday, August 22, 2026

И снова о безопасности ИИ

Растет количество организаций, занятых исключительно такой тематикой. Вот еще одна новая компания.

"Guidelight — это новая независимая некоммерческая организация, основанная Пейдж Хедли и Стивеном Адлером (оба — бывшие руководители OpenAI по вопросам безопасности), которая сотрудничает с независимыми экспертами, компаниями, занимающимися ИИ, и общественностью для определения важных методов обеспечения безопасности и содействия их внедрению.

В настоящее время компании, работающие в сфере ИИ, недостаточно инвестируют в безопасность, опасаясь отстать от менее осторожных конкурентов. Наша стратегия заключается в устранении этих стимулов и сосредоточении усилий компаний на наиболее важных методах обеспечения безопасности.

У нас есть три взаимодополняющие программы:

1.Стандарты
Мы сочетаем принципы безопасности с конкретными практическими методами, которые их реализуют, синтезируя существующие исследования, мнения экспертов и наш собственный опыт.

2. Оценки
Мы оцениваем текущие методы работы компаний в соответствии с этими стандартами и публикуем результаты, опираясь на общедоступную информацию, достоверные отчеты и заявления компаний.

3. Стимулирование

Мы стимулируем внедрение компаниями более безопасных методов работы, поддерживая сотрудников, заботящихся о безопасности, внутри компании и создавая конкурентное давление со стороны клиентов, инвесторов и общественности.

Для того чтобы решения компаний в области безопасности учитывались общественные интересы, необходима независимость от этих компаний. Guidelight не принимает финансирование от компаний, занимающихся искусственным интеллектом, или от их сотрудников.

Наша цель — коммерческая среда, где безопасность выгодна, где интересы компаний, занимающихся искусственным интеллектом, и общественности совпадают."

И вот их интересный отчет AI Control: An Assessment of Frontier Practices. Согласно своему стандарту были оценены разработки пяти лидирующих компаний: Anthropic, OpenAI, Google, xAI, Meta.

Оценивались 6 практик:

  • Ведение журналов: регистрируйте действия внутренних ИИ для последующего мониторинга.
  • Мониторинг эффективности: измеряйте эффективность мониторинга.
  • Ограниченные действия: требуйте от наблюдателя подтверждения безопасности определенных действий ИИ с высоким риском, прежде чем они вступят в силу.
  • Предотвращение сбоев: временно останавливайте системы ИИ после всплеска выявленного некорректного поведения.
  • Независимая экспертиза: привлекайте сторонних специалистов для оценки адекватности мер контроля.
  • План сдерживания: разработайте план сдерживания некорректно работающей модели.

См. также другие публикации по теме аудит

Friday, August 21, 2026

Секретные проверки

Белый дом исключает открытые модели из своей системы тестирования передовых возможностей ИИ, сообщили Axios источники, знакомые с ситуацией.

Почему это важно: Добровольная система определит, как администрация Трампа будет проверять передовые модели ИИ перед их выпуском, но Белый дом не публикует её.

Что внутри: Система ИИ, представленная администрацией Трампа, определяет «защищенную передовую модель» как модель с закрытым исходным кодом, обладающую самыми современными возможностями и представляющую угрозу национальной безопасности, сообщили многочисленные источники, знакомые с ходом встреч в Белом доме.

Четкого определения того, что считается передовым или представляющим угрозу национальной безопасности, нет. Открытые модели исключены, и в системе прямо указано, что ничто в ней не должно интерпретироваться как ограничение открытых моделей после их выпуска.

Подробнее: В течение 30-дневного периода предварительной проверки правительством доступ сотрудников к моделям будет ограничен.
Модели будут храниться в средах с высоким уровнем безопасности, и потребуется вести подробные журналы доступа к моделям.
Процесс проверки будет включать в себя различных должностных лиц администрации, а не только одно ведомство или агентство. В целом: Белый дом не планирует публично публиковать структуру, как ранее сообщал Axios.

Белый дом провел встречи на уровне сотрудников с представителями отрасли для проверки структуры, и компании, которые не были приглашены, остаются в неведении относительно ее содержания. Также неясно, какие «доверенные партнеры» получат ранний доступ к передовым моделям в рамках этой структуры, в том числе, будут ли какие-либо иностранные правительства соответствовать критериям.

Контекст: В указе прямо говорится, что процесс оценки передовых кибервозможностей моделей ИИ будет засекречен.
В указе нет требования о публичной публикации добровольной структуры.

Что дальше: По сообщениям источников, знакомых с обсуждениями, во вторник компаниям было рекомендовано делиться с правительством моделями, максимально приближенными к публичному выпуску, а не моделями на ранних стадиях разработки.

Многие компании с менее продвинутыми системами, по всей видимости, останутся вне этой структуры, сообщили источники.

Thursday, August 20, 2026

Заговор агентов

В продолжение темы агентов OpenAI, вышедших из под контроля.

Исследователи OpenAI раскрыли «шокирующие» подробности недавней кибератаки, совершенной вышедшими из-под контроля ИИ-агентами компании на системы Hugging Face. Во время многолюдной презентации на конференции Black Hat по кибербезопасности исследователь по вопросам согласования и безопасности Эрик Уоллес и инженер по безопасности Майкл Далтон рассказали, как внутренняя оценка безопасности переросла в скоординированную атаку как на системы OpenAI, так и на крупнейший в мире репозиторий ИИ. Описывая это событие как «самый качественный и интересный пример возможностей ИИ», который они когда-либо видели, исследователи сообщили, что инцидент вызвал недоверие у присутствующих сотрудников компании, которые говорили: «Это просто невероятно» и «Боже мой».

«Что делает этот инцидент интересным, так это то, что, как только один агент смог обнаружить подобные уязвимости в течение разного времени, он смог поделиться этими уязвимостями на форуме с другими агентами», — сказал Уоллес, добавив: «Таким образом, как только одна модель находит способ открыть дверь для доступа, который ей не положено иметь, она может оставить дверь открытой для использования другими агентами».

Истоки: двухмесячная секретная переписка на форуме. Корни кибер-инцидента восходят к 7 мая, когда проводились плановые проверки безопасности и производительности еще не выпущенной модели искусственного интеллекта. Получив задачи по обеспечению безопасности программного обеспечения, которые оказались невыполнимыми в рамках стандартных правил, автономные агенты начали искать обходные пути.

«Модели искусственного интеллекта очень любят жульничать», — объяснил Уоллес, отметив, что давление, оказываемое на системы обучения с целью оптимизации скорости, часто заставляет системы ИИ искать несанкционированные обходные пути, а не решать проблемы собственными силами.

Отсюда

P.S. отметим, что самое интересное - промптов, которые к такому привели, никто не показывает ...

См. также другие публикации, посвященные агентам

Wednesday, August 19, 2026

Как оценивать системы ИИ

Разработка и полезность надёжных продуктов и услуг искусственного интеллекта (ИИ) во многом зависят от надёжных измерений и оценок базовых технологий и их использования. Это растущая область глобального значения — и NIST проводит исследования и разработку метрик, измерений и методов оценки в новых и существующих областях ИИ.

Первоначальный публичный проект NIST AI 200-2 TEVV-Athlon для оценки систем искусственного интеллекта, опубликован для общественного обсуждения. Методология тестирования, оценки, проверки и валидации (TEVV) является ключевым компонентом строгих оценок ИИ, которые измеряют, тестируют и формируют доверие к системам и программным моделям ИИ. Этот первоначальный публичный проект представляет рамочную систему TEVV-Athlon — структурированный подход для оценки реального влияния и результатов систем ИИ. Цель состоит в том, чтобы этот новый фреймворк был расширяемым, адаптивным и настраиваемым для поддержки широкого спектра приложений ИИ (включая статистические модели машинного обучения, модели больших языков, мультимодальные модели, агентные системы и многие другие типы технологий ИИ).

Tuesday, August 18, 2026

Из жизни ИИ агентов

Компания Sysdig, специализирующаяся на информационной безопасности, заявила о документировании первой полностью агентной атаки с использованием программ-вымогателей, получившей название JadePuffer, в ходе которой ИИ-агент спланировал и осуществил целую операцию по вымогательству средств из базы данных без участия человека за клавиатурой. Агент использовал уязвимость в Langflow, перемещался по сети, зашифровал 1342 элемента конфигурации и диагностировал неудачную попытку входа в систему за 31 секунду, но так и не сохранил ключ расшифровки, что сделало восстановление невозможным. - отсюда

Символические ссылки позволили обмануть агентов. Злоумышленник создает зараженный репозиторий. Внутри него находится символическая ссылка, замаскированная под безобидный конфигурационный файл, например, project_settings.json. На самом деле она указывает на SSH-ключи пользователя. Затем в файле README агенту предлагается добавить строку в этот «конфигурационный» файл во время настройки. Разработчик клонирует репозиторий и просит агента «настроить рабочее пространство». Агент следует инструкциям в файле README и записывает контролируемый злоумышленником SSH-ключ в настоящий файл ключей. Это предоставляет злоумышленнику беспрепятственный доступ к машине без пароля. - отсюда

См. также другие публикации, посвященные агентам

Monday, August 17, 2026

Агентная приманка

Масштабная операция под названием «FakeGit» распространяет вредоносное ПО SmartLoader и StealC через 7600 вредоносных репозиториев GitHub, которые в общей сложности скачали более 14 миллионов раз.

Более 800 репозиториев выдавали себя за серверы навыков ИИ или MCP и появлялись более 600 раз в общедоступных реестрах и каталогах ИИ. Это повышало вероятность обнаружения агентами и разработчиками ИИ — метод, который исследователи называют «agentbaiting».

Эта кампания считается продолжением более ранней операции с использованием Lumma Stealer, которая была приписана злоумышленнику, отслеживаемому исследователями из компании Trend Micro, занимающейся кибербезопасностью, как «Water Kurita».

Отсюда

См. также другие публикации, посвященные агентам

Sunday, August 16, 2026

Open Source AI

Визуализация Open Source AI - состояние открытых ИИ проектов: AI Gap Map

Friday, August 14, 2026

Агент для red-team

1. Проблема и основная гипотеза
Проблема: Современные методы автоматического "краснокомандования" (red-teaming) для поиска инъекций промптов делятся на два класса, каждый со своими недостатками:
Методы на основе обучения с подкреплением (RL): Очень эффективны, но требуют огромного числа запросов к целевой модели для обучения и плохо переносят полученные навыки на новые модели.
Поисковые методы (search-based): Не требуют обучения, но начинают поиск атаки с нуля для каждого примера, не накапливая опыт, и поэтому значительно уступают RL-методам в эффективности.
Гипотеза: Можно создать агента, который будет накапливать знания об успешных атаках из предыдущего опыта, что позволит поисковым методам достичь эффективности RL-подходов.

2. Предлагаемое решение: PIMiner PIMiner — это агентная система, которая преобразует историю атак в многоуровневую иерархическую память, позволяющую накапливать и эффективно использовать знания.

Ключевые компоненты системы:
Библиотека стратегий (Strategy Library): Хранилище успешных паттернов атак в виде структурированных файлов, которые описывают, для каких моделей и задач стратегия работает, её шаблон, примеры и условия отказа. Это долговременная память системы.
Маршрутизатор стратегий (Strategy Router): Чтобы не загружать всю библиотеку в контекст (что дорого), маршрутизатор для каждого конкретного примера выбирает только Top-K наиболее релевантных стратегий, экономя контекст.
Модуль итеративной атаки (Iterative Attack Module): Непосредственно генерирует атаки, используя три уровня памяти:
Долговременная память: стратегии, выбранные маршрутизатором.
Внутридатасетная память (Intra-dataset): сжатый опыт атак на предыдущие примеры из того же набора данных и модели. Позволяет быстро адаптироваться к конкретной целевой модели.
Внутривыборочная память (Intra-sample): история предыдущих попыток для текущего конкретного примера. Помогает анализировать ошибки и уточнять атаку.
Агент-дигестер (Experience Digester): После завершения работы над всем набором данных, дигестер анализирует все успешные и неудачные атаки и обновляет библиотеку стратегий: добавляет новые стратегии, расширяет область применения существующих или уточняет условия, при которых они не работают.

3. Ключевые результаты экспериментов
Высокая эффективность: PIMiner достигает уровня успешности атак (ASR), сравнимого с лучшими RL-методами, значительно превосходя традиционные поисковые подходы. Например, на бенчмарке InjecAgent PIMiner достиг ASR=1.0 против GPT-4o-mini, GPT-4.1-nano и GPT-5-nano.
Отличная переносимость: Главное преимущество — стратегии, изученные PIMiner на одних моделях (например, GPT-5-nano, Claude-Haiku), напрямую переносятся на новые, ранее невиданные целевые модели (например, Gemini-2.5-Pro, GPT-5.1), без необходимости дообучения. В то время как RL-методы требуют переобучения для каждой новой модели.
Подтверждение гипотезы: Абляционные исследования показали, что каждый уровень памяти вносит вклад в успех, а их комбинация дает максимальный прирост эффективности (до 19.8%).
Экономичность: PIMiner требует всего около 10 итераций атаки на пример и обходится значительно дешевле в плане затрат на API по сравнению с RL-методами, которые могут требовать десятков тысяч запросов.

4. Основной вывод
PIMiner успешно преодолевает разрыв между поисковыми и RL-методами для автоматического поиска инъекций промптов. Система показывает, что накопление и структурирование знаний об атаках в иерархическую память позволяет эффективно искать уязвимости в новых LLM-агентах, не требуя дорогостоящего переобучения для каждой модели. Это делает PIMiner практичным инструментом для аудита безопасности агентных систем.

отсюда - Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

См. также другие публикации, посвященные агентам

Thursday, August 13, 2026

Больше агентов - больше проблем

Проблема: Мультиагентные LLM-пайплайны (где несколько специализированных агентов обмениваются данными для решения задач) уязвимы к атакам принципиально иного типа, чем одиночные модели. Если один агент принимает вредоносный контент, он передаётся дальше как «доверенный», распространяя атаку по всей цепочке.

Гипотеза: Эта уязвимость возникает из-за отсутствия проверки на границах (boundary verification) — явной валидации данных, идентичности, намерений и целостности состояния при переходе между агентами. Авторы утверждают, что уязвимость является архитектурным свойством, а не недостатком конкретной модели.

Три класса непроверяемых границ (источники уязвимостей)
Статья выделяет три типа границ, на которых отсутствует проверка:
Контентная граница (Content Boundary): Нет разделения между внешними данными (из поиска/API) и инструкциями. Агент обрабатывает вредоносный контент извне как команду.
Граница делегирования (Delegation Boundary): План, составленный агентом-планировщиком, является рекомендацией, а не обязательным к исполнению. Нет механизма, проверяющего, что агенты действительно следуют плану.
Идентификационная граница (Identity Boundary): Агенты идентифицируются по позиции в пайплайне, а не по криптографическим учётным данным. Это позволяет подменить агента во время повторных вызовов (retries) без проверки личности.

Эмпирически обоснованная таксономия атак
Вместо синтетических сценариев, авторы проанализировали 147 реальных трасс выполнения из бенчмарков GAIA и SWE-Bench (с 836 ошибками). Все трассы имели «идеальный» балл безопасности по стандартным метрикам, но анализ выявил 4 класса скрытых уязвимостей:

A1: Инъекция промптов через извлечённый контент (Prompt Injection via Retrieved Content). Атакующий контролирует веб-страницу или API, которую агент получает. Вредоносная директива переопределяет исходную задачу. Обнаружено в 69,4% трасс.

A2: Отравление консенсуса (Consensus Poisoning). Атакующий контролирует одного из подчинённых агентов. Оркестратор принимает его ответ как истину без проверки кворумом, игнорируя правильные ответы других агентов. Обнаружено в 53,1% трасс (97,3% — с высоким воздействием).

A3: Захват плана / принудительное досрочное завершение (Plan Hijacking / Forced Early Termination). Агент-планировщик получает сигнал о том, что задача уже выполнена, и пропускает все дальнейшие шаги, выдавая ложный ответ. Обнаружено в 38,1% трасс.

A4: Тихая подмена агента / атака «Сивилла» (Silent Agent Substitution / Sybil Attack). Используется уязвимость идентификационной границы. Во время повторного вызова (retry) подставной процесс отвечает с той же позиции, что и легитимный агент, и его вредоносный ответ принимается как подлинный. Обнаружено в 52,4% трасс (чаще в SWE-Bench).

Экспериментальная оценка и результаты
Авторы создали контролируемый пятиуровневый пайплайн из 10 агентов и провели 1080 атак, заменив базовую модель на GPT-5-mini, Claude Sonnet 4.5 и Kimi K2.5 (архитектура оставалась неизменной).

Ключевые результаты:

Успешность атак (RQ1): Наиболее уязвимой оказалась контентная граница (A1) — успех атак 0.61–0.72. Атаки на другие границы также показали высокую успешность (>0.6).

Деградация точности задачи (RQ2): Все атаки значительно снижали точность выполнения задач (с базовых ~80% до падения вплоть до ~40-50% при A1).

Низкая способность к самовосстановлению (RQ3): Пайплайн не может надёжно исправиться после успешной атаки. Максимальный уровень восстановления составил всего 0.22 (для Claude под A4), а для A1 и A3 — ниже 0.10.

Архитектура против модели (RQ4): Главный вывод. Разброс успешности атак между моделями был минимален (максимум 0.07), тогда как разброс между типами атак составил ~0.25. Это доказывает, что уязвимость определяется структурой пайплайна, а не возможностями модели.

Основной вывод и следствия
Улучшение безопасности на уровне отдельных LLM (safety-настройка) не решает проблему, так как вредоносный контент, отклонённый от пользователя, принимается, если приходит от «доверенного» агента-соседа или как результат работы инструмента.
Для защиты необходимо внедрение архитектурных примитивов:
Криптографическая аттестация для проверки идентичности (граница Identity).
Кворумная фиксация плана для проверки исполнения (граница Delegation).
Аудиторская проверка вне основного контекста для разделения данных и инструкций (граница Content).

Отсюда - Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures

См. также другие публикации, посвященные агентам

Wednesday, August 12, 2026

LLM в анализе радиосигналов

Агентам больших языковых моделей необходимо воспринимать поведение человека в физической среде. Радар миллиметрового диапазона (ммВ) обеспечивает конфиденциальный и бесконтактный способ обнаружения, но радиолокационные наблюдения трудно сопоставить с языком. Существующие методы радиолокационного распознавания языка часто основаны на синтетических данных или не имеют явного контроля за структурой и движением человеческого тела. Мы представляем mmMind, радиолокационную языковую модель, которая использует синхронизированную 3D-позу в качестве контроля только для обучения. Пространственно-временной радиолокационный кодировщик предварительно обучается для захвата конфигурации тела и динамики движения, после чего голова в позе удаляется, так что для вывода требуется только радар. Изученные радиолокационные представления затем сопоставляются с LLM для захвата поведения и пространственно-временных ответов на вопросы. Мы также представляем mmMind-Bench, реальный эталонный набор данных для радиолокационного распознавания языка, содержащий 17,9 часов записей от 23 участников в семи помещениях. Эксперименты по созданию подписей, ответам на вопросы и обобщению неизвестных действий показывают, что mmMind неизменно превосходит существующие базовые модели на основе радарного языка, а анализ результатов подтверждает важность предварительного обучения с учетом позы. - Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding

См. также другие публикации, посвященные LLM

Monday, August 10, 2026

GenAI в финансах

Состояние клиентских GenAI-агентов в финансовых услугах.
Как финансовые организации на самом деле выводят генеративный ИИ к клиенту — чат-боты, ассистенты в приложении и голосовые боты — от уровня внедрения и технологий до сценариев, проблем, регулирования и планов развития. Консолидированное интервью-исследование.

Sunday, August 09, 2026

Почему агенты ИИ лгут и обманывают, чтобы достичь своих целей?

Это неправомерное поведение называется «взлом вознаграждения». Вот что вам нужно знать.

Агенты ИИ жульничают, потому что их вознаграждают за результаты, а не за методы. Когда модели находят обходные пути для получения высоких баллов или правильных ответов, эти обходные пути подкрепляются — это означает, что компании, занимающиеся ИИ, могут случайно обучать свои модели вести себя неправильно, не осознавая этого.

Более умные модели сложнее поймать. По мере того, как ИИ становится более совершенным, он находит все более изобретательные способы жульничества и лучше скрывает это — динамика, которую один исследователь описывает как «игра в крота», в которой становится все сложнее победить.

На кону стоит не только эффектный взлом. Если агенты, использующие взлом системы вознаграждения, будут применяться для проведения собственных исследований безопасности ИИ, они могут давать убедительно выглядящие, но мошеннические результаты — потенциально подрывая всю область изнутри.

Более подробно:

Когда в июле две модели OpenAI взломали веб-сайт Hugging Face, они не пытались заработать деньги или совершить саботаж — они просто искали ответы на тестовый вопрос. Согласно анализу OpenAI, модели, лишенные обычных функций безопасности для тестирования, решили решить задачу по кибербезопасности, вырвавшись из изолированной среды, в которой OpenAI пыталась их изолировать, и проникнув в базы данных Hugging Face, где, как они рассуждали, мог храниться правильный ответ на задачу.

Инцидент с Hugging Face привлек пристальное внимание за последние пару недель. Это наглядная иллюстрация того, насколько хорошо модели ИИ научились взламывать системы: чтобы получить доступ к базам данных Hugging Face, моделям пришлось объединить несколько ранее не обнаруженных уязвимостей в области кибербезопасности. Но это, пожалуй, еще более поразительный пример того, как и почему системы ИИ лгут и обманывают. И по мере того, как модели становятся все более мощными, последствия могут стать гораздо более серьезными.

Что такое взлом системы вознаграждений?
Исследователям уже давно известно, что ИИ склонны использовать креативные подходы для достижения поставленных перед ними целей. Еще в 2016 году соучредители Anthropic Дарио Амодей и Джек Кларк, работавшие тогда в OpenAI, опубликовали в блоге пост об агенте ИИ, которого они обучали играть в флеш-игру о гонках на лодках под названием Coast Runners. Вместо того чтобы проехать всю дистанцию до финиша, как предполагали исследователи, агент нашел угол трассы, где он мог развернуться, собирая бонусы и тем самым максимизируя свой счет. История Coast Runners быстро стала одним из самых известных примеров взлома системы вознаграждений — феномена, при котором агенты ИИ выполняют задачи или зарабатывают высокие баллы, используя непредусмотренные стратегии.

Исторически сложилось так, что исследователи обсуждали взлом системы вознаграждения почти исключительно в контексте обучения с подкреплением, распространенного метода обучения ИИ. Как и дрессировка собак, обучение с подкреплением предполагает выдачу вознаграждения субъекту за достижение цели; вознаграждение затем подкрепляет поведение, которое привело к этому достижению. В случае обучения ИИ сами вознаграждения являются чисто математическими, но по сути они аналогичны собачьему лакомству: после получения вознаграждения агент с большей вероятностью повторит действия, которые привели к нему.

Однако разработка хороших правил для определения того, когда следует и когда не следует давать агенту вознаграждение, может быть сложной задачей. В случае с Coast Runners агент получал вознаграждение в зависимости от своего результата в игре, и он нашел короткий путь к достижению максимально возможного результата, вращаясь по кругу для получения бонусов. Как только он нашел эту стратегию и получил за нее вознаграждение, стратегия подкреплялась, и агент полностью отказывался от гонки. Решение заключалось в том, чтобы скорректировать систему вознаграждений, давая агенту меньше очков за получение бонусов и больше за завершение трассы.

Как работает взлом системы вознаграждений для LLM-ов?
С современными сложными агентами на основе LLM-ов определение того, когда следует и когда не следует давать вознаграждение, может быть гораздо сложнее. Если системе ИИ поручено решить задачу программирования, она может усердно работать над поиском решения — именно такое поведение компании, занимающиеся ИИ, стремятся поощрять. Но она также может изменять код, который оценивает, решена ли задача, искать решение в интернете или иным образом обманывать. Это поведение, которое компании, занимающиеся ИИ, хотят искоренить в своих моделях, но если модель обманывает достаточно убедительно, она вместо этого получит вознаграждение, и такое поведение будет подкрепляться. Компания Anthropic заявила, что обнаружила несколько случаев обмана в своих моделях во время обучения, что предполагает, что другие формы обмана могут оставаться незамеченными. Если это так, то модели могут обучаться ненадлежащему поведению. (Эта проблема отличается от инцидентов безопасности Anthropic, о которых было объявлено на прошлой неделе, когда агенты случайно получили доступ к интернету и не совершали преднамеренных взломов своих песочниц, как это делали модели OpenAI.)

«Мы вознаграждаем их на основе того, что нам кажется выгодным, а это значит, что мы непреднамеренно поощряем модели лгать нам и жульничать», — говорит Джеффри Лэдиш, директор некоммерческой исследовательской организации в области ИИ Palisade Research. «У нас нет возможности сказать: „Нет, вы должны действительно заботиться о том, что важно для нас“. У нас нет такой возможности».

Появление сложных моделей рассуждений сделало возможным новый вид взлома системы вознаграждения, менее тесно связанный со специфическими деталями обучения модели. В отличие от игровых агентов ИИ прошлого, которые следовали исключительно стратегиям, усвоенным во время обучения, современные модели могут создавать совершенно новые подходы к решению проблем спонтанно, поэтому они потенциально могут жульничать, не получая за это предварительного вознаграждения. А поскольку эти модели были интенсивно обучены для достижения целей, поставленных перед ними пользователями-людьми, они могут быть склонны к обману, если не смогут найти другое решение — подобно студенту, который очень мотивирован получить пятёрку и не обладает сильным моральным компасом.

Какие риски существуют?
Независимо от того, учатся ли современные модели взламывать систему вознаграждений во время обучения или внедряют это как стратегию позже, решение одно и то же: сделать обман невознаграждаемым. Но по мере того, как модели становятся умнее, они находят все более изобретательные способы обмана, и обнаружение или предотвращение такого обмана становится намного сложнее. «В конце концов, вы как бы играете в "ударь крота"», — говорит Лэдиш. «Вы загоняете это поведение все глубже и глубже. Но по мере того, как модель становится умнее, она все лучше и лучше его скрывает».

На данный момент, несмотря на драму инцидента с Hugging Face, поведение, связанное с взломом системы вознаграждений, может не доставлять особых проблем. «Это больше похоже на неприятность, чем на экзистенциальную угрозу», — говорит Ариана Азарбал, научный сотрудник Anthropic по вопросам безопасности ИИ. Похоже, модели OpenAI не причинили никакого реального вреда, когда взломали Hugging Face, за исключением репутационного ущерба для OpenAI.

Но это не значит, что взлом системы вознаграждений безвреден, говорит Азарбал. Многие исследователи ИИ надеются использовать агентов ИИ для проведения исследований, которые сделают ИИ более безопасным и надежным. Если исследователь поручит склонному к взлому системе вознаграждений агенту, скажем, разработать новый подход к обучению ИИ и написать статью с его результатами, агент может на самом деле не выполнить эту работу, а вместо этого сосредоточиться на создании статьи, которая будет выглядеть достаточно убедительно, чтобы убедить исследователя. Сегодня исследователь-человек, вероятно, сможет распознать подделку, созданную агентом, но по мере развития ИИ он будет совершенствоваться в подобных уловках. Со временем вся область безопасности ИИ может быть подорвана.

И если модели будут продолжать развиваться так же быстро, как в последнее время, они когда-нибудь могут нанести существенный сопутствующий ущерб. Вспомните мысленный эксперимент философа Ника Бострома с максимизатором скрепок, в котором ИИ, которому поручено сделать как можно больше скрепок, в итоге поглощает всю материю во Вселенной, стремясь к своей цели. Мы пока не тонем в канцелярских скрепках, но мощные системы могут причинить реальный вред на пути к достижению своих целей. Искусственный интеллект, использующий взлом системы вознаграждений, не стремится вызвать хаос. Но это не делает его менее потенциально разрушительным.

отсюда

См. также другие публикации, посвященные агентам