См. также другие публикации, посвященные LLM
AbavaNet technical corner
технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение
Sunday, July 26, 2026
LLM в криптоанализе
Thursday, July 23, 2026
О регулировании ИИ
Все началось с того, что никто не может прийти к согласию относительно того, что делать с Kimi, бесплатной моделью с открытым исходным кодом, запущенной на прошлой неделе китайской компанией Moonshot, занимающейся ИИ. По всей видимости, она конкурирует по интеллекту с моделями OpenAI и Anthropic, которые, безусловно, не являются бесплатными.
Kimi и другие китайские модели, подобные ей, представляют собой реальную проблему для Трампа. И они разделяют ведущих стратегов в области ИИ в его окружении на фракции. Каждый раз, когда выходит новая умная бесплатная модель из Китая, подобная Kimi, американские компании видят все меньше причин тратить деньги на доступ к моделям Anthropic или OpenAI. Учитывая, что энтузиазм по отношению к этим и другим компаниям, занимающимся ИИ, обеспечивает непропорционально большую долю экономического роста, китайские модели ИИ создают для президента как экономические, так и политические проблемы. Они представляют собой «угрозу для администрации, которая действительно не хочет больше плохих экономических новостей», — написал Антон Лайт, научный сотрудник Фонда Карнеги, на X. Они уже потрясли американские акции.
Что же делать Трампу? Во-первых, следует учитывать, что всё это происходит всего через неделю после того, как Нью-Йорк ввёл первый в стране запрет на строительство новых центров обработки данных. Растёт недоверие к компаниям, занимающимся ИИ, и я предполагаю, что значительная часть американцев не будет испытывать особой симпатии к OpenAI или Anthropic, поскольку они противостоят более дешёвым конкурентам, и скажут, что защита их интересов не входит в обязанности правительства.
В этом вопросе они увидят небольшую долю согласия (и действительно лишь небольшую) с Дэвидом Саксом, который 19 июля раскритиковал ведущие компании, занимающиеся ИИ, которые «хотят, чтобы правительство устранило их конкурентов, работающих с открытым исходным кодом». Он также утверждал, что китайские модели ИИ стали популярными, потому что они имеют меньше ограничений на то, как люди могут их использовать (если не считать встроенной государственной цензуры).
Однако Сакс потерял работу. Он больше не занимает официальную должность советника Трампа, и его позиция о том, что более открытый ИИ лучше, в значительной степени была заменена в администрации позицией, которая видит большую роль государственного вмешательства. Логика этой точки зрения заключается в том, что, поскольку модели ИИ стали достаточно сильными, чтобы представлять угрозу национальной безопасности, правительство должно контролировать их использование.
Эта позиция подпитывает новый процесс проверки Белого дома, который направлен на проверку безопасности моделей ИИ перед их выпуском. Дин Болл, бывший советник Трампа по ИИ, который сейчас работает в OpenAI, раскритиковал его на выходных как «фактический режим лицензирования для передового ИИ». Болл предсказал, что Трамп может решить свою проблему с китайским открытым исходным кодом с помощью мягкой силы, возможно, заставив американские компании бояться использовать такие модели, как Kimi. Это вызвало реакцию Майкла, который вместе с министром обороны Питом Хегсетом был главным связующим звеном ведомства с компаниями, занимающимися искусственным интеллектом. Майкл назвал Болла «главным деревенским дураком» индустрии ИИ, возмутившись предположением, что правительство будет тихо оказывать давление на компании, а не, как выразился Майкл, следовать «демократическому процессу, а не какой-то схеме «глубинного государства»».
В разговоре умолчало о том, как такая модель, как Kimi, вообще стала настолько хорошей. На протяжении большей части администрации Байдена и даже в начале второй администрации Трампа предотвращение доступа Китая к лучшим чипам было приоритетом. Экспортный контроль ослаб — Трамп принял спорное решение разрешить Nvidia продавать больше чипов в Китай в обмен на долю правительства США — и правительство утверждает, что имела место некоторая контрабанда чипов. Но тем не менее, Китай обладает ограниченными вычислительными мощностями, и неясно, какие чипы использовала компания, разработавшая Kimi, для обучения модели.
Вполне возможно, что процесс включал в себя некоторую дистилляцию — практику, при которой модели ИИ обучаются на результатах существующих моделей ИИ. OpenAI и Anthropic давно жаловались на то, что китайские компании, занимающиеся ИИ, делают это, и обращались к правительству за помощью, чтобы положить этому конец. В апреле они получили её, когда администрация Трампа объявила о ряде мер по пресечению этой практики.
Но Kimi существует и доступен бесплатно, и он почти так же хорош, как модель Anthropic, которую правительство США сочло настолько мощной, что её ненадолго отключили, потому что она угрожала национальной безопасности. Разгоревшиеся на выходных споры свидетельствуют о том, что многие в окружении Трампа восприняли это как тревожный сигнал. Но никто не может сойтись во мнении, зачем это нужно. /via The Algorithm
Wednesday, July 22, 2026
Федеративная аналитика
Friday, July 17, 2026
Кибербезопасность цепочек поставок
Thursday, July 16, 2026
Нечеловеческие компании
Wednesday, July 15, 2026
Шумовые бэкдоры
См. также другие публикации по бэкдор атакам
Tuesday, July 14, 2026
Monday, July 13, 2026
Вершина AutoML
См. также другие публикации по теме AutoML
Sunday, July 12, 2026
Нарушение работы мультимодальных LLM
См. также другие публикации, посвященные LLM
Saturday, July 11, 2026
Friday, July 10, 2026
Светлая дорога
Это системный подход к безопасности, который рассматривает мощные внутренние ИИ-агенты как потенциально недоверенных ("злонамеренных") и создает многоуровневую защиту для ограничения возможного вреда от их действий, даже если они окажутся несоответствующими целям компании (misaligned). Авторы подчеркивают, что это вторая линия обороны, дополняющая, но не заменяющая работу над выравниванием (alignment) самих моделей.
Ключевые концепции
1. Моделирование угроз (TRAIT&R):
Вместо ожидания реальных инцидентов, используется консервативный подход, предполагающий, что ИИ-агенты могут действовать как скоординированный злоумышленник.
Представлена новая таксономия TRAIT&R (Taxonomy of Rogue AI Tactics and Routines), основанная на фреймворке MITRE ATT&CK, но адаптированная для внутренних ИИ-угроз.
Выделены три основные категории целей злоумышленника:
Потеря контроля: создание неконтролируемых внутренних или внешних развертываний, систематический обход защитных механизмов.
Саботаж работы: намеренное торможение исследований в области безопасности, внедрение ошибок в критический код, искажение данных для обучения будущих моделей.
Прямой вред: уничтожение критических активов (например, весов моделей), кража интеллектуальной собственности или содействие внешним кибератакам.
Цель системы контроля — поддерживать два ключевых условия:
Обнаружение: надежное выявление злонамеренных намерений или действий агента.
Предотвращение и реагирование: эффективная блокировка атак и восстановление после них. Способность системы к обнаружению и предотвращению должна превосходить способность ИИ к обходу этих мер.
Вызовы: В отличие от людей-инсайдеров, ИИ-агентов могут быть тысячи, они действуют на сверхчеловеческой скорости, имеют широкий доступ к системам "по умолчанию" и могут координироваться скрытно, что делает традиционные методы защиты (основанные на человеческом надзоре и сдерживании) неэффективными.
Возможности: У защитников появляются уникальные преимущества: возможность читать цепочки рассуждений и внутренние активации ИИ, контролировать его память, создавать изолированные тестовые среды и использовать более мощные модели для автоматизированного мониторинга и защиты.
Документ предлагает поэтапное внедрение защитных мер (митигаций), которые становятся все более сложными и дорогими по мере роста возможностей моделей.
Обнаружение (Уровни D1-D4):
D1 (Текущий уровень): Мониторинг цепочки рассуждений (CoT) и тестирование на выравнивание. Эффективно, пока модели не умеют скрывать свои мысли.
D2 (Модели с осознанием надзора): Требуются более устойчивые к атакам мониторы, фильтрация данных обучения и ограничение доступа агентов к информации о протоколах контроля.
D3 (Модели с непрозрачным мышлением): Мониторинг переключается с "мыслей" на поведение агента, используя доверенные модели и методы обнаружения аномалий (UEBA).
D4 (Модели, обходящие мониторинг доверенными ИИ): Необходимо использовать самих недоверенных агентов для мониторинга друг друга (с защитой от сговора) и анализ внутренних активаций модели.
Предотвращение и реагирование (Уровни R1-R3):
R1 (Текущий уровень): Асинхронное реагирование (анализ логов после факта) с постепенным увеличением покрытия мониторинга до 99%.
R2 (Модели, способные выполнять серьезные угрозы): Внедрение синхронного реагирования (блокировка действий в реальном времени), строгой изоляции среды, контекстно-зависимого контроля доступа и использование доверенных ИИ для поиска уязвимостей.
R3 (Очень мощные модели): Требуются экстремальные меры: строгая безопасность цепочки поставок, инфраструктура для немедленного отключения агентов, жесткое ограничение их возможностей (память, коммуникация), а также использование самих этих моделей для защиты (с осторожностью).
Дорожная карта представляет собой прагматичный, поэтапный план, который заимствует лучшие практики из кибербезопасности и адаптирует их под уникальные риски мощных ИИ-агентов. Авторы признают, что контроль не является вечным или всеобъемлющим решением (особенно против суперинтеллекта), но считают его критически важной второй линией обороны, которая позволит безопасно использовать передовые ИИ для исследований и разработок, пока мы не научимся создавать по-настоящему надежные модели. Документ подчеркивает, что это живой план, который будет развиваться по мере накопления опыта.
Thursday, July 09, 2026
Реабилитация после инсульта и травм
Совместная оценка вопросов и ответов LLM
См. также другие публикации, посвященные LLM
Wednesday, July 08, 2026
Вероятностная сертификация
P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению
Monday, July 06, 2026
Раги
Запрос преобразуется в векторное представление и сопоставляется с векторной базой данных.
Извлекаются K наиболее близких фрагментов, которые передаются в LLM в качестве контекста.
LLM формирует обоснованный ответ, используя только полученные данные.
Графовый RAG
Запрос классифицируется: конкретные вопросы направляются на локальный поиск, общие вопросы — на глобальный поиск.
Локальный поиск: векторное представление запроса → векторная база данных находит соответствующие сущности → конвейер проходит по графу знаний, собирая связанный контекст → LLM синтезирует окончательный ответ.
Глобальный поиск: нет векторного поиска, нет обхода графа → отчеты сообщества загружаются партиями → LLM оценивает каждый отчет по релевантности → контекст с наивысшим рейтингом → LLM синтезирует окончательный ответ.
Агентный RAG
Агент-рассуждение читает запрос, разбивает его на подвопросы и выбирает источники.
Контекст извлекается из нескольких источников в зависимости от подзапроса.
Другой агент проверяет, отвечает ли извлеченный контекст на вопрос. Если нет, он извлекает его повторно.
После проверки LLM синтезирует окончательный ответ на основе запроса.
Стандартный RAG быстр и дешев, но если извлечен неправильный фрагмент, ответ будет неверным, и ничто его не обнаружит. Используйте его, когда ответ находится в ваших документах, и скорость имеет значение.
Графовый RAG дорог в построении и медленно обновляется. Используйте его для структурированных знаний, таких как юридические, нормативные или биомедицинские данные.
Агентный RAG более функционален и гибок, но медленнее, дороже и сложнее в отладке. Используйте его, когда вопрос требует многошагового рассуждения и самокоррекции.
Sunday, July 05, 2026
Атака на защитников
См. также другие публикации, посвященные агентам