Wednesday, December 06, 2023

Хмм ...

Простая иллюстрация работы HMM (Hidden Markov Model). Код на Python.

Граф знаний и LLM

Перекачивание графа знаний в LLM. Neo4J позиционирует себя как основной продукт для knowledge graph. См. также следующую публикацию

См. также другие публикации, посвященные LLM

Tuesday, December 05, 2023

Кругом вода

О кибербезопасности систем водоснабжения

О социальной динамике

Когда-то с подобных работ начинались проекты по краудсенсингу. В социальной динамике исследовались перемещения людей на основе треков их мобильных устройств (оригинально - в MIT). Вот современное состояние - анализ сегрегации жителей города

Friday, December 01, 2023

Аудит и сертификация систем машинного обучения

Презентация, посвященная аудиту систем машинного обучения. Аудит должен быть обязательной процедурой для промышленных систем ИИ.

Thursday, November 30, 2023

Обучение без учителя

"Для внедрения ИИ в практику нужны серьезные технические решения, к которым готовы далеко не все медучреждения, сказывается и дефицит кадров в этой области, добавляет гендиректор сервиса онлайн-расшифровки снимков «Честная медицина» Дмитрий Росляков. Михаил Виноградов основную проблему видит в том, что ИИ приходится учиться в том числе на снимках, где врач не выделил патологию, никак не прокомментировал данные и не подтвердил диагноз."

Отсюда

Wednesday, November 29, 2023

Техники допроса

Техники prompt engineering

См. также другие публикации по теме prompt и LLM

См. также другие материалы, посвященные подсказкам

Tuesday, November 28, 2023

Управляемые нейронные сети

Steerable Neural Networks. Расширение для CNN, когда возможна не только трансляция, нои другие преобразования (повороты и т.п.)

Забудь все это

Программные подходы к стиранию памяти LLM

См. также другие публикации, посвященные LLM

Friday, November 17, 2023

LLM оценивает LLM

Использование LLM для оценки LLM

См. также другие публикации, посвященные LLM

Как учить LLM

В порядке борьбы с галлюцинациями: данные берутся из внешних источников. LLM отвечает за интепретацию полученных данных в контексте запроса.

Отсюда

См. также другие публикации, посвященные LLM

Sunday, November 12, 2023

Нюансы Redis

Хорошее описание деталей работы с Redis

См. также другие публикации, посвященные Redis

Friday, November 10, 2023

О контрфактических примерах

On the Practical Generation of Counterfactual Examples

One of the important elements in evaluating the stability of machine learning systems are the so-called adversarial examples. These are specially selected or artificially created input data for machine learning systems that interfere with their normal operation, are interpreted or processed incorrectly. Most often, such data are obtained through some formal modifications of the real source data. This article considers a different approach to creating such data, which takes into account the semantic significance (meaning) of the modified data - counterfactual examples. The purpose of the work is to present practical solutions for generating counterfeit examples. The consideration is based on the real use of counterfactual examples in assessing the robustness of machine learning systems.

Картинки из текста

Практическое применение text-to-image генераторов: создание состязательных примеров для тренировки систем распознавания изображений

Tuesday, November 07, 2023

О состязательных тренировках

Регулярный поход к возмущению исходных данных для построения устойчивых моделей анализа трафика. Интересная и практическая идея.

Monday, November 06, 2023

Инверсия черного ящика

Атака инверсии модели (восстановление приватных тренировочных данных) в режиме черного ящика. Довольно впечатляющие результаты. От атакуемой модели известны только метки (результаты работы).

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Вижу поле боя

Интересная работа по военному зрению - A Review of Intelligent Vision Enhancement Technology for Battlefield

Saturday, November 04, 2023

Оглянись назад

Интересная техника задания вопросов LLM - Step-Back Prompting. Формирование абстрактных знаний для цепочки рассуждений.

См. также другие публикации, посвященные LLM

Friday, November 03, 2023

Где ваши тесты?

"...developers must watermark generated outputs and share results of safety tests conducted by so-called red teams" - из американского закона о безопасных системах ИИ.

См. также другие публикации, посвященные Red Team

Thursday, November 02, 2023

Знай это !

Руководство по загрузке фактов в LLM. RAG - retrieval augmented generation

См. также другие публикации, посвященные LLM

Wednesday, November 01, 2023

Про работу

Очень правильный текст от рекрутера из Linkedin. Именно так и нужно делать. Один момент добавлю к тому, что ниже. Домашняя работа - изучите и другие вакансии в компании. Нужно понять про компанию - кто они? Постарайтесь понять, что (кто) им нужно на самом деле. Кто они в технологиях (стек, архитектуры и т.п.). И исходя их этого и правьте (настраивайте) резюме.

Поиск работы за рубежом - это навык. Ему можно научиться, но важно разобраться, как именно работает система.

Очень важно, какую историю вы о себе рассказываете. Ваша история должна быть последовательна, из неё должно быть очевидно, как именно вы росли в профессию.

Затачивайте весь свой бэкграунд под конкретную вакансию или под ту позицию, которую ищете (если речь про публичное резюме или профиль в Linkedin).
Зачем это делать:
Никто не догадается, что вы идеально подходящий кандидат, пока вы это не объясните в резюме.
Если работодатель не увидит в вашем резюме, чем ваш опыт релевантен задачам вакансии, вы получите отказ.
Вас может спасти прямой рефёрал, который поручится, что вы норм. Но на всех работодателей рефёралов не напасёшься.

Как описывать опыт, если кратко: вот что я делал, вот каких результатов добивался, вот такая ответственность у меня была, вот так я развивался как профессионал в течении нескольких лет
Резюме нужно затачивать под позицию, под тип позиции и даже под индустрию.
Очень важно показывать правильные ключевые слова, правильное описание того, что вы делали.
Везде нужно описывать достижения и/или результаты.

Со стороны почти никогда не понятно, кто вы как профессионал. Люди — не телепаты! Поэтому, делайте краткое Summary в начале вашего резюме, чтобы объяснить незнакомому человеку, в чем именно вы профи.
Summary должен быть очень релевантно той позиции, на которую вы подаётесь.

Компания вас нанимает не для того, чтобы закрыть вакансию, а для того, чтобы решить какую-то бизнес-задачу.
Работодатель хочет увидеть, что у вас уже есть релевантный опыт, который компания хочет купить. Чтобы это показать, опишите в своём резюме результаты, которые вы достигали ранее и заточите их под требования вакансии. Если работодатель видит, что вы достигали ровно таких результатов, которые нужны компании, он априори считает, что вы способны решить задачу его бизнеса.

Руководство по визуализации

Объемное руководство по визуализации данных

P.S. см. также другие публикации, посвященные визуализации данных

Прогнозирование для временных рядов

Авторы утверждают, что их метод - лучший в классе. Найдено - здесь

Tuesday, October 24, 2023

Twin network

Интересная модель использования контрфактических примеров. Сети-близнецы рассматривают контрфакты как пару вероятностных моделей: одна представляет реальный мир, другая — вымышленный. Модели связаны таким образом, что модель реального мира ограничивает модель вымышленного мира, сохраняя ее неизменной во всех отношениях, за исключением фактов, которые вы хотите изменить. Отсюда.

Friday, October 20, 2023

Модели использования LLM

Как большие модели используются в бизнесе прямо сейчас. И отдельный обзор - использование LLM в медицине

См. также другие публикации, посвященные LLM

Wednesday, October 18, 2023

Saturday, October 14, 2023

Безопасность LLM

Интересный портал по безопасности больших языковых моделей - LLM security. У автора есть еще и Twitter

Примеры диалогов с одной отечественной LLM:

Q:Татарстан граничит с Дагестаном?
A: Да, Республика Татарстан расположена на юго-востоке Европейской части России и граничит с несколькими регионами. На севере она омывается водами реки Волга, на востоке — Камским водохранилищем, на западе — рекой Кама.

Q:Что расположено на морском побережье Белоруссии? Что лучше для туристов?
A: Морское побережье Белоруссии находится в пределах Балтийского моря и Калининградского залива. Здесь расположены города-курорты, такие как Светлогорск, Зеленоградск, Пионерский и другие.

Это то, чем занимается AI Red Team

См. также другие публикации, посвященные LLM

Saturday, October 07, 2023

Цифровой двойник транспортной логистики

Интересная работа по практическому использованию цифровых двойников в городской логистике. Со ссылками на реальные продукты.

См. также другие публикации, посвященные digital twins

Wednesday, October 04, 2023

Устойчивая многомерная статистика

Книга в открытом доступе: Algorithmic High-Dimensional Robust Statistics

AI Red Team

Добрые хакеры для систем машинного обучения. Быстрое распространение приложений машинного обучения, основанных на больших языковых моделях (ChatGPT и т.п.) привлекло внимание к известной проблеме систем машинного обучения – состязательным атакам. Такие атаки представляют собой специальные модификации данных на разных этапах стандартного конвейера машинного обучения (тренировка, тестирование, использование), которые призваны либо воспрепятствовать работе систем машинного обучения, либо добиться требуемого атакующему специального поведения таких систем. В последнем случае атакующий обычно желает добиться того, чтобы обученная модель специальным (нужным атакующему) способом реагировала на определенным образом подготовленные входные данные. Есть также классы атак на модели машинного обучения, которые специальным образом опрашивают работающие модели с целью получения скрытой информации, использованной при обучении модели. Все перечисленные атаки достаточно просто реализуются и для больших языковых моделей, что открыло глаза бизнес-сообществу на реально существующую проблему – кибербезопасность самих систем машинного обучения (искусственного интеллекта). Ответом стало ускоренное создание подразделений корпоративной кибербезопасности, которые должны тестировать системы искусственного интеллекта – AI Red Team. Принципы построения и работы таких команд и рассматриваются в данной статье.

Monday, October 02, 2023

Конвергентные когнитивно- информационные технологии

Продолжается регистрация для участия в Международном конгрессе «Современные проблемы компьютерных и информационных наук», который состоится на факультете вычислительной математики и кибернетики Московского государственного университета имени М.В. Ломоносова 30 ноября - 2 декабря 2023 года, г. Москва (Россия). Конгресс проводится в рамках программы деятельности Федерального учебно-методического объединения в сфере высшего образования по УГСН 02.00.00 «Компьютерные и информационные науки». Конгресс проводится в рамках направлений деятельности Московского центра фундаментальной и прикладной математики. Детали - здесь.

5 советов

На самом деле - вполне добротные рекомендации идущим в Data Science

Интерпретируемые CNN

Попытка построить интерпретируемые CNN за счет большего количества аннотаций - Concept Bottleneck Models

Sunday, October 01, 2023

Сегментация пользователей

Практические методы анализа сегментации пользователей (покупателей): Kmeans, K-Prototype и LLM + Kmeans

INJOIT vol. 11, no. 10

Вышел десятый номер журнала INJOIT в 2023 году. И одиннадцатый год издания журнала.

Темы статей:

  • Comparison of Outlier Filtering Methods in Terms of Their Influence on Pose Estimation Quality
  • Алгоритм оценки отклонения между регуляризованным и точным решениями в обратных задачах
  • A Hybrid Optimization Method for Path Planning and Obstacle Avoidance in Cluttered Environments
  • Интерпретация оценок параметров моделей полносвязной линейной регрессии
  • Эволюционная модель представления знаний
  • An optimization of path planning A* for static uniform grid based on pruning algorithms: Experimental experience
  • Сегментация неструктурированного текста на изображениях книжных обложек с помощью сверточной сети, основанной на архитектуре U-Net
  • Анализ моделей оценки качества вычислительной системы
  • Использование нейронных сетей в задаче классификации аномального поведения в финансовых транзакциях с использованием Python и Keras
  • Исследование развития межконфессиональных отношений на основе математического аппарата марковских процессов
  • Обзор методов очистки данных для машинного обучения
  • Performance of 32kb/s ADPCM for Data Transmissin at 14.4kb/s
  • Разработка программного обеспечения для мониторинга параметров сетей связи и серверного аппаратного обеспечения
  • Применение интеллектуальных методов анализа данных к задаче прогнозирования результатов промышленного испытания элементов конструкции по данным тензометрии
  • Перспективы использование технологии блокчейн в сфере городского транспорта
  • Обеспечение безопасности открытых проектов Python: проблема оценки потенциально разрушительного функционала
  • Генерация врачебных заключений и классификация по Bethesda с использованием глубокого обучения
  • О работе AI Red Team

Архив журнала находится здесь.

/via Лаборатория ОИТ

Saturday, September 30, 2023

Об утечке данных

И это не про кибербезопасность. Утечки данных в машинном обучении - это использовать при тренировке модели данные, которые будут недоступны на этапе вывода. В итоге, модель может показывать хорошую произволительность на тестах, но плохо работать на реальных данных.

Friday, September 29, 2023

О робастности метрик

Сравнение робастности регрессионных метрик: MAE, MSE и RMSE

См. также другие публикации, посвященные робастности

Синтетические личности

В некоторых странах - это уже главная проблема при выдаче кредитов банками. Кредиты берут синтетические персоны

Thursday, September 28, 2023

Знания из ничего

Машинное обучение в ситуации, когда количество экземпляров данных меньше, чем количество классов: Learning N Classes From M < N Samples. Вот здесь можно почитать про другие подобные примеры.

В перспективе

Интересный инструмент для визуализации больших наборов данных - Perspective

См. также другие статьи, посвященные визуализации