Monday, December 27, 2021

Friday, December 24, 2021

Чем сердце успокоится

Так долго продолжаться не будет. Деплоймент моделей машииного обучения не может быть столь запутанным.

Вот, что про это думает Google: Five Principles for Machine Learning to Go Mainstream

Все должно превратиться в нормальное программное обеспечение.

И еще о SHAP

SHAP для табличных данных

См. также другие публикации, посвященные SHAP

Saturday, December 18, 2021

Как машины видят нас

Xinming Huang - домашняя страница профессора WPI с интересными работами по семантической сегментации данных лидаров

Здесь есть пример сегментации и датасет для тестирования

Thursday, December 16, 2021

Открытые модели ML

Интересный материал - модели машинного обучения как программное обеспечение с открытым кодом

Поездки на метро

В московском метро существуют предпочтения пассажиров по маршрутам. Для многих станций конечная точка маршрута известна с большой вероятностью. Отсюда

Wednesday, December 15, 2021

В живом режиме

Interactive Tools for machine learning, deep learning, and math. Можно, например, посмотреть как работает GAN непосредственно в браузере.

См. также другие публикации об интерактивных моделях

Моделирование сдвига данных

Реальные данные для систем машинного обучения часто оказываются отличными от тех, на которых тренировали модель. В работе предлагается способ расширения тренировочного набора данных "сдвинутыми" элементами.

Friday, December 10, 2021

102-й пример машинного обучения

В дополнение к практическим примерам использования ML - хороший учебный пример, полностью рассматривающий построение модели машинного обучения с использованием PyCaret

Thursday, December 09, 2021

Дети цветов

Универсальный патч (цветок), который выглядит естественно, но при этом обманывает _любой_ классификатор изображений на основе глубинного обучения. Это то, чем в итоге заменят камуфляж на военной технике :)

Вот здесь есть видео с процессом.

Monday, November 29, 2021

Больше пояснений

Схемы объяснений для вклада различных характерстик (features) в результат работы модели машинного обучения:

InterpretML

LIME & SHAP

Перестановки характеристик (Permutation Feature Importance)

ParSHAP - какие из характеристик вызывают перетренированность

SHAP vs ACV

См. также другие публикации, посвященные SHAP и ответу на вопрос "почему" для моделей машинного обучения

Friday, November 26, 2021

Данные, а не модели

Работайте с данными, а не моделями. Результаты будут много лучше. Работа с моделями все равно будет автоматизирована инструментами, подобными этому и все сведется к AutoML. А анализ данных не автоматизирует до конца никто, поскольку это связано с конкретной задачей (физикой процесса).

feature engineering - это главное в машинном обучении

Monday, November 22, 2021

Разъяснения по состояниям ИИ

Мы уже публиковали делали отчета о состоянии исследований по искусственному интеллекту в 2021 году - AI 2021. Вот еще один материал, который разбирает этот отчет: State of AI Report 2021 Summary. Хорошо читаемый материал. Автор группирует отчет по слайдам и темам.

Моделирование неопределенности

Неопределенность в нейронных сетях - как с этим работать? Толковый материал по моделированию неопределенности в нейронных сетях

См. также предыдущие публикации, посвященные работе с неопределенностью

Tuesday, November 16, 2021

Нарисовать текст

Интересная модель отрисовки текста - сопоставление текста и картинок. Удивительно, что Сбер еще скопировал :). Исходные корни - в OpenAI

Monday, November 15, 2021

Открытая наука том 9, номер 11

Очередной номер журнала INJOIT появился на сайте Киберленинка. В этом номере опубликована, в частности, очередная статья из нашего нового цикла работ, посвященного устойчивому машинному обучению.

Это том 9, номер 11 за 2021 год. По данным elibrary.ru, журнал INJOIT занимает второе место в разделе Кибернетика и второе в разделе Автоматика и вычислительная техника

/via Лаборатория ОИТ

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Friday, November 12, 2021

Overfitting

Как его определить переобучение - весьма простой подход. Используется SHAP — SHapley Additive exPlanations. Вот здесь можно прочитать про него

Вот здесь можно посмотреть другие публикации, посвященные SHAP

Wednesday, November 10, 2021

Пример платформы данных

Пример собственной платформы данных в компании, занимающейся маркетингом в ecommecrce. Собрана целиком из открытых инструментов.

Tuesday, November 09, 2021

Цифровой двойник для беспилотников

Цифровой двойник и 3D моделирование для транировки беспилотных автомобилей

См. также другие публикации, посвященные digital twins

ИИ в 2021

Подборка достижений в Искусственном Интеллекте за 2021 год - статьи, код, видео с пояснениями

Пара интересных работ:

DefakeHop: A Light-Weight High-Performance Deepfake Detector
Мы уже представляли эту работу здесь

The Cocktail Fork Problem: Three-Stem Audio Separation for Real-World Soundtracks
Вы когда-нибудь настраивались на видео или телешоу, и актеры были совершенно не слышны, или музыка была слишком громкой? Что ж, эта проблема, также называемая проблемой коктейльной вечеринки, может больше никогда не повториться. Mitsubishi и Университет Индианы только что опубликовали новую модель, а также новый набор данных, решающий задачу определения правильного саундтрека. Например, если мы возьмем тот же аудиоклип, который мы только что запустили, со слишком громкой музыкой, вы можете просто увеличить или уменьшить звуковую дорожку, которую хотите придать речи больше, чем музыке.

Проблема здесь в том, чтобы изолировать любой независимый источник звука от сложной акустической сцены, такой как сцена из фильма или видео на YouTube, где некоторые звуки не сбалансированы. Иногда вы просто не слышите некоторых актеров из-за музыки, взрывов или других звуков на заднем плане. Что ж, если вы успешно изолировали разные категории в саундтреке, это означает, что вы также можете повышать или понижать только одну из них, например, немного приглушить музыку, чтобы правильно слышать всех других актеров. Именно этого и добились исследователи. И получилась довольно ясная архитектура

Friday, November 05, 2021

Missing Data

Пропущенные данные - что делать на практике и почему просто взять среднее значение соседей не есть хорошо.

У автора статьи есть целая книга в свободном доступе, где рассматривается именно такой итеративный процесс, когда пропущенные значения вычисляются как функция от других значений в датасете.

Внимательный телезритель

Multimodal Event Representation Learning Over Time (MERLOT) - метод предварительного обучения, который концентрирует знания, полученные из видео, без необходимости использования помеченных данных. Полученные в результате представления помогли точно настроенным моделям проводить различные суждения по видео с высочайшей точностью.

Как это работает: авторы разделили шесть миллионов видеороликов YouTube на 180 миллионов отдельных кадров, каждый из которых соединен с соответствующим текстом из расшифровки стенограммы.

Во время предварительного обучения ResNet-50 (кодировщик изображений на иллюстрации выше) генерировал начальное представление каждого кадра.

Трансформер (кодировщик только для языка) произвел представление связанного текста (с учетом всей транскрипции до этого момента). Функция потерь поощряла совпадение кадров и текстовых представлений быть похожими, а несоответствия - несхожими.

Другой трансформер получил представление каждого кадра и соответствующий ему текст (но не текстовое представление). Он научился угадывать замаскированные слова в тексте, а также правильный порядок кадров.

Результаты: MERLOT установил новый уровень достижимых результатов для 14 задач, которые включали ответы на вопросы об отдельных кадрах, ответы на вопросы о последовательностях кадров и упорядочивание неупорядоченных кадров. Особенно хорошо он справился с задачами с ответами на вопросы, предназначенными для проверки пространственных и временных рассуждений на GIF-файлах с Tumblr. Например, MERLOT ответил на вопросы с несколькими вариантами ответов о действии, выполняемом в клипе, с точностью 94,0 процента по сравнению с предыдущим лучшим результатом в 82,8 процента точности. В других областях улучшение было менее значительным. Например, в Drama-QA (датасет для тренировки понимания видео-историй) он ответил на вопросы с несколькими вариантами ответов об истории в клипах телешоу с точностью 81,4 процента по сравнению с предыдущим лучшим результатом в 81,0 процента.

Почему это важно: MERLOT научился упаковывать ряд важной информации о видеоизображениях, сопроводительном тексте и порядке кадров в создаваемые им представления. Количество неразмеченных видео и аудио данных - огромно, и такие алгоритмы обучения с самоконтролем, как этот, могут раскрыть огромную ценность таких данных.

А зависимость от публичных м легко модицируемых датасетов является хорошим примеров для иллюстрации проблем кибербезопасности. Текстовые описания для видео никто ведь не проверяет ...

Thursday, November 04, 2021

Wednesday, November 03, 2021

Машинное обучение на потоке

MediaPipe - Open Source кроссплатформенный пакет для машинного обучения на потоковых медиа. От Google, с хорошей документацией и со множеством примеров.

Не все так просто

Маска - я вас не знаю. Для авторизации в банковском приложении лицо в маске не подходит. Нужны другие устройства.

См. публикацию о физических атаках на системы машинного обучения.

Tuesday, November 02, 2021

Физические атаки на системы машинного обучения

Физические атаки на системы распознавания лиц

Весьма богатая тема. Естественные изменения для лиц используются как состязательные примеры. Здесь "одевают" маску.

Другие варианты:
маска с изображением другого лица (такой метод маскировки использовался в военном флоте - на борту корабля рисовали контур другого, более мелкого)
очки
повороты головы
кепка с козырьком
наушники
серьги
косметика

См. также другие публикации по теме adversarial, посященные устойчивому машинному обучению

Данные, данные

Анализ того, как проблемы с данными отражаются на моделях машинного обучения. Google называет это каскадами данных

Google также выпустил руководство по сбору и оценке данных - PAIR AI Guidebook, предназначенное для разработчиков и дизайнеров машинного обучения.

Sunday, October 31, 2021

Ленивая загрузка

Ускорение загрузки сайта через использование CSS свойства content-visibility

content-visibility: auto гарантирует максимальный возможный прирост производительности рендеринга страницы при минимальных усилиях.

Прокладка пути

Модуль прокладки маршрутов для OSM - Open Source Routing Machine

Thursday, October 28, 2021

Печатные новости

Пара статей из свежего номера журнала INJOIT:

Физический браузер: концепция и обзор существующих решений API - как использовать в веб-браузере информацию о физическом обружении. Например, различать с помощью JavaScript, открыта страница магазина (торгового центра и т.п.) в обычном десктоп-браузере, или же это мобильный веб-браузер и пользователь находится сейчас в помещении магазина.

Устойчивое машинное обучение - почему это стало самым важным.

Tuesday, October 26, 2021

О дип фейках

Facebook о поиске deep fakes. Ищут следы работы GAN в изображениях

См. также другие публикации, посвященные GAN

Sunday, October 24, 2021

Тренды в машинном обучении

Согласно Google Cloud’s Applied ML Summit:

Более развитые библиотеки компонентов, которые можно комбинировать.

Снижение ручных усилий: позвольте инструментам выполнять настройку гиперпараметров за вас или даже использовать AutoML, чтобы выполнить всю машинную обработку за вас.

Использование облака для массового параллельного обучения и конвейеров машинного обучения.

Развертывание моделей в TensorFlow Lite и TensorFlow.js.

про то, что все идет к AutoML, мы уже однократно писали

Отсюда

Карта ИИ

Гигантская карта искусственного интеллекта (кликабельна)

Отсюда

Friday, October 22, 2021

Тайные общества

Поиск сообществ на графах. Новый вариант использования рекуррентной графовой нейронной сети.

Агентное моделирование

Пример агентного моделирования с использование Mesa в Python

Водяные знаки

Пометка изображений с использованием состязательного машинного обучения, так что попытки редактирования защищенного изображения становятся видны.

Thursday, October 21, 2021

Нейронные сети с самых основ

Классно сделанный интерактивный учебник по нейронным сетям

Анализ логов

LogMine - извлечение шаблонов из логов

P.S. и интересная дискуссия со ссылками на другие продукты на YC

P.P.S. См. также другие публикации, посвященные анализу логов

Tuesday, October 19, 2021

Почему - по версии Netflix

Вычислительные причинно-следственные выводы - как это понимает Netflix. Вот исходная статья, представляющая программый инструмент для анализа каузальности

см. также другие публикации, посвященные каузальности

Think different

Будущее ИИ - не в новых моделях, а в новом (ином) использовании существующих

Sunday, October 17, 2021

Обогащение данных

Об одном подходе к улучшению качества данных. Имея изначально небольшой набор изображений для обучения, автор искусственно создавал изображения, проверял модель на них и добавлял к исходноиму набору данных нераспознанные изображения с правильными, вручную проставленными метками. Фактически - состязательная тренировка для улучшения качества данных.

Saturday, October 16, 2021

Наше общее детство прошло на одних букварях

Атаки на система машинного обучения позволяют, в частности, выяснить - а был ли интересующий нас объект в тренировочном наборе? То есть по результатам работы системы можно оценить тренировочный набор данных. Вот пример такой атаки, которая называется Identity Membership Attack. Волшебная технология ...

Открытая наука, том 9, номер 10

Очередной номер журнала INJOIT появился на сайте Киберленинка. В этом номере опубликована, в частности, первая статья из нашего нового цикла работ, посвященного устойчивому машинному обучению.

Это том 9, номер 10 за 2021 год. По данным elibrary.ru, журнал INJOIT занимает второе место в разделе Кибернетика и второе в разделе Автоматика и вычислительная техника

/via Лаборатория ОИТ

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Thursday, October 14, 2021

State of AI

Еще один отчет по Искусственному интеллекту: AI 2021. Интересен весьма глубокой технической экспертизой. Авторы - из мира венчурного капитала. То есть за выводы им отвечать своими деньгами.

Ключевые темы отчета за 2021 год включают:

ИИ развивается более конкретными способами, в том числе применяется в критически важной инфраструктуре, такой как национальные электрические сети, и в автоматизированной оптимизации складских помещений в супермаркетах во время пандемий.

Подходы, ориентированные на ИИ, взяли штурмом биологию благодаря более быстрому моделированию клеточных механизмов человека (белков и РНК). Это может изменить открытие новых лекарств и здравоохранение.

Трансформеры появились как архитектура общего назначения для машинного обучения, превзойдя современные достижения во многих областях, включая НЛП, компьютерное зрение и даже предсказание структуры белков.

Инвесторы обратили на ИИ внимание: рекордное финансирование в этом году стартапов в области ИИ и два первых в истории IPO компаний, занимающихся открытием новых лекарств, а также блокбастерные IPO для компаний, занимающихся инфраструктурой данных и кибербезопасностью, которые помогают предприятиям переоснащаться для перехода на эру ИИ.

Недостаточные ресурсы усилий по согласованию ИИ со стороны ключевых организаций, которые продвигают ИИ в целом, а также озабоченность по поводу наборов данных, используемых для обучения моделей ИИ, и предвзятость в контрольных показателях оценки моделей поднимают важные вопросы о том, как лучше всего отображать прогресс ИИ.

ИИ теперь представляет собой настоящую гонку вооружений, а не фигуральную форму. Исследователи ИИ традиционно рассматривали гонку вооружений ИИ как образную - имитированные воздушные бои между конкурирующими системами ИИ, проводимые в лабораториях, - но это меняется с сообщениями о недавнем использовании автономного оружия различными вооруженными силами.

В рамках соперничества между США и Китаем примечателен рост качества исследований и подготовки талантов Китая, при этом китайские институты теперь опережают наиболее известные западные. Зависимость мира от полупроводниковой промышленности Тайваня, которая производит микросхемы искусственного интеллекта для глобальных технологических гигантов, является центральной точкой геополитической напряженности.

Как и в случае с другими аспектами так называемого «фрагментированного интернета», происходит появление и национализация крупных языковых моделей.

См. также публикации про альманах искусственного интеллекта

Монография по Байесовской оптимизации

Книга в открытом доступе: Bayesian Optimization Book

См. также другие публикации по теме Байес

Saturday, October 09, 2021

Всех не просканируешь

Использование GAN для медицинских изображений. Для машинного обучения нужны данные (изображения), собирать трудно и дорого. Остается делать их самим.

Monday, October 04, 2021

Устойчивое машинное обучение

Академические и индустриальные проекты, посвященные устойчивому машинному обучению. Обзорная статья.

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Реальный ИИ

Про искусственный интеллект: "Несмотря на утверждения об обратном, у беспилотных автомобилей в настоящее время больше аварий, чем у автомобилей, управляемых людьми, но травмы менее серьезные. В среднем происходит 9,1 ДТП с участием беспилотных автомобилей на миллион пройденных километров, в то время как такой же показатель составляет 4,1 ДТП на миллион миль для обычных транспортных средств."

Отсюда

См. также предыдущую публикацию по этой теме

Sunday, October 03, 2021

О нейронных сетях на графах

Пара статей:

1. Обзор GNN

2. О кодировке графов

См. также другие публикации, посвященные GNN

Печальная реальность

Реальное состояние систем искусственного интеллекта - без человека пока никак. Или это должны быть системы с низкой ценой ошибки.

Saturday, October 02, 2021

"Жидкие" нейронные сети

Нейронные сети, которые обучаются в процессе работы. Вот здесь есть подробнее об этом проекте из MIT. Выглядит как вариация на тему онлайн обучения. И совсем непонятно, как в такой модели бороться за устойчивость.

Friday, October 01, 2021

Online ML

Онлайн системы машинного обучения. Это ситуация, когда у нас нет полного датасета. Данные поступают последовательно