NEW BOT Телеграм, страница

Reliable ML

Методы Causal Inference. Часть 1.

В различных докладах и статьях по причинно-следственному анализу мне всегда не хватало систематизации методов. Многие причисляют отдельные методы к каким-то категориям, подкатегориям, но общей классификации не дают, и в итоге возникает путаница. Непонятно, как собрать воедино все, что разрабатывается в этой области. Когда начинаешь прицельно искать систематизацию, то оказывается, что их очень много. И каждая, конечно, несовершенна.

Расскажу вам про лучшую, на мой взгляд, систематизацию – Evidence Ladder от A.Rebecq (2020).

Методы Causal Inference можно упорядочить с помощью так называемой доказательной лестницы (Evidence Ladder). От нижней ступени к верхней будет расти, во-первых, доказательная сила метода, во-вторых, простота применения, или, другими словами, снижаться число необходимых проверок на устойчивость результата применения метода (robustness checks).

На вершине этой лестницы находятся естественные эксперименты (Natural Experiments). Это, например, классические лабораторные эксперименты в физике и химии, когда мы можем создать полностью одинаковые условия для двух вариантов Y, отличающихся только наличием Х. Можно представить себе две одинаковые пробирки в химии (Y), где в одну добавлено какое-либо вещество (X), а в другую – нет. Тогда отличие Y где нет Х от Y с Х и будет выявленным причинно-следственным эффектом. Мы будем абсолютно уверены, что изменение состояния Y вызвано участием Х.

Следующая ступень – статистические эксперименты (Statistical Experiments) aka рандомизированные контролируемые эксперименты (Randomized Controlled Trials) aka АБ-тестирование (AB Testing). Здесь мы не можем обеспечить идеально одинаковые Y, но можем случайным образом собрать выборки объектов Y в пилотную (вводим событие Х) и контрольную (не вводим событие Х) группы таким образом, что размер этих выборок компенсирует различия Y между собой. То есть, пилотная и контрольная выборки должны быть достаточно объемны и однородны, чтобы статистический тест был корректным с точки зрения статистической мощности и значимости. На практике подобные тесты чаще всего возможны в e-commerce, где объектов (клиентов магазина, посетителей сайтов) много.

Если случайный отбор не работает, мы вынуждены спускаться еще на ступень ниже – к квази-экспериментам (Quasi-Experiments). На практике категории статистических экспериментов и квази-экспериментов чаще всего смешиваются, и называются просто АБ-тестами. В квази-экспериментах объекты Y могут существенно отличаться и их общего количества недостаточно, чтобы обеспечить однородные выборки и корректный статистический эксперимент. Поэтому в таких АБ-тестах мы вынуждены прибегать к дополнительным мерам снижения дисперсии типа CUPED и линеаризации, и другим танцам с бубном типа проверок репрезентативности выборки для генеральной совокупности и созданию синтетического контроля при критически малом количестве объектов. В АБ-тестах для офлайн-бизнеса чаще всего возможно применение только квази-экспериментов, вследствие малого количества объектов, на которых мы можем позволить себе проведение пилота (долго, дорого, трудно).

#tech #causal_inference #ab_testing

👍8🔥8

1.43K views13:04

Reliable ML

Методы Causal Inference. Часть 2.

Иногда бизнес-ограничения не позволяют добиться корректной оценки даже с помощью квази-экспериментов. В таком случае, мы вынуждены спуститься в самый низ нашей доказательной лестницы – к контрфактическим методам (Counterfactuals). Тут мы отказываемся от идеи пилотной и контрольной групп (на самом деле, не совсем), и, по сути, моделируем временной ряд Y по историческим данным без участия Х в будущее, где Х уже вступает в игру. Таким образом, в период проведения эксперимента мы сможем сравнить фактические данные Y (где Х участвовал) с модельными (прогноз Y без участия Х) и предположить размер эффекта. Однако, чтобы это предположение оказалось близким к правде, нам нужно сделать наибольшее количество тестов на устойчивость метода. Результирующий эффект будет критически зависеть от корректности применения выбранного метода CI категории Counterfactuals: от выбора самого метода до подбора гиперпараметров и учета при моделировании всех необходимых ковариатов (факторов, помимо Х).

На практике необходимость в counterfactual методах возникает совсем не редко. Например, построили mvp по какому-то проекту (не обязательно ML), прикинули в уме, что вроде норм, взяли и раскатали в прод сразу на все объекты Y. Как теперь оценить эффект от внедрения, если контрольной группы нет в принципе, а на объекты Y ежедневно воздействует миллион внешних факторов: от макроэкономических трендов до внутренних изменений в бизнес-процессах? Знакомо?

Или другой случай: бюджета проекта хватает только на один объект Y, а эффект оценить хочется. Как ни мучайся, подбирая синтетический контроль из множества других объектов Y, сделать это почти невозможно.

Ну и третий случай: мы хотим на исторических данных, там, где никакого эксперимента не проводили, понять, а был ли эффект от какого-то действия/события Х на целевую переменную Y. В последнем случае, мы чаще всего не можем собрать корректные контрольную и тестовую группы. Историческое событие Х чаще всего распределено сложно, внедрялось либо во всех объектах, либо в малом количестве и в разное время.

#tech #causal_inference #ab_testing

🔥11👍10❤1

1.42K views13:07

Reliable ML

Систематизация методов Causal Inference. Более детальное описание каждой ступени можно найти в моем докладе тут.

#tech #causal_inference #ab_testing

👍15🔥5

1.52K viewsedited 13:07

Reliable ML

Применение методов Causal Inference

Потребность в применении методов причинно-следственного анализа развивается со временем. В начале она была сконцентрирована, в основном, в науках: социальных науках, экономике, медицине, биологии, генетике. В последние пять лет наблюдается резкий рост этой потребности для бизнеса. Основными отраслями применения методов являются IT-компании, игровая индустрия, ритейл и e-commerce.

Ключевыми используемыми методами являются АБ-тесты, но с каждым годом встречается все больше отдельных интересных кейсов. Часто эти кейсы возникают из проблем применения классического ML для задач, когда мы хотим управлять параметрами моделей, тем самым, меняя целевую переменную Y. К этой категории можно отнести истории про исключение эффекта эндогенности при исследовании эффекта изменения цен на выручку при динамическом ценообразовании, оценку реального причинно-следственного эффекта изменения параметров персональной промо-кампании на выручку, которую она генерирует (uplift-модели), повышение эффективности работы прокатного стана за счет управления параметрами его работы, оценка эффекта генерации дополнительного спроса от установки различных видов прилавков (мясо, рыба, хлеб, и др.) в продуктовых магазинах.

В целом, о кейсах бизнес-применения causal inference 2021 г. я рассказывала в одном из постов @Reliable_ML еще в начале года.

#business #causal_inference #practice

👍7🔥5❤1

1.89K viewsedited 10:49

Reliable ML

#business #causal_inference #practice

👍4

1.22K viewsedited 10:49

Reliable ML

Митап DataPeople

Для управления жизненным циклом любого продукта полезно понимать риски, возникающие на каждом этапе его развития - чтобы вырабатывать меры по митигации этих рисков. Не менее полезно думать и о глобальных рисках внедрения продвинутой аналитики и управлять ими.

В дальнейшем в нашем канале планируем об этом серию постов.

А пока можно посмотреть материалы офлайн-митапа DataPeople, который прошел 12 апреля. Вот тут можно посмотреть запись трансляции и видеоотчет.

Темы, которые обсуждались на митапе:

- инструменты импортозамещения в Marketing Management и в направлении Risk Management & Compliance;
- система принятия решений для управления данными и мониторинга ML-моделей (разработка kolmogorov.ai).

👍5

1.3K viewsedited 14:18

Reliable ML

Causal Inference как ключ к балансу классического ML и эконометрики

На мой взгляд, который озвучивала еще в 2019 г., data science можно определить через сближение дисциплин эконометрики и машинного обучения.

Основой моделирования для классического машинного обучения является качество прогноза. Вопросы интерпретируемости модели при этом вторичны. В начале развития ML стремление к интерпретируемости модели воспринималось, скорее, негативно – как упрощение модели в жертву способности ее интерпретировать.

Эконометрика – статистическая наука, основой которой является интерпретируемость. При этом во время становления дисциплины машинного обучения, когда в моду вошли слова data mining, эконометристы воспринимали их также с негативным окрасом. Те, кто занимаются data mining, добиваются роста метрик качества, используя любые преобразования данных, отодвигая на второе место логику модели – то, как она в реальном мире будет принимать решения/выдавать результат.

При этом постепенно происходило сближение этих дисциплин в науку о данных – data science. Можно обозначить ее как гармонию принципов классического ML и эконометрики. Интерпретируемость здесь трактуется как необходимость принятия моделей бизнесом, но она не должна быть абсолютной и не должна снижать качество прогноза.

В 2021 г. вышла статья Judea Pearl с более глубокой проработкой идеи роли Causal Inference в ML. В ней автор определяет data science как объединение дисциплины машинного обучения как школы радикального эмпиризма (когда только данные генерируют модель реальности) и эконометрики как школы интерпретации данных (когда модель процессов/реальности генерирует данные). Методы causal inference в данном случае выступают ключом к балансу эмпиризма и интерпретируемости в DS.

Этот баланс достигается с помощью трех ключевых принципов:

- Целесообразности. Модели реальности и Causal Inference помогают ускорить эволюцию ML-моделей. Так при резком появлении в нашей жизни COVID-19 отсутствие фактических исторических данных не дало бы возможность строить модели машинного обучения с прогнозами развития и принимать какие-либо решения. Развитию моделей помогли теоретические модели о принципах развития пандемии, которые объединялись с доступными историческими данными. Таким образом, модели быстро эволюционировали.

- Прозрачности. Использование инструментов и принципов причинно-следственного анализа критически полезно для управления процессами исследования и интерпретации данных.

- Объяснимости. Модель должна быть полезна конечному пользователю.

#business #causal_inference

👍6❤3🔥2

1.49K viewsedited 08:57

Reliable ML

#business #causal_inference

👍10

1.53K viewsedited 08:58

Reliable ML

Data Fest 3.0 - Reliable ML - Call for presentations

В этом году - 4 июня 2022 г. - состоится Data Fest 3.0 - крупнейшая конференция крупнейшего русскоязычного сообщества Open Data Science в области анализа данных.
Конференция будет онлайн, о деталях проведения скоро будет известно.

А сейчас хотелось бы объявить сбор заявок на доклады по теме Reliable ML.
О том, что такое Reliable ML можно почитать тут. Форма для заявок вот тут.

Будем рады, если сможете рассказать об интересных теоретических аспектах, или о кейсах применения в бизнесе по следующим темам:

- Планирование исследований и развития продукта – #planning
- Причинно-следственный анализ в машинном обучении – #causal_inference
- АБ-тестирование – #ab_testing
- Управление рисками инвестиционных инициатив – #investment_process
- Интерпретация моделей – #interpretable_ml
- Выбор технических и бизнес-метрик для оценки качества моделей - #metrics

👍8🔥7

4.85K viewsedited 11:54

Reliable ML

Reliable ML pinned a photo

08:13

Reliable ML

На Хабре была опубликована статья "Причинно-следственный анализ в машинном обучении", собранная из постов в этом канале.
Особо внимательные читатели даже найдут там новую информацию, которая тут еще не постилась 🙂.

Лучи добра за лайк, шер, репост статьи!

Хабр

Причинно-следственный анализ в машинном обучении

Что появилось первым: курица или яйцо? Статистики давно уже нашли ответ на этот вопрос . Причем несколько раз. И каждый раз ответ был разным. А если серьезно, то для машинного обучения становятся все...

👍28

1.85K viewsedited 11:07

Reliable ML

Causal Inference в ML
Для тех, кто не читал статью на Хабре (1/3)

В 2020 году в отчете State of AI впервые в явном виде была обозначена необходимость интеграции классического ML c методами Causal Inference.

Yoshua Bengio и Yann LeCun отметили, что ML-системы, построение которых основано на корреляциях, часто не справляются с задачами в реальном мире. Это происходит вследствие того, что реальный мир отличается от данных для обучения модели:

- Мир не является статичным. Условия, в которых работает модель, постоянно меняются. Если модель опирается на причинно-следственные связи, а не на корреляции, она будет более устойчива к изменениям.

- Параметры модели могут влиять на изменение целевой переменной, а целевая переменная, в свою очередь, может влиять на параметры модели. Так, цены влияют на спрос на товар, а спрос влияет на цены. С таким явлением также помогают бороться методы причинно-следственного анализа. Например, инструментальные переменные.

- Работа модели в продуктиве/реальном мире может менять закономерности, которые были выучены на исторических данных. Особенно уязвимы к этому системы, основанные на корреляциях. Так, в примере про высокую корреляцию вероятности умереть от пневмонии и наличия астмы, если в продуктиве мы будем меньше лечить тех, кто болен астмой, то вскоре кардинально поменяем ситуацию.

Решением указанных выше проблем ученые считают применение методов Causal Inference в ML. В State of AI 2020 тема causal inference была обозначена как путь к новому витку усиления ML-алгоритмов за счет повышения обобщающей способности моделей, их устойчивости и применимости для процесса принятия решений.

#business #causal_inference

👍17🔥2

1.42K viewsedited 10:17

Reliable ML

Causal Inference в ML: материалы
Для тех, кто не читал статью на Хабре (2/3)

Пост с главной литературой по Causal Inference в ML в 2020-2021 гг.

Материалы, систематизирующие методы causal inference в ML:

- Causal Inference Book. Это очередное обновленное издание замечательной фундаментальной книги по causality от Hernan & Robins. На Data Fest 2020 Антон Лебедевич в своем докладе разбирал основные интересные примеры из этой книги.

- A Survey on Causal Inference - Liuyi Yao et al. (2020). В этой статье авторы сравнивают по единому фреймворку ключевые существующие (и главное, применяемые на практике) методы Causal Inference, обсуждают тонкости их применения в R/Python.

Материалы по обобщающим Causal Inference фреймворкам:

- Библиотека DoWhy для python с различными датасетами, специально собранными или разработанными для тестирования, сравнения и бенчмаркинга различных методов causal inference. Если вы утром за чашечкой чая вдруг придумали новый метод причинно-следственного анализа, то вам дорога к этой библиотеке, чтобы понять, насколько ваш метод конкурентоспособен среди остальных. Подробнее про библиотеку и ее возможности можно почитать тут.

- Auto Causal Inference. Попытка создания AutoCI - один из трендов, возникших в рамках интеграции Causal Inference c машинным обучением. Можно ли, только загрузив датасет в библиотеку, понять структуру данных, существующие взаимосвязи и выбрать наилучший метод для из анализа, или для коррекции предсказаний модели, чтобы были учтены необходимые causal inference взаимосвязи? Пока исследования в данном направлении далеки от финальной стадии, но одна из его важных вех этого процесса – публикация от Netflix 2020 г. по Computational Causal Inference.

- Proximal Causal Inference – о возможностях непараметрической и полупараметрической оценки причинно-следственного эффекта, на примере медицинских исследований.

- Spatial Causal Inference – обзор методов для выявления причинно-следственных эффектов на пространственных данных.

- Causal Inference using DL – фреймворк для выявления причинно-следственного эффекта с помощью DL.

#tech #causal_inference

🔥5👍3❤1

1.69K views10:23

Reliable ML

Causal Inference в ML: инструменты
Для тех, кто не читал статью на Хабре (3/3)

Tool Boxes для Python:

- Dowhy - Propensity-based Stratification, PSM, IPW, Regression
- Causal ML - Tree-based algorithms, X/T/X/R-learner
- CausalNex - Structural Causal Models based on Bayesian Networks
- EconML - Doubly Robust Learner, Orthogonal Random Forests, Meta-Learners, Deep Instrumental Variables
- causalImpact - Bayesian structural time-series model (сейчас активна реализация c бекендом на tensorflow-probability вместо pystan)

Tool Boxes для R:

- causalToolbox - BART, Causal Forest, T/X/S-learner with BART/RF as base learner
- causalImpact - Bayesian structural time-series model
- did - Classical Difference-in-Difference (group-time average treatment effects)
- synthdid - Synthetic difference in difference estimator (SDID) for the average treatment effect in panel data, Arkhangelsky et al (2019) – доклад на Causal Inference in ML Track 2020
- causalweight - Inverse probability weighting (IPW)

Если вы считаете, что стоит пополнить этот список - пишите в комментариях!

#tech #causal_inference

❤8👍6👏2🔥1

1.88K viewsedited 11:41

Reliable ML

Causal Inference in ML в тренде

С 2019 г. мы с Димой Колодезевым в рамках конференций Data Fest проводим секции по Interpretable ML и Causal Inference in ML. И с 2019 г. эти треки признаются лучшими по итогам голосования участников конференции.
Многие из докладов этих секций также оказываются в списке лучших.

Interpretable ML Track - 2019, 2020
Causal Inference in ML Track - 2020
Interpretable & Causal ML Track 2021

Сегодня получила посылку с наградами от организаторов Data Fest - сообщества Open Data Science и компании Data Souls. Доехали награды за 2020-2021 гг.

Очень рады видеть такое признание.
Это вдохновляет двигаться дальше!

Всем хорошего вхождения в трудовые будни после майских праздников!
Скоро будут интересные анонсы и новости от Reliable ML.

Stay tuned!

❤23🔥15👍13👎1

1.94K views15:08

Reliable ML

Reliable ML Интервью

Вчера в новом выпуске подкаста "Дайте данных" сообщества NoML была опубликована запись беседы со мной. Поговорили про влияние академического прошлого на работу в бизнесе. Как опыт работы в науке может помочь добиться успехов в бизнесе, какой багаж знаний и навыков можно взять с собой в коммерческое настоящее - и в чем придется переучиваться. Какие тренды в развитии ML ждать в ближайшие годы? Кто такой сегодня дата сайентист, и чем можно покорить работодателя при приеме на работу.

А если у вас есть еще какие-либо вопросы ко мне, по Reliable ML и не только, их можно будет задать сегодня в 20:00 в новом выпуске подкаста "Данные люди".

❤7👍6🔥2😁2

1.49K views08:18

Reliable ML

Data Fest 3.0 - Reliable ML - Программа

Секция Reliable ML состоится 5 июня онлайн.
Планируем провести 3 круглых стола по актуальным темам.

Тема 1: Interpretable ML.

Про стандартные алгоритмы интерпретируемости много докладов сказано, много книг и статей написано. Обсудим вопросы, которые встречаются на практике и не имеют однозначного решения.

Вот несколько примеров из нашей практики:

- Агрегация результата интерпретации множества однотипных моделей
- Интерпретация результатов оптимизации
- Учет качества модели при интерпретации
- Объяснение логики работы модели конечным пользователям
- Использование интерпретируемости при расследовании инцидентов
- Интерпретация по внешним данным
- Конфликт этики и простоты оптимизации

Обсуждение пройдет намного лучше, если вы добавите свои вопросы по интерпретации моделей. Это можно сделать вот тут.

Эксперты:

Кирилл Быков, PhD student, TU Berlin – Understandable Machine Intelligence Lab
Данила Савенков, Senior ML Engineer, Yandex
Вадим Борисов Research Fellow / Ph.D. Student, University of Tübingen, Germany
Юрий Бабуров, CTO ApRbot

Эксперты-модераторы:

Дмитрий Колодезев, директор Promsoft
Ирина Голощапова, Head of Data Science, Lenta

👍13❤1

1.97K viewsedited 08:21

Reliable ML

Data Fest 3.0 - Reliable ML - Программа
Продолжаем анонсы

Секция Reliable ML состоится 5 июня онлайн.
Планируем провести 3 круглых стола по актуальным темам.

Тема 2: Causal Inference in ML

За последние пару лет осознание того, что причинно-следственный анализ - это важно и нужно в ML системах, довольно прочно пришло в бизнес. А где же бизнес все-таки использует causal inference?

Поговорим об известных кейсах, обсудим ваши вопросы по использованию causal inference в работе.

Если вы хотели бы добавить свои вопросы для обсуждения - welcome. Пишите здесь.

Эксперты:

Иван Комаров, Chief Data Scientist, ЦФТ
Григорий Чернов, экономист, аспирант лаборатории экспериментальной и поведенческой экономики Высшей школы экономики, приглашенный исследователь департамента принятия решения Тюбингенского университета
Иван Горбань, Senior Data Scientist, Careem

Эксперты-модераторы:

Дмитрий Колодезев, директор Promsoft
Ирина Голощапова, Head of Data Science, Lenta

***
Тема 1: Interpretable ML.
В круглом столе по Interpretable ML, кстати, серьезно обогатился состав экспертов.

👍6❤1

1.72K views08:02

Reliable ML

По мотивам постов в канале опубликована новая статья на Хабр: Интерпретируемость в машинном обучении: итоги 2021 г.

А уже 5 июня, на секции Reliable ML Data Fest 3.0, Дима Колодезев, директор Promsoft, расскажет доклад о том, что нового появилось в интерпретируемости в последнее время.

Хабр

Интерпретируемость в машинном обучении: итоги 2021 г

В наши дни уже ни для кого не секрет, что понимать логику работы моделей машинного обучения важно и нужно. Иначе можно насобирать множество проблем: от того, что модель не будет принята конечным...

👍8👏2

1.54K views12:11

Reliable ML

Data Fest 3.0 - Reliable ML - Программа
Продолжаем анонсы

Секция Reliable ML состоится 5 июня онлайн.
Планируем провести 3 круглых стола по актуальным темам.

Тема 3: ML System Design

Компетенции в области ML System Design крайне востребованы на рынке. Однако понимание этого термина многими компаниями разное. Обсудим, что же это вообще такое ML System Design, как его структурировать и применять.

Если вы хотели бы добавить свои вопросы для обсуждения - welcome. Пишите здесь.

Эксперты:

Валерий Бабушкин, Head of Data Science, Blockchain.com, автор книги Principles of ML Design (2023)
Алексей Натекин, CEO, Data Souls, Founder, Open Data Science Community, Organizer, Data Fest
Александр Бородин, руководитель направления аналитики и моделирования в финансах и рисках, GlowByte

Эксперты-модераторы:

Дмитрий Колодезев, директор Promsoft
Ирина Голощапова, Head of Data Science, Lenta

***
Тема 1: Interpretable ML
Тема 2: Causal Inference in ML

🔥18👍2

2.92K views10:33

Reliable ML

Data Fest 3.0 - Reliable ML - 5 июня 2022 г. - Программа
Продолжаем анонсы

В 10:00 по Мск нашу секцию откроет Полина Окунева, ведущий аналитик Glowbyte, с докладом "Causal Inference. Advanced методы моделирования".

Полина расскажет об усовершенствованных методах моделирования причинно-следственного эффекта с опорой на библиотеки causalML и EconML : X-, R-, DR-learner, Domain Adaptation Learner, Doubly Robust Instrumental Variable learner, Tree-based algorithms (DDP, CTS). Рассмотрит основные плюсы и минусы методов и особенности их применения.

👍21🔥6👏1

3.1K views11:05

About

Blog

Apps

Platform