NEW BOT Телеграм, страница

AB тесты и все вот про это вот все

Одноклассники на Хабре рассказали про свою платформу экспериментов - https://habr.com/ru/companies/odnoklassniki/articles/772958/

Хабр

Работа с A/B-тестами в крупной соцсети: подробно об A/B платформе Одноклассников

ОК — социальная сеть, которой ежемесячно пользуется более 36,5 млн уникальных пользователей из России. Наш продукт имеет сложную архитектуру, включает десятки сервисов и инструментов, которые мы...

😱2❤1

2.19K views12:30

AB тесты и все вот про это вот все

Как и говорил, о некоторых докладах с Матемаркетинга буду писать.

Начинаю с доклада Виталия Черемисинова - Как оценивать эффективность вашей платформы экспериментов для бизнеса.
Этот доклад воспринимаю как карту с нанесенными на карту точками на тему:
- вот что самое важное в процессе разработки своей платформы для экспериментов
- а вот к этому мы должны быть готовы до всей этой разработки, иначе не беритесь

И прекрасна формулировка второй части - Оценка эффективности команд через эксперименты. Это тот прекрасный момент, когда бездна всматривается в тебя. Работа с полноценной системой для экспериментов будет помогать росту продуктовой команды

👍6❤1

2.34K views04:51

AB тесты и все вот про это вот все

Ребята из продуктовой аналитики Mail.ru в VK рассказали о своей расчетной архитектуре платформы для A/B-тестов Mail.Ru и ее недавнем обновлении, поделились опытом и инсайтами. Они создали архитектуру метрик для A/B-тестов, которая позволяет масштабировать сложность расчетов.

Сама статья - https://habr.com/ru/companies/vk/articles/781300/

👍5

5.45K viewsedited 06:39

AB тесты и все вот про это вот все

Forwarded from Время Валеры

Прочитал заметку от Spotify - Choosing a Sequential Testing Framework — Comparisons and Discussions

Рассматривают различные подходы для непрерывного тестирования в А/Б тестах, то-есть когда можно подглядывать, их плюсы и минусы

Group sequential tests
Плюсы: подход с alpha-spending функцией, которая тратится, только когда мы проверяем результаты, позволяет принимать решение, готовые ли мы сейчас подглядывать или лучше подождем. Если не подсматривать - тест сходится до традиционного z-test.
Легко объяснить - по факту z-test.
Минусы: нужно знать предельное количество данных, которое мы можем собрать, если что то пойдет не так в обе стороны, то тест может иметь как заниженный, так и завышенный false positive rate
Нужно выбирать alpha-spending, если мы заранее знаем сколько данных, то это не проблема, а если не знаем - underpower
Подглядывать можно не более пары сотен раз
Заметка для себя: Надо посмотреть пересекается ли как то с этим - Increase A/B Testing Power by Combining Experiments & Weighted Z-test

Always valid inference - куда входит любимый нами mSPRT The Mixture Sequential Probability Ratio Test
Плюсы: Легко воплотить
Можно сколько удобно данных скормить и не нужно знать размер данных заранее
Можно задать любое правило для остановки
Работает как с батчами так и со стримингом (в отличии от пункта выше)
Минусы: Нужно описывать параметры распределения для успеха, как некоторую смесь распределений
Тяжелее понять для челов, которые не понимают
Underpowered если батч а не стриминг, потому что обновляются данные сразу куском, а не по итерации
Заметка для себя: - Давно такой лажи надуманной я не читал, челы сразу сказали в начале статьи, что выбирают GST и начали выдумывать какие-то дурацкие причины почему mSPRT плох. Ну то есть, да, есть некоторая смесь распределений, но даже смесь распределений это распределение, на практике мы всегда делаем какое-то допущение, это в принципе тоже самое как задавание MDE, которые мы хотим поймать. То, что кому-то тяжелее это понять, удивительная причина, там все довольно просто на пальцах показать, для многих будет даже проще z-testа, ну а то - что underpowered для батчей - вообще ерунда. Кто вам мешает взять батч и прогнать его последовательно как будто это стриминг, ведь timestamp для каждого события есть, а обновление - это операция умножения двух циферок, то есть по факту вы это итак делаете с батчем, просто докинуть один sort
Bonferroni corrections - куда-же без нее
Плюсы - легко закодить
Минусы - заранее решаем сколько раз будем подсматривать
Если подсматривать много раз, скорее всего ничего не найдем

Проверили эти подходы на симуляции
Bounded false positive rate - держится у всех
GST всех побил по чувствительности на батчах, правда на стриминге он просто не работает и пойди тут сравни теперь, судя по всему mSPRT они не обработали в батчах через таймстемпы и должного сравнения мы не получим (если только их графики батча и стрима это не один и те-же данные, тогда худо бедно можно сравнить Можно пойти и посмотреть код - оставляю это на вашу совесть, код написан в R)

Описали свои выводы - что и когда брать. В целом читать можно и нужно, но с осторожностью
#ArticleReview

Spotify Engineering

Choosing a Sequential Testing Framework — Comparisons and Discussions | Spotify Engineering

❤1👍1🔥1

1.73K views08:23

AB тесты и все вот про это вот все

На досуге в небольшой статье собрал список самых серьезных ошибок при проведении A/B-тестов. В формате вредных советов, чтобы более явно их подсветить.
Если что-то забыл или ошибся, у нас есть комментарии. И список будет доработан. Буду очень благодарен критике.
Собственно, статья.

Medium

Как сломать наш A/B-тест

Мы постоянно пытаемся понять, как проводить наши A/B-тесты правильно. А сейчас зайдем с противоположной стороны — изучим, какие есть…

🔥3👍2

1.95K views04:08

AB тесты и все вот про это вот все

Forwarded from Trisigma — про эксперименты (Iskαnder)

Наиболее цитируемые статьи по экспериментам

Мы в EXPF ведем свою базу знаний по всему, что связано с экспериментированием. Она включает в себя в внешние источники, такие как публичные gihub репозитории и интересные статьи. Очевидно, нам это необходимо для более эффективной реализации проектов, а также для понимания рынка экспериментирования.

Иногда мы заглядываем в открытые сборники с пейперами. Ниже дана ссылка на сборник от Ронни Кохави со списком наиболее цитируемых статей от авторитетных авторов.

Эта коллекция регулярно обновляется, поэтому рекомендую также добавить к себе в закладки:

https://docs.google.com/spreadsheets/d/1PAWG7NWVEwAwwfrd9b-V5o5q4nB6i67N2ITrzyrIdP0/edit#gid=224694437

Google Docs

Most cited sources in A/B Testing

👍3

1.94K views20:47

AB тесты и все вот про это вот все

Рекомендую посмотреть крайне интересное недавнее видео о проведении АБ-теста в оффлайн-ритейле, в формате собеседования. Там все работает несколько иначе, нем на наших привычных сайтах, приложеньках, играх. Оттого еще интереснее. Смотрим...

YouTube

A/B-тесты с Валерием Бабушкиным | Собеседование | karpov.courses

Симулятор A/B-тестов: @

Представьте, что вы работаете в физическом ритейле. Команда машинного обучения разрабатывает алгоритм ценообразования. Как оценить его эффективность с помощью A/B-теста?

Смотрите новое собеседование, чтобы узнать, как с этой задачей…

💩2👍1

2.05K views11:34

AB тесты и все вот про это вот все

Когда подводим результаты АБ-теста, выносим некий вердикт, например, стат. значимых изменений нет, нулевая гипотеза отвергнута, идем дальше.

А потом к тебе приходят с запросом - а давай покопаемся в тех или иных сегментах пользователей, возможно, в каких-то из них у нас будет стат. значимый результат. И, конечно, почти всегда можно найти большие или маленькие сегменты, где наши изменения сработали. Но, они не меняют метрики на всех пользователях, так как или сегменты маленькие, или и на них влияние было не сильно кратное. А, может, и то, и другое сразу.

Такая информация может быть полезна, как дополнительное знание, которое может подтолкнуть к какием-то новым гипотезам, экспериментам, исследованиям.

Беда в том, что такие результаты иногда пытаются использовать для того, чтобы сказать, что "вот у таких и таких пользователей есть стат. значимое изменение метрик и поэтому данную фичу нужно раскатить на всех". В таком случае это явная манипуляция с целью исказить результаты нашего эксперимента. Потому что очень хочется, чтобы получилось успешно.

В такой ситуации стоит подводить итоги, как изначально планировалось. И, если все же приняли решение что-то дополнительно поисследовать в каких-то сегментах, оформить это именно как доп. исследование, не касающееся основных выводов по эксперименту. Мы же за истину все ж...

👍12

2.15K views13:51

AB тесты и все вот про это вот все

Сейчас, наверное, у всех крупных компаний используются собственные платформы для проведения АБ-тестов. Если кто-то еще на пути к этому, кое-где можно срезать углы, использовав чужой опыт.

И вот что некоторые из них про это рассказывают:
- Авито раз и два
- Ozon раз и два
- Lamoda
- Сбер
- Х5 про оффлайн-эксперименты

Хабр

Как устроено A/B-тестирование в Авито

Всем привет. Меня зовут Данила, я работаю в команде, которая развивает аналитическую инфраструктуру в Авито. Центральное место в этой инфраструктуре занимает А/B-тестирование. А/B эксперименты —...

❤13

2.52K views08:38

AB тесты и все вот про это вот все

Сбермаркет продолжает тему про платформы для A/B-тестов и проводит 28 марта митап.
Помимо Сбермаркета участвуют EXPF (легендарные легенды индустрии) и Авито (не менее легендарные легенды в своей индустрии).
Ссылка на регистрацию

sbermarket.timepad.ru

A/B Platform Meetup | SberMarket Tech / События на TimePad.ru

Приглашаем на онлайн-митап СберМаркет Tech.
Регистрируйся и присоединяйся к нам!

Трансляция здесь: www.youtube.com/watch?v=YoTTuiVDeMo...

🔥6

2.36K views07:58

AB тесты и все вот про это вот все

Тут ребята из X5 рассказывают, как решают проблему проведения АБ-тестов с небольшими выборками с помощью разработки собственно критерия. Непонятно только, насколько это воспроизводимо на регулярной основе.

Хабр

А/Б тестирование на маленьких выборках. Построение собственного критерия

Хабр, привет! Сегодня рассмотрим кейс, в котором классические статистические критерии не работают, и разберёмся, почему так происходит. Научимся строить свои собственные критерии по историческим...

👍6

2.07K viewsedited 10:44

AB тесты и все вот про это вот все

А если свой платформы для АБ-тестов нет и не используется готовое внешнее решение, приходится обходиться собственными силами. Тут у нас снова развилка:
- писать свои функции-библиотеки
- приспособить готовые библиотеки на питоне

Из интересных библиотек могу выделить две:
- Ambrosia от коллег из МТС
- Kolmogorov ABacus

Недавно потестировал Kolmogorov ABacus, очень даже неплохо. Основные особенности:
- Оценка результатов эксперимента с помощью многих стат. критериев, в том числе бустрапа - собственно, ожидаемо
- Инструмент для деления на группы с оценкой качества деления
- Подготовка эксперимента - ошибки 1 и 2 рода, mde, расчет необходимой выборки

Ссылки:
- Гитхаб
- Примеры оценки результатов эксперимента на гитхабе
- Документация
- Канал в телеграме
- Чат поддержки в телеграме
- Статья на Хабре об использовании

GitHub

GitHub - kolmogorov-lab/abacus: ABacus: fast hypothesis testing and experiment design solution

ABacus: fast hypothesis testing and experiment design solution - kolmogorov-lab/abacus

🔥8👍2❤1

2.62K views06:59

AB тесты и все вот про это вот все

Сбермаркет продолжает тему про платформы для A/B-тестов и проводит 28 марта митап. Помимо Сбермаркета участвуют EXPF (легендарные легенды индустрии) и Авито (не менее легендарные легенды в своей индустрии). Ссылка на регистрацию

Есть прекрасная поговорка - завтра в 6. Митап перенесен на завтра, 4 апреля, 18.00.
Ссылка актуальна.

sbermarket.timepad.ru

A/B Platform Meetup | SberMarket Tech / События на TimePad.ru

🤯2

2.17K viewsedited 12:09

AB тесты и все вот про это вот все

На хабре вышла большая статья с подробным разбором нескольких стат. критериев:
- z-статистика
- t-статистика
- критерий хи-квадрат
- f-статистика

Она будет особенно полезна тем, кто использует эти критерии, не вникая с их суть.

Хабр

Индуктивная статистика: доверительные интервалы, предельные ошибки, размер выборки и проверка гипотез

Одной из самых распространённых задач аналитики является формирование суждений о большой совокупности (например, о миллионах пользователей приложения), опираясь на данные лишь небольшой части этой...

🔥16👍3

2.91K views07:59

AB тесты и все вот про это вот все

Несколько дней назад коллега из Сбермаркета написал статью по работе с Ratio-метриками в AB-тестах. В ней предлагается использовать линеаризацию.
Почему это интересно. Потому что у наших любимых бутстрапа и дельта-метода тоже есть как сильные, так и слабые стороны. Плюс дополнительный метод точно будет полезен.

И еще прикладываю несколько материалов на тему дельта-метода и ratio-метрик:
- раз
- два
- три
- четыре
- пять

Хабр

Линеаризация: зачем и как укрощать ratio-метрики в A/B-тестах

Привет, Хабр! В прошлой статье я указал, что в A/B-тестах используются три основных типа метрик, а именно пользовательские конверсии , средние метрики пользователей и ratio-метрики . К последним...

🔥13👍3

2.44K views09:02

AB тесты и все вот про это вот все

Если вдруг кто-то пропустил митап от EXPF, запись здесь.
Темы:
- Как из подручных средств организовать процесс А/В тестирования
- Критерии валидности АБ-тестов
- Поиск Эффективных Прокси-Метрик
- Сбор качественных данных для проведения А/Б тестов

YouTube

Митап EXPF x DataGo!

Программа

18:00 – 18:30 Как из подручных средств организовать процесс А/В тестирования

Макс Шевченко, OKKO

18:30 – 19:00 Критерии валидности АБ-тестов

Полина Ревина, руководитель платформы экспериментов СберМаркет

19:00 – 19:30 Поиск Эффективных…

🔥10❤2

2.31K views06:58

AB тесты и все вот про это вот все

Тут очень интересный доклад легендарного в некоторых кругах Анатолия Карпова про оценку продолжительности АБ-теста. Это одна из самых интересных и проблемных вопросов при проведении экспериментов. Внутри подглядывание, т-тесты, mde, fixed horizon.
Отдельно рекомендую к просмотру раздел со штрафами за подглядывание - менеджерам может понравиться...
Статья EXPF, о которой говорит Анатолий, здесь.

YouTube

Анатолий Карпов, «Методы оценки размера выборки в А/Б-тестах. От размера эффекта до симуляций»

Анатолий Карповm, СЕО Karpov.Courses
Kolesa Conf 2022, 8 октября

Описание доклада:
Уметь отвечать на вопрос «Как долго должен идти А/Б-тест?» — важнейший навык аналитика. Если вы запускаете А/Б-тест на глазок, будьте готовы, что вас ждёт множество проблем:…

3K views11:23

AB тесты и все вот про это вот все

Интересный разговор Александра Игнатенко (телеграм-канал Модель атрибуции) и Виталия Черемисинова (EXPF) про:
- альтернативы закрывшемуся Google Optimize
- особенности интерфейса GA4
- внедрение Сигмы от EXPF
- метрики экспериментов
- распространенные ошибки в командах, работающих с АБ-тестами
- нужно ли очень глубоко закапываться в исследования данных при АБ-тестах
- прочие важные вопросы про АБ-тесты и эксперименты от зрителей стрима

Незаслуженно мало просмотров у ролика как-то.

YouTube

Есть ли жизнь после Оптимайза?

Запись стрима о том, как, где и каким способом проводить AB-тесты после заката Google Optimize. И не только об этом.

Участники:
Александр Игнатенко, эксперт по маркетинг-аналитике, автор телеграм-канала «Модель атрибуции» - https://bit.ly/3uMhmZo

Виталий…

👍5

2.68K views09:19

AB тесты и все вот про это вот все

Сбермаркет в новой статье рассказывает, как в своей платформе (да, я снова про платформу) АБ-тестов проверяет АБ-тесты на валидность.

Хабр

Как оценить валидность A/B-тестов. SRM и другие критерии

Привет! Меня зовут Полина, я руковожу A/B‑платформой в СберМаркете. В этой статье я расскажу о нескольких нюансах экспериментирования, которые возникают на разных этапах: от дизайна и сплитования до...

❤2

2.61K views12:31

AB тесты и все вот про это вот все

Тем, кто начинает заниматься АБ-тестами, часто кажется, что самое главное - делить на группы, считать pvalue, выбирать стат. Критерий. Но это не так.
На AHA сейчас идёт мастер-класс, на котором наши коллега из Самокат Тех разбирает дизайн АБ-теста со своего конкурса.
Для тех, кто не очень понимает, с чего начинается эксперимент, рекомендую.

👍7

2.5K viewsedited 09:33

AB тесты и все вот про это вот все

А Озон банк показал свои ключевые принципы АБ-тестов

👍6

2.48K views10:08

About

Blog

Apps

Platform