NEW BOT Телеграм, страница

Графики, без опечаток

508 views06:48

Трилогия статей про Байесовское AB тестирование:

1. https://towardsdatascience.com/bayesian-ab-testing-part-i-conversions-ac2635f878ec
2. https://towardsdatascience.com/bayesian-ab-testing-part-ii-revenue-1fbcf04f96cd
3. https://towardsdatascience.com/bayesian-ab-testing-part-iii-test-duration-f2305215009c

Towards Data Science

Bayesian AB Testing - Part I - Conversions | Towards Data Science

How to model, use and analyse conversion based metrics in bayesian product experiments

533 views18:20

AB тесты и все вот про это вот все

Forwarded from Trisigma — про эксперименты

Как устроена экспериментальная платформа у Linkedin?

Оказывается, в тех-блоге Linkedin подробно описано как устроена инфраструктура их АБшницы изнутри. Я думаю какую-то аннотацию писать бессмысленно, просто прочтите заголовки вот этих 3 статей:

- A/B testing at LinkedIn: Assigning variants at scale
- Our evolution towards T-REX: The prehistory of experimentation infrastructure at LinkedIn
- Making the LinkedIn experimentation engine 20x faster

A/B testing at LinkedIn: Assigning variants at scale

445 views12:02

AB тесты и все вот про это вот все

Forwarded from Trisigma — про эксперименты

Проведение A/B для оптимизации SEO

Как задизайнить a/b для оптимизации ранжирования в поисковой выдаче (гугла, яндекса, другого поисковика)?

Это довольно таки распространенный вопрос и решение лежит в плоскости создания синтетических контролей. Вариантов здесь целое множество: хочешь бери байевские временные ряды (prophet или causal impact), хочешь что-то более традиционное (arima или, в частности, sarimax), а можно еще Diff-in-Diff.

Синтетические контроли редко используются на практике в силу проблем, связанных с обучением модели и последующей интепретацией. Тем не менее про подход Diff-in-Diff, часто используемый в социологических иссследованиях, вполне развернуто написали Airbnb:

Читать статью на medium

Medium

Experimentation & Measurement for Search Engine Optimization

Leveraging a market-level approach to measure landing page effectiveness on Airbnb.

511 views07:37

AB тесты и все вот про это вот все

Forwarded from BigQuery Insights

Калькулятор размера выборки A/B-теста в Tableau для неравного деления аудитории.

@BigQuery

464 views07:33

AB тесты и все вот про это вот все

Как-то посмотрел отчет коллег по результатам AB теста. И в нем целевой показатель - конверсия из сессии, в которой был показан вариант эксперимента (тестовый или контрольный) в сессию с заказом. В чем проблема? А в том, что в данном случае измерять в сессиях неправильно. И вот почему.
Одно из важнейших условий проведения AB теста - независимость наблюдений. И у нас, например, перекраска кнопки "В корзину" из красного в синий, это изменение показывается постоянно.
Если пользователь утром зашел на сайт и увидел новую кнопку, мы засчитали сессию с показом. Когда он снова вечером снова зайдет на сайт и снова увидит новую кнопку, снова будет засчитана сессия с показом, итого уже две. В таком случае у нас получились два измерения, и они одно из них зависимо от другого - так как второй сессии могло не быть без первой. То же самое может быть с заказами - может быть много сессий в заказом у одного пользователя.
Таким образом, у нас нарушается обязательное требование о независимости измерений. В данном случае мы должны были считать конверсию из пользователя, увидевшего кнопку, в пользователя, совершившего заказ.

527 views08:48

AB тесты и все вот про это вот все

На прошлой неделе прошел митап от Expf и Сберамаркета. Обсудили проблематику создания платформы для проведения AB тестов, выбора наиболее подходящих метрик.
https://youtu.be/1blbhx9BYxk

YouTube

online meetup EXPF x СберМаркет

online meetup EXPF x СберМаркет

18:00–18:30, Платформа А/Б тестирований: создание универсальной системы для проведения экспериментов на онлайн платформах

Станислав Романихин, head of DS sever x

18:30–19:00, Метрики для метрик

Виталий Черемисинов, co…

556 views14:59

AB тесты и все вот про это вот все

Forwarded from Trisigma — про эксперименты

Когда останавливать A/B-тест? Часть 1: MDE

«Сколько ждать?» – самый частый вопрос, который приходится слышать до и во время проведения эксперимента.

Мы написали новую статью (правильнее было бы назвать это руководством) про то, как стоит подходить к решению этой задачи. А именно от чего в первую очередь зависит прогнозируемое время и как это считать + с кодом на питоне.

В первой части рассматривается концепция Fixed time Horizon, которая основана на расчете MDE. Следующая часть выйдет через несколько недель. А может и раньше, следите за обновлениями в этом канале

Читать статью на медиуме

502 views09:06

AB тесты и все вот про это вот все

Forwarded from Аналитика. Это просто

Только сегодня досмотрел митап от EXPF и СберМаркет - https://youtu.be/1blbhx9BYxk.
Для меня самым интересным был доклад Виталия Черемисина про чувствительность метрик. Виталий очень доступно все разжевал и рассказал о том, как оценивать эту самую чувствительность метрик. Ниже небольшой конспект этой части его выступления.

Для того, что оценить чувствительность той или иной метрики, нужно моделировать рост нашей метрики на некоторой выборке и оценивать, при каком условии чувствительность максимальная.

1. Нужно взять некоторую группу пользователей, разбить ее на две группы, так чтобы в обеих группах наша метрика была равна.

2. Выбрать несколько значений uplift. Шаг может быть разным, исходя из эмпирического опыта.

3. И по каждому из значений uplift нужно произвести операции:
- В одной из выборок (пусть она будет B) увеличить значение метрики на величину uplift. Это нужно делать не коэффициентом умножить на вреднее, а некоторым пользователям добавить конверсии, каким-то убрать - в результате получится полноценная выборка с дополнительными конверсиями.
- Делать множественные подвыборки (например, 1000) из обеих групп, сравнивать их показатели, рассчитывать pvalue.
- В результате у нас получится 1000 значений pvalue. Считаем, какой в каком проценте из них pvalue был ниже 0,05. Например, их будет 65%. Вот это процент и есть чувствительность нашей метрики при увеличении на некоторую величину.
- Фиксируем данные. И то же самое теперь производим с остальными значениям uplift.

4. В результате у нас получится таблица, в которой у нас посчитана чувствительность метрики при разных значениях ее увеличения. И можно сделать вывод, при каком росте конверсии можно рассчитывать зафиксировать эффект, если он есть.

Для чего это можно использовать:
1. Чтобы сделать вывод, нужно при проводить эксперимент. Например, выяснится, что, чтобы получить чувствительность 80%, нужно увеличить конверсию на 30%, что считается невозможным при данных изменениях. Значит, на данный момент нужно отказаться от тестирования данной гипотезы.
2. Чтобы приоритизировать гипотезы для проведения экспериментов. Проверив чувствительность многих метрик и предполагая их увеличение на определенный процент, можно понимать, какие гипотезы про какие метрики являются более перспективными с точки зрения возможности увидеть положительный эффект. Становится понятно, с каких метрик и каких гипотез лучше начать тестирование изменений.

YouTube

online meetup EXPF x СберМаркет

641 views17:43

AB тесты и все вот про это вот все

Много накопилось материалов по использованию Байесовских методов в AB тестах. Собрал их в единый список:
- https://telegra.ph/Primenenie-Bayesian-podhoda-v-AB-testah-03-02
- https://vidogreg.shinyapps.io/bayes-conversion-test/
- http://varianceexplained.org/r/bayesian_ab_baseball/
- https://medium.com/convoy-tech/the-power-of-bayesian-a-b-testing-f859d2219d5
- https://www.youtube.com/playlist?list=PLAKBwakacHbRRw278HMXpCsOOIIcLYGX5
- https://mobiledevmemo.com/its-time-to-abandon-a-b-testing/
- https://cxl.com/blog/bayesian-frequentist-ab-testing/
- https://cxl.com/blog/bayesian-ab-test-evaluation/
- https://towardsdatascience.com/bayesian-a-b-testing-with-python-the-easy-guide-d638f89e0b8a
- https://academy.yandex.ru/posts/prostoy-gid-po-bayesovskomu-a-b-testirovaniyu-na-python
- http://blog.analytics-toolkit.com/2017/5-reasons-bayesian-ab-testing-debunked/
- https://towardsdatascience.com/why-you-should-try-the-bayesian-approach-of-a-b-testing-38b8079ea33a
- https://www.countbayesie.com/blog/2016/5/1/a-guide-to-bayesian-statistics
- https://www.countbayesie.com/blog/2015/4/25/bayesian-ab-testing
- https://towardsdatascience.com/bayesian-ab-testing-part-i-conversions-ac2635f878ec
- https://towardsdatascience.com/bayesian-ab-testing-part-ii-revenue-1fbcf04f96cd
- https://towardsdatascience.com/bayesian-ab-testing-part-iii-test-duration-f2305215009c

Telegraph

Применение Bayesian подхода в A/B тестах

Я очень увлечен оптимизацией процессов, и классический вариант проведения A/B тестов меня не устраивал долгое время. Ощущение что все, или почти все продакты просто приняли способ обработки теста как так должно быть и не ищут новых путей. Есть калькулятор…

1.07K views11:48

AB тесты и все вот про это вот все

Forwarded from Product Analytics

Как увеличить мощность критериев для A/B-тестирования, используя машинное обучение? Дима Лунин, аналитик AvitoTech, подробно рассказал в своей статье, а ещё:
🔹 что такое CUPED-метод и как улучшить CUPED-алгоритм;
🔹 как использовать Uplift-модель в качестве статистического критерия;
🔹 методы и критерии, разработанные и придуманные командой AvitoTech.

Хабр

ML-критерии для A/B-тестов

Всем привет! Меня зовут Дима Лунин, и я аналитик в Авито. Как и в большинстве компаний, наш основной инструмент для принятия решений — это A/B-тесты. Мы уделяем им большое внимание: проверяем на...

885 views08:36

AB тесты и все вот про это вот все

Небольшой чек-лист для проведение АБ теста. Полезно им руководствоваться, чтобы не упустить какую-нибудь "мелочь".
https://www.notion.so/AB-dc3c2f5b1c394124ba65ef7f6100bbee

Alexandr's Notion on Notion

Проведение AB теста

Этапы проведения AB теста

1.42K views13:26

AB тесты и все вот про это вот все

И небольшой кейс по результатам AB теста. Просто и полезно.
http://holoway.io/page15625650.html

holoway.io

Как А/В тесты помогли увидеть увеличение конверсии в 1% при небольшом изменении формы заказа

1.03K views17:48

AB тесты и все вот про это вот все

Forwarded from Trisigma — про эксперименты

Когда останавливать A/B-тест? Часть 2: Monte Carlo

Мы написали вторую часть статьи по планированию времени на проведение эксперимента. На этот раз речь пойдет про метод Монте-Карло. Он универсален для любых метрик и любых статистических критериев (включая ранговых). В статье подсвечиваются моменты, в которых он лучше аналитического подхода по расчету MDE, а также с кодовыми примерами

Читать статью на медиуме

1.13K views10:13

AB тесты и все вот про это вот все

Отличная статья по приоритизации гипотез, разбираются несколько фреймворков, их плюсы и минусы: https://cxl.com/blog/better-way-prioritize-ab-tests/.
Собственно, это не только для AB теста полезно, и для любых фич, нововведений, даже если по ним нет возможности провести тест.

CXL

PXL: A Better Way to Prioritize Your A/B Tests

If you're doing it right, you probably have a large list of A/B testing ideas in your pipeline. Some good ones (data-backed or result of a careful

1.05K views15:18

AB тесты и все вот про это вот все

Статья от Joom о процессе запуска A/B теста - как определиться с гипотезой, задизайнить эксперимент, выбрать аудиторию, метрики, продолжительность.
https://habr.com/ru/company/joom/blog/661639/

Хабр

Как устроен запуск экспериментов в ИТ-продукте на примере Joom

Привет, Хабр! Меня зовут Леонид Огрель, я работаю аналитиком в Джум Лабс. В этой статье я расскажу, зачем нужен эксперимент в ИТ-продукте, и на что нужно обратить внимание при его запуске. Как...

1.04K views18:46

AB тесты и все вот про это вот все

Forwarded from Trisigma — про эксперименты

Как раскатывать фичи в A/B с помощью подхода CRL

Все мы привыкли, что фазы раскатки фичи в A/B следуют планомерному увеличению траффика по ходу эксперимента (например, с 1% до 100%). В этом подходе мы хотим учесть, что на маленькой доле траффика много не потеряем на случай, если вдруг целевые метрики просели. Если все ок, то выкатываемся на полную. Такой подход понятен, он работает как часы. Однако, в таком подходе все равно всегда есть риск, что плохой эффект заметен будет не сразу, а чуть погодя. В первую очередь это может коснуться метрик лояльности (например, spu – sessions per user)

В Microsoft и других крупных компаниях практикуется альтернативный подход, в котором фазы лишь условно следуют этому правилу. Подход именуем как Controlled Rollout (CRL). Условность в том, что раскатка зависит не от доли траффика, а от аудитории. Пользователей можно поделить на 4 сегмента: Dogfood, Internal, Insiders, Production.

- Dogfood – по сути внутренняя разработка, оунеры фичи и интересанты
- Internal – внутренние сотрудники, которые могут исчисляться сотнями или тысячами в зависимости от размера компании
- Insiders – внешние пользователи/потребители продукта, которые ранее проявляли интерес к новшевствам сервиса и готовые получать их как можно раньше
- Production – все внешние пользователи

Для каждой аудитории выделены свои критерии и чекеры, говорящие об успешной фазе раскатки и не везде нужно ориентироваться на целевые (OEC) метрики, как это принято при поэтапной раскатке, постепенно увеличивая долю траффика. Что это за метрики и как устроена методология – можно почитать в пейпере

982 views22:27

AB тесты и все вот про это вот все

Интересно, когда обычный AB тест заменяется "когортным анализом". Мы все знаем, что ничего это не даст, но делаем вид, что экономим время.
Видимо, чтобы получить ответ типа "Лучше бы провели AB тест". Тем временем прошёл месяц.

927 views20:52

AB тесты и все вот про это вот все

Друзья, проводите эксперименты

955 viewsedited 20:52

AB тесты и все вот про это вот все

Forwarded from Аналитика. Это просто

Коллеги из Delivery Club написали о внедрении switchback в A/B тестировании, https://habr.com/ru/company/deliveryclub/blog/670762/

Хабр

Как мы научились А/B-тестировать алгоритмы с помощью switchback-тестов

Привет! На связи Евгений Бокарев и Надежда Грачёва, в этой статье мы расскажем про внедрение switchback A/B-тестов в логистике Delivery Club. Обсудим, как оценивать результат эксперимента, если...

870 views10:14

AB тесты и все вот про это вот все

Forwarded from Trisigma — про эксперименты (Iskαnder)

How Airbnb Safeguards Changes in Production
Статья от Airbnb про их процесс выкатки A/B-тестов:

Introduction
По мере того, как Airbnb выросла до компании с более чем 1200 разработчиками, количество платформ и каналов для внесения изменений в наш продукт — и количество ежедневных изменений, которые мы вносим в прод, — также значительно выросло. Перед лицом этого роста нам постоянно необходимо масштабировать возможности обнаруживать ошибки до того, как они попадут в рабочую среду. Однако ошибки неизбежно ускользают от предварительной проверки, поэтому мы также вкладываем значительные ресурсы в механизмы для быстрого обнаружения ошибок, когда они все же попадают в прод. В этом статье мы рассмотрим причины и фундамент системы защиты изменений в рабочей среде, которую мы называем безопасным развертыванием (Safe Deploys). В двух следующих постах будет подробно рассказано о технической архитектуре, о том, как мы применяли ее к традиционным A/B-тестам и развертыванию кода соответственно

https://medium.com/airbnb-engineering/how-airbnb-safeguards-changes-in-production-9fc9024f3446

Medium

How Airbnb Safeguards Changes in Production

Part I: Evolution of Airbnb’s experimentation platform

865 views08:06

About

Blog

Apps

Platform