NEW BOT Телеграм, страница

Datalytics

Пожалуй, обращение к элементам датафрейма с помощью loc и iloc - это одна из тех тем, которая становится камнем преткновения для людей, начинающих изучать pandas. На самом деле, всё не так сложно. Erik Marsja в своей статье подробно освещает использование loc и iloc.

https://www.marsja.se/how-to-use-iloc-and-loc-for-indexing-and-slicing-pandas-dataframes/

Erik Marsja

How to use iloc and loc for Indexing and Slicing Pandas Dataframes

In this extensive tutorial you will learn how to work with Pandas iloc and loc to slice, index, and subset your dataframes, e.g., by row and columns.

1.93K viewsedited 09:05

Datalytics

Проверка гипотез с помощью статистических критериев ничего не сообщает о величине различия. В ходе теста устанавливается p-value, что говорит о уровне статистической значимости. А для того чтобы выяснить величину какого-то явления или уровень различия между величинами используют методы оценки величины эффекта (effect size). Величина эффекта может считаться по-разному в зависимости от типа гипотезы, которую мы проверяем. Мер для оценки величины эффекта очень много, чтобы в этом убедиться можно посмотреть статью на википедии. Например, для проверки гипотезы равенства двух средних можно использовать метрику d-Коэна. В статье представлен доступный разбор того что же такое effect size и несколько примеров его расчета с кодом.

https://machinelearningmastery.com/effect-size-measures-in-python/

👍1

1.77K views12:59

Datalytics

WolframMathematica официально представили клиентскую библиотеку Wolfram для Python. Библиотека имеет полностью открытый исходный код.

Клиентская библиотека Wolfram позволяет легко интегрировать большую коллекцию алгоритмов языка Wolfram Language, а также базу знаний Wolfram непосредственно в любой уже существующий код Python.

В статье есть классный пример использования встроенного алгоритма обнаружения лиц в пару строчек кода.

https://habr.com/ru/company/wolfram/blog/471814/

Хабр

WolframClientForPython | Новая клиентская библиотека Wolfram Language для Python

Оригинал перевода в моём блоге Получение полного доступа к языку Wolfram Language из языка Python Язык Wolfram ( Wolfram Language ) дает программистам в руки уникальный язык с огромным множеством...

3.01K views12:02

Datalytics

Лёша Куличевский делится замечательными советами о том как стать аналитиком

1.29K views15:20

Datalytics

Forwarded from Канал Алексея Куличевского

Игорь спрашивает: «Как сформировать путь из маркетолога в аналитика? Какие навыки нужно приобрести?»

Вот алгоритм работы аналитика:

Всё начинается с того, что какой-то заказчик приходит с задачей. Обычно эта задача сформулирована в мире заказчика, например «разобраться, почему у нас не растут продажи» или «мы запустили новую фичу, хотим понять, работает ли она».

Задача аналитика: разобраться в задаче, декомпозировать ее на атомарные подзадачи, решение которых поможет ответить на основной вопрос.
Например «разобраться, почему у нас не растут продажи» можно разобрать так:
* В прошлом году выручка компании расла каждый месяц (дальше значения выручки)
* В этом году рост остановился на значении…
* Как компания зарабатывает деньги? Какие продукты продает? Кому?
* Как изменилось количество новых покупателей?
* Как изменилось количество вернувшихся покупателей?
* Как изменился средний чек?
* Как изменился состав покупательской корзины?
* Как изменились цены на товары?
* Как изменилась посещаемость сайта?

И так далее. Аналитику нужно выделить из задачи целевые метрики и разобраться, из чего они состоят. Я называю этот подход составлением «Пирамиды метрик». В консалтинге его называют составлением «Дерева KPI». Я когда-то описывал этот процесс в блоге: https://blog.ohmystats.com/printsip-piramidy-kak-planirovat-reklamnyie-aktivnosti/

171 views15:21

Datalytics

Forwarded from Канал Алексея Куличевского

После того, как аналитик декомпозировал задачу, надо где-то достать данные для ее решения.
Данные могут лежать, например, в какой-нибудь базе. Чтобы их оттуда достать, нужно уметь писать запросы на SQL.
Еще они могут лежать где-то в интернете и, чтобы их получить, нужно написать запрос к API или распарсить какой-то сайт. Для этого полезно уметь писать несложные программы на каком-нибудь языке программирования. Я, например, пишу на R ил Python.

150 views15:21

Datalytics

Forwarded from Канал Алексея Куличевского

Когда данные получены, их нужно проанализировать, чтобы найти ответ на вопрос. Если аналитик хорошо декомпозировал задачу на первом шаге, весь анализ представляет собой последовательность простых математических операций: тут сложить, там поделить.

Как компания зарабатывает деньги? Какие продукты продает? Кому?
— продаем холодильники через интернет по всей России

Как изменилось количество новых покупателей?
— снизилось на 30%

Почему? Как изменилась посещаемость сайта?
— осталась на том же уровне, зато снизилась конверсия из посетителей в покупателей

Почему она снизилась? На каком этапе воронки?
— Конверсия просела на этапе оформления заказа

Когда она снизилась? Что произошло в этот день?
— 5 января. Мы в этот день убрали бесплатную доставкую

166 views15:21

Datalytics

Forwarded from Канал Алексея Куличевского

Последний этап в пработе аналитика — объяснить результаты анализа заказчику.
Для этого нужно логично и понятно объяснить ваш ход мыслей и подкрепить их иллюстрациями. Иногда задача — не столько ответить на один вопрос, сколько создать для заказчика инструмент, с помощью которого он сам бы на него отвечал в будущем. Это может быть дешборд, модель или какой-нибудь еще дата-продукт.

Создавать такие дата-продукты удобно теми же R и Python.

159 views15:21

Datalytics

Forwarded from Канал Алексея Куличевского

Итого, хороший аналитик умеет:
1. Декомпозировать задачу
2. Находить, доставать и готовить нужные для ее решения данные
3. Анализировать эти данные
4. Понятно объяснять результаты анализа заказчику

Первый пункт — самый важный.

156 views15:21

Datalytics

Кстати, подписывайтесь на канал Лёши Куличевского. Он в аналитике съел слона и плохого не посоветует.

https://news.1rj.ru/str/kulichevskiy

Канал Алексея Куличевского

Алексей Куличевский пишет

1.6K views15:23

Datalytics

При работе с анализом непрерывных числовых данных может быть полезным разбить эти данные на диапазоны (иначе называемые корзинками или bins). В статье подробно рассказывается о том как разбить данные на диапазоны с помощью функций cut и qcut в pandas.

https://pbpython.com/pandas-qcut-cut.html

Pbpython

Binning Data with Pandas qcut and cut

Pandas qcut and cut are both used to bin continuous values into discrete buckets or bins. This article explains the differences between the two commands and how to use each.

1.86K views10:25

Datalytics

Статья из блога DataQuest о том как анализировать данные опросов с помощью Python. Полезно будет новичкам в качестве простого примера разведочного анализа данных

https://www.dataquest.io/blog/how-to-analyze-survey-data-python-beginner/

Dataquest

How to Analyze Survey Data with Python for Beginners – Dataquest

Learn to analyze and filter survey data, including multi-answer multiple choice questions, using Python in this beginner tutorial for non-coders!

1.95K views09:33

Datalytics

Forwarded from BigQuery Insights

Новый Python скрипт - позволяет извлекать данные об активности пользователя из Google Analytics и импортировать их в таблицу Google BigQuery.

via @BigQuery

149 views07:03

Datalytics

Если вы в pandas используете apply на большом объеме данных, то может быть полезным прикрутить шкалу прогресса выполнения функции. В статье рассказывается о том как это сделать с применением библиотеки tqdm

https://towardsdatascience.com/progress-bars-in-python-and-pandas-f81954d33bae

Medium

Progress Bars in Python (and pandas!)

Time and estimate the progress of your functions in Python (and pandas!)

1.89K views11:25

Datalytics

Небольшая, но от этого не менее информативная, статья о том как строить гистограммы и столбчатые диаграммы в Python

https://habr.com/ru/post/470535/

Хабр

Способы создания гистограмм с помощью Python

За последний год я сталкивалась с необходимостью рисования гистограмм и столбчатых диаграмм достаточно часто для того, чтобы появилось желание и возможность об э...

1.89K views08:55

Datalytics

7 советов для повышения эффективности анализа данных в Python: pandas-profiling для быстрого обзора данных, magic-команды, горячие клавиши, выделение блоков markdown цветом и многое другое

https://towardsdatascience.com/7-things-to-quickly-improve-your-data-analysis-in-python-3d434243da7

Medium

7 things to quickly improve your Data Analysis in Python

Take your Data Analysis to the next level!

2.06K views08:51

Datalytics

Инструкция, позволяющая настроить VS Code для того, чтобы в нем можно было работать c ipynb-файлами

https://towardsdatascience.com/ipython-notebook-support-is-finally-here-for-visual-studio-code-b578abe0361c

Medium

IPython Notebook Support is Finally Here for Visual Studio Code

You can now edit Jupyter Notebooks directly in Visual Studio Code. But should you make a switch?

1.95K views08:43

Datalytics

Крутой обзор функций NumPy, которые сильно помогут в работе с массивами. Ну и позволят понять что внутри pandas, т.к. основой для объектов pandas выступают numpy-массивы

https://habr.com/ru/post/469355/

Хабр

Нескучный туториал по NumPy

Меня зовут Вячеслав, я хронический математик и уже несколько лет не использую циклы при работе с массивами… Ровно с тех пор, как открыл для себя векторные опера...

2.22K views06:13

Datalytics

Подробный гайд по работе с временными рядами в Python. В нем даются примеры визуализации рядов, декомпозиции на трендовую и сезонную компоненту, применение статистических критериев для проверки гипотез, например, тест под забавным для постсоветского пространства названием KPSS, который позволяет проверить стационарность ряда.

https://www.machinelearningplus.com/time-series/time-series-analysis-python/

Machine Learning Plus

Time Series Analysis in Python – A Comprehensive Guide with Examples

Learn Data Science (AI/ML/Gen AI) Online

2.2K views08:11

Datalytics

Наткнулся на интересную библиотеку для статистики - Pingouin. Имеет ряд преимуществ по сравнению с scipy.stats, например, t-test по умолчанию выдает не только T-value и p-value, но и доверительные интервалы, статистическую мощность и размер эффекта. Понятное дело, что всё это можно сделать и в scipy, но Pingouin делает это одной функцией, что крайне удобно. Вот ноутбук с кратким обзором того, что умеет Pingouin: https://nbviewer.jupyter.org/github/raphaelvallat/pingouin/blob/master/notebooks/00_QuickStart.ipynb

https://github.com/raphaelvallat/pingouin

GitHub

GitHub - raphaelvallat/pingouin: Statistical package in Python based on Pandas

Statistical package in Python based on Pandas. Contribute to raphaelvallat/pingouin development by creating an account on GitHub.

2.35K viewsedited 06:53

Datalytics

Книга Nicolas P. Rougier "From Python to Numpy" рассказывает о том как с помощью NumPy существенно улучшить эффективность алгоритмов анализа данных. Автор специализируется в применении Python к научным исследованиям и визуализациям, поэтому книга изобилует сложными, но очень крутыми примерами.

https://www.labri.fr/perso/nrougier/from-python-to-numpy/

www.labri.fr

From Python to Numpy

An open-source book about numpy vectorization techniques, based on experience, practice and denoscriptive examples

2.13K views08:59

About

Blog

Apps

Platform