NEW BOT Телеграм, страница

LEFT JOIN

Обнаружение статистических выбросов

В блоге «Stats and R» мы нашли интересный материал про то, как обнаружить выбросы в датасете, используя пакеты и встроенные решения языка R. Внутри описаны самые разные способы — начиная простым поиском максимальных и минимальных значений выборки заканчивая статистическими тестами Граббса и Диксона.

Мы решили перевести этот материал, но так как Python встречается чаще, дополнительно сделали еще один — как все те же методы реализовать в Python.

®️ Обнаружение выбросов в R: https://leftjoin.ru/all/outliers-detection-in-r/
🐍 Обнаружение выбросов в Python: https://leftjoin.ru/all/outliers-detection-in-python/

LEFT JOIN

Обнаружение статистических выбросов в R

Изучите различные подходы к обнаружению статистических выбросов в R, включая описательную статистику, гистограммы, диаграммы размаха и другие.

3.19K views12:44

LEFT JOIN

Попалась интересная статья про downsampling временных рядов.

#ссылка

2.88K viewsedited 09:53

LEFT JOIN

Opensource альтернатива databricks для управления пайплайнами данных — Arc.

arc.tripl.ai

Arc is an opinionated framework for defining data pipelines which are predictable, repeatable and manageable.

3.2K views13:27

LEFT JOIN

Логирование — мощный инструмент выявления и исправления непредвиденных ошибок. Сегодня мы напишем свой логгер на базе встроенного модуля logging в Python, подготовим для него конфигурационный файл и протестируем его работу на скрипте парсинга данных по API в базу данных:

https://leftjoin.ru/all/python-logger/

leftjoin.ru

Эффективное логирование в Python

2.99K views10:55

LEFT JOIN

Мне очень интересен тг-канал @BigQuery, на который я подписан и регулярно читаю. Делюсь с вами списком аналогичных полезных Телеграм-каналов для аналитиков смежной тематики:

@BigQuery — аналитика в Google BigQuery, примеры решений и SQL-запросов, инсайты, лайфхаки и советы по работе с данными.
@WebAnalyst — WebAnalytics — полезная информация по веб-аналитике, повышению конверсии и анализу данных в маркетинге.
@ProductAnalytics — шпаргалка продуктового аналитика, актуальные материалы из закладок аналитиков.
@ABtesting — лучшие материалы по A/B-тестированию в одном канале.
@MarkeTech — канал о маркетинговой аналитике и применении современных технологий в digital-маркетинге.

2.46K views10:01

LEFT JOIN

2.37K views10:01

LEFT JOIN

На прошлой неделе в блоге вышел перевод англоязычного материала «Обнаружение статистических выбросов в R» с обзором самых популярных методов обнаружения и проверки выбросов.

После выхода материала мне в личку написал Алексей Селезнёв, автор канала R4marketing. Он уточнил, что в разделе про фильтр Хэмпеля есть неточность, связанная с поведением функции вычисления медианного абсолютного отклонения mad(). Это правда: без дополнительного параметра функция будет искать не совсем медианное абсолютное отклонение. Функция принимает параметр constant, и для точного расчёта он должен равняться 1, а по умолчанию принимает значение равное 1.4826. Указание этого параметра со значением 1 исправляет неточность.

Мы поправили материал и написали автору оригинальной статьи Энтони Соэтвэю. Через сутки после обращения Энтони ответил, что такая неточность действительно есть и отредактировал материал в блоге statsandr.

Скриншот изменений ниже.

LEFT JOIN

Обнаружение статистических выбросов в R

2.39K views12:10

LEFT JOIN

2.24K views12:10

LEFT JOIN

Вот это действительно классная новость! Надеюсь дойдет до стабильной версии CH и можно посмотреть на это на продакшене.

2.27K views12:30

LEFT JOIN

Forwarded from karpov.courses

Невероятно, но факт: в ClickHouse появилась поддержка оконных функций!

Почему это важно? ClickHouse – это база данных, созданная специально для аналитиков, а аналитические задачи не всегда решаются без оконных функций. Самые ловкие и умелые писали аналоги на словарях, лямбда-функциях и подзапросах, но всё же это считалось велосипедом и могло потребовать переписывать код под новую задачу. Отсутствие оконных функций часто звучало в обсуждениях баз данных для аналитиков и было одним из ключевых аргументов, почему не ClickHouse.

Пока что оконные функции находятся в альфа-версии и поддерживают не весь спектр параметров в сравнении с, например, PostgreSQL, но начало положено. Тем более ClickHouse – opensource база, так что ожидается, что при поддержке сообщества их быстро доделают до стандартов индустрии.

Ну и напомним, что ClickHouse является основной базой в нашем модуле по SQL. Мы обновили версию, так что студенты уже могут покрутить оконки на нашем кластере:)

2.74K views12:30

LEFT JOIN

Согласен с @kuandi! Мы в Петербурге умеем до 50 таких оттенков серого отличать 😎

2.61K views17:31

LEFT JOIN

Forwarded from настенька и графики

Приятные оттенки серого для разнообразия. Серый вообще топ цвет для визуализаций, когда нужно делать фокус на чем-то одном (тогда серым делаете все категории, а какую-то выделяете другим более ярким). Связка серый+синий уже немного классическая, но часто берут самые дефолтные серый и синий, а вот такие оттенки могут сделать виз ещё симпатичнее 🦭

2.77K views17:31

LEFT JOIN

Не все используют GUI при работе с системой контроля версий, и для коммита файлов приходится вводить не одну команду в терминал, а смена веток нередко приводит к путанице.

А у GitHub есть API, который позволяет создавать репозитории, получать информацию о пользователях, отправлять и обновлять файлы и многое другое. В сегодняшнем материале пишем скрипт, который автоматизирует отправку коммитов при помощи запросов к GitHub API:

https://leftjoin.ru/all/github-api/

leftjoin.ru

Пишем скрипт для автоматизации коммитов GitHub

3.25K views13:25

LEFT JOIN

Лучшие практики использования SQL по версии Metabase.

Некоторые советы действительно ценные. Из того, что реально встречалось на практике особенно выделил бы один, так как в свое время удалось существенно оптимизировать время выполнения запроса:
Prefer EXISTS to IN
If you just need to verify the existence of a value in a table, prefer EXISTS to IN, as the EXISTS process exits as soon as it finds the search value, whereas IN will scan the entire table. IN should be used for finding values in lists.

Metabase довольно интересный инструмент, на одном из проектов используем его, надо бы записать видео в продолжение Гайда по BI.
Если у кого-то есть время и интерес поисследовать Metabase, а также записать видео, пишите мне в DM: @valiotti.

Metabase | Business Intelligence, Dashboards, and Data Visualization

Best practices for writing SQL queries | Metabase Learn

SQL best practices: a brief guide to writing better SQL queries.

5.6K views10:07

LEFT JOIN

Для работы с SQL-кодом и подключением к разным базам данных я достаточно давно использую DBeaver, это довольно удобный инструмент для работы с большим количеством разнообразных БД, у которого есть Community версия (читай, бесплатная).

И вот наткнулся на CloudBeaver (от создателей, разумеется), который умеет все то же самое через браузер.

3.22K views07:04

LEFT JOIN

Fivetran прислали письмо, в котором рассказывают про свою конференцию Modern Data Stack на ЕMEA, которая состоится 25го мая.

2.75K views09:31

LEFT JOIN

Думал, как это увязать с аналитикой и понял, что, наверное, никак, но и не поделиться не могу 🙂 Если кто-то вдруг заскучал по старому плееру Winamp, поддержка которого прекращена, поностальгируйте и скрасьте свой день с веб-версией Winamp ⚡️⚡️⚡️

webamp.org

Webamp • Winamp in your browser

Winamp reimplemented in HTML5 and JavaScript

3.04K viewsedited 11:08

LEFT JOIN

Forwarded from DataEng

Про Query Plan в PostgreSQL: https://arctype.com/blog/postgresql-query-plan-anatomy/

3.24K views06:28

LEFT JOIN

Продолжаем цикл материалов про работу с веб-фреймворком Dash. Ранее мы рассказывали про развертывание дашбордов на AWS Elastic Beanstalk. Если у вас уже есть виртуальная машина на Amazon EC2, то дашборд можно развернуть как веб-приложение на вашем инстансе. О том, как это сделать, читайте в новом материале на нашем сайте:

https://leftjoin.ru/all/deploy-dashboard-ec2/

LEFT JOIN

Деплой дашборда на виртуальной машине Amazon EC2

Мы уже рассказывали о том, как развернуть дашборд с помощью сервиса Elastic Beanstalk от Amazon Web Services. В этом материале расскажем как развертывать дашборды на виртуальной машине Amazon EC2. Подготовка Начало работы с платформой AWS и создание сервера…

2.49K viewsedited 07:48

LEFT JOIN

Любопытное аналитическое исследование о том, как поменялась предвзятость судей к гостевым командам в виду отсутствия зрителей на стадионе с момента начала COVID.

#link

RunRepeat - Athletic shoe reviews

Referees’ Home-Bias in Football Disappears without Audience [Study]

We analyzed referees’ performances in 1283 games from the top four Eu

2.43K views10:26

LEFT JOIN

Анализа данных с помощью SQL
Достаточно прикольный и полезный гайд по использованию SQL для анализа данных вместо Pandas.
Автор делится рядом любоптных идей: train/test split, линейная регрессия (оказывается, есть по умолчанию в PostgreSQL) и много других полезностей, собранных в одном месте, рекомендую!

Кстати, Mode когда-то тоже предлагали несколько изощренный способ построения регрессии с помощью SQL.

#link

Hakibenita

Practical SQL for Data Analysis

What you can do without Pandas

6K views10:18

About

Blog

Apps

Platform