NEW BOT Телеграм, страница

Инжиниринг Данных

Amazon стратегически развивает SageMaker - облачный сервис для ML (виртуальные машины EC2 + Jupyter Notebooks + ML Framework). В 2021 году он планируется стать основным для внутренней и внешней разработки в области ML для Amazon/AWS. Есть интересный science paper про Autopilot (имеется ввиду AutoML).

Книги про SageMaker:
1) Learn Amazon SageMaker: A guide to building, training, and deploying machine learning models for developers and data scientists
2) Data Science on AWS

Тренинг и примеры Python Notebooks по Sage Maker. Там будет одна из лаб - использование Autopilot.

2.57K viewsDmitry Anoshin, edited 16:27

1 comment

Инжиниринг Данных

2.33K viewsDmitry Anoshin, 17:01

1 comment

Инжиниринг Данных

Один из главных принцип лидерства (Leadership Principles) в Амазон - Любовь к Клиентам (Customer Obcession). Да и не только у Амазона, многие компании являются клиентоориентированными.

Когда мы внедряем или сопровождаем аналитическое решение, мы тоже должны быть customer obcession. Только для нас клиенты - это пользователи BI решения. Лучший способ узнать у коллег - провести опрос и визуализировать результат. Таким образом вы сможете собрать обратную связь, быть проактивным и приоритизировать или выявить ключевые проблемы у ваших пользователей, которые вы сможете решить. Таким образом, вы повысите клиентский опыт и у вас будет, что рассказать вашему руководителю или другой компании на собеседовании. 😉

В этом видео мы узнаем:
📌 Для чего нужны опросы пользователей BI
📌 Типы опросов
📌 Net Promoter Score
📌 Customer Satisfaction Score
📌 Customer Effort Score
📌 Реальные примеры опросов
📌 Пример визуализации опросов в Tableau

https://youtu.be/kKI5PMVC6A4

2.47K viewsDmitry Anoshin, edited 18:01

Add a comment

Инжиниринг Данных

Для модуля 3.9 я хотел установить Tableau Server на Windows. У меня 16Гб оперативки, и я выделил 8Гб для виртуальной. Раньше этого было достаточно. Теперь Tableau попросил меня мин 32Гб оперативки. Поэтому я скачала версию 2018 года, и ей хватило 8ми.

Почему я так люблю возиться с виртуальными машинами? Для меня это единственный способ понять как все работает. Идеальная ситуация, когда на одной виртуальной машине (Windows) находиться BI Server, на другой (Linux) находится аналитическое хранилище данных (раньше можно было скачать готовую виртуалку с Teradata) или виртуальная машина Cloudera с Hadoop. Дальше, мы все это соединяем в одну сеть, и подключаемся с BI клиента и SQL клиента с локального компьютера. И когда вся эта история работает, для меня это прям ZEN. Чего и вам желаю.

К счастью или к сожалению не достаточно уметь писать SQL запрос или строить графики, нужно понимать как сервисы взаимодействуют между собой.

2.43K viewsDmitry Anoshin, 07:12

2 comments

Инжиниринг Данных

2.35K viewsDmitry Anoshin, 07:13

Add a comment

Инжиниринг Данных

Если вам нужно быстро визуализовать данные, построить пару графиков, которые буду сами обновляться, то вы можете поддержать отечественного производителя Yandex DataLens.

Я его добавлю в обзор fancy BI решений для модуля 3.12.

Цена у dataleans прозрачная, платим не за пользователей, а за часы. До 166 часов в месяц бесплатно.

Из преимуществ - есть встроенные конекторы к яндекс сервисам.

Кому подойдет? В первую очередь людям, которые любят пробовать новые решения или кому нужно быстро визуализировать данные с использованием простых графиков, чтобы показать коллегам или вывести на экран в офис.

Через несколько лет появятся вакансии, где уже будет требоваться опыт Yandex Cloud, так что лучше изучить на ранней стадии все про решения в облаках, тем более все на русском.

2.51K viewsDmitry Anoshin, 15:45

Add a comment

Инжиниринг Данных

И еще один сервис, который вы можете запустить бесплатно (на облачные кредиты) - Yandex Data Proc. То есть вы можете запустить кластер Hadoop со Spark. Отличный вариант потренироваться на больших данных и Spark. То есть вместо того, чтобы учить как настраивать hadoop, hdfs, как крутить всякие настройки, вы можете сразу перейти к делу и сосредоточиться на решение проблемы. Пару кликов, и вы можете уже писать PySpark или Scala для обработки массива данных. Мне кажется хорошая история для собеседования, рассказать как вы интересуетесь современными технологиями и сравнили AWS EMR и Yandex Data Proc. https://cloud.yandex.com/docs/data-proc/concepts/

Yandex

Yandex Cloud Documentation | Yandex Data Proc | Relationship between Data Proc service resources

Data Proc helps implement distributed data storage and processing using the Apache Hadoop service ecosystem. Resources Resources.

2.63K viewsDmitry Anoshin, 15:51

Add a comment

Инжиниринг Данных

Линейная регрессия на sql? Не вопрос! До этого я только в табло ее делал😬

Mode

How to do linear regression in SQL | Mode

A step-by-step guide to get a simple regression analysis done in pure SQL with relatively little pain.

2.47K viewsDmitry Anoshin, 00:00

9 comments

Инжиниринг Данных

Все слышали про IP адрес? Вы можете всегда узнать какой у вас IP адрес, набрав в google "What's my IP", и получите что-то вроде 205.251.233.106, цифры могут быть любые. Когда мы делали домашнее задание по 3му модулю - подключение БД postgres к локальному клиенту, то мы просто открывали firewall между нашей БД и клиентом SQL полностью (public access). Так никогда не делают, обычно прописывают конкретный range IP адрессов, для этого используют CIDR Notation. Вы на практике познакомитесь с ней в модуле 5 (облачные вычисления) и 6 (облачное хранилище данных. А вот пока для ознакомления статья, как это работает.

Напишите примеры использования CIDR, если на работе сталкиваетесь при кейсах аналитики, доступа сервисов и тп.

Medium

Understanding CIDR Notation and IP Address Range

This article will help you become familiar with IP addresses and CIDR notation.

2.48K viewsDmitry Anoshin, 05:43

5 comments

Инжиниринг Данных

На ресурсе datalearn мы хотим собрать информацию о самых лучших телеграм или youtube каналах, блогах или сообществах для наших студентов, подписчиков и посетителей сайта.

Много талантливых ребят делятся опытом и рассказываю об интересных проектах, мероприятиях и вакансиях связанных с аналитикой. Мы решили собрать их вместе! Если у вас есть телеграмм канал и в нем больше 500 подписчиков, значит у вас хороший контент и им необходимо поделиться со всеми!

Пожалуйста, заполните опрос или перешлите кому будет интересно.

2.42K viewsDmitry Anoshin, 05:58

Интересная статья про technical debt для ML, написанная сотрудниками google.

Technical debt - это метафара, которую ввели в 1992 году, она обозначает стоимость решения на долгой перспективе. То есть, чтобы быстро строить решения, двигаться быстро (fast time to market, quick wins). Вы сможете показать быстрый результат, особенно при использовании облачных вычислений, но со временем вам это встанет в копеечку, так как поддерживать систему будет все сложнее. И это не пусты слова, прямо сейчас я наблюдаю такую картину у нас в команде, нам необходимо создавать Onsite Feature Attributiin модель для маркетологов, чтобы они могли измерять эффективность кампаний. Мы двигаемся быстро, а это значит сотни ТБ данных разбросаны по AWS аккаунтам, и я все добавляю новые данные (даже не думаю, чтобы что-то ненужное удалить - потом удалю). Это стоимость хранения данных, которая еще не очень большая. А вот стоимость вычислений (compute) - сканировать данные (processing, querying) - это уже дорого, особенно если это GPU.

3.3K viewsDmitry Anoshin, 17:12

Add a comment

Инжиниринг Данных

Поэтому моя роль как data engineer, на основе информации выше, разбираться с этим, чтобы на выходе я мог написать что-то вроде (взял у Facebook data engineer и немного изменил):
- Managed a 10 PB+ data platform
- Consolidated and conformed company-wide growth metrics (across Amazon Events and marketing efforts) into a single, company-wide view.
- Optimized machine learning feature set generation pipelines (200+ TB/day) from having a 4 day latency to having a 1 day latency. While also dropping compute costs for those pipelines 4x.
- Reduced core notification data set latencies from 36 hours to < 8 hours.
- Migrated 50% of notifications pipelines from using Hive to use Spark, Presto, or real-time streaming.
- Cut compute cost from notifications pipelines by 40% over the course of 9 months.

+ надо обязательно упомянуть Privacy (GDPR, и все другие вещи, про удаление клиентских данных и compliance)

2.47K viewsDmitry Anoshin, edited 17:17

1 comment

Инжиниринг Данных

Вышла новая книга по созданию и управление аналитическими командами - Data Teams. Я уже заказал. https://www.amazon.com/Data-Teams-Management-Successful-Data-Focused/dp/1484262271/ref=sr_1_1?dchild=1&keywords=data+teams&qid=1601141315&sr=8-1

2.73K viewsDmitry Anoshin, 17:30

3 comments

Инжиниринг Данных

Что вы любите больше? (В России я не пил кофе вообще, а теперь вот 1-2 капучино/латте в день) Интересно как вас:)

Anonymous Poll

878 voters2.61K viewsDmitry Anoshin, 06:01

11 comments

Инжиниринг Данных

2.74K viewsDmitry Anoshin, 01:24

Add a comment

Инжиниринг Данных

2.6K viewsDmitry Anoshin, 02:39

Add a comment

Инжиниринг Данных

2.67K viewsDmitry Anoshin, 15:46

4 comments

Инжиниринг Данных

Интересная статья, которая сравнивает Azure Synapse (их хранилище данных) и Azure Databricks (Spark) - рассматривается что, для чего используется. На самом деле даже без Azure, можно просмо посмотрят, что когда используется. Это же самое важно, выбрать правильную технологию.

element61

When to use Azure Synapse Analytics & Azure Databricks?

What is Azure Synapse Analytics?Azure Synapse Analytics is the Azure SQL Datawarehouse rebranded. Azure Synapse Analytics v2 (workspaces incl. Azure Synapse Studio) is still in preview. This version of Azure Synapse Analytics integrates existing and new analytical…

2.65K viewsDmitry Anoshin, 05:04

Add a comment

Инжиниринг Данных

Статья про delta lake. Кто-то уже строил такое?

Medium

Engagement Activity Delta Lake

Unlike data in our other data lakes, engagement activity is mutable and the mutation ratio is high, which creates a huge challenge for us.

2.64K viewsDmitry Anoshin, 15:13

Add a comment

Инжиниринг Данных

Табло организует Tableau Day на русском 1 Октября.

3.17K viewsDmitry Anoshin, edited 17:32

Add a comment

Инжиниринг Данных

Оказывается, если на работе у вас есть лучшие друзья, то вы в 7 раз более эффективно работаете. Я с этим согласен, вспоминаю веселые проекты в России, где все дружили. За 5 лет в Амазоне у меня нет ни одного друга из Амазона🤨 Наверно поэтому я работаю в 7 раз хуже чем мог бы)))

Harvard Business Review

True Friends at Work

The case for making deeper connections with colleagues

2.8K viewsDmitry Anoshin, edited 18:18

7 comments

About

Blog

Apps

Platform