У Ростелекома в ноябре была конференция DataTalks 2.0, а сегодня на просторах сети нашел линк на все презентации.
Пока не добрался до просмотра видео, но приметил интересные темы:
- Data Governance
- Как сделать проекты Data Governance успешными
- Качество данных
- От DataOps к MLOps
Ссылка на полный плейлист
Пока не добрался до просмотра видео, но приметил интересные темы:
- Data Governance
- Как сделать проекты Data Governance успешными
- Качество данных
- От DataOps к MLOps
Ссылка на полный плейлист
YouTube
Data Governance
Решения и процессы для управления корпоративными данными.
• Что такое управления корпоративными данными (Data Governance), почему это важно.
• Управление метаданными: как создать бизнес глоссарий и каталог данных — корпоративный “Google” и “Wikipedia” по…
• Что такое управления корпоративными данными (Data Governance), почему это важно.
• Управление метаданными: как создать бизнес глоссарий и каталог данных — корпоративный “Google” и “Wikipedia” по…
Всем привет! 🤝
Прошел месяц с момента поста от 30 января про курс Apache Airflow 2.0. Я планировал его закончить к концу февраля, но сейчас он готов на 50%. Последнюю неделю я занимался разработкой платформы на которой он будет размещаться. Сначала я планировал взять что-то готовое, чтобы быстренько развернуть и иметь возможность показывать вам прогресс, но быстро понял, что с "готовыми" решениями я трачу куда больше времени на разбор что и как + допиливание своих хотелок.
Если интересно, то я смотрел в сторону open edx. Это открытая платформа сайта edx.org. Проект написан на Python и Django. Почитав исходный код проекта я понял, что там много лишнего и он уже достаточно объёмный.
Быстро нашлась легковесная альтернатива от Ines Montani (автор spaCy) - course-starter. Мне проект очень понравился, получилось быстро перенести свой контент на этот легковесный фрейм, но проблемы начались как только нужно было накрутить что-то своё. Например, авторизацию, подключение оплаты, комменты и всякие мелкие свистелки вроде кастомных линков и т.д. Проект классный, под капотом использует GatsbyJS (к сожалению, старую версию) и кучу разных плагинов вроде конвертации Markdown в HTML, плеер plyr, плагин для показа слайдов (а-ля презентации PowerPoint).
Помучавшись с готовыми решениями пришел к выводу, что надо пилить свою LMS (learning management system). Сказано - сделано. Встречайте: dataengineer.ru
Домен регистрировал почти 4 года назад, пришло время им воспользоваться. Ранее свой первый курс я запускал на платформе Stepik, но это невыгодно, т.к. комиссия порой достигает 30%, также выводить деньги я могу не чаще 1 раза в месяц. Своя платформа выгоднее во всех смыслах (кроме времени на её разработку). Также я, как нерезидент РФ, мог поставить цену только в долларах, а это большой минус для студентов из СНГ.
На платформе dataengineer.ru полностью доступен курс про дата пайплайны на Luigi, отныне цена в рублях и дешевле чем на степике ($10 против 590 рублей). Посмотреть его можно по ссылке. Есть бесплатный ознакомительный модули.
Курс про Apache Airflow также размещён, но пока не доступен для покупки, однако есть бесплатные модули, которые можно посмотреть уже сейчас.
На платформе доступна регистрация студентов, покупка курсов через процессинг Qiwi (пока купить можно только Luigi курс). В курсе есть возможность просматривать видео, читать текст и отвечать на вопросы. Планирую в ближайшее время добавить возможность оставлять комментарии к урокам и выполнять задания на кодинг (пока python). В будущем хочу также добавить SQL.
Возвращаясь к курсу Airflow. Постараюсь его полностью добить в течение первой половины марта. Всем, кто оставил заявку, сообщение о запуске придёт первым.
Прошел месяц с момента поста от 30 января про курс Apache Airflow 2.0. Я планировал его закончить к концу февраля, но сейчас он готов на 50%. Последнюю неделю я занимался разработкой платформы на которой он будет размещаться. Сначала я планировал взять что-то готовое, чтобы быстренько развернуть и иметь возможность показывать вам прогресс, но быстро понял, что с "готовыми" решениями я трачу куда больше времени на разбор что и как + допиливание своих хотелок.
Если интересно, то я смотрел в сторону open edx. Это открытая платформа сайта edx.org. Проект написан на Python и Django. Почитав исходный код проекта я понял, что там много лишнего и он уже достаточно объёмный.
Быстро нашлась легковесная альтернатива от Ines Montani (автор spaCy) - course-starter. Мне проект очень понравился, получилось быстро перенести свой контент на этот легковесный фрейм, но проблемы начались как только нужно было накрутить что-то своё. Например, авторизацию, подключение оплаты, комменты и всякие мелкие свистелки вроде кастомных линков и т.д. Проект классный, под капотом использует GatsbyJS (к сожалению, старую версию) и кучу разных плагинов вроде конвертации Markdown в HTML, плеер plyr, плагин для показа слайдов (а-ля презентации PowerPoint).
Помучавшись с готовыми решениями пришел к выводу, что надо пилить свою LMS (learning management system). Сказано - сделано. Встречайте: dataengineer.ru
Домен регистрировал почти 4 года назад, пришло время им воспользоваться. Ранее свой первый курс я запускал на платформе Stepik, но это невыгодно, т.к. комиссия порой достигает 30%, также выводить деньги я могу не чаще 1 раза в месяц. Своя платформа выгоднее во всех смыслах (кроме времени на её разработку). Также я, как нерезидент РФ, мог поставить цену только в долларах, а это большой минус для студентов из СНГ.
На платформе dataengineer.ru полностью доступен курс про дата пайплайны на Luigi, отныне цена в рублях и дешевле чем на степике ($10 против 590 рублей). Посмотреть его можно по ссылке. Есть бесплатный ознакомительный модули.
Курс про Apache Airflow также размещён, но пока не доступен для покупки, однако есть бесплатные модули, которые можно посмотреть уже сейчас.
На платформе доступна регистрация студентов, покупка курсов через процессинг Qiwi (пока купить можно только Luigi курс). В курсе есть возможность просматривать видео, читать текст и отвечать на вопросы. Планирую в ближайшее время добавить возможность оставлять комментарии к урокам и выполнять задания на кодинг (пока python). В будущем хочу также добавить SQL.
Возвращаясь к курсу Airflow. Постараюсь его полностью добить в течение первой половины марта. Всем, кто оставил заявку, сообщение о запуске придёт первым.
Пятничный видос: https://www.youtube.com/watch?v=qSJ8_Lc1oAY
Сам ещё не смотрел, но планирую на выходных глянуть. Я давно наблюдаю за Apache Druid, и даже когда-то предлагал его попробовать вместо Redshift. Возможно сейчас самое время сделать тест-драйв.
А у вас был опыт работы с Druid?
Сам ещё не смотрел, но планирую на выходных глянуть. Я давно наблюдаю за Apache Druid, и даже когда-то предлагал его попробовать вместо Redshift. Возможно сейчас самое время сделать тест-драйв.
А у вас был опыт работы с Druid?
YouTube
Inside Apache Druid's Storage and Query Engine (Gian Merlino)
CMU Database Group - Vaccination Database Tech Talks (2021)
Speakers: Gian Merlino (Imply)
Inside Apache Druid's Storage and Query Engine
March 01, 2021
https://db.cs.cmu.edu/seminar2021/#db5
Sponsors:
OtterTune (https://ottertune.com)
Steven Moy Foundation…
Speakers: Gian Merlino (Imply)
Inside Apache Druid's Storage and Query Engine
March 01, 2021
https://db.cs.cmu.edu/seminar2021/#db5
Sponsors:
OtterTune (https://ottertune.com)
Steven Moy Foundation…
Прошел ещё один вебинар от Astronomer про управление секретами в Airflow: https://www.youtube.com/watch?v=Mf2uTVe3GPA
YouTube
Secrets Management in Airflow 2.0
Learn about Secrets Management and best practices in Airflow 2.0
Написал небольшую заметку про работу с XCom в Apache Airflow: Apache Airflow и XCom
Код из заметки можно взять из репа у меня на гитхабе.
Код из заметки можно взять из репа у меня на гитхабе.
Нашел интересный блог дата инженера Anna Geller (Anisienia): https://www.annageller.com/
Судя по постам начинала она его в этом году, но уже есть ряд годных статей про Airflow, Prefect, AWS EKS и тд
Мне особенно понравился её глубокий и чуточку скептический пост про TaskFlow API, который появился в Airflow 2.0: https://www.annageller.com/posts/taskflow-api-in-apache-airflow-2-0-should-you-use-it
Я сейчас тоже готовлю подробный пост про TaskFlow API и кастомный бэкэнд для Xcom, где не всё так грустно как пишет Анна. Пост будет сегодня-завтра.
Ближе к концу этой недели все, кто оставил заявку на ранний доступ к курсу про Airflow получат письма на почту.
Судя по постам начинала она его в этом году, но уже есть ряд годных статей про Airflow, Prefect, AWS EKS и тд
Мне особенно понравился её глубокий и чуточку скептический пост про TaskFlow API, который появился в Airflow 2.0: https://www.annageller.com/posts/taskflow-api-in-apache-airflow-2-0-should-you-use-it
Я сейчас тоже готовлю подробный пост про TaskFlow API и кастомный бэкэнд для Xcom, где не всё так грустно как пишет Анна. Пост будет сегодня-завтра.
Ближе к концу этой недели все, кто оставил заявку на ранний доступ к курсу про Airflow получат письма на почту.
Нынче я сертифицированный Airflow юзер 🤣: https://www.youracclaim.com/badges/9e52c30b-8760-4f46-b43b-cbc7008fd32c/linked_in
Ребята из Astronomer подготовили экзамен из 75 вопросов, получил 90% из 100. В целом полезно для проверки знаний.
Ребята из Astronomer подготовили экзамен из 75 вопросов, получил 90% из 100. В целом полезно для проверки знаний.
Credly
Astronomer Certification for Apache Airflow Fundamentals was issued by Astronomer to Adil Khashtamov.
Earners of the Astronomer Certification for Apache Airflow Fundamentals can demonstrate the fundamental skills needed to create, manage and monitor DAGs on Apache Airflow effectively. This includes understanding the airflow components and the task lifecycle…
Forwarded from Mikhail Kumachev
DE or DIE #6
Друзья, мы рады анонсировать митап #6 нашего сообщества DE or DIE!
Дата и время: 25 марта (четверг) 18:00
Формат: Онлайн (трансляция на YouTube)
Регистрация по ссылке: https://deordie.timepad.ru/event/1584420/
Наши спикеры:
1. Иван Трусов из Databricks с докладом: Delta Lake — table format for large scale storage and analytics
2. Паша Финкельштейн из JetBrains с докладом: Kotlin for Apache Spark: WHY?
(*): Несмотря на англоязычные названия доклады будут на русском языке.
Ждем вас в следующий четверг. Ссылку на трансляцию опубликуем за час до мероприятия.
Друзья, мы рады анонсировать митап #6 нашего сообщества DE or DIE!
Дата и время: 25 марта (четверг) 18:00
Формат: Онлайн (трансляция на YouTube)
Регистрация по ссылке: https://deordie.timepad.ru/event/1584420/
Наши спикеры:
1. Иван Трусов из Databricks с докладом: Delta Lake — table format for large scale storage and analytics
2. Паша Финкельштейн из JetBrains с докладом: Kotlin for Apache Spark: WHY?
(*): Несмотря на англоязычные названия доклады будут на русском языке.
Ждем вас в следующий четверг. Ссылку на трансляцию опубликуем за час до мероприятия.
Системный аналитик умеет говорить как на языке IT, так и на языке бизнеса. Именно этот специалист решает, какое программное обеспечение понадобится для решения конкретных задач, чтобы достигнуть поставленной цели. Он понимает, чего хочет заказчик, и следит за тем, чтобы команда разработки сделала все правильно.
Если вы задумывались о карьере в IT и системной аналитике — приходите на бесплатный интенсив «Погружение в профессию системного аналитика» от GeekBrains.
Узнаете, что нужно знать, чтобы попасть в эту профессию, научитесь работать с JSON, разберетесь, что такое API и как их проектируют.
Кликайте по ссылке, чтобы записаться на интенсив → https://geekbrains.ru/link/gGL1Zh
Если вы задумывались о карьере в IT и системной аналитике — приходите на бесплатный интенсив «Погружение в профессию системного аналитика» от GeekBrains.
Узнаете, что нужно знать, чтобы попасть в эту профессию, научитесь работать с JSON, разберетесь, что такое API и как их проектируют.
Кликайте по ссылке, чтобы записаться на интенсив → https://geekbrains.ru/link/gGL1Zh
Небольшой курс по распределённым системам: https://www.distributedsystemscourse.com/
Distributedsystemscourse
Distributed Systems Course
The home page of a free online class in
distributed systems.
distributed systems.
🍾Команда Podlodka Crew запускает новую онлайн-конференцию! Если вы занимаетесь бэкенд-разработкой, специально для вас 29 марта стартует Podlodka Backend Crew!
Мы решили не завязываться на конкретные языки программирования и фреймворки, и выбрали такие темы недель, которые будут интересны всем. И эти темы – “Распределенные системы” и “Протоколы передачи данных”.
🤔На неделе “Распределенные системы” рассмотрим тонкости разработки и поддержки распределенных систем. Ответим на вопросы про то, как деплоить такие системы, как их правильно тестировать, как правильно организовать балансировку и сбор логов, как работать с данными и не только.
💾А на неделе “Протоколы передачи данных” прокачаем очень прикладной навык: как максимально осмысленно выбрать протокол в зависимости от решаемых задач, и как эффективно работать с выбранным протоколом. Не json’ом единым!
Мы бы не были Podlodka Crew, если бы у нас были только доклады, поэтому как всегда в программе множество нескучных форматов: рулетки кейсов, батлы, лайв-кодинги и не только. Добавим к этому общение со спикерами на зум-сессиях и нетворкинг в слаке, и получим прекрасный способ с пользой провести время!
Старт 29 марта, расписание уже на сайте. Ждем на борту! ⚓️
Мы решили не завязываться на конкретные языки программирования и фреймворки, и выбрали такие темы недель, которые будут интересны всем. И эти темы – “Распределенные системы” и “Протоколы передачи данных”.
🤔На неделе “Распределенные системы” рассмотрим тонкости разработки и поддержки распределенных систем. Ответим на вопросы про то, как деплоить такие системы, как их правильно тестировать, как правильно организовать балансировку и сбор логов, как работать с данными и не только.
💾А на неделе “Протоколы передачи данных” прокачаем очень прикладной навык: как максимально осмысленно выбрать протокол в зависимости от решаемых задач, и как эффективно работать с выбранным протоколом. Не json’ом единым!
Мы бы не были Podlodka Crew, если бы у нас были только доклады, поэтому как всегда в программе множество нескучных форматов: рулетки кейсов, батлы, лайв-кодинги и не только. Добавим к этому общение со спикерами на зум-сессиях и нетворкинг в слаке, и получим прекрасный способ с пользой провести время!
Старт 29 марта, расписание уже на сайте. Ждем на борту! ⚓️
podlodka.io
Онлайн-конференция Podlodka Backend Crew, сезон #5
Недельное мероприятие от команды Podlodka: ежедневные интерактивные сессии в Zoom по актуальным проблемам backend-разработки, нон-стоп общение с экспертами и звёздами индустрии, закрытое профессиональное сообщество в Telegram.
Друзья, всем привет!
Коллеги из ОТУСа собираются запускать курс DWH Analyst и просят заинтересованных поделиться фидбеком.
Необходимо пройти по ссылке, чтобы ознакомиться с подробной программой курса и заполнить анонимный опрос.
Заранее всем спасибо!
Коллеги из ОТУСа собираются запускать курс DWH Analyst и просят заинтересованных поделиться фидбеком.
Необходимо пройти по ссылке, чтобы ознакомиться с подробной программой курса и заполнить анонимный опрос.
Заранее всем спасибо!
Привет!
Всем, кто оставлял заявку на ранний доступ к курсу Apache Airflow, только что ушло письмо со скидкой и инструкцией как её активировать.
Пожалуйста, проверьте ваш почтовый ящик, оставленный в Гугл-форме.
Всем, кто оставлял заявку на ранний доступ к курсу Apache Airflow, только что ушло письмо со скидкой и инструкцией как её активировать.
Пожалуйста, проверьте ваш почтовый ящик, оставленный в Гугл-форме.
⚠ Ребят, все кто оплачивал курс и у кого зависает окно после оплаты (и деньги с карты были сняты) — не беспокойтесь, у Qiwi сейчас сильные задержки с зачислением средств.
Уведомления приходят в течение 5-6 часов после оплаты. Напишите мне в личку или на почту, я вручную открою доступ в этом случае.
Уведомления приходят в течение 5-6 часов после оплаты. Напишите мне в личку или на почту, я вручную открою доступ в этом случае.
В подкасте Data Engineering Podcast вышел эпизод с инженерами DoorDash про их Data-платформу: https://www.dataengineeringpodcast.com/doordash-data-platform-episode-176/
Data Engineering Podcast
Managing The DoorDash Data Platform - Episode 176
The team at DoorDash has a complex set of optimization challenges to deal with using data that they collect from a multi-sided marketplace. In order to handle the volume and variety of information that they use to run and improve the business the data team…
Всем салют! 🤝
А вот и обещанная статья про TaskFlow API, который появился во второй версии Airflow: https://bit.ly/39lsHSK
Кажется получилось неплохо, в заметке есть небольшой практический пример + сравнение old-style и нового стиля написания PythonOperator'ов.
Код с примерами лежит как всегда у меня в репе: https://github.com/adilkhash/airflow-taskflow-api-examples
Приветствуется конструктивная критика и пожелания 🙏
Скоро будет продолжение про кастомный бэкенд для XCom.
А вот и обещанная статья про TaskFlow API, который появился во второй версии Airflow: https://bit.ly/39lsHSK
Кажется получилось неплохо, в заметке есть небольшой практический пример + сравнение old-style и нового стиля написания PythonOperator'ов.
Код с примерами лежит как всегда у меня в репе: https://github.com/adilkhash/airflow-taskflow-api-examples
Приветствуется конструктивная критика и пожелания 🙏
Скоро будет продолжение про кастомный бэкенд для XCom.
Khashtamov
TaskFlow API в Apache Airflow 2.0
Декабрьский релиз Apache Airflow 2.0 принёс много нововведений в инструмент. А самое, пожалуй, заметное из них это TaskFlow API. В этой заметке я подробно разберу что это такое и как стало красиво и …
Про data engineering для тех, кто не в теме: https://www.youtube.com/watch?v=qWru-b6m030
Классное вводное видео.
Классное вводное видео.
YouTube
How Data Engineering Works
So, the sole purpose of data engineering is to take data from the source and save it to make it available for analysis. Sounds simple, but it’s the matter of the system that works under the hood.
Watch our video to find out more about data engineering:
00:00…
Watch our video to find out more about data engineering:
00:00…
В Казахстане компания Beeline организует бесплатную конференцию — BeeTech CONF: https://beetech.kz/conf
Она пройдёт завтра, начало в 8 утра по Москве. В программе есть несколько интересных докладов для вас:
Поток Big Data:
— Как нам живется с Apache Airflow, доклад от местной команды разработки Beeline Kazakhstan
— Строим собственную платформу данных: от отчётов и триггеров до сложных пайплайнов, от Samokat.ru
Регистрация по ссылке: https://beetech.kz/conf
Она пройдёт завтра, начало в 8 утра по Москве. В программе есть несколько интересных докладов для вас:
Поток Big Data:
— Как нам живется с Apache Airflow, доклад от местной команды разработки Beeline Kazakhstan
— Строим собственную платформу данных: от отчётов и триггеров до сложных пайплайнов, от Samokat.ru
Регистрация по ссылке: https://beetech.kz/conf
Видосы с прошедшего митапа DE or DIE #6:
— Delta Lake — table format for large scale storage and analytics: https://www.youtube.com/watch?v=znVE6fpQqAU
— Love to Frankenstein’s monster: Kotlin for Apache Spark: https://www.youtube.com/watch?v=sYTE-gICPuA
— Delta Lake — table format for large scale storage and analytics: https://www.youtube.com/watch?v=znVE6fpQqAU
— Love to Frankenstein’s monster: Kotlin for Apache Spark: https://www.youtube.com/watch?v=sYTE-gICPuA
YouTube
DE or DIE #6. Иван Трусов – Delta Lake — table format for large scale storage and analytics
Материалы всех наших митапов: https://deordie.org
Наш чат в Telegram: https://news.1rj.ru/str/deordie_chat
Новые события сообщества DE or DIE: https://deordie.timepad.ru/events/
Автор доклада: Иван Трусов, Solutions Architect, Databricks
Delta Lake — эффективный OSS…
Наш чат в Telegram: https://news.1rj.ru/str/deordie_chat
Новые события сообщества DE or DIE: https://deordie.timepad.ru/events/
Автор доклада: Иван Трусов, Solutions Architect, Databricks
Delta Lake — эффективный OSS…