DataEng – Telegram
DataEng
4.35K subscribers
40 photos
9 files
537 links
Канал про Data Engineering & Distributed Systems.

Всё, что вы хотели знать про построение инфраструктуры для хранения, обработки и эффективного анализа гигантского объёма данных.

Автор @adilkhash
Download Telegram
Пятничный видос: https://www.youtube.com/watch?v=qSJ8_Lc1oAY

Сам ещё не смотрел, но планирую на выходных глянуть. Я давно наблюдаю за Apache Druid, и даже когда-то предлагал его попробовать вместо Redshift. Возможно сейчас самое время сделать тест-драйв.
А у вас был опыт работы с Druid?
Прошел ещё один вебинар от Astronomer про управление секретами в Airflow: https://www.youtube.com/watch?v=Mf2uTVe3GPA
​​Написал небольшую заметку про работу с XCom в Apache Airflow: Apache Airflow и XCom

Код из заметки можно взять из репа у меня на гитхабе.
Нашел интересный блог дата инженера Anna Geller (Anisienia): https://www.annageller.com/
Судя по постам начинала она его в этом году, но уже есть ряд годных статей про Airflow, Prefect, AWS EKS и тд

Мне особенно понравился её глубокий и чуточку скептический пост про TaskFlow API, который появился в Airflow 2.0: https://www.annageller.com/posts/taskflow-api-in-apache-airflow-2-0-should-you-use-it
Я сейчас тоже готовлю подробный пост про TaskFlow API и кастомный бэкэнд для Xcom, где не всё так грустно как пишет Анна. Пост будет сегодня-завтра.

Ближе к концу этой недели все, кто оставил заявку на ранний доступ к курсу про Airflow получат письма на почту.
Forwarded from Mikhail Kumachev
DE or DIE #6

Друзья, мы рады анонсировать митап #6 нашего сообщества DE or DIE!

Дата и время: 25 марта (четверг) 18:00
Формат: Онлайн (трансляция на YouTube)

Регистрация по ссылке: https://deordie.timepad.ru/event/1584420/

Наши спикеры:
1. Иван Трусов из Databricks с докладом: Delta Lake — table format for large scale storage and analytics
2. Паша Финкельштейн из JetBrains с докладом: Kotlin for Apache Spark: WHY?

(*): Несмотря на англоязычные названия доклады будут на русском языке.

Ждем вас в следующий четверг. Ссылку на трансляцию опубликуем за час до мероприятия.
​​Системный аналитик умеет говорить как на языке IT, так и на языке бизнеса. Именно этот специалист решает, какое программное обеспечение понадобится для решения конкретных задач, чтобы достигнуть поставленной цели. Он понимает, чего хочет заказчик, и следит за тем, чтобы команда разработки сделала все правильно.

Если вы задумывались о карьере в IT и системной аналитике — приходите на бесплатный интенсив «Погружение в профессию системного аналитика» от GeekBrains.
Узнаете, что нужно знать, чтобы попасть в эту профессию, научитесь работать с JSON, разберетесь, что такое API и как их проектируют.

Кликайте по ссылке, чтобы записаться на интенсив https://geekbrains.ru/link/gGL1Zh
🍾Команда Podlodka Crew запускает новую онлайн-конференцию! Если вы занимаетесь бэкенд-разработкой, специально для вас 29 марта стартует Podlodka Backend Crew!

Мы решили не завязываться на конкретные языки программирования и фреймворки, и выбрали такие темы недель, которые будут интересны всем. И эти темы – “Распределенные системы” и “Протоколы передачи данных”.

🤔На неделе “Распределенные системы” рассмотрим тонкости разработки и поддержки распределенных систем. Ответим на вопросы про то, как деплоить такие системы, как их правильно тестировать, как правильно организовать балансировку и сбор логов, как работать с данными и не только.

💾А на неделе “Протоколы передачи данных” прокачаем очень прикладной навык: как максимально осмысленно выбрать протокол в зависимости от решаемых задач, и как эффективно работать с выбранным протоколом. Не json’ом единым!

Мы бы не были Podlodka Crew, если бы у нас были только доклады, поэтому как всегда в программе множество нескучных форматов: рулетки кейсов, батлы, лайв-кодинги и не только. Добавим к этому общение со спикерами на зум-сессиях и нетворкинг в слаке, и получим прекрасный способ с пользой провести время!

Старт 29 марта, расписание уже на сайте. Ждем на борту! ⚓️
Друзья, всем привет!

Коллеги из ОТУСа собираются запускать курс DWH Analyst и просят заинтересованных поделиться фидбеком.

Необходимо пройти по ссылке, чтобы ознакомиться с подробной программой курса и заполнить анонимный опрос.

Заранее всем спасибо!
Привет!
Всем, кто оставлял заявку на ранний доступ к курсу Apache Airflow, только что ушло письмо со скидкой и инструкцией как её активировать.
Пожалуйста, проверьте ваш почтовый ящик, оставленный в Гугл-форме.
Ребят, все кто оплачивал курс и у кого зависает окно после оплаты (и деньги с карты были сняты) — не беспокойтесь, у Qiwi сейчас сильные задержки с зачислением средств.
Уведомления приходят в течение 5-6 часов после оплаты. Напишите мне в личку или на почту, я вручную открою доступ в этом случае.
Всем салют! 🤝
А вот и обещанная статья про TaskFlow API, который появился во второй версии Airflow: https://bit.ly/39lsHSK

Кажется получилось неплохо, в заметке есть небольшой практический пример + сравнение old-style и нового стиля написания PythonOperator'ов.
Код с примерами лежит как всегда у меня в репе: https://github.com/adilkhash/airflow-taskflow-api-examples
Приветствуется конструктивная критика и пожелания 🙏

Скоро будет продолжение про кастомный бэкенд для XCom.
В Казахстане компания Beeline организует бесплатную конференцию — BeeTech CONF: https://beetech.kz/conf
Она пройдёт завтра, начало в 8 утра по Москве. В программе есть несколько интересных докладов для вас:

Поток Big Data:

— Как нам живется с Apache Airflow, доклад от местной команды разработки Beeline Kazakhstan
— Строим собственную платформу данных: от отчётов и триггеров до сложных пайплайнов, от Samokat.ru

Регистрация по ссылке: https://beetech.kz/conf