NEW BOT Телеграм, страница

Forwarded from Mark

https://www.youtube.com/watch?v=bDbJBWvonVI

How to design line charts effectively. Based on the design principles of Stephen Few's "Show Me the Numbers" and inspired by the "Remove to Improve" series from Darkhorse Analytics.

289 views06:12

data будни

Forwarded from Mark

https://www.youtube.com/watch?v=FMcYMAbwZZs

YouTube

Как улучшить гистограмму · Remove to improve data-ink

Enjoy the videos and music you love, upload original content, and share it all with friends, family, and the world on YouTube.

287 views06:12

data будни

Forwarded from Че-куда?

Это такая базовая гигиена, можно просто по шагам делать и получится лучше, чем было.

284 views06:12

data будни

ребята из «Кружка» ездят по глубинке и показывают детям «другую жизнь»: как работают компьютеры, что есть такой интернет, как можно там что-то делать. Для детей это действительно больше дело — говорю как выросший в небольшом городе.

Послушайте подкаст или почитайте про ребят на сайте. Это большое и важное дело.

https://kruzhok.io/

Не знаю, как ребята это всё успевают в довесок к основной работе. Не могу пройти мимо — оформил ежемесячный взнос.

kruzhok

Некоммерческий проект «Кружок»

Помогаем проводить бесплатные учебные программы там, где они нужны.

313 views03:56

data будни

Forwarded from запуск завтра

🎙 Образовательный проект «Кружок» ездит по маленьким российским городам и деревням и знакомит подростков с веб-разработкой, музыкой, астрономией и журналистикой. За 3 года «Кружок» был в Калининградской области, Дагестане, Республике Марий Эл и еще в 16 разных поездках.

Это эпизод о людях, которые делают «Кружок» и о тех, кто в нем участвует. Вы услышите голоса и звуки из Тарусы, дагестанского села Хрюг и марийской деревни Сардаял; ссылки ведут на сайты, которые сделали подростки. А ещё, я чуть не расплакался во время этого интервью.

Один из лучших наших эпизодов, блестящая работа нашего редактора Юли Яковлевой и звукорежиссера Нины Мамотиной, слушайте на всех платформах: Apple, Google, ютуб, Castbox, Spotify, Яндекс, Overcast и веб-версия.

А ещё кружок снимает офигенные короткие фильмы о своих поездках, их можно посмотреть на ютубе. Поддержать проект можно вот тут.

350 views03:56

data будни

Новый джуниор замедляет команду

Чтобы начать приносить пользу, надо много чего узнать. Даже опытным ребятам надо время, чтобы разобраться в новом проекте. И чем меньше опыта, тем больше нужно времени.

А ещё на адаптацию нового сотрудника нужно время сотрудника бывалого — время, которое он мог бы потратить, например, на код. Поэтому новый сотрудник замедляет команду, а не наоборот.

Как может новый сотрудник приносить пользу?

«взгляд новичка» — опытные ребята отдельно прокачивают навык смотреть на свой проект как первый раз. Ведь когда ты сам всё спроектировал с нуля, нестыковки и дефекты уже не бросаются.

А новому сотруднику и тренировать ничего не нужно — он и так всё видит впервые. И поэтому может подмечать что ему было неудобно и где ему жмут новые процессы. Про коммуникацию в слаке, про расположение корпоративных документов, про процедуру регулярных созвонов.

Вот Всеволод Скрипник показывает хороший пример (хоть он и совсем не джуниор)
https://news.1rj.ru/str/vsvld_skrpnk/293

Главное не перегнуть палку, делясь потом наблюдениями :-) Для этого можно представить как Гарри Поттер на своей первой неделе даёт Дамблдору ценные указания™ по улучшению Хогвартса.

Когда падает продакшен

Сегодня был мой первый рабочий день в fedorandsamat.com

Первый день задаёт ритм, поэтому я придумал с этого дня каждую неделю в понедельник отправлять им на рассмотрение Предложение по Улучшению «Феди и Самата», сокращённо ПУФС. Сегодня улетел первый пуфс…

325 views15:07

data будни

Forwarded from Datalytics

Мальчишки и девчонки! Мы в Практикуме планируем в этом году кратно увеличить количество полезного и задорного образовательного контента, посвященного дата-профессиям.

Мы умеем делать тексты такими, чтобы студенты в них влюблялись: интересными, понятными, образовательными на 100%. Но ничего не получится без экспертов, которые готовы делиться своим опытом и вместе с нами превращать знания в качественный образовательный опыт: продумывать структуру уроков, генерировать и искать датасеты для заданий, придумывать примеры, описывать простыми словами сложные теоретические концепции, создавать проверочные задания и квизы.

Поэтому мы ищем людей, профессионально разбирающихся в таких темах как data science, data analytics, data engineering, готовых вместе с нами делать топовый edtech-контент. Так победим!

Ссылка на вакансию тут

Присылайте резюме на почту polinanagorna@yandex-team.ru или в Telegram Полине @polinanahor

Yandex.Practicum on Notion

Автор курсов по анализу данных и data science в Яндекс.Практикум

Яндекс.Практикум — сервис онлайн-образования, который помогает людям расти на работе и в жизни. Так, направление аналитики готовит студентов к джуниорской позиции в анализе данных и data science.

311 views16:38

data будни

Ложная дихотомия

Ложная дихотомия — это когда кажется, что выбора всего два и надо обязательно выбрать один из них.

Я, как один из тех, кто только выучил новый термин, люблю это рассказывать (вот как сейчас) и находить ложные дихотомии в чужих решениях. Например, с работой: люди решают оставаться или уходить — хотя таких работ на рынке очень много и есть из чего выбрать.

А вчера обсуждали с коллегой курсы по Tableau: он говорил, что дорого — а я вступился и начал оправдывать эту цену (зачем-то). Интересно, что я даже не заметил, как сам провалился в ложную дихотомию! Пока коллега не предложил третий вариант, у меня в голове было всего два выбора: «дорого» и «не дорого».

А вариант, кстати, отличный: за цену групповых курсов нанять себе личного ментора с большим опытом и получить 20+ часов персональных консультаций.

Ложная дихотомия на Википедии

480 views07:00

data будни

Forwarded from Под капотом Яндекс.Такси

Yandex.Go Data Driven Backstage

Не секрет, что в Yandex.GO (Такси, Драйв, Лавка, Еда) умеют работать с данными. Но прежде чем стать кристально чистой эссенцией пророческих знаний, данные проходят через несколько стадий очистки, перегонки и выдержки — за все это отвечает наша служба DMP (Data Management Platfrom).

На конференции SmartData ребята из службы DMP подсветили часть интересных нюансов про внутреннее устройство подготовки данных для аналитики всего Yandex.GO.

Highly Normilized Hybrid Model
Для того, чтобы сделать структуру DWH гибкой, существуют современные подходы к проектированию: Data Vault и Anchor modeling — похожие и разные одновременно. Задавшись вопросом, какую из двух методологий выбрать, Евгений и Николай пришли к неожиданному ответу: выбирать надо не между подходами, выбирать надо лучшее из двух подходов.

Как мы разрабатываем DMP для Yandex.GO
Владимир рассказывает про мотивацию, которая нужна для разработки собственного ETL-инструмента, про превращение ETL и DWH в DMP. Из доклада вы узнаете, какие проблемы возникают в процессе разработки DMP и про опыт их решения.

P.S.
Наши ребята засветились в еще одном интересном докладе Максима Стаценко Обзор технологий хранения больших данных как эксперты.

P.P.S.
А еще DMP Такси нанимает

SmartData 2025. Конференция по инженерии данных

SmartData 2025 — конференция по инженерии данных. Технические доклады о хранилищах данных, стриминге, data governance, архитектуре DWH и другом, применимые в работе дата-инженера.

407 views09:56

data будни

Forwarded from настенька и графики

This media is not supported in your browser

VIEW IN TELEGRAM

Ну как красиво! Карта высот острова Оаху, Гавайи. Автор - Александр Варламов и у него просто фантастический профиль на паблике: https://public.tableau.com/profile/alexandervar#!/

Гифка с реддита

338 views16:44

data будни

Послушать:

Лену Бунину — гендиректора Яндекса и профессора МГУ про то нужна ли математика в программировании.

Вместе с ведущим — Салатом Галимовым — прошлись по всем сервисам Яндекса и прикинули сколько там математики. В среднем по рынку примерно 20% программистам нужна математика. В Яндекса — примерно половине. Например, сделать распределённую устойчивую и быструю базу данных.

Интересно, что математика иногда уходит в полную абстракцию и не совсем понятно как это можно применить в реальном мире. Так было и с популярными сейчас нейросетями — математическую основу для придумали ещё в 70-х, но до 2000-х годов не было доступной компьютерной мощности для их применения.

https://news.1rj.ru/str/ctodaily/1270

Анализ данных и Python

Суровые программисты из Moscow Python пригласили BI разработчика поговорить про анализ данных

Интересно, что ребята быстро пробежались перечислили основные инструменты жду анализа данных и потом долго обсуждали критическое мышление и общие когнитивные способности. Набор обсуждаемых книг тоже получился нетипичным: Thinking Fast and Slow Даниела Канемана и «Слепой часовщик» Ричарда Докинза.

Подкаст в Apple Podcasts

#data_podcast

запуск завтра

🎙 Нужна ли математика программисту? Разбираемся с гендиром Яндекса в России Еленой Буниной.

Мы с гостями подкаста много раз отвечали на вопрос, нужно ли знать математику и иметь университетское образование, чтобы заниматься программированием. Но вопросы…

315 viewsedited 14:35

data будни

Давайте знакомиться!

Меня зовут Саша Михайлов и я всегда любил покопаться в данных: дай только из чего-нибудь сделать гугл-таблицу. Вот например парсил веб-страницу просто через гугл-таблицу.

До того, как стал учить Питон, я как-то написал конвертатор эксельки из 1С в приличную таблицу, используя только внутренние формулы О_о

После универа работал специалистом по логистике. Отучился в Яндекс.Практикуме на аналитика данных и потом нашёл работу по новой специальности.

Меня взяли делать аналитику для торгового центра, вот только данных для анализа не было ¯\_(ツ)_/¯ — мне как раз и предстояло их собрать. Дали сервер с убунтой, показали где брать данные и попросили собрать всё в одной базе (и сделать верхнеуровневые дешборды). Так я освоил на практике ETL пайплайны: пришлось работать с базами данных, API и даже чуток вебскрапить. Потом я узнал, что эта профессия называется дата инженер :-)

А после этого перешёл в агентство по заказной разработке (таки вошёл в IT, ага). Делаю почти то же самое, только для разных клиентов и в бо́льших масштабах: Airflow, git, Docker, Google Cloud, BigQuery. Познаю что такое инкрементальность и идемпотентность.

Хочу узнать побольше о тех, кто читает этот канал. Так я смогу лучше формулировать мысли и подбирать идеи для постов. Так что здесь время от времени будут появляться небольшие опросы — не пугайтесь)

sashamikhailov.ru

Как спарсить веб-страницу гугл-таблицей

У агентства IT-Agency есть план обучения для сотрудников — он открыт и опубликован на их сайте

313 viewsedited 13:44

data будни

Первый вопрос, который мне пришёл в голову: «А вы по работе сталкиваетесь с данными?»

Anonymous Poll

78%

работаю с данными

работаю с теми, кто работает с данными

20%

(пока) не работаю с данными

65 voters292 views13:46

data будни

Google Big Query

На последнем проекте удалось поработать с Big Query — собрали на нём DWH с данными из 10 разных БД, чтобы строить сквозные отчёты по всем отделам.

Big Query — это облачная база данных с нетипичными свойствами. Размер хранимых данных никак не ограничен — не надо думать сколько это всё занимает места на диске и сколько нужно серверов чтобы всё нормально работало.

Плату берут не за хранение данных, а за доступ к ним: 6 долларов за каждый просканированный терабайт данных. Главную опасность в таком случае представляют не ручные запросы аналитиков, а код дата инженеров: один невнимательный цикл может запросто пройтись несколько сотен раз по таблице в 10 гигабайт.

Вместо ограничения на количество данных, есть другие: количество запросов по АПИ (1500 в сутки на таблицу или не более 5 запросов каждые 10 секунд; и ещё разные другие).

Поэтому данные приходится туда заливать особым образом: сначала данные форматируются в Parquet файлы, заливаются на облачный Google Storage, а потом уже импортируются в таблицу в Big Query. Таким образом удаётся не превысить суточные лимиты.

#data_tools

337 viewsedited 15:11

data будни

Рассказ с примерами кода как устроен dbt в Wheely

- cлои, модели, тесты (!) данных.
- оптимизированные конфигурации для хранения таблиц для быстрого доступа
- инкрементальное обновление витрин
- ссылки на промежуточные таблицы через шаблоны по внутренним ссылкам

> в рамках написания кода при ссылках на другие модели нет хардкода, но есть конструкция {{ ref('fine_details_flatten') }} – ссылка на наименование другой модели. Она и позволяет распарсить весь проект и построить граф связей и зависимостей.

https://habr.com/ru/company/wheely/blog/549614/

Хабр

Мультитул для управления Хранилищем Данных — кейс Wheely + dbt

Уже более двух лет data build tool активно используется в компании Wheely для управления Хранилищем Данных. За это время накоплен немалый опыт, мы на тернистом пути проб и ошибок к совершенству в...

361 viewsСаша Михайлов, 14:37

data будни

Не делать ненужное

Одним из заданий по анализу данных в Яндекс.Практикуме было проанализировать датасет по недвижимости. А перед этим была тема про пропуски в данных.

И вот в датасете в колонке «этажность» было аж 15% пропусков. Помню, я с завидной фанатичностью поставил себе цель избавиться от эти пропусков всеми вновь изученными способами.

Спустя три дня я сдался на показателе что-то около 3%, коорые ну никак не мог победить. Прихожу к наставнику: «отце, помоги! Как быть? Я потратил 10 часов на эти пропуски, добился снижения до 3%. Как победить оставшиеся??»

На что он спросил, зачем вообще я это делал. Он резонно рекомендовал перечитать задание и найти там вопрос, для ответа на который можно было бы применить эту этажность. Такого там не было ¯\_(ツ)_/¯

* * *

Этот урок пригодился и на реальной работе. Первое задание на новом проекте: «резберись как в текущую систему АБ тестиирования прикрутить CUPED»

Я, значит, зарылся в репозиторий, нашёл там методы, где это всё используется, оттуда вышёл на сами функции; там, значит, построчно разобрал алгоритм, непонятное загуглил. И на следующий день гордо приношу результат: «вот тут в репозитории нужно поменять формат данных. Разрешите приступать?».

Начальница недоуменно заметила, что править код не надо; а надо было просто вкурить мануалы по новому методу и сделать доклад текущим сотрудникам о новых возможностях. Дел на пару часов вместе с рассказом.

* * *

С тех пор стараюсь, чтобы у меня в голове на фоне всегда вертелся вопрос «что я сейчас делаю? а зачем именно я это делаю? чтобы что?»

368 viewsСаша Михайлов, 14:29

data будни

стажировка по data engineering

316 viewsСаша Михайлов, 14:27

data будни

Forwarded from Analyzecore (Sergii Bryl')

Мы официально запустили набор на летнюю стажировку 2021.

Интернатура в MacPaw - это не просто посмотреть на работу продуктовой компании изнутри, а и непосредственно стать частью команды, окунуться в нашу культуру, прокачать скиллы, тесно поработать с лучшими специалистами над реальными задачами, увидеть свое влияние на продукт.

Среди 13 направлений, есть 3 в Data Science департаменте. В общем, приглашаю!

https://macpaw.com/internship

MacPaw

MacPaw Bootcamp 2023

Start your tech journey at an ambitious team of Bootcamp. Learn from professionals, apply your knowledge on real products, and get lifelong skills with us.

324 viewsСаша Михайлов, 14:27

data будни

Forwarded from Без шелухи

📊 Всем SQL

Помню, лет десять назад американские СМИ захватила идея, что «каждый должен научиться программировать». Повсеместно открывались буткампы из серии «от нуля до сеньор-разработчика за 10 дней», и даже президент США делал вид, что учится писать на джаваскрипте.

Я не уверен, что программирование нужно прямо так уж всем. И точно не стоит всем бросаться учить джаваскрипт: для автоматизации повседневной работы есть более подходящие языки.

А вот что имеет смысл освоить — так это прикладной анализ данных. Данные лежат в основе всего, что мы делаем. Данные — основа принятия решений в продуктовом управлении, аналитике, дизайне, разработке, тестировании и эксплуатации.

Если вы согласны, и чувствуете, что навыки работы с данными стоило бы подтянуть — дальше я расскажу про три курса и один инструмент. Инструментом я пользуюсь каждый день, а курсы проходил лично (один даже сделал сам). Авторы не платили за рекомендации. Хотя, естественно, если вы выберете мой курс — я на этом заработаю.

SQL — это «родной» язык работы с данными. В принципе, можно прожить и без него: в базовом варианте достаточно понимать основы статистики и знать Excel на более глубоком уровне, чем «рисую таблички в рамочке». В этом поможет курс Алексея Куличевского «Данные для бизнеса». Хотя небольшой порции SQL и там не избежать.

Если интересна продуктовая аналитика — курс Анатолия Макаревича SQL Habit. Типа GoPractice, только бодрее и на голом SQL, без Amplitude. Проводит от самых основ до серьезной работы.

Если уже знаете основы SQL и хотите научиться применять его в повседневных задачах — мой курс «SQLite для аналитики». Научитесь загружать и выгружать данные, «чистить» проблемы, находить связи и анализировать показатели, применять аналитические функции и работать с JSON.

А инструмент — Redash. Это веб-интерфейс к любым базам данных, в нем строят отчеты и собирают дашборды. Простая и дешевая замена замороченным BI-инструментам. Из этой же серии есть Metabase и Superset — их многие хвалят, но я не пробовал.

В любом случае — освойте SQL. С ним вы перестанете зависеть от специально обученных людей, к которым ходите на поклон за очередным отчетом. Сможете принимать решения быстрее и увереннее. Да и в целом станете автономнее и ценнее как специалист. Всем SQL!

385 viewsСаша Михайлов, 04:54

data будни

плюс один канал с инфографикой

375 viewsСаша Михайлов, 14:23

data будни

Forwarded from На самом деле

Пока в кино Годзилла борется с Кинг-Конгом, на IT-рынке продолжается битва других гигантов — цифровых экосистем. На прошлой неделе стало известно о скором разводе Сбербанка с Mail.ru Group. По информации Financial Times, компании не договорились о стратегии развития. Ждем вестей о том, как они разделят активы, а пока смотрим на общую расстановку сил

407 viewsСаша Михайлов, 14:23

About

Blog

Apps

Platform