NEW BOT Телеграм, страница

Aspiring Data Science

#trading #erema

Прогресс

Добавил, помимо простых голосующих ансамблей, настоящий стэкинг (пока что бустинги над бустингами). Провел несколько простых экспериментов.

Пока у меня такой сеттинг: есть train, val, test множества, состоящие из последовательных торговых дней. На train обучается несколько базовых моделей, с ранней остановкой по validation. Каждая базовая модель в конце делает прогнозы на все 3 множества. Для голосующих ансамблей прогнозы базовых моделей просто усредняются одним из математических средних. Для полноценного стэкинга же создаётся свой train и val наборы, в качестве признаков подаются выходы базовых моделей+их построчные аггрегаты. Разбиение на train/val для стэкинга тестировал в 5 вариантах: все комбинации train/val базовых моделей, а также train+val базовых, но со случайным отбором 15% на новый val. Я ожидал увидеть на test, что использование старого train в стэкинге токсично, и лучшие результаты покажет сплит старого val/val.

Результаты:

для стэкинга, не только старый train, но и val тоже оказался токсичным (из-за того что на нём работала ранняя остановка). то есть для стэкинга нужно выделять отдельный набор, которой вообще никак не используется при обучении базовых моделей, даже косвенно.

для голосования, лучшие результаты показали гармоническое и геометрическое среднее. на test они превзошли показатели лучших базовых моделей. (возможно, эти средние хороши только для задач классификации, регрессию пока не тестировал).

вернул xgboost в ансамбли, т.к. нашёл настройки для категориек, с которыми он не херит результаты. с дефолтными работать просто нельзя.

Придумал очень перспективный подход к бэктесту подобных моделей, который позволит снизить подгонку, потестирую его в ближайшее время.

Добавил несколько новых метрик в трэкинг, исправил старые.

Уже понятно, что некоторые группы фичей избыточны. Некоторые признаки, добавленные просто для галочки, неожиданно поднялись в топ важности.

Планы

Теоретизировать и улучшать можно бесконечно, так и не начав реальных действий. Поэтому решил поскорее влезть в
рынок с тем, что уже есть.

Пока решил оставить за бортом улучшения конвейера (FS, HPT), стэкинг,dask, новые признаки (хотя уже примерно понятно, куда копать). Эта возможность появилась, т.к. я сменил старый рынок на рынок с более низкой комиссией, и придумал как переделать торговую политику. По сути, я не сделал шаг вперёд к новой фазе проекта, а вернулся к старой фазе, но с лучшими инструментами трэкинга.

Ставлю сейчас обучение по нескольким таргетам (но одному горизонту и одному рынку), 3 разных бустинга. Для самого прогнозируемого таргета сделаю новый бэктест.

👍2✍1

141 viewsAnatoly Alekseev, edited 22:20

Aspiring Data Science

#trading

https://www.youtube.com/watch?v=ExOCRH-aXMM

YouTube

Deep Order Flow Imbalance: Extracting Alpha at Multiple Horizons from the... | Nicholas Westray

Advances of ML Approaches for Financial Decision Making
"Deep Order Flow Imbalance: Extracting Alpha at Multiple Horizons from the Limit Order Book"
Nicholas Westray

The Applied Machine Learning Days channel features talks and performances from the Applied…

95 viewsAnatoly Alekseev, 06:57

Aspiring Data Science

Forwarded from ML for Value / Ваня Максимов

Почему бустинг плохо понимает линейные зависимости?

Я подумал-подумал и решил прямо в канале отвечать на хорошие вопросы из комментариев) Начнем с вопроса про линейные зависимости в градиентном бустинге над деревьями

Условному LightGBM непросто выучить зависимость y = x по 2 причинам:

1. Нужно довольно много сплитов дерева (большая глубина / мнго деревьев), чтобы это выучить
if x < 10 then y = 9
if x > 10 then y = 11
if x > 12 then y = 13
…. (N раз)
if x > 1000 then y = 1001

2. Сложно прогнозировать out-of-distribution
Вторая проблема хорошо видна из “крайних” условий на х:
if x <10 then y = 9
if x > 1000 then y = 1001

Бустинг довольно плох для значений Х, которых не было в трейне (out-of-distribution). И если у вас, например, продажи с растущим трендом, то прогнозировать больше, чем было раньше - очень проблемно

Можно конечно для продаж прогнозировать не сами продажи, а их прирост. Но и это не всегда решает проблему: представьте, что на товар была скидка не более 10%, а сейчас стала 30%. Можно неаккуратно переобучиться на историю скидок именно этого товара и не прогнозировать бОльший рост, даже если на всех товарах (где бывают любые скидки) есть около-линейная зависимость от скидки

Рубрика “Ответы на вопросы из комментариев” #answers

❤‍🔥1👍1

86 viewsAnatoly Alekseev, 16:05

Aspiring Data Science

#featureselection

https://www.youtube.com/watch?v=u7TVqtW7jM0

YouTube

Feature Ranking and Selection

Feature Ranking and Selection
Teacher: Dr. Michael Pyrcz

For more webinars & events please checkout: http://daytum.io/events

Website: https://www.daytum.io/
Twitter: https://twitter.com/daytum_io?lang=en
LinkedIn: https://www.linkedin.com/company/35593451…

128 viewsAnatoly Alekseev, 16:41

Aspiring Data Science

#knots #math #unknot #trefoil #grannyknot #squareknot #poke #slide #twist #tait #reidemeister #haken #alexander #jones #perko #conway #dowker #thistlethwaite #hoste #weeks #burton #tricolorable #pcolorable #polynomial #homfly

Про лучший вариант завязывания шнурков и скручивания наушников - кажется полезным, проверю )

https://www.youtube.com/watch?v=6LeWR0GsA_U

YouTube

Теория узлов: от шнурков до новых молекул [Veritasium]

Поддержать проект можно по ссылкам:
Если вы в России: https://boosty.to/vertdider
Если вы не в России: https://www.patreon.com/VertDider

Есть шанс, что вы никогда не слышали о теории узлов. Это не удивительно — разобраться в ней весьма сложно, а практического…

104 viewsAnatoly Alekseev, edited 17:06

Aspiring Data Science

https://youtu.be/JoK8V2eWFPE?si=9JRytQnWP1JzZp87

YouTube

Jim Crist - Make it Work, Make it Right, Make it Fast Debugging and Profiling in Dask

Denoscription
Dask is a pure python library for parallel and distributed computing. It's designed with flexibility in mind, making it easy to parallelize the complicated workflows often found in science. However, once you get something working, how do you debug…

98 viewsAnatoly Alekseev, 03:40

Aspiring Data Science

#arm #ipo

"К выходу на биржу компанию Arm оценили по верхней границе в $54,5 млрд, а цена одной акции была установлена на уровне $51. Ещё на стадии предварительных торгов стоимость акций выросла примерно на 10 % — до $56,1. Рост продолжился и даже усилился во время торговой сессии, в результате чего Arm завершила свой первый торговый день с ценой $63,59 за акцию. Капитализация составила $67,9 млрд.

Компания, торгующаяся под тикером «ARM», выпустила на биржу около 95,5 млн акций. Компания SoftBank, которая приобрела Arm в 2016 году, сохранила контроль над 90,6 % акций, а в результате IPO заработала $4,9 млрд. Среди инвесторов, купивших крупные доли в Arm значатся компании Apple, Google, NVIDIA, Samsung, AMD, Intel, Cadence, Synopsis и TSMC."

https://3dnews.ru/1093065/aktsii-arm-vzleteli-na-25-v-perviy-den-torgov-na-birge

3DNews - Daily Digital Digest

Акции Arm взлетели на 25 % в первый день торгов на бирже

Разработчик процессорных архитектур Arm вышел на фондовую биржу Nasdaq.

98 viewsAnatoly Alekseev, 09:10

Aspiring Data Science

Forwarded from ML for Value / Ваня Максимов

Неклассические бустинги над деревьями (hybrid regression tree boosting)

У бустингов над деревьями есть некоторые проблемы с линейными зависимостями. Почему бы тогда не совместить бустинг, деревья и линейную регрессию?

Идея такая: в классическом дереве для задачи регрессии для прогноза в каждом листе берется среднее таргетов (для rmse loss). Что если вместо простого среднего строить в листе линейную регрессию? И в качестве прогноза брать прогноз линейной регрессии

Так и возник подход hybrid regression tree (HRT) - это дерево, в каждом листе которого есть линейная регрессия. Пример работы можно посмотреть на картинке к посту. Ну и конечно это можно обобщить до бустинга

Штука прикольная, и как-то в универе мы с ребятами даже запилили код hybrid regression tree. Ни о какой оптимизации по скорости и памяти в студенческом проекте речи конечно нет, но поиграться можно

И внезапно наша репа до сих пор топ-1 по запросу ”hybryd regression tree” в гугле аж с 2 звездочками 😅

Это говорит скорее о непопулярности подхода - по метрикам чуть лучше классического lightGBM / CatBoost, но сииииильно медленнее: может работать только на небольших наборах данных до 10-100к строк. Можете, кстати, посчитать сложность алгоритма в комментариях - удивитесь 😄

UPD: В комментариях подсказали, что этот алгоритм завезли в lightGBM. Что ж, очень радует!)

#answers - ответы на вопросы из комментариев

114 viewsAnatoly Alekseev, 11:28

Aspiring Data Science

#dask

https://www.youtube.com/watch?v=WoVVLk7dod4

YouTube

Saturn Cloud Workshop: Scaling LightGBM training with Dask on Saturn Cloud

In this workshop, attendees will get an introduction to LightGBM, a popular lightweight gradient-boosted decision tree (GBDT) library. This introduction will cover GBDTs generally and LightGBM, specifically. It will also describe which parts of a GBDT can…

135 viewsAnatoly Alekseev, 13:16

Aspiring Data Science

https://youtu.be/XFVcoBu1rNw?si=3LEWGMReqS8gqnDj

YouTube

LightGBM | How Distributed LightGBM on Dask Works | James Lamb | Dask Summit 2021

In this talk, attendees will learn about LightGBM, a popular gradient boosting library. The talk offers details on distributed LightGBM training, and describes the main implementation of it using Dask. Attendees will learn which pieces of the Dask ecosystem…

150 viewsAnatoly Alekseev, 04:39

Aspiring Data Science

#dask #blazingsql #holoviz #cuxfilter

https://www.youtube.com/watch?v=auBaWD31FCk

YouTube

Dask + Rapids | Using GPUs to Accelerate Data Science with Dask + Rapids | Jacob Schmitt

RAPIDS supercharges data science with NVIDIA accelerated compute. Paired with Dask, data professionals can build highly-performant, distributed workloads with a comfortable toolset similar to favorites like pandas or scikit-learn. In this workshop, we’ll…

122 viewsAnatoly Alekseev, edited 10:39

Aspiring Data Science

Forwarded from Машинное обучение от ИЦ "ГЕВИССТА"

Формирую набор на курс по рядам, разбираю вопросы. Отвечаю на вопрос, почему нельзя выбирать, пропускать материал, который знаешь. Во-первых, курс у меня не шведский стол, когда вы «выбираете» или мы «это пропускаем, это я знаю» вы рвете мне нить повествования, потому что у меня все достаточно жестко, системно спланировано. Во-вторых, и это более важно, а вы уверены, что вы знаете? На своем примере расскажу. Я довольно неплохо знаю ARIMA (пруф – пособие в посте выше), могу очень приличную модель сделать. Устроился в Capital, вторая неделя пошла, коллеги делятся опытом, там у нас есть ARIMA guys, и я думаю, ну чему они меня еще могут научить. Выясняется, я совсем забыл про применение сплайнов в качестве признаков для ARIMA, я неправильно делал интеракции Фурье и календарных признаков (календарные брал в лоб, тогда как эффективнее их переводить в формат десятичных дробей), у меня были предубеждения (ошибочные) в отношении оптимизации с ограничениями для ARIMA и, позор мне, я делал совершенно бездарное сглаживание для ARIMA (с выбросами бороться), а потом и вовсе его бросил, потому что оно не помогало, а оно, естественно, помогало, просто нужно было делать его по-другому. Еще я игнорировал правило про проверку на единичный корень в AR и MA-части, ребята показали убедительные примеры, как важно его проверять. И я не знал толком техник деагрегации прогнозов, когда для того, чтобы модель по очень шумному ряду не шпарить, делаем агрегацию ряда, но тогда прогнозы будут для агрегированного ряда и надо деагрегировать. Знал, что в Greykite применяют, а как руками делать не видел. И это я с немалым опытом работы c ARIMA. У ребят было свое преимущество, они проводили воркшопы, разбирали кучу научных статей, сами писали статьи и взяли на вооружение очень много подходов, которые не всегда выведешь в лоб эмпирически. Представьте, я б себя индюком повел, мол, "я тут все знаю", этих важных тонкостей не узнал бы. Так что не переоцениваем себя, слушаем, мотаем на ус.

✍3👍1

82 viewsAnatoly Alekseev, 16:02

Aspiring Data Science

https://www.youtube.com/watch?v=dI_-shCf72M

YouTube

PyData Boston Sept session 1: Mike Woodward - Data sci done wrong: how/why scientists make mistakes.

Data science done wrong: how & why data scientists make mistakes
Sometimes data scientists get things very, very wrong. They make poor choices because their focus is too narrow and too low-level; they're in love with machine learning to everything else's…

112 viewsAnatoly Alekseev, 16:50

Aspiring Data Science

#fun

👀1

104 viewsAnatoly Alekseev, 16:54

Aspiring Data Science

#algorithms #tries #consistenhashing #quadtrees #leakybucket #bloomfilter #raft #paxos

https://www.youtube.com/watch?v=xbgzl2maQUU

YouTube

Algorithms You Should Know Before System Design Interviews

Get a Free System Design PDF with 158 pages by subscribing to our weekly newsletter: https://bytebytego.ck.page/subscribe

Animation tools: Adobe Illustrator and After Effects.

Checkout our bestselling System Design Interview books:
Volume 1: https://amzn.to/3Ou7gkd…

138 viewsAnatoly Alekseev, edited 17:11

Aspiring Data Science

#automl #flaml

https://www.youtube.com/watch?v=BDbGLGCVOKo

YouTube

Jiang et al. - Automated Machine Learning & Tuning with FLAML | PyData Seattle 2023

www.pydata.org

In this session, we will provide an in-depth and hands-on tutorial on Automated Machine Learning & Tuning with a fast python library named FLAML. We will start with an overview of the AutoML problem and the FLAML library. We will then introduce…

108 viewsAnatoly Alekseev, 20:27

Aspiring Data Science

#vr #mr #quest3 #meta

А тем временем выходит Квест 3 за $500 с вдвое более мощным железом, лучшими линзами и разрешением выше на 30% чем у 2-ки. 2-й я брал за $300, кажется. Смешанную реальность ещё не пробовал, говорят, круто, можно играть в настолки, открывать порталы в стенах (хорошо хоть не проходить), прятаться за диваном от выстрелов в игре.

https://www.youtube.com/watch?v=KoqQCl6l73k

YouTube

Meta Quest 3 Announcement.

Pre-order: https://metaque.st/Q3POtyrielwoodYT

Mark Zuckerberg, CEO of Meta presents The Next Generation Mixed Reality Headset on Stage. Introducing the Meta Quest 3.

US https://amzn.to/3ESBfja
EU https://amzn.to/3EWFytY

#quest3 #meta #explorewithquest…

135 viewsAnatoly Alekseev, edited 05:00

Aspiring Data Science

#math #puzzle

136 viewsAnatoly Alekseev, 11:03

Aspiring Data Science

#trading #rotation #chechet

Будни алготрейдера: Ротация торговых систем

https://www.chechet.org/226

127 viewsAnatoly Alekseev, edited 12:17

Aspiring Data Science

#competitions #sber

Новая МЛ-сорева от Сбера стартовала.

"Присоединяйтесь к соревнованию AIJ Contest 2023 и предложите решения пяти актуальных задач в AI

В этом году победители разделят рекордный призовой фонд
в размере более 11 млн рублей. Участникам предстоит решить задачи по AI, каждая из которых настоящий вызов:

Strong Intelligence — создать мультимодальную модель, которая обыгрывает знатоков интеллектуальных викторин и покажет суперуровень эрудиции

Unique RecSys — разработать уникальный RL-алгоритм для подбора максимально релевантного контента

Personal AI — подготовить модели для подбора персонализированных рекомендаций по продуктам

Equal AI — создать модель, распознающую русский жестовый язык по видео

Rescue AI — разработать модель, способную определять изменения в геноме человека"

142 viewsAnatoly Alekseev, edited 06:22

Aspiring Data Science

#graphs #topology

https://www.youtube.com/watch?v=jzdFyCAV7H4

YouTube

Croshapes - Using Graph to Design a Toy - Irina Smirnova-Pinchukova

Live Stream of the in person meetup.
https://www.meetup.com/pydata-suedwest/events/295202051/

Lightning Talk by Irina Smirnova-Pinchukova
Croshapes - Using Graph to Design a Toy - Irina Smirnova-Pinchukova

Irina uses Python to navigate the process…

172 viewsAnatoly Alekseev, 07:51

About

Blog

Apps

Platform