DATABASE DESIGN – Telegram
DATABASE DESIGN
1.41K subscribers
2.08K photos
3 videos
5.3K links
Лучшие материалы по работе с хранилищами данных на русском и английском языке

Разместить рекламу: @tproger_sales_bot

Правила общения: https://tprg.ru/rules

Другие каналы: @tproger_channels

Другие наши проекты: https://tprg.ru/media
Download Telegram
Это база: как я превращаю копилку личного опыта в социальные технологии, которые работают

Рефлексия по поводу собирательства знаний + подборки такого собирательства в Notion. В комплекте - несколько лайфхаков, скриншотов, ну и само содержание: собранные за многие месяцы базы знаний.
Посмотреть и потрогать:

Читать: https://habr.com/ru/post/702002/
10 years of MongoDB customers at AWS re:Invent

Read: https://www.mongodb.com/blog/post/ten-years-mongodb-customers-aws-reinvent
👎1
Родители и дети. Связываем документы в Elasticsearch

Как-то раз, мне попалась интересная задача: выделить общую часть информации из нескольких документов, находящегося в Elasticsearch, в отдельный «фрагмент» с целью ее независимого и частого обновления по типу отношения «один ко многим». В данной статье я расскажу вам про join field type.


Читать: https://habr.com/ru/post/702134/
Как мы обновили старый кластер Elasticsearch на 3 ПБ без простоев. Часть 2 — Два последовательных кластера

Прим. переводчика: автор статьи рассказывает о процессе обновления кластера Elasticsearch размером более 3 петабайт методом последовательного включения двух кластеров, а также о том, как решались проблемы согласованности индексирования и миграции данных.

Это вторая часть из серии статей об обновлении кластера Elasticsearch без простоев и с минимальным воздействием на пользователей. Как упоминалось в первой части, необходимо было обеспечить плавный переход между двумя версиями системы, при этом сохраняя возможность отката.


Читать: https://habr.com/ru/post/702028/
MongoDB Named as a Leader in The Forrester Wave: Translytical Data Platforms, Q4 2022

Read: https://www.mongodb.com/blog/post/mongodb-named-leader-forrester-wave-translytical-data-platforms-q4-2022
Дельта BI глазами (и руками) разработчика Tableau

Уже больше полгода назад крупнейшие BI вендоры прекратили работу в России. Мы в компании Vizuators, имея многолетний опыт разработки и консалтинга в Tableau, столкнулись с необходимостью тестировать альтернативные инструменты, которые подошли бы нашим клиентам.

Одним из наиболее привлекательных для нас вариантов стала платформа визуальной аналитики Дельта BI. Под катом мы говорим о том, что получит и потеряет «таблошник», перейдя на Дельта BI.


Читать: https://habr.com/ru/post/702660/
MariaDB C++ Connector 1.1.2 RC now available

Read: https://mariadb.com/?p=34179
Built With MongoDB: Inspirit Helps Kids Learn Science Through Immersive Technology

Read: https://www.mongodb.com/blog/post/built-mongodb-inspirit-helps-kids-learn-science-through-immersive-technology
Choosing the Right Tool for the Job: Understanding the Analytics Spectrum

Read: https://www.mongodb.com/blog/post/choosing-right-tool-job-understanding-analytics-spectrum
Нужно больше гигабайт. Экзабайты будущего

Человечество продолжает создавать все больше информации. Физический мир постепенно оцифровывается, и этот гигантский массив данных требуется где-то хранить. А значит, существует растущая потребность в системах хранения для накопленной информации. В этом посте рассмотрим перспективные технологии, которые будут помогать сохранять информацию в ближайшем будущем.


Читать: https://habr.com/ru/post/701394/
PostgreSQL Antipatterns: простой(?) INSERT… VALUES

Представим, что у вас есть некоторая табличка статистики, куда вы периодически скидываете таймстамп последнего "текущего" состояния в паре координат - например, (ID организации, ID сотрудника).

Как больно наступить на грабли в совсем простом, казалось бы, запросе?


Читать: https://habr.com/ru/post/702902/
Achieving Industrial Connectivity at Scale with Wimera and MongoDB

Read: https://www.mongodb.com/blog/post/achieving-industrial-connectivity-scale-wimera-mongodb
To Data Lake or Not to Data Lake

For enterprise data, analytics and machine learning can be done simpler, faster, and at less total cost in an Oracle Database. The Oracle Database-centric Data Lab is a unique embedded platform for doing analytics within your transaction systems or data warehouses. Whether your Oracle Database is in the cloud or in your data center, take advantage of these embedded and free capabilities today!

Read: https://blogs.oracle.com/database/post/to-data-lake-or-not-to-data-lake
Выбор оптимального решения для хранения разнородных данных pandas

Проблема выбора формата файла, с которым предстоит работать для чтения и записи  pandas.DataFrame, заключается как раз в том, что есть из чего выбрать: даже сам pandas включает в себя функционал, позволяющий работать с большим перечнем типов файлов. Обилие доступных для данной задачи форматов обусловлено невозможностью решить проблему импорта/экспорта раз и навсегда: ничего идеального, как и формата для хранения данных, к сожалению, не существует, поскольку даже самый, на первый взгляд, оптимальный и минимально затратный по ресурсам pickle способен создать очень много проблем.


Читать: https://habr.com/ru/post/703064/
Совместный доступ к Spark-датасетам из разных приложений — Redis нам в помощь

Apache Spark, универсальная платформа для крупномасштабной обработки данных, в сочетании с Redis способна обеспечить ускоренные расчеты в реальном времени для таких задач, как анализ временных рядов, прогнозы и рекомендации на основе машинного обучения и т. д.

Spark также способен извлекать датасеты в кэш-память кластера. Это невероятно полезно, когда приложению необходимо многократно запрашивать одни и те же данные. Если вы используете датасет, создание которого достаточно затратно, и который потом используется в вашем приложении не один раз, то этот датасет обязательно нужно кэшировать. Но если вы захотите получить доступ к этому датасету сразу из нескольких приложений, то вам придется поломать голову, как это сделать. Здесь на помощь приходит коннектор Spark-Redis.


Читать: https://habr.com/ru/post/703136/
Multiple VM Cluster Support & VM Cluster Node Subsetting now available on ExaDB-D

With Multiple VM Clusters (Multi-VM) support and VM Cluster Node Subsetting capability, you can now create multiple VM Clusters on a single Exadata Infrastructure in ExaDB-D and have the flexibility to choose specific DB Servers within the infrastructure to host VMs from the cluster.

Read: https://blogs.oracle.com/database/post/multiple-vm-cluster-support-vm-cluster-node-subsetting-now-available-on-exadb-d
Детальное рассмотрение поведения при использовании INCLUDE

Некоторые базы данных такие, как Microsoft SQL Server, IBM Db2, а также PostgreSQL начиная с 11 версии – предлагают прибегнуть к оператору include для генерации индекса. Представление данного функционала в PostgreSQL (исходная статья вышла 30.04.2019) послужило поводом для этого объёмного рассуждения о работе с оператором include.

Содержание:

1)    Напоминание: btree-индексы

2)    Напоминание: Index-only сканирование

3)    Оператор include

4)    Фильтрация по полям в include

5)    Уникальные индексы при использовании include

6)    Сравнение

7)    PostgreSQL: Никакой фильтрации до проверки области видимости


Читать: https://habr.com/ru/post/703578/