Мониторим ИТ – Telegram
Мониторим ИТ
8.07K subscribers
200 photos
2 files
1.52K links
Канал о наблюдаемости (Monitoring & Observability): логи, трейсы, метрики.

Реклама: @gals_ad_bot
Вопросы: @antoniusfirst

@usr_bin_linux — Linux, Kubernetes, Docker, Terraform, etc.

@zabbix_ru — только Zabbix

@elasticstack_ru — ElasticSearch/OpenSearch
Download Telegram
Tracing Node.js application with OpenTelemetry & Jaeger UI

In this tutorial I will demonstrate how to trace and instrument Node.js application with OpenTelemetry. Читать дальше.
Announcing Grafana Mimir, the most scalable open source TSDB in the world

Yet another TSDB. Сегодня анонсировали Grafana Mimir, которая, как предполагается, будет альтернативой Cortex или Thanos. Подробнее по ссылке.
Что нового в плане мониторинга в PostgreSQL (Алексей Лесовский)

Расшифровка доклада Алексея Лесовского про то, что нового есть в PostgreSQL в плане мониторинга. Читать на Хабре.
How to reduce your Prometheus cost

Пишут как снизили количество инжестируемых метрик в Prometheus. Читать на Медиуме.
How Prometheus Operator facilitates Prometheus configuration updates

The goal: Update Prometheus configuration nicely! Читать дальше на Медиуме.
Using Environment Variables for Configuration, Provisioning, and Dashboards in Grafana

The number of use cases operating Grafana as a platform to build modern applications is increasing. Compared to a single central Grafana instance, we are looking at multiple distributed installations with new kinds of data sources. Читать дальше на Медиуме.
Обход аутентификации и способы выполнения произвольного кода в ZABBIX

В этой статье мы поговорим о некоторых атаках на систему мониторинга Zabbix и рассмотрим сценарии удаленного выполнения кода (RCE). Дальше на Хабре.
Grafana и автотесты: учимся измерять работу тестов

Grafana позволяет собрать на одном экране разную информацию:
⚡️результаты тестов в режиме реального времени,
⚡️срезы по окружениям, браузерам и чему угодно ещё,
⚡️скорость выполнения тестов,
⚡️покрытие тестами страниц и действий на них,
⚡️результаты релизов.

На примерах тестов вы узнаете, как Grafana помогает в анализе результатов автотестирования, чтобы точнее понимать, что происходит. Читать дальше на Хабре.
Installing Grafana plugins from a Private repository

Grafana Marketplace application is one of our favorite features introduced in Grafana 8. It allows installing registered plugins from the official Grafana repository when connected to the Internet, but how to upgrade and manage Grafana plugins without access to external network? Читать дальше.
How we scaled our new Prometheus TSDB Grafana Mimir to 1 billion active series

Полторы недели назад Grafana анонсировала собственную TSDB Mimir, и вот теперь рассказывает как они затестили Mimir с миллиардом серий данных.

Блог Grafana
How relabeling in Prometheus works

Relabeling is a powerful tool that allows you to classify and filter Prometheus targets and metrics by rewriting their label set. Блог Grafana.
How summary metrics work in Prometheus

A summary is a metric type in Prometheus that can be used to monitor latencies (or other distributions like request sizes). For example, when you monitor a REST endpoint you can use a summary and configure it to provide the 95th percentile of the latency. If that percentile is 120ms that means that 95% of the calls were faster than 120ms, and 5% were slower. Читать дальше.
How To Troubleshoot Slow Linux Servers

atop, free, ncdu, iotop и nethogs
5 Network Performance and Analysis Tools For Linux

iperf, tcpdump, hping, netstat и scapy
Упрощаем мониторинг и управление контейнерами Docker при помощи инструментов CLI

Dockly, Dive, Ctop, Dry, Lazy Docker, Poco, Sen и Skopeo.
How to drop and delete metrics in Prometheus

Keeping your Prometheus optimized can be a tedious task over time, but it’s essential in order to maintain the stability of it and also to keep the cardinality under control. Identifying the unnecessary metrics at source, deleting the existing unneeded metrics from your TSDB regularly will keep your Prometheus storage & performance intact.

In this article we’ll look at both identifying, dropping them at source and deleting the already stored metrics from Prometheus.

Читать дальше на Медиуме.
Культура postmortems или как мы учимся на ̶с̶в̶о̶и̶х̶ факапах

Где-то три года назад я выступал на небольшом митапе с темой, которая вынесена в название этой статьи. В том докладе я рассказывал о том, как мы за несколько лет выстроили работу с инцидентами у себя в привлечении Tinkoff. Ну и чтобы доклад был не таким скучным я поделился несколькими postmortems, которые произошли в командах “моего друга”. Читать дальше.
Calculating composite SLA

How to serial and parallel dependencies affect the total SLA. Читать дальше.