Словник для розмов про спостережуваність і моніторинг

Основний словниковий запас англійської мови для спостереження і моніторингу: метрики, журнали, сліди, SLO, попередження і фрази, які інженери використовують для обговорення стану системи.

Спостережливість - це те, як команди розуміють, що їхні системи насправді роблять у виробництві. У цьому полі міститься багато слів — метрики, сліди, SLO, процентилі — і використання цих слів точно визначає вас як людину, яка знає операції. У цьому довіднику наведено основні терміни, поширені фрази і приклади речень для обговорення стану системи англійською мовою.


Три стовпи

TermMeaning
MetricsNumerical measurements over time (e.g. requests per second).
LogsTimestamped records of events.
TracesThe path of a single request through your services.
  • « Метрика показує підвищення затримки, але мені потрібно подивитися на сліди, щоб побачити, яка служба повільна. » *

Ці три часто називають “трьома стовпами спостережливості” — фраза, яку варто знати.


Метричний словник

  • ** Затримка ** — час, який займає запит.
  • ** Пропускна здатність ** — кількість запитів за секунду.
  • ** Частота помилок ** — відсоток невдалих запитів.
  • ** Насиченість ** — рівень заповненості ресурсу (ЦП, пам’ яті, диска).
  • ** Перцентиль (p50, p95, p99) ** — значення, нижче якого знаходиться X% запитів.

“Наша затримка p99 становить 800 мс, що означає, що 1% користувачів чекають майже секунду.”

Процентилі важливі, тому що середні значення приховують найгірший досвід. Сказавши “p95”, ти показуєш, що розумієш це.


Сло, Сла, Слай

Ці три значення легко сплутати, тому будьте точними:

TermMeaning
SLIService Level Indicator — what you measure (e.g. uptime).
SLOService Level Objective — your internal target (e.g. 99.9%).
SLAService Level Agreement — a contractual promise to customers.
Error budgetHow much unreliability you can “spend” before breaching the SLO.

“Ми використали більшу частину нашого бюджету на помилки цього місяця, тому нам слід призупинити ризиковані розгортання.”


Попереджаючий словник

  • щоб ** викликати ** попередження — коли буде викликано попередження.
  • щоб когось розбудити.
  • ** втомлюваність від попереджень ** — перевантаження занадто великою кількістю попереджень.
  • ** тремтіння ** попередження — попередження, яке викликається і звільняється неодноразово.
  • ** шумне ** попередження — попередження, яке занадто часто викликається, щоб бути корисним.

*“Це попередження занадто гучне — воно посилає нам повідомлення о 3 ранку про те, що нічого не сталося. «Відкрийте двері» (фр


Опис поведінки системи

PhraseMeaning
”It’s degraded.”Working but slow or partial.
”It’s flapping.”Switching between healthy and unhealthy.
”We’re seeing elevated error rates.”More errors than normal.
”It’s saturated.”A resource is at capacity.
”There’s a memory leak.”Memory use grows over time.

“Служба погіршилася — вона працює, але час відповіді вдвічі перевищує базовий.”

Слово * « базовий » * (нормальний рівень) є важливим для порівняння поточної поведінки зі звичайною.


Постійно використовує слово «Світ»

  • до ** інструменту ** коду (додати до нього спостережливість)
  • для ** збирання ** метрик (збирання їх)
  • для ** кореляції ** журналів і слідів
  • щоб ** просунутися вниз ** до метричної оцінки
  • до ** панелі приладів ** щось (неформально: покласти на панель приладів)
  • щоб ** попередити про ** умову

“Ми повинні вивчити потоки виведення, щоб знати, звідки походить затримка.”


Фрази, які використовуються в розслідуванні

“Дай мені пробурити вниз до p99 по кінцевій точці.” “Частота помилок почала зростати відразу після 14:00.”

  • « Я не можу зв’ язати ці журнали без ідентифікатора трасування — додамо його. » * “На приборной панели видно явный скачок, но причина пока не очевидна.”

Люди плутають слова

ConfusedClarification
Monitoring vs observabilityMonitoring watches known problems; observability helps explore unknown ones.
Logs vs tracesLogs are events; traces follow one request across services.
Latency vs throughputLatency is speed per request; throughput is volume.
SLO vs SLASLO is your internal goal; SLA is the customer contract.

Вирок на практиці

“Наша SLI має затримку запитів, наша SLO має p95 нижче 300 мс, і ми майже вичерпали бюджет помилок цього кварталу — тому я рекомендую заморозити ризиковані зміни і зосередитися на надійності, поки вона не відновиться.”

Доставляя это плавно сигнализирует о реальной оперативной зрелости.


Небезпека і невизначеність

В инцидентах ты часто не уверен. Англійською мовою є чіткі огорожі:

  • «The metrics suggest a database bottleneck.» (англійською)
  • «Це ** виглядає як ** витік пам’яті, але я не підтвердив це.»
  • «Ми досить впевнені, що розгортання спричинило це»

За допомогою цього словника ви зможете вільно пересуватися у будь- якій дискусії щодо спостережливості — від опису погіршеної служби, до вивчення піка p99, до обговорення того, чи не перевищили ви свій бюджет помилок. Використовуйте прикладні речення як шаблони, дотримуйтесь правил SLI, SLO і SLA, і тримайтеся чесних, коли ви все ще розслідуєте.

Національні мови: лексика та її значення

Будьмо чесними - термінологія навколо спостережливості може здатися щільною, особливо коли ви намагаєтеся ефективно спілкуватися з командою, яка може мати різні джерела або рівень технічної експертизи. Крім простого знання * того, що * щось є (метрика, слід, тощо), важливо розуміти * як * ці терміни використовуються на практиці і тонкі наслідки, які вони несуть. Часто нерозуміння виникають не з-за відсутності знань про основні поняття, а з-за різних інтерпретацій того, як ці терміни застосовуються або пріоритизуються. Наприклад, молодший інженер може зосередитися виключно на збільшенні кількості зібраних метрик, не враховуючи вартість - з точки зору інфраструктури і часу команди - пов’язаних з цими даними. Аналогічно, хтось, хто не знайомий з трасируванням, може запропонувати додати інструменти для трасування скрізь, повністю ігноруючи потенційний вплив на продуктивність.

Ключовим питанням, на яке варто звернути увагу, є обговорення навколо впливу. Описуючи проблему або пропонуючи рішення, інженери часто використовують фрази, які ненадовго змінюють фокус. Сказати «система переживає високу затримку» відразу ж говорить про невідкладну проблему, що вимагає негайної уваги, тоді як сказати «ми бачимо підвищену затримку в декількох регіонах» звучить більш виміряно і запрошує обговорення про кореневі причини, а не стрибати до висновків. Використання точної мови – наприклад, «95-й процентиль тривалості запиту перевищує поріг SLO» – змушує говорити про те, що відбувається на основі даних, і уникнути емоційної мови, яка може призвести до неправильного тлумачення.

Інша поширена пастка - це нездатність чітко сформулювати * чому * щось важливо. Просте повідомлення, що «логи є високими», не забезпечує контексту або невідкладності. Замість цього, описуючи певний шаблон в журналах, наприклад, «Ми спостерігаємо збільшення 404 Not Found помилок, що походять від запитів користувача до кінцевої точки /api/v1/users», негайно підкреслює потенційну проблему і звертає увагу на певну область системи. Цей рівень деталізації є життєво важливим для ефективного співробітництва.

Нарешті, пам’ ятайте, що чітке спілкування виходить за рамки письмової документації або повідомлень Slack. Вербальні дискусії часто використовують структуровані підходи, наприклад, використовуючи заздалегідь визначені категорії при описі проблем під час виступів — рейтинг «серйозності» разом з технічними деталями дозволяє ефективно визначати пріоритети.

# Example: Using Prometheus to query latency metrics

promql "rate(http_request_duration_seconds_sum{job='my-app'}[5m])"

Цей запит показує, яким чином спостерігати за певною метрикою (тривалістю запиту HTTP) за допомогою PromQL, показуючи практичне застосування принципів спостережливості. Функція rate() обчислює збільшення суми тривалостей за секунду протягом 5-хвилинного вікна, надаючи динамічний перегляд продуктивності системи. Такий конкретний приклад допомагає закріпити розуміння того, як метрики збираються і інтерпретуються в контексті спостережливості.

Поширені запитання

Про що ця стаття "Словник для розмов про спостережуваність і моніторинг"?

Основний словниковий запас англійської мови для спостереження і моніторингу: метрики, журнали, сліди, SLO, попередження і фрази, які інженери використовують для обговорення стану системи.

Чи безкоштовна ця стаття?

Так. Усі статті на CoderSlingo, включно з цією, доступні безкоштовно без реєстрації.

Скільки часу займає читання "Словник для розмов про спостережуваність і моніторинг"?

Приблизно 9 min.