English for Data Governance Teams: Quality, Lineage, and Catalog Discussions
Освоєння англійської лексики і шаблонів спілкування для управління даними — якість даних, походження, керування каталогами і мова управління даними англійською мовою.
Управління даними є однією з найшвидше зростаючих дисциплін в індустрії даних - і однією, де словник особливо щільний. Рамки якості даних, графіки послідовності, метадані каталогів і процеси управління мають точну термінологію, яка значно відрізняється від загальної мови інженерії програмного забезпечення.
Для людей, для яких англійська мова не є рідною, але які працюють в інженерії даних, аналітичній інженерії або ролях платформи даних, цей словник є необхідним для участі в переглядах управління, написання звітів про якість даних і управління відносинами з споживачами і виробниками даних.
Цей посібник містить ключові поняття і певні шаблони англійської мови, які використовуються у контексті управління даними.
Що таке дані управління?
Керування даними — це система процесів, політик, ролей і стандартів, які забезпечують, що дані є точними, послідовними, знайденими, безпечними і використовуються відповідально. Він відповідає на такі питання:
- “Звідки взявся цей номер?”
-
- “Хто відповідає за цей набір даних?” *
- “Ці дані підходять для мети, для якої ми їх використовуємо?”
- “Хто має доступ до цього чутливого поля, і чому?”
Команда управління, як правило, включає в себе керівників даних, власників даних, інженерів даних і співробітників з відповідності - всім з яких потрібно точно спілкуватися про дані.
Кваліфікаційний словник
Якість даних вимірюється за допомогою декількох вимірів. Знаючи словниковий запас кожного з цих вимірів, ви зможете писати точні звіти про якість і брати участь у перегляді якості.
1. Точність
Ступінь, до якої дані правильно відображають реальну сутність, яку вони представляють.
** Використання: ** * “У полі доходів клієнта є проблема з точністю — воно включає повернені транзакції, які не були належним чином виключені, отже, цифри завищено приблизно на 7%.” *
2. Полнота
Ступінь, до якої всі потрібні дані присутні і не відсутні.
** Використання: ** * “Рейтинг повноти для поля email становить 73% — у 27% записів відсутня коректна адреса електронної пошти, що перешкоджає запуску кампанії пошти.” *
** Спільний словник повноти: **
-
- « Нульові значення » * — відсутні дані у полі
-
- « Обов’ язкове поле » * — поле, яке не може бути порожнім
-
- « Частота заповнення » * — відсоток ненульових значень: * « Частота заповнення для поля
phone_numberстановить 61% ». *
- « Частота заповнення » * — відсоток ненульових значень: * « Частота заповнення для поля
-
- « Відсутність випадкових значень (MAR) » * — коли ймовірність відсутності даних не пов’ язано з відсутнім значенням
- “Відсутність не випадково (MNAR)” — коли відсутність пов’ язана з самою цінністю (наприклад, високооплачувані працівники не повідомляють про прибуток)
3. Послідовність
Ступінь, в якій дані є послідовними в системах і наборах даних - одна й та ж сутність описана однаково в декількох місцях.
** Використання: ** * “Існує проблема з послідовністю між CRM і сховищем даних — запис клієнта для « Acme Corp » використовує різні коди валют у кожній системі. CRM показує GBP, але склад показує USD.”*
4. Своєчасність / свіжість
Ступінь, до якої дані є актуальними для їх передбаченого використання. Також називається ** свіжість ** у сучасних контекстах стека даних.
** Використання: ** * “Таблиця каталогу продуктів має SLA свіжості 4 години. Поточне затримка становить 11 годин — трубопровід не вдалося в 03:00 UTC і на вимогу було покликано.”*
Словник загальних термінів:
-
- « Затримка даних » * — затримка між моментом, коли щось відбувається, і моментом, коли це відображено у даних
-
- « SLA свіжості » * — максимально допустима затримка
-
- « Дані, що застаріли » * — дані, які перевищують поріг свіжості
-
- « Заповнення » * — процес переобробки історичних даних для виправлення або додавання даних
5. Унікальність
Ступінь, до якої записи не дублюють один одного. Дублікати записів є однією з найпоширеніших і найбільш шкідливих проблем з якістю даних.
** Використання: ** “Помилка перевірки унікальності поля order_id — у даних за останній місяць ми маємо 1247 дублікатів ідентифікаторів замовлень. Це викликає подвійний підрахунок на панелі доходів.”
Дійсність
Ступінь, у якій значення даних відповідають очікуваним форматам, діапазонам або спискам посилань.
** Використання: ** * “Ми знайшли 340 записів, де поле country_code містить значення, які не вказані у списку стандартів ISO 3166. Це викликає невдачі в службі розрахунку податку на нижньому рівні.»*
Мова опису даних
Під час написання звіту про якість даних використовуйте структуровану, точну мову:
- “Таблицю
ordersу складі даних виробництва було оцінено на якість даних у п’ яти вимірах. Точність і унікальність знаходяться в межах прийнятних порогів. Було виявлено дві проблеми:*
- ** Завершеність: ** Поле
shipping_addressмає рівень заповнення 64%, нижче 95% мети. Основна причина: новий поток мобільних платежів не захоплює адресу доставки для цифрових продуктів. Рекомендована дія: додайте логіку умовного захоплення полів у мобільну відправку (квиток: DATA- 891). *
- ** Вчасність: ** SLA для свіжості таблиці — 2 години. Поточний затримка P95 становить 3,4 години, що обумовлено вузьким місцем в трансформаційному трубопровіді під час пікової напруги. Рекомендована дія: перевірити оптимізацію обрізання розділів (квиток: DATA- 892).”*
Інформаційно-аналітичний словник
Походження даних описує, звідки походять дані, як вони були перетворені, і куди вони надходять. Це стежка аудиту вашого конвеєра даних.
7. Лінії
Повний список історії активу даних — від його системи- джерела через всі перетворення до поточного розташування.
** Використання: ** “Походження метрики monthly_revenue відслідковується через три шари перетворення до сирої таблиці stripe_events, що вводиться з API Stripe.”
8. Вгору/вниз по течії
** Upstream ** — дані або системи, які надходять до поточного набору даних ** Downstream ** — дані або системи, які споживають поточний набір даних
** Використання: ** “Таблиця user_attributes має 14 залежностей нижче по течії — перед тим, як ми змінимо схему, нам потрібно оцінити вплив на всі 14.”
9-й. Система джерел (Source of Record / System of Record)
Авторитетна система, з якої походять дані. * джерело запису * є остаточним, надійним джерелом для певного об’ єкта даних.
** Використання: ** * “Для даних про особистість клієнта CRM є системою записів. Будь-які розбіжності між сховищем даних і CRM повинні вирішуватися на користь CRM. “*
10. Конвейер даних
Послідовність кроків — вживання, перетворення, завантаження — які пересують дані з джерела до призначення.
** Співвідношення мов конвеєра: **
- «Поглинання» — перший крок: внесення необроблених даних у платформу
-
- « Перетворення » * — очищення, формування і збагачення даних
-
- « Завантаження » * — запис перетворених даних до місця призначення
-
- « Оркестрація » * — планування і керування виконанням конвеєра
-
- « DAG » * (Directed Acyclic Graph) — структура, яку використовують інструменти оркестрації (Airflow, Dagster) для представлення залежностей конвеєра
11. Зміни
У контексті послідовності даних, зміна набору даних (зміна схеми, зміна логіки, перейменування), що розбиває нижні споживачі.
Використання: “Переназва колонки customer_id на account_id є зміною, що перериває роботу — всі 14 моделей dbt нижче по течії посилаються на стару назву колонки і зазнають невдачі.”
** Як повідомити про зміну: **
- “Це є зміна схеми таблиці
orders, яка призведе до її руйнування. Ми вилучаємо застарілийlegacy_status_codeполе і перейменовуємоcustomer_refнаcustomer_id. Команди, що працюють на нижніх рівнях, повинні запланувати міграцію до п’ятниці, 20 червня. Посібник з міграції доступний на [link]. Будь ласка, зв’яжіться, якщо ваш трубопровід залежить від цих полів, щоб ми могли координувати.”*
Каталог словників
Каталог даних — це централізоване сховище активів даних — таблиць, полів, панелей, метрик — з метаданими, які роблять їх відкритими і зрозумілими.
12. Актив даних
Будь- який об’ єкт даних, яким керується каталог — таблиця, перегляд, панель приладів, визначення метрики, модель даних.
Метадані
Інформація * про * дані, а не самі дані. Типи метаданих:
- ** Технічні метадані ** — схема, типи даних, кількість рядків, дата і час останнього оновлення
- ** Бізнес- метадані ** — опис бізнесу, власник, класифікація, SLA
- ** Операційні метадані ** — історія виконання конвеєра, результати перевірки якості
14. Власник даних
Особа або команда, відповідальна за якість, точність і належне використання набору даних. Не інженер, який побудував трубопровід - бізнес-партнер, який відповідає за зміст даних.
** Використання: ** * “Для метрики revenue власником даних є команда з фінансів. Будь-які зміни до визначення метрики вимагають їх підписання.»*
15.Дейта Стюард
Особа, відповідальна за щоденне управління і документацію набору даних - підтримка метаданих, вирішення проблем з якістю і перший контакт для споживачів даних.
Словник даних
Документ або функція каталогу, яка визначає кожне поле у наборі даних: назву, опис, тип даних, дозволені значення і будь- які бізнес- правила.
** Використання: ** “Перед використанням цієї таблиці, будь ласка, перегляньте словник даних — особливо зауваження до поля adjusted_revenue, яке виключає конкретні категорії доходів, які там задокументовані.”
17. Глосарій бізнесу
Централізований список бізнес-термінів і їх офіційних визначення - забезпечення того, що “активний клієнт”, “місячний повторний прибуток” і “відтік” означають одне і те ж у всіх командах.
** Використання: ** * “У нас була невідповідність у панелі керування, оскільки маркетинг і фінанси використовували різні визначення « активного клієнта ». Ми вирішили це, додавши узгоджене визначення до бізнес-глосарію і пов’язавши його з обох панелей управління. “*
18-й. PII — персонально ідентифікуюча інформація
Дані, які можна використовувати для ідентифікації певної особи — імена, адреси електронної пошти, номери телефонів, IP- адреси, біометричні дані. Набори даних, що містять PII, вимагають спеціального оброблення, контролю доступу і документації.
** Використання: ** “У цій таблиці містяться особисті дані — адреса електронної пошти і адреса IP. Доступ обмежено командою аналітики згідно з правилами доступу до даних. Не копіюйте PII в середовища стажування.”
Класифікація даних
Категорізація даних за рівнем чутливості — часто: Публічні, Внутрішні, Конфіденційні, Обмежені. Класифікація визначає керування доступом, правила зберігання і вимоги до обробки.
Правила зберігання
Правило, яке визначає, як довго зберігати дані перед їх вилученням або анонімізацією. Підтримка законних вимог (GDPR, CCPA) і бізнес-вимог.
** Використання: ** “За нашою політикою зберігання GDPR, персональні дані клієнта вилучаються через 24 місяці після закриття облікового запису. Автоматичне завдання вилучення виконується на перший день кожного місяця.”
Система управління даними для управління інформацією
Визначення ступеня точності даних
- “Я хочу повідомити про проблему з якістю даних у таблиці
orders. Ми виявили близько 1200 дублікатів записів за останні 30 днів, які були введені зміною в потоку поглинання 3 червня. Дублікати викликають завищений прибуток приблизно на £ 47,000 в червневому звіті. Я створив квиток (ДАНІ-901) і позначив власника трубопроводу. Ми рекомендуємо призупинити червневий звіт про прибуток до тих пір, поки дублікати не будуть розв’язані і історичні дані не будуть виправлені. “*
Запит документації про лінію
- “Перед тим, як ми побудуємо нову модель атрибуції на основі цього набору даних, чи можемо ми переглянути похідну таблиці
campaign_events? Зокрема, я б хотів зрозуміти, як обчислюється полеattribution_weight— опис бізнесу в каталогу неоднозначний, і я хочу переконатися, що наша модель побудована на правильному розумінні.»*
Відповідь на запитання споживача даних
- “Готове питання про метрику
monthly_active_users. Згідно з нашим словником для бізнесу, « активним користувачем за місяць » є користувач, який завершив принаймні один сеанс тривалістю 60 секунд або більше за календарний місяць. Це визначення було погоджено з командою продукту в січні 2025 року і зазначено в визначенні метрики в каталогу даних. Якщо у вас є інший випадок використання, який вимагає іншого визначення, ми можемо створити варіантну метрику — давайте налаштуємо швидкий виклик.”*
Ключеві моменти
- ** Якість даних ** має п’ ять ключових вимірів: точність, повність, послідовність, своєчасність і унікальність. Використовуйте правильний термін для правильної проблеми.
- ** Lineage ** словник — попередній, наступний, джерело запису — є необхідним для аналізу впливу і повідомлення про інцидент.
- ** Зміни, що йдуть вперед ** повинні бути прокомунізовані проактивно: що змінюється, хто зазнає впливу, коли і як мігрувати.
- ** Каталог даних ** надає метадані для кожного активу, який можна знайти — завжди посилатися на нього у повідомленнях, а не переписувати визначення в рядку.
- ** Власник даних ** (відповідальний) і ** керівник даних ** (операційний) є різними ролями — скористайтеся відповідним терміном.
- PII і класифікація даних не є технічними поняттями — це управлінські обов’ язки, які вимагають точної мови.
Робота з управлінням даними в основному стосується комунікації - між командами, системами і впродовж часу. Clear English робить політику управління примусовою, а активи даних надійними.