Повний посібник з англійської для Дата-саєнтистів і ML-інженерів
Повідомляйте результати експериментів, захищайте вибір моделей, розповідайте історії даних зацікавленим сторонам, читайте статті з машинного навчання і обговорюйте інженерію функцій — повна англійська сучасної науки про дані і машинного навчання.
Інформаційні технології для інженерів та науковців
Наука про дані і машинне навчання займають унікальне положення в сучасних технологічних організаціях: робота є глибоко технічною, але цінність, яку вона створює, реалізується тільки тоді, коли вона ефективно комунікується з приймаючими рішення, які часто не є технічними. Модель, яка досягає відмінної продуктивності, але результати якої не можна пояснити менеджеру продукту, не буде розгорнута. Експеримент, який виявляє важливий погляд на поведінку користувача, не змінить стратегію продукту, якщо історія даних похована в ноутбуці Jupyter, яку ніхто не читає.
Англійська мова науки про дані і ML охоплює широкий спектр реєстрів і аудиторій. Під час написання нотатки в Jupyter ви пишете для технічних фахівців, які хочуть стежити за вашими аналітичними роздумами. Представляючи результати експериментів в щотижневому огляді даних, ви пишете для змішаної аудиторії, до якої належать інженери, менеджери продуктів, а іноді і керівники. Під час написання картки моделі для розгорнутої моделі ви пишете офіційну документацію для широкого кола зацікавлених осіб. Кожен контекст вимагає іншого словника, різних рівнів технічних деталей і різних структур.
ML-інженерія додає операційний вимір: комунікація про моделі тренувальних конвеєрів, магазини функцій, контракти з даними, інфраструктура обслуговування моделей і моніторинг виробництва. Це теми, які вимагають словникового запасу як з досліджень ML, так і з інженерії програмного забезпечення, а також здатності обговорювати їх з науковцями даних і інженерами платформ.
Є також вимір читання і взаємодії з дослідницьким співтовариством ML. Статті ML на arXiv, NeurIPS proceedings, і блоги з основних дослідницьких лабораторій написані технічною англійською мовою з певними угодами — резюме, розділ, пов'язаний з роботою, заява про внесок, дослідження абляції. Вміння ефективно читати цю літературу, а потім синтезувати її для вашої команди є значною конкурентною перевагою.
Цей посібник охоплює всі ці реєстри. Прочитайте кожен розділ, щоб розвинути словниковий запас і навички спілкування, які зроблять вашу роботу з наукою про дані і машинним навчанням більш ефективною.
Розділ 1: Комунікація результатів експерименту
Комунікація результатів експериментів, мабуть, є найчастішою і найважливішою роботою, яку виконує науковець з даних. Чи то в повідомленні Slack, Google Doc, ноутбуці Jupyter, чи презентації, структура і словниковий запас експериментальних записів відповідає конвенціям, які варто вивчати явно.
Стандартний експериментальний запис структури
Чиста записка експерименту містить: мотивацію (навіщо ми запустили цей експеримент?), гіпотезу (що ми очікуємо знайти?), метод (що ми зробили?), результати (що ми спостерігали?), інтерпретацію (що це означає?) і висновок/ рекомендацію (що нам робити далі?). Кожен розділ має свої власні мовні шаблони.
Мотиваційний допис: «Ми спостерігали значний спад конверсії на сторінці оплати після редизайну інтерфейсу в березні. Цей експеримент було розроблено для дослідження того, чи сприяє розташування кнопки CTA зниженню кількості покупок. Гіпотеза: « Ми зробили гіпотезу, що пересування кнопки CTA над складом збільшить рівень завершення покупки. » Метод: « Ми провели тестування 50/ 50 A/ B протягом двотижневого періоду з 3 квітня по 17 квітня, з n=48 000 користувачів на варіант. »
Статистика та мова
Розділи з результатами вимагають точної статистичної мови. Ключові формулювання: «Група лікування показала відносне збільшення на 3, 2% у швидкості перетворення порівняно з контрольною групою (8, 4% проти 8, 1%, p=0, 03)». Елементи: напрямок (збільшення/зменшення), величина (3,2%), порівняння (лікування проти контролю), абсолютні значення (8,4% проти 8,1%), і значення p або довірчий інтервал. Завжди повідомляйте як відносні, так і абсолютні зміни — «40% поліпшення» безглуздо без базисного рівня (40% поліпшення з 1% до 1,4% дуже відрізняється від 40% поліпшення з 10% до 14%).
Мова статистичної значимості: « Результат є статистично значущим на 95% рівні довіри (p=0. 03) ». / « Ми не спостерігали статистично значущого ефекту (p=0. 31) — результат збігається з випадковою варіацією ». / « Довірчий інтервал для підйому становить [1. 1%, 5. 3%] — ми на 95% впевнені, що справжній ефект знаходиться у цьому діапазоні ». Практична значимість: « Хоча результат є статистично значущим, розмір ефекту 0, 3% абсолютного підйому може не бути практично значущим, враховуючи вартість реалізації »
Недоліки: нульовий результат
Повідомлення нульових або негативних результатів вимагає обережної мови: «Експеримент не підтримував нашу гіпотезу — ми не спостерігали значної різниці між варіантами (p = 0,42). Це свідчить про те, що розташування кнопок не є головним чинником, що впливає на зниження перетворення. Ми рекомендуємо вам дослідити [альтернативну гіпотезу] далі.» Нульові результати мають значення — чітко вкажіть, що було досліджено і що слід спробувати далі.
Практикуйте ці навички
Розділ 2: Модель оцінки лексики
Оцінка моделі генерує щільний словник метрик, еталонів і систем оцінки. Вміння вільно обговорювати їх - пояснювати їх нетехнічним зацікавленим сторонам, порівнювати версії моделей в командних оглядах і писати моделі карт для розгорнутих моделей - це основна комунікаційна вміння науки про дані.
Класифікація метричних мов
Комбінація точності і відновлення є однією з найчастіше обговорюваних тем в оцінці ML: «Точність вимірює, скільки наших позитивних передбачень було правильними. Вимірювання відновлення кількості фактичних позитивних результатів, які ми правильно визначили. У цьому випадку використання — виявлення шахрайських операцій — ми надаємо перевагу відновленню перед точністю, оскільки пропущений шахрайський вчинок коштує більше, ніж хибна тривога. » Оцінка F1 « балансує точність і відновлення. » AUC- ROC « вимірює розрізнювальну здатність за всіма порогами класифікації. » Завжди контекстуалізуйте метрику з бізнес- метою: « AUC 0, 87 означає, що модель правильно ранжує випадковий позитивний приклад вище за випадковий негативний приклад у 87% випадків. »
Стандартний шаблон звітів еталонів: «Ця модель досягає результату F1 0,84 на тестовому наборі, поліпшення на 6 пунктів порівняно з базовим (0,78). На наборі оцінки, що відповідає розподілу виробництва, F1 дорівнює 0, 81." Ключові умови: завжди вказувати, який набір (тренаж/ перевірка/ тест/ оцінка); завжди порівнювати з базовим; зауважте зміни розподілу між наборами оцінки і виробництва.
Регресія і ранжування метрики
Регресія: «Модель досягає RMSE 2,3 на тестовому наборі, що на 15% краще порівняно з попередньою моделлю (RMSE 2,7). MAE становить 1,8, що вказує на те, що в середньому прогнози моделі відхиляються на 1,8 одиниць." Для рейтингу: "Модель досягає NDCG@10 0,73, порівняно з 0,68 для базису - відносне поліпшення на 7,4%. "
Мова порівняння і абляції моделей
При порівнянні моделей: «Модель А перевершує модель Б за точністю (93% проти 89%), але має в 3 рази більшу затримку виводу (85 мс проти 28 мс). Враховуючи наші вимоги до обслуговування в реальному часі, модель B є кращим вибором для виробництва. "Мова дослідження абляції: "Ми провели дослідження абляції, щоб зрозуміти внесок кожної групи функцій. Вилучення тимчасових особливостей погіршило продуктивність на 4,2 F1 пункти, підтверджуючи їх важливість. Вилучення демографічних характеристик мало незначний ефект (0,3 F1 пунктів), що свідчить про те, що ми можемо спростити набір функцій без значної втрати продуктивності»
Розділ 3: Дані Storytelling & презентація
Розповідання історій даних - це здатність брати числа і результати і представляти їх як послідовну розповідь, яка стимулює розуміння і дії. Це, мабуть, найцінніша комунікативна вміння в науці даних, і це майже повністю мова і структура виклику - дані часто не є проблемою, рамка є.
Структура даних
Історія даних повинна слідувати за оповідною дугою: Ситуація (який поточний стан?), Ускладнення (яка проблема або питання?), Розв' язання (що показують дані?) і Рекомендація (що нам робити?). Ця структура знайома бізнес- аудиторії і забезпечує, що дані служать для прийняття рішення, а не представлені як кінцевий результат. « Наша кількість користувачів зменшується вже три квартали. Ми гіпотезували, що тертя при посадці було ключовим чинником. Аналіз даних про активність першого тижня підтримує цю гіпотезу - користувачі, які завершили три або більше основних дій в перший тиждень, мають в 4 рази більшу 90-денну зберігання. Моя рекомендація полягає в тому, щоб переробити поток впровадження, щоб керувати користувачами цими трьома діями. "
Диаграма і опис мови візуалізації
Під час презентації візуалізації даних, надайте вербальний оповідь, що підкреслює ключовий взірець, а не тільки назву: "Ця діаграма показує щомісячні активні користувачі за останні 18 місяців. Ключовим моментом є різке падіння у вересні, яке збігається зі зміною цін. Що цікаво тут, так це те, що абсолютний число користувачів впало, але прибуток на користувача фактично збільшився — що свідчить про те, що ми зберегли більш цінних користувачів."
Розділ 4: Мова звітів зацікавлених сторін
Звітування про науку про дані і роботу з ML для нетехнічних зацікавлених сторін - менеджерів продуктів, бізнес-лідерів і керівників - вимагає перекладу технічних концепцій на бізнес-мову без надмірного спрощення до точки неточності. Цей переклад - це навички, які відокремлюють ефективних науковців з даних від блискучих, але ізольованих.
Переклад з англійської: Ігор Ткачук
Ключовим методом є завжди прив'язувати технічні показники до бізнес-результатів: замість «модель досягає 91% точності», скажіть «модель правильно ідентифікує 91% шахрайських транзакцій до їх обробки, зменшуючи втрати від шахрайства на приблизно £ 2.3M щорічно.» замість «ми зменшили затримку з 120 мс до 45 мс», скажіть «час відповіді рекомендацій тепер в 3 рази швидший — сеанси користувачів, де рекомендації з'являються в межах 50 мс, показують на 18% більшу частоту кліків»
Мова невизначеності для зацікавлених сторін: «Наша модель передбачає, що рівень відходу в 3 кварталі буде приблизно 8,4%, з довірчим інтервалом ± 1,2%. Це означає, що ми досить впевнені, що фактичний відсоток відмов знизиться з 7, 2% до 9, 6%.» Уникайте натяків на хибну точність, поки ви все ще повідомляєте точкову оцінку. « Заснована на поточних даних, очікувана вартість розгортання цієї моделі становить приблизно £ 400k у збережених доходах — ця оцінка має значну невизначеність і повинна розглядатися як напрямкова коректна, а не точна. »
Пояснення обмежень моделі
Проактивне повідомлення обмежень моделі створює довіру і запобігає зловживанню: «Ця модель добре працює для користувачів на ринках Великої Британії та ЄС, але у нас недостатньо тренувальних даних для ринку АПАК — прогнози для цих користувачів менш надійні.» / «Модель була тренована на даних з 2022—2024 років — якщо умови ринку значно зміняться, нам доведеться перенавчатися.» / «Ця модель розроблена для [випадок використання X] — використання її для [випадок використання Y] буде за межами її підтвердженого обсягу»
Практикуйте ці навички
Розділ 5: Читання та обговорення ML-документів
Ефективне читання дослідницьких статей ML є конкурентною навичкою для науковців даних і інженерів ML. Документи написані високоспеціалізованою академічною англійською мовою зі специфічними структурними та лінгвістичними конвенціями. Як тільки ви зрозумієте ці правила, документи стануть набагато швидше аналізуватися.
Мова і структура документів
Документи ML мають стандартну структуру: Резюме (резюме вкладу, методу і результатів — зазвичай один абзац), Вступ (мотивація, висновок про проблему, резюме підходу і внесок), Порівняльна робота (контекстуалізація роботи проти попереднього стану техніки), Метод / Підхід (технічний опис того, що було зроблено), Експерименти (оцінка налаштувань і результатів) і Заключний висновок. Розділ «Внесок» — часто вказується у вступі — перераховує те, що є новим: «Головними внесками цієї роботи є: (1) ми пропонуємо новий механізм уваги, який..., (2) ми демонструємо найсучасніші результати на X-еталоні..., (3) ми надаємо дослідження абляції, що показує...»
Поширені фрази в роботах з МЛ: « Ми пропонуємо…» / « Ми вводимо…» / « Ми демонструємо, що…» / « Паралельна робота [авторів] незалежно пропонує…» / « Наш метод перевершує [базовий] на X% на [еталоні]. » / « Наскільки нам відомо, це перша робота, яка…» / « Ми залишаємо [обмеження] для майбутньої роботи. »
Розповідь про його команду
Під час презентації роботи вашій команді, структуруйте її так: яку проблему вона вирішує, як вона її вирішує, яких результатів вона досягає, і що має значення для вашої роботи. « Ця робота від Google Brain пропонує новий підхід до [проблеми]. Ключовим розумінням є [ідея]. Вони показують на [benchmark], що це перевершує попередній стан техніки на 8%. Найважливішою частиною для нас є [спеціфічна техніка] - я думаю, ми могли б адаптувати її для [нашого випадку використання]»
Практикуйте ці навички
Розділ 6: Функціональний інженерний словник
Інженерія функцій — процес створення інформаційних вхідних змінних для моделей ML з сирих даних — має специфічний словник для опису функцій, обговорення їх властивостей і комунікації про процес розробки функцій.
Мова опису властивостей
При документуванні або обговоренні можливостей, описуйте: що вимірює функція, як вона обчислюється, яке часове вікно вона покриває, і який сигнал ви очікуєте, що вона захопить. "user_7day_purchase_count — кількість завершених покупок користувачем за 7 днів до дати прогнозу. Ця функція призначена для відображення частоти останніх покупок як сигналу схильного до покупок. » У документації з хорошою функцією слід вказати вікно часу (7 днів до чого?), агрегування (кількість, сума, середнє, макс.) і гіпотезу (чому ви очікуєте, що ця функція буде передбачуваною?).
Складання та переклад документів
Склади функцій є інфраструктурою для зберігання і обслуговування попередньо обчислених функцій. Словник: « визначення можливості » (визначення способу обчислення можливості), « свіжість можливості » (наскільки оновленими є значення можливості), « коректність у певний момент часу » (переконання, що можливості, використані для тренування, відображають лише дані, доступні на час прогнозування, щоб уникнути витоку цілі), « заповнення можливостей » (обчислення історичних значень можливостей для перенавчання). « Нам слід додати цю можливість до сховища можливостей — вона має вимогу щодо свіжості 1 годину і її слід заповнювати протягом останніх 12 місяців для перенавчання. »
Вибір і значення
« Важливість властивості » описує, наскільки кожна властивість сприяє прогнозам моделі. « Ця властивість має велике значення у моделі — вилучення її погіршить продуктивність на 4, 2 F1 пункти. » « Характеристика віку користувача має високу кореляцію з цільовою, але вона також сильно корелює з user_ signup_ date — ці властивості є колінеарними, що може призвести до нестабільності у моделі. » « Нам слід вилучити [природу] з тренувальних даних — вони містять майбутню інформацію, яка не буде доступною під час виведення висновків, що призведе до витоку цільових даних. »
Розділ 7: ML в мові виробництва
Розгортання і підтримка моделей ML у виробництві вимагає словника, який поєднує науку про дані і інженерію платформи. Інженерам ML потрібно спілкуватися про моделювання, моніторинг, перенавчання конвеєрів і виробничі інциденти з науковцями даних і інженерами програмного забезпечення.
Моделі обслуговування та розгортання мови
«Обслуговування моделі» відноситься до інфраструктури, яка робить треновану модель доступною для прогнозів. Ключові поняття: «затримка висновку» (час повернення прогнозу — «наша модель має затримку висновку p99 120 мс»), «пропускна здатність» (передбачення за секунду), «пакетне висновування» (запуск прогнозів на багатьох вхідних даних одночасно, зазвичай офлайн), «виведення в реальному часі» (передбачення, обчислені на запит для окремих запитів), «версії моделі» (відстеження версії моделі, яка розгортається) і «A / B тестування моделей у виробництві» (обслуговування двох версій моделі для різних сегментів користувачів для порівняння продуктивності).
Модифікація мови та мови програмування
Для моделей машинного навчання, що використовуються у виробництві, потрібне спостереження за « дрейфом даних » (зміна розподілу вхідних даних у порівнянні з тим, на якому було треновано модель), « дрейфом концепції » (зміна зв’ язку між властивостями і цільовою метою), « погіршенням якості моделі » (зменшення продуктивності за цільовою метрикою) і « дрейфом прогнозування » (зміна розподілу вихідних даних моделі). « Точність моделі зменшилася на 8 відсоткових пунктів за останній місяць. Аналіз вхідних даних показує значний дрейф даних у функції user_location — це, ймовірно, пов'язано з географічним розширенням на нові ринки.» — «Ми бачимо дрейф прогнозів — модель тепер передбачає «високий ризик» для 40 % користувачів, порівняно з 18 %, коли вона була розгорнута. Це може вказувати на те, що модель більше не калібрується до поточної поведінки користувача.»
Найбільш корисні слова та фрази для науковців даних та інженерів ML
Рекомендований шлях навчання для науковців даних та інженерів ML
- 1-йНабір словників з науки даних та ML
Збудуйте свій основний словник для концепцій ML, статистичних методів і інструментів науки про дані.
- 2-йВправи з мови ML
Практикуйте використання словника ML у контексті — описи експериментів, порівняння моделей і навчання комунікації конвеєра.
- 3-йМова моделювання моделей
Мова точного відновлення, звіти про еталони, шаблон «ця модель досягає X на еталоні Y» і словник для дослідження абляції.
- 4-йВправи з мови Numbers & Data
Представлення статистики, відсотків, довірчих інтервалів і порівняльних даних чітко і точно.
- П'ятьВправи з візуалізації даних
Описування діаграм, розповідь про розуміння і керування аудиторією через презентації, засновані на даних.
- 6-йТехнологія ділового спілкування
Переклад технічних результатів ML на бізнес-мову для менеджерів продуктів і керівників.
- СімВправи з інженерної мови даних
Сховища функцій, конвеєри даних, контракти даних і операційний словник інфраструктури ML.
- 8-йВправи з англійської мови
Ефективне читання статей з машинного навчання, розуміння структури академічних статей і синтезування результатів досліджень для вашої команди.
- Дев'ятьІнтерв'ю з М. І. Леніним
Практика для науки даних і інтерв'ю з інженерією ML — обговорення оцінки моделі, проектування експериментів і проектування систем ML.
Також досліджувати
Набори вправ для науковців даних та інженерів ML
Вправляйтеся у словниковому запасі і моделях спілкування, які описано у цьому підручнику, за допомогою таких груп вправ:
Вправи на словниковий запас
- Data Science & ML Vocabulary — оцінка моделі, інженерія функцій, проектування експериментів
- Applied AI & LLMs Vocabulary — концепції LLM, RAG, швидка інженерія, тонка налаштування
- AI Safety & Alignment Vocabulary — відповідальна термінологія штучного інтелекту для технічних та політичних дискусій
Підготовка та проведення інтерв'ю
- IT Колокаційні вправи — природні фрази для презентації результатів і обговорення продуктивності моделі
- Технічні вправи інтерв'ю — метод STAR, поведінкові питання, технічне пояснення
- AI & ML Interview Questions — підготовка інтерв'ю для конкретних ролей
Часті запитання
У чому різниця між « інженерією можливостей » і « вибором можливостей » у цьому посібнику?
« Інженерія властивостей » включає створення нових властивостей з існуючих, наприклад, поєднання стовпчиків або застосування перетворень (наприклад, логічне масштабування) для поліпшення продуктивності моделі. « Вибір властивостей », навпаки, зосереджено на виборі підмножин * оригінальних * властивостей, які найбільш відповідають задачі прогнозування — це стосується зменшення розмірності і шуму.
Я бачу такі терміни, як «надмірне» і «недостатнє». Як я можу їх визначити в моїй моделі?
« Передозування » означає, що ваша модель занадто добре вивчає дані тренування, включаючи їх шум, що призводить до поганої продуктивності у випадку невидимих даних. « Недозування » означає, що ваша модель занадто проста і не вміє визначати основні шаблони; вона погано працює як у тренуванні, так і у тестуванні. Ви можете візуально оцінити це за допомогою кривих навчання — великий проміжок між тренуванням і втратою перевірки свідчить про проблеми.
Що саме означає «градієнтне спускання» і чому воно так важливо при тренуванні нейронних мереж?
« Градієнтний спад » є ітеративним алгоритмом оптимізації, який мінімізує функцію помилки моделі шляхом повторюваного регулювання параметрів у напрямку, протилежному градієнту (нахилу) — по суті рухаючись до найнижчої точки. Цей процес є ключовим для навчання нейронних мереж, оскільки вони мають багато регульованих ваг, а градієнтний спад дозволяє нам ефективно знаходити оптимальні значення.
Чи можете ви пояснити «функцію втрат» і її роль у тренуванні моделей?
«Функція втрат», також відома як функція вартості або об'єктивна функція, кількісно виражає різницю між прогнозами моделі і фактичними цільовими значеннями. Метою тренування є мінімізація цієї втрати - алгоритми, такі як градієнтне спуску використовують його для керування оновлення параметрів і поліпшення точності прогнозування.
Що таке «перехресна перевірка» і чому мені потрібно використовувати її при оцінці моїх моделей?
« Перехресна перевірка » передбачає розділення ваших даних на декілька складок, навчання моделі на підмножині складок, а потім перевірку її ефективності на решті складок. Це забезпечує більш надійну оцінку того, наскільки добре модель узагальнює невидимі дані, ніж просто використовуючи один потяг / тестовий розділ.
Що таке «регуляризація» в машинному навчанні, і що таке L1 і L2 регуляризація?
Методи «регуляризації», такі як L1 (Lasso) і L2 (Ridge) додають штрафи до функції втрат моделі на основі величини її ваги. Це заважає надто складним моделям, які можуть перебільшувати, сприяючи простішим рішенням з кращими можливостями узагальнення - L1 заохочує розрідженість.
Що таке «незбалансовані дані» і як це впливає на точність моєї моделі?
« Незбалансовані дані » виникають, коли один клас має значно більше вибірок, ніж інші. Це може зумовити упередження моделей до класу більшості, що призводить до поганої продуктивності на меншості (і часто більш важливому) класі; потрібні такі методи, як перевибірка або використання навчання, чутливого до витрат.
Пояснити «точність» і «пригадування» в контексті класифікаційних моделей.
« Точність » вимірює частку позитивних прогнозів, які були насправді правильними, а « Відкликання » вимірює частку справжніх позитивних прогнозів, які було правильно визначено. Модель високої точності мінімізує хибні позитивні результати, тоді як модель високого відновлення мінімізує хибні негативні результати - вибір між ними залежить від конкретного застосування.
Що таке «дрейф» в моделях машинного навчання і чому я повинен його контролювати?
« Дрейф » стосується змін статистичних властивостей ваших вхідних даних з плином часу, які можуть погіршити швидкодію моделі. Спостереження за дрейфом дозволяє виявити ці зміни і перенавчити модель за допомогою оновлених даних, щоб зберегти точність — це особливо важливо для розгорнутих моделей.
Що таке «гіперпараметрична настройка» і чим вона відрізняється від тренування моделі?
«Налаштування гіперпараметрів» включає в себе пошук оптимальних значень параметрів, які контролюють сам процес навчання (наприклад, швидкість навчання, кількість шарів в нейронній мережі), а не параметрів, які вивчаються * під час * тренування. Це зазвичай робиться за допомогою таких методів, як пошук за ґраткою або випадковий пошук.