Writing ML Model Cards in English: Structure, Vocabulary, and Examples
Дізнайтеся, як написати професійні картки моделей машинного навчання англійською мовою — з урахуванням призначення, показників продуктивності, обмежень, етичних міркувань і необхідних вам слів.
Карта моделі — це короткий документ, який супроводжує модель машинного навчання, щоб повідомити, що вона робить, як вона працює і які її обмеження. Спочатку запропоновані Google в 2018 році, моделі карт стали стандартним способом документування моделей ML як для внутрішніх команд, так і для публічних релізів. Написання хорошої моделі карти англійською мовою вимагає розуміння як структури, так і словникового запасу відповідального спілкування ШІ.
У ньому міститься карта
Повна картка моделі, зазвичай, містить такі розділи:
| Section | Contents |
|---|---|
| Model overview | Brief description of the model, its type, and its purpose |
| Intended use | The tasks and contexts the model is designed for |
| Out-of-scope use | Tasks or contexts the model is NOT designed for |
| Training data | A description of the data used to train the model |
| Evaluation data | The datasets used to measure model performance |
| Performance | Quantitative results broken down by relevant subgroups |
| Limitations | Known weaknesses, failure modes, and edge cases |
| Ethical considerations | Potential harms, bias findings, and mitigation measures |
| Caveats and recommendations | Additional guidance for users |
Запис розділу « Зазначене використання »
Розділ « Зазначене використання » говорить користувачам, для чого призначена модель. Будь конкретним — нечіткі заявки на використання закликають до зловживання.
Шаблон:**
- “Ця модель розроблена для [основного завдання] з використанням [типу вводу] як вводу. Він призначений для використання [цільовими користувачами] в [контексті].”*
** Приклад: **
- “Ця модель розроблена для класифікації квитків на підтримку клієнтів за однією з 12 категорій пріоритету. Він призначений для використання командами підтримки операцій в робочому потоці «людина-в-пікелі», де людський агент переглядає і підтверджує класифікацію, перш ніж вона буде діяти». *
Запис розділу з обмеженнями
Розділ з обмеженнями є однією з найважливіших частин моделі карти — і часто найбільш забутим. Хороші розділи з обмеженнями є конкретними і чесними.
** Ключовий словник: **
| Term | Meaning |
|---|---|
| Bias | Systematic errors in model behaviour that unfairly affect certain groups |
| Fairness | The degree to which a model performs equitably across different demographic groups |
| Evaluation metric | A quantitative measure of model performance |
| Training data distribution | The statistical properties of the data used to train the model |
| Out-of-distribution | Inputs that differ significantly from the training data distribution |
| Subgroup performance | Model performance measured separately for different demographic or categorical groups |
| Calibration | The alignment between a model’s predicted probabilities and actual outcomes |
** Обмеження мовних шаблонів: **
- “Ця модель працює значно гірше на вхідних даних від носіїв з не-рідним англійським акцентом, що відображається в 15-бальному падінні точності в оцінці підгрупи.”
- “Модель була тренована на даних з 2019–2022 і може не точно відображати поточні мовні шаблони або культурні посилання.”
-
- “Розробка зображень, зроблених у умовах слабкого освітлення, не була оцінена і повинна розглядатися як поза межами початкового випуску.” *
-
- “Модель не була оцінена для використання поза текстом англійською мовою. Застосування його до інших мов не підтримується і може привести до ненадійних результатів. *
Розділ «Етичні питання»
Цей розділ присвячений потенційним шкодам і тому, що було зроблено для їх зменшення.
** Структура: **
- Определить потенциальную вредность
- Опишете докази або оцінку, що її визначили
- Заявіть про зменшення на місці
- Зауважте будь-який залишковий ризик
** Приклад: **
- “Модель може підсилити соціально-економічні упередження, присутні в тренувальних даних. Внутрішній аудит виявив, що модель присвоїла нижчі бали кредитоспроможності заявникам з певних областей поштових індексів, що корелювали з нижчими середніми доходами. Щоб зменшити це, поштовий індекс був видалений як функція і замінений більш деталізованими економічними показниками. Залишкове географічне упередження на більш локальному рівні не було повністю оцінено.»*
Виконавчий комітет ВО «Свобода»
Під час повідомлення про швидкодію завжди вказуйте:
- ** Метрика ** (точність, F1, AUC тощо)
- ** Набір даних **, на якому він був виміряний
- ** Умови ** (дата, фрагмент даних тощо)
** Приклад: ** “Загальна точність тестового набору становить 91,3% (оцінена на 10 000 виключених прикладах з набору даних оцінки 2023 року). Аналіз підгрупи за різноманітністю мов виявив точність 93,1% на американській англійській та 87,4% на індійській англійській.»
Словник виконавців:
-
- « оцінка з розбивкою » * — показники роботи з розбивкою на підгрупи
-
- « виключений набір тестів » * — дані, які не використовувалися під час тренування або перевірки
-
- « довірчий інтервал » * — діапазон можливих значень для метрики
-
- « статистична значущість » * — чи є різниця у продуктивності реальною, чи це випадковість
Приклади висловлювань
- «Ця модель призначена для використання як помічник у складанні проектів для юристів — всі виходи повинні бути переглянуті кваліфікованим юристом перед використанням в будь-якому юридичному контексті»
- Оцінка підгрупи виявила 12-бальною різницю в результатах F1 між чоловічими і жіночими кодованими іменами в наборі даних перевірки резюме; цей висновок був ескалаційний до відповідальної ради перегляду штучного інтелекту
- «Тренувальні дані моделі не включають приклади після березня 2023 року; запити про недавні події дадуть ненадійні або галюцинативні відповіді»
- «Використання поза сферою застосування включає будь-яке застосування в контексті медичної діагностики — модель не була перевірена для клінічного використання і не відповідає вимогам медичного пристрою»
- «Картка моделі документує всі відомі обмеження прозоро, щоб нижчі користувачі могли приймати обґрунтовані рішення про те, чи відповідає ця модель їх конкретному випадку використання»
Національні мови: мова не має офіційного статусу
Написання ефективних карт моделей - це більше, ніж просто перелік технічних деталей; це важливий інструмент комунікації. Для розробників, чия перша мова не є англійською — і це стосується всіх розробників, незалежно від рідної мови — тонкощі професійного фразування можуть бути особливо викликом. Метою тут є не просто переклад; це передавати значення точно і впевнено в рамках встановлених рамок. Поширена пастка - це прямий переклад буквальних термінів без урахування того, як вони зазвичай розуміються в технічному контексті. Наприклад, спроба перекласти «надійність» буквально може призвести до фрази, яка не резонує з рецензентом, який очікує чіткого пояснення стійкості до варіацій у вхідних даних.
Розглянемо такий сценарій: ви щойно надіслали запит на захоплення нової моделі карти. Під час перегляду коду, Сара, колега з іншої команди, залишає цей коментар: «Чи можете ви розібратися в «оцінці довіри»? Неясно, як це пов’язано з фактичними показниками продуктивності. “Це не обов’язково критика; це запрошення до пояснення. Нерідний мовець може відразу відчувати себе в обороні або боротися, щоб сформулювати нюанси обчислення рейтингу довіри - можливо, пояснювати це включає в себе баєсову мережу і методи калібрування. Замість цього, більш доступною відповіддю було б: «Звичайно! Довірчий бал представляє впевненість моделі в її прогнозі за вхідними даними. Ми калібрували цю метрику проти [згадайте конкретний набір даних перевірки], щоб переконатися, що він відповідає повідомленій точності 85% на порозі верхньої частини 1. ” Це пояснення використовує простішу мову, надає контекст і посилається на реальний еталон, вилучаючи неоднозначність.
Інша поширена ситуація виникає під час описів PR. Уявіть, що ви документуєте призначення моделі: « Ця модель розроблена для аналізу настроїв клієнтів щодо квитків на підтримку ». Нерідко людина, яка не є рідною мовою, може просто вказати цей факт без подальших пояснень. Однак, сильніший опис додасть важливий контекст: “Ця модель розроблена для * автоматизованого * аналізу настроїв квитків на підтримку клієнтів, особливо ідентифікуючи негативний відгук, пов’язаний з дефектами продукту і затримками обслуговування. Ми зосередилися на поліпшенні точності в межах сфери взаємодії технічної підтримки, визнаючи, що продуктивність може відрізнятися в інших контекстах. “Додаток деталей прояснює обсяг, визнав обмеження проактивно, і демонструє продуманий підхід до розгортання моделі - життєво важливий для будівництва довіри з зацікавленими сторонами.
Нарешті, пам’ ятайте, що прохання про відгук * завжди * заохочується. Якщо ви не впевнені, як щось звучить, або якщо фраза не звучить правильно, не вагайтеся запитати колегу про їхню думку. Просте запитання, наприклад, « Чи ця фраза чітко передає бажане значення? » може бути безцінним у вдосконаленні вашого спілкування і забезпеченні того, щоб усі ефективно розуміли вашу роботу. Не бійтеся просити про допомогу - це ознака активного навчання і співпраці, необхідних якостей для будь-якого успішного розробника.