RLHF and Annotation Quality: English for Human Feedback Pipelines (англійською)

Вивчає англійську лексику для конвеєрів RLHF — угоду між анотаторами, бали Kappa, сеанси калібрування, пари уподобань і контроль якості для людського зворотного зв’ язку.

RLHF: де машинне навчання зустрічає людський суд

Підсилення навчання від людського зворотного зв’язку (RLHF) є тренувальною технікою, що використовується для вирівнювання великих мовних моделей з людськими перевагами. Це забезпечує якість розмов сучасних асистентів штучного інтелекту. За кожною вирівняною моделлю стоїть велика операція анотації — команди людських анотаторів, які надають сигнали переваг, з яких модель навчається. Якщо ви працюєте у галузі інженерії штучного інтелекту, науки про дані або операцій, ви знайдете певний словник для обговорення якості анотації. Цей підручник містить основні терміни.

Що таке RLHF?

У RLHF, люди порівнюють пари виходів моделі і вказують, який з них краще відповідно до визначених критеріїв. Ці ** пари переваг ** вводяться в модель винагороди, яка потім використовується для вдосконалення мовної моделі за допомогою навчання підкріплення.

** Пара переваг ** — набір двох (або більше) відповідей, створених за допомогою моделі, на одне і те ж запитання, які позначено анотаційним символом, щоб вказати, який з них є перевагою. « Кожен анотаційний символ переглядає 30 пар переваг за годину на рівні якості, який було визначено. »

** Модель винагороди ** — модель, яку було навчено на основі анотованих пар переваг для передбачення того, які виводи людина віддає перевагу. « Модель винагороди є мостом між людськими мітками і сигналом навчання підкріплення »

Аннотаційний словник якості

Міжнародна асоціація анотаторів (IAA)

** Договорення між анотаторами ** вимірює ступінь, у якому різні анотатори надають одну і ту ж мітку одному і тому ж елементу. Висока оцінка IAA вказує на те, що правила анотації є ясними, а завдання добре визначено. Низька IAA свідчить про неоднозначність в завдання, погано навчених анотаторів або справді суб’єктивні області судження.

IAA виражається як метрика. Найбільш поширеним для категорійних задач є ** каппа Коена (κ) **:

  • κ > 0,80 — майже ідеальна збіг
  • κ 0.61–0.80 — суттєва збіг
  • κ 0.41–0.60 — помірна погода
  • κ нижче 0,40 — погана збіжність, що вказує на проблему

Наш IAA на класифікації безпеки впав до κ = 0,52 після додавання трьох нових анотаторов, що викликало негайну сеанс калібрування

Calibration

** Калібрування ** — це процес вирівнювання розуміння анотаторами завдання і рекомендацій. Сеанси калібрування включають анотаційні мітки того ж набору прикладів, а потім обговорення розбіжностей для досягнення спільної інтерпретації.

«Ми запускаємо сеанс калібрування на початку кожного нового завдання і після будь-якого оновлення до рекомендацій щодо анотації»

** Золотий набір ** — набір прикладів з відомими, перевіреними правильними мітками, який використовується для вимірювання точності анотації. « Щоденна робота кожного анотатора включає 10% елементів золотого набору, що дозволяє безперервно стежити за якістю »

Анотація Утомлення і побічні ефекти

** Втомлення анотаторів ** — зниження якості анотації, яке відбувається, коли анотатори працюють протягом тривалого часу без перерви. Це проявляється як збільшення кількості помилок і зменшення IAA.

** Позиційне відхилення ** — тенденція до того, що анотатори надають перевагу першому варіанту у парі параметрів, незалежно від якості. « Ми випадково визначаємо порядок відповідей у кожній парі параметрів, щоб зменшити відхилення від позиції. »

** Упередження, що слідує за інструкціями ** — тенденція надавати перевагу відповідям, які, здається, слідують інструкціям, навіть якщо вони містять фактичні помилки.

Розглядають проблеми якості з командами анотації

Ясне, уважне спілкування щодо проблем якості є важливим у операціях з анотаціями. Ось деякі корисні фрази:

** Визначення проблеми: **

  • «Наші дані IAA для цього завдання показують систематичну незгоду на [країнний тип випадку]»
  • «Точність золотих наборів для цієї когорти анотаторов впала нижче нашого порогу в 85 %»
  • «Ми бачимо непослідовне застосування рекомендацій щодо безпеки в аспекті безпеки»

** Пропонується виправлення: **

  • “Я б рекомендував цілеспрямовану сеанс калібрування, зосереджену конкретно на [неоднозначна категорія].”
  • «Ми повинні переглянути рекомендації, щоб включити три додаткових приклади роботи для цього краю випадку.»
  • «Давайте переглянемо найскладніші 20 пунктів як група перед початком наступної партії анотації»

** Відстеження покращень: **

  • Після оновлення калібрування, IAA на цей вимір поліпшився з κ = 0,54 до κ = 0,71
  • «Золота точність набору повертається вище порогу для всіх анотаторов після тренування по відновленню»

П’ять прикладів висловлювань

  1. «Міжанотатарна угода про оцінки корисності є сильною при κ = 0,78, але угода про фактичну точність була непослідовною, що вказує на те, що рекомендація потребує пояснення»
  2. «Ми випадково переплітаємо елементи золотого набору в черзі кожного анотатора, щоб вони не могли визначити, які елементи використовуються для моніторингу якості»
  3. «Після сеансу калібрування команда досягла консенсусу щодо того, як поводитися з парами переваг, де обидві відповіді містять незначні фактичні помилки»
  4. «Позиційна упередженість була підтверджена в наших даних: анотатори обирали першу відповідь 62% часу в збалансованій вибірці, набагато вище очікуваних 50%»
  5. «Виконання моделі винагороди на запитаннях поза розподілом сильно корелювало з якістю анотації набору даних пар преференцій, використовуваних для тренування»

Практичні рекомендації з написання статей

Рекомендації щодо анотації є технічними документами, написаними англійською мовою, які анотатори з різних сфер діяльності повинні розуміти і застосовувати послідовно. Ясні, конкретні рекомендації — з багатьма працюючими прикладами — виробляють вищі IAA, ніж абстрактні описи якостях вимірів. Під час написання рекомендацій англійською використовуйте активний голос, короткі речення і конкретні приклади. Уникайте таких кваліфікаторів, як « зазвичай » або « зазвичай », без пояснення винятків.

Розробка рішень: ефективне управління проектами в ERP-системі

Ядро Reinforcement Learning from Human Feedback (RLHF) полягає в зборі високоякісних даних - зокрема, людських переваг. Але перетворення цієї інтуїції в дії вимагає точної та спільної мови. Для не рідних англомовних людей, які працюють на цих складних трубопроводах, оволодіння конкретною термінологією може здатися пригнічуючим. Це не просто про знання визначення; це про розуміння * як * використовувати цей словник в потоці професійного середовища, особливо при обговоренні нюансів з колегами. Розглянемо деякі практичні сценарії.

Уявіть, що ви переглядаєте запит на витягування, який пропонує зміни до функції винагороди моделі, заснованої на даних про людські переваги. Коментар від одного з ваших колег може бути таким: « Оцінка kappa для цієї ітерації значно нижча за цільову. Нам потрібно дослідити, чи анотатори постійно не погоджуються щодо відносної якості цих відповідей, або чи є систематична упередженість. Це не просто технічне спостереження; це запит на глибше розуміння і потенційне дослідження міжанотаторовської згоди. Зрозуміти, що «каппа бал» представляє собою міру послідовності між оцінювачами, є ключовим. Аналогічно, повідомлення Slack, що обговорює «калібрувальну сесію» - де анотаторам представлена ​​серія пар переваг для уточнення їх суджень - вимагає розуміння мети: зменшити неоднозначність і встановити ясніші критерії для оцінки вихідних даних моделі. Це про перехід від простого зауваження, що щось “не виглядає правильно” і вираження * чому * це не так, посилаючись на конкретні показники, такі як kappa або обговорюючи процес уточнення переваг через цілеві сеанси. Крім того, обговорення навколо «пар переваг» - фундаментальної одиниці даних в RLHF - вимагають чіткого розуміння того, як ці пари побудовані і аналізуються для тренування моделі винагороди.

Поширеною проблемою є нерозуміння ітераційної природи RLHF. Це не просто збір більше даних про переваги; це стратегічне вдосконалення процесу на основі спостережених розбіжностей. Хороший опис PR може початися так: «Ця ітерація зосереджена на поліпшенні калібрування за допомогою серії цільових пар переваг, розроблених для вирішення невідповідностей, виявлених в попередньому раунді аналізу балів Kappa». Це демонструє розуміння петлі зворотнього зв’язку і підкреслює конкретну дію, що здійснюється - використання пар переваг - керованих знаннями, заснованими на даних. Акцент робиться на поєднанні дій з їхньою основою, що є ключовим для ефективного спілкування в команді.

# Example: Filtering preference pairs based on inter-annotator agreement using Label Studio's API (Illustrative)
# This assumes a simplified Label Studio API interaction for demonstration purposes.
label_studio api get_pairs --filter "kappa > 0.7"

Ця команда, хоча і спрощена, представляє собі такий вид маніпулювання даними і фільтрування, який можна обговорити в контексті RLHF — за допомогою спеціального інструменту (Label Studio) для визначення пар, де анотатори в основному погоджуються, пропонуючи дані вищої якості для тренування. Вміння впевнено сформулювати цей процес є надзвичайно важливим.

Поширені запитання

Про що ця стаття "RLHF and Annotation Quality: English for Human Feedback Pipelines (англійською)"?

Вивчає англійську лексику для конвеєрів RLHF — угоду між анотаторами, бали Kappa, сеанси калібрування, пари уподобань і контроль якості для людського зворотного зв’ язку.

Чи безкоштовна ця стаття?

Так. Усі статті на CoderSlingo, включно з цією, доступні безкоштовно без реєстрації.

Скільки часу займає читання "RLHF and Annotation Quality: English for Human Feedback Pipelines (англійською)"?

Приблизно 8 min.