Пояснення міжанотатної угоди нестатистичним зацікавленим сторонам
Як пояснити співвідношення між анотаторами, бали kappa і якість анотації менеджерам продуктів і учасникам бізнесу, які не мають досвіду роботи зі статистикою.
Розташований на південному заході Ісландії
Міжанотатарна угода (IAA) є одним з найважливіших сигналів якості в контрольованому машинному навчанні - і одним з найважливіших для комунікації з нетехнічними зацікавленими сторонами. Коли ви кажете “наша каппа Коена 0,67”, менеджер продукту чує числа без контексту. Коли ви кажете *“наші анотатори погоджуються 67% часу”, * вони недооцінюють якість, тому що 67% звучить низько.
Насправді число не є нічим з цих речей. Kappa вимірює згоду поза випадковістю, і повідомлення про це розрізнення є тим, про що йдеться в цьому посібнику.
What IAA Actually Measures (англійською)
Коли декілька анотаторов незалежно міткує ті ж дані, вони погодяться з деякими елементами просто випадково — навіть якщо вони вгадують випадково. Каппа Коена корректує цю випадкову угоду.
Аналогія, яка найкраще підходить для більшості нетехнічних аудиторій:
- “Якщо дві людини кинуть монетку, щоб вирішити, чи позначити щось ПОСІТИВНО чи НЕГАТИВНО, вони погодяться в половині випадків випадково. Каппа Коена запитує: наскільки краще, ніж кидання монет, наші анотатори? Каппа 0,7 означає, що наші анотатори погоджуються по суті — не тому, що вони вгадують так само, але тому, що вони справді навчилися тому ж завданню. “*
Інтерпретація Kappa Score
| Kappa range | Interpretation |
|---|---|
| < 0.20 | Slight agreement |
| 0.21 – 0.40 | Fair agreement |
| 0.41 – 0.60 | Moderate agreement |
| 0.61 – 0.80 | Substantial agreement |
| 0.81 – 1.00 | Near-perfect agreement |
Ці діапазони (від Landis і Koch, 1977) є стандартними посиланнями. При представленні категорії kappa, завжди контекстуалізуйте її в рамках цієї шкали: * “Наша kappa 0,71 входить в значний діапазон погоди, який є сильним для суб’єктивного завдання, такого як аналіз настроїв.” *
Неправильні погляди і як їх виправити
67 % голосів було віддано за «Слугу народу»
** Що думають зацікавлені сторони: ** Більшість рішень потребують консенсусу вище 67%.
** Що сказати: ** * “Рівень погодження не є правильним числом, на якому варто зосередитися. Наші анотатори погоджуються 87% часу — але деякі з них просто випадкові, тому що багато елементів очевидно є однією міткою. Каппа 0,71 говорить нам, наскільки ця угода є справжньою і виходить за межі випадкового випадку. У промисловості, 0,7 вважається сильним для суб’єктивних завдань.”*
Чи не можемо ми просто вибрати найпопулярніший лейбл?»
** Що думають зацікавлені сторони:** Голосування більшості усуває розбіжності.
** Що слід сказати: ** * « Голосування більшістю дає нам мітку, але не говорить нам, чи добре визначено завдання. Якщо анотатори не погоджуються на 30%, у нас є проблема з нашими правилами або дизайном завдання — прийняття більшості голосів просто приховує проблему, не вирішуючи її. Низька категорія kappa є сигналом для виправлення визначення завдання, а не для голосування.”*
«Наша модель потребує 95% + точності, тому 70% погодження анотаторів занадто низьке»
** Що думають зацікавлені сторони: ** Точність моделі вимагає більшої людської згоди.
** Що слід сказати: ** * “Модель вивчає з позначок * консенсусу , а не з кожного окремого анотатора. Індивідуальна каппа відображає складність завдання і якість керівництва. Kappa 0,7 на суб’єктивне завдання, як правило, виробляє високоякісні тренувальні дані, коли використовуються консенсусні позначки. 95% ціль точності для моделі є окремим питанням про набір даних оцінки. “
Що робити, якщо вага не підходить?
Якщо ви повідомляєте про категорію kappa нижче 0, 6, зацікавлені сторони можуть зробити висновок, що дані непридатні до використання або що автори анотацій некомпетентні. Ніщо з цього не є обов’язково правдою.
** Конструктивна рамка: **
- “Наша kappa 0. 48 вказує на те, що анотатори застосовують рекомендації непослідовно до значної підмножини елементів. Це сигнал для покращення наших рекомендацій, а не наших анотацій. Ми визначили три категорії позначок, де найбільше незгодні, і ми проводимо цільовий перегляд і рекалібрування цього тижня. ”*
Ключевые моменты для передачи:
- Низька IAA є проблемою проектування завдання, а не помилкою анотаторів
- Це діагностується — ви знаєте які категорії є проблематичними
- Це можна виправити - перегляд рекомендацій + рекалібрування, як правило, значно збільшує каппу
- Низька IAA виявлена * до * тренування є цінною; було б набагато гірше виявити її через помилку моделі
Недоліки: Нетехнічні пояснення
-
- “Уявіть каппу як вимірювання того, наскільки добре наші анотатори читають з того ж самого збірника правил. Каппа 0,75 означає, що вони читають з того ж самого правила; каппа 0,4 означає, що вони занадто багато імпровізують. ”*
-
- “Наша загальна ступінь погодження становить 83%, але на простому завданні з двома класами випадковий випадок дасть нам 50% погодження. Каппа коригує це, тому наша каппа 0,66 є більш значущим числом.”*
-
- “Ми з задоволенням продовжуємо тренування моделей з каппою 0,72 - це в межах діапазону, який рецензовані статті з ML повідомляють як прийнятний для завдань цього типу.” *
- “Спад kappa з 0.78 до 0.61 після додавання нової категорії позначок говорить нам, що анотатори ще не впевнені, коли використовувати її — нам потрібно ще два або три працюючих приклади в рекомендаціях.”
-
- “Каппа 1. 0 означає, що наші анотатори завжди погоджуються, що звучить ідеально, але також може вказувати на те, що завдання є тривіально простим і не захоплює нюанс, який нам потрібен для корисної моделі.” *
Вибір правильних статистичних даних
Різні статистичні дані IAA підходять для різних типів завдань.
| Task type | Recommended statistic |
|---|---|
| Two annotators, two labels | Cohen’s kappa |
| Multiple annotators, two labels | Fleiss’ kappa |
| Multiple annotators, ordinal ratings | Weighted kappa or Intraclass Correlation (ICC) |
| Span-level annotation (NER, etc.) | F1-based IAA or span-level kappa |
Під час презентації зацікавленим особам, вам рідко потрібно пояснювати * яку * статистику ви використовували, якщо вони не запитують. Що має значення, так це інтерпретація: “Наша сума погодження є X, яка вважається Y згідно зі стандартними еталонами.”
Наприклад, описати категорію «невідомі» можна за допомогою категорії «невідомі»
Міжанотатарна угода — часто представлена каппа-оцінками — може відчуватися як непроникний жаргон, коли пояснює її людям поза наукою про дані або статистикою. Ключовим є перенесення акценту з технічних деталей на вплив і забезпечення якості. Замість того, щоб занурюватися у формули, поясніть, що ви по суті вимірюєте, наскільки послідовно різні люди позначають одну і ту ж річ. Подумайте про це як про команду перекладачів — якщо всі вони погоджуються щодо значення слова, ви можете бути впевнені у перекладі. Аналогічно, висока взаємозгодність між анотаторами означає, що ваші дані є надійними. Почніть з визнання їх потенційної плутанини – «Я знаю, що статистика може здатися складною», – а потім розгляньте каппу як простий показник для оцінки якості. Використовуйте аналогії, які відповідають їхнім потребам; можливо, порівняйте їх з послідовним керівництвом зі стилю для написання або з чіткими стандартами кодування. Найважливіше, завжди зв’язуйте обговорення з * чому * ця угода має значення - щоб забезпечити точність у вашому аналізі даних, поліпшити тренувальні набори даних або зменшити неоднозначність у процесі розробки продукту.
Розглянемо реалістичний сценарій: ви працюєте з командою анотаторов, які позначають відгуки клієнтів для аналізу настроїв. Ви обчислили категорію Каппа 0,85. Замість того, щоб сказати: «Каппа є мірою згоди між анотатором, і вона коливається від 0 до 1, причому 1 є ідеальною згодою», спробуйте щось на зразок: «Ми оцінили, наскільки послідовно наша команда ідентифікує позитивний, негативний або нейтральний відгук в відгуках клієнтів. Рейтинг Kappa 0,85 показує, що є дуже високий рівень згоди — майже всі класифікують ті ж самі відгуки в той же спосіб. Це означає, що ми можемо бути впевнені, що наша модель аналізу настроїв точно відображатиме думки клієнтів.” Обрамляйте це як довіра і надійність.
Крім того, передбачити питання про те, що є «добрим» kappa. Не просто вкажіть число, а поясніть його контекст. Оцінка 0,8 або вище зазвичай вважається «значною погодою», що вказує на хороший рівень надійності. Поясніть, що цей рівень погодження мінімізує ризик упередження, введеного декількома анотатором, і зміцнює основу для прийняття рішень на основі даних. Ви навіть можете візуально представити це - простий графік, що показує діапазон балів Kappa (наприклад, від 0 до 1) з чітко позначеним «значимим», разом з прикладами того, що цей рівень згоди * означає * в матеріальних термінах, наприклад, «Це означає, що ми можемо довіряти нашим уявленням про задоволення клієнтів»
Нарешті, при обговоренні потенційних областей для поліпшення - можливо, нижчий бал Kappa на певному підмножини даних - підходити до цього як до можливості вдосконалити рекомендації щодо анотації, а не підкреслювати помилку. Наприклад, «Ми шукаємо способи подальшого поліпшення послідовності та забезпечення ще більшої точності в цій області». Використання чіткої, нетехнічної мови є ключовим у всій розмові.