Пояснення міжанотатної угоди нестатистичним зацікавленим сторонам

Як пояснити співвідношення між анотаторами, бали kappa і якість анотації менеджерам продуктів і учасникам бізнесу, які не мають досвіду роботи зі статистикою.

Розташований на південному заході Ісландії

Міжанотатарна угода (IAA) є одним з найважливіших сигналів якості в контрольованому машинному навчанні - і одним з найважливіших для комунікації з нетехнічними зацікавленими сторонами. Коли ви кажете “наша каппа Коена 0,67”, менеджер продукту чує числа без контексту. Коли ви кажете *“наші анотатори погоджуються 67% часу”, * вони недооцінюють якість, тому що 67% звучить низько.

Насправді число не є нічим з цих речей. Kappa вимірює згоду поза випадковістю, і повідомлення про це розрізнення є тим, про що йдеться в цьому посібнику.


What IAA Actually Measures (англійською)

Коли декілька анотаторов незалежно міткує ті ж дані, вони погодяться з деякими елементами просто випадково — навіть якщо вони вгадують випадково. Каппа Коена корректує цю випадкову угоду.

Аналогія, яка найкраще підходить для більшості нетехнічних аудиторій:

  • “Якщо дві людини кинуть монетку, щоб вирішити, чи позначити щось ПОСІТИВНО чи НЕГАТИВНО, вони погодяться в половині випадків випадково. Каппа Коена запитує: наскільки краще, ніж кидання монет, наші анотатори? Каппа 0,7 означає, що наші анотатори погоджуються по суті — не тому, що вони вгадують так само, але тому, що вони справді навчилися тому ж завданню. “*

Інтерпретація Kappa Score

Kappa rangeInterpretation
< 0.20Slight agreement
0.21 – 0.40Fair agreement
0.41 – 0.60Moderate agreement
0.61 – 0.80Substantial agreement
0.81 – 1.00Near-perfect agreement

Ці діапазони (від Landis і Koch, 1977) є стандартними посиланнями. При представленні категорії kappa, завжди контекстуалізуйте її в рамках цієї шкали: * “Наша kappa 0,71 входить в значний діапазон погоди, який є сильним для суб’єктивного завдання, такого як аналіз настроїв.” *


Неправильні погляди і як їх виправити

67 % голосів було віддано за «Слугу народу»

** Що думають зацікавлені сторони: ** Більшість рішень потребують консенсусу вище 67%.

** Що сказати: ** * “Рівень погодження не є правильним числом, на якому варто зосередитися. Наші анотатори погоджуються 87% часу — але деякі з них просто випадкові, тому що багато елементів очевидно є однією міткою. Каппа 0,71 говорить нам, наскільки ця угода є справжньою і виходить за межі випадкового випадку. У промисловості, 0,7 вважається сильним для суб’єктивних завдань.”*

Чи не можемо ми просто вибрати найпопулярніший лейбл?»

** Що думають зацікавлені сторони:** Голосування більшості усуває розбіжності.

** Що слід сказати: ** * « Голосування більшістю дає нам мітку, але не говорить нам, чи добре визначено завдання. Якщо анотатори не погоджуються на 30%, у нас є проблема з нашими правилами або дизайном завдання — прийняття більшості голосів просто приховує проблему, не вирішуючи її. Низька категорія kappa є сигналом для виправлення визначення завдання, а не для голосування.”*

«Наша модель потребує 95% + точності, тому 70% погодження анотаторів занадто низьке»

** Що думають зацікавлені сторони: ** Точність моделі вимагає більшої людської згоди.

** Що слід сказати: ** * “Модель вивчає з позначок * консенсусу , а не з кожного окремого анотатора. Індивідуальна каппа відображає складність завдання і якість керівництва. Kappa 0,7 на суб’єктивне завдання, як правило, виробляє високоякісні тренувальні дані, коли використовуються консенсусні позначки. 95% ціль точності для моделі є окремим питанням про набір даних оцінки. “


Що робити, якщо вага не підходить?

Якщо ви повідомляєте про категорію kappa нижче 0, 6, зацікавлені сторони можуть зробити висновок, що дані непридатні до використання або що автори анотацій некомпетентні. Ніщо з цього не є обов’язково правдою.

** Конструктивна рамка: **

  • “Наша kappa 0. 48 вказує на те, що анотатори застосовують рекомендації непослідовно до значної підмножини елементів. Це сигнал для покращення наших рекомендацій, а не наших анотацій. Ми визначили три категорії позначок, де найбільше незгодні, і ми проводимо цільовий перегляд і рекалібрування цього тижня. ”*

Ключевые моменты для передачи:

  • Низька IAA є проблемою проектування завдання, а не помилкою анотаторів
  • Це діагностується — ви знаєте які категорії є проблематичними
  • Це можна виправити - перегляд рекомендацій + рекалібрування, як правило, значно збільшує каппу
  • Низька IAA виявлена * до * тренування є цінною; було б набагато гірше виявити її через помилку моделі

Недоліки: Нетехнічні пояснення

    • “Уявіть каппу як вимірювання того, наскільки добре наші анотатори читають з того ж самого збірника правил. Каппа 0,75 означає, що вони читають з того ж самого правила; каппа 0,4 означає, що вони занадто багато імпровізують. ”*
    • “Наша загальна ступінь погодження становить 83%, але на простому завданні з двома класами випадковий випадок дасть нам 50% погодження. Каппа коригує це, тому наша каппа 0,66 є більш значущим числом.”*
    • “Ми з задоволенням продовжуємо тренування моделей з каппою 0,72 - це в межах діапазону, який рецензовані статті з ML повідомляють як прийнятний для завдань цього типу.” *
  1. “Спад kappa з 0.78 до 0.61 після додавання нової категорії позначок говорить нам, що анотатори ще не впевнені, коли використовувати її — нам потрібно ще два або три працюючих приклади в рекомендаціях.”
    • “Каппа 1. 0 означає, що наші анотатори завжди погоджуються, що звучить ідеально, але також може вказувати на те, що завдання є тривіально простим і не захоплює нюанс, який нам потрібен для корисної моделі.” *

Вибір правильних статистичних даних

Різні статистичні дані IAA підходять для різних типів завдань.

Task typeRecommended statistic
Two annotators, two labelsCohen’s kappa
Multiple annotators, two labelsFleiss’ kappa
Multiple annotators, ordinal ratingsWeighted kappa or Intraclass Correlation (ICC)
Span-level annotation (NER, etc.)F1-based IAA or span-level kappa

Під час презентації зацікавленим особам, вам рідко потрібно пояснювати * яку * статистику ви використовували, якщо вони не запитують. Що має значення, так це інтерпретація: “Наша сума погодження є X, яка вважається Y згідно зі стандартними еталонами.”

Наприклад, описати категорію «невідомі» можна за допомогою категорії «невідомі»

Міжанотатарна угода — часто представлена каппа-оцінками — може відчуватися як непроникний жаргон, коли пояснює її людям поза наукою про дані або статистикою. Ключовим є перенесення акценту з технічних деталей на вплив і забезпечення якості. Замість того, щоб занурюватися у формули, поясніть, що ви по суті вимірюєте, наскільки послідовно різні люди позначають одну і ту ж річ. Подумайте про це як про команду перекладачів — якщо всі вони погоджуються щодо значення слова, ви можете бути впевнені у перекладі. Аналогічно, висока взаємозгодність між анотаторами означає, що ваші дані є надійними. Почніть з визнання їх потенційної плутанини – «Я знаю, що статистика може здатися складною», – а потім розгляньте каппу як простий показник для оцінки якості. Використовуйте аналогії, які відповідають їхнім потребам; можливо, порівняйте їх з послідовним керівництвом зі стилю для написання або з чіткими стандартами кодування. Найважливіше, завжди зв’язуйте обговорення з * чому * ця угода має значення - щоб забезпечити точність у вашому аналізі даних, поліпшити тренувальні набори даних або зменшити неоднозначність у процесі розробки продукту.

Розглянемо реалістичний сценарій: ви працюєте з командою анотаторов, які позначають відгуки клієнтів для аналізу настроїв. Ви обчислили категорію Каппа 0,85. Замість того, щоб сказати: «Каппа є мірою згоди між анотатором, і вона коливається від 0 до 1, причому 1 є ідеальною згодою», спробуйте щось на зразок: «Ми оцінили, наскільки послідовно наша команда ідентифікує позитивний, негативний або нейтральний відгук в відгуках клієнтів. Рейтинг Kappa 0,85 показує, що є дуже високий рівень згоди — майже всі класифікують ті ж самі відгуки в той же спосіб. Це означає, що ми можемо бути впевнені, що наша модель аналізу настроїв точно відображатиме думки клієнтів.” Обрамляйте це як довіра і надійність.

Крім того, передбачити питання про те, що є «добрим» kappa. Не просто вкажіть число, а поясніть його контекст. Оцінка 0,8 або вище зазвичай вважається «значною погодою», що вказує на хороший рівень надійності. Поясніть, що цей рівень погодження мінімізує ризик упередження, введеного декількома анотатором, і зміцнює основу для прийняття рішень на основі даних. Ви навіть можете візуально представити це - простий графік, що показує діапазон балів Kappa (наприклад, від 0 до 1) з чітко позначеним «значимим», разом з прикладами того, що цей рівень згоди * означає * в матеріальних термінах, наприклад, «Це означає, що ми можемо довіряти нашим уявленням про задоволення клієнтів»

Нарешті, при обговоренні потенційних областей для поліпшення - можливо, нижчий бал Kappa на певному підмножини даних - підходити до цього як до можливості вдосконалити рекомендації щодо анотації, а не підкреслювати помилку. Наприклад, «Ми шукаємо способи подальшого поліпшення послідовності та забезпечення ще більшої точності в цій області». Використання чіткої, нетехнічної мови є ключовим у всій розмові.

Поширені запитання

Про що ця стаття "Пояснення міжанотатної угоди нестатистичним зацікавленим сторонам"?

Як пояснити співвідношення між анотаторами, бали kappa і якість анотації менеджерам продуктів і учасникам бізнесу, які не мають досвіду роботи зі статистикою.

Чи безкоштовна ця стаття?

Так. Усі статті на CoderSlingo, включно з цією, доступні безкоштовно без реєстрації.

Скільки часу займає читання "Пояснення міжанотатної угоди нестатистичним зацікавленим сторонам"?

Приблизно 7 min.