Англійська мова для ML Model Evaluation Discussions

Вивчайте словниковий запас оцінки моделі машинного навчання: точність/ відновлення, AUC- ROC, BLEU/ ROUGE, LLM- як- суддя, RAGAS, частота галюцинацій, червона команда і насиченість еталонів.

Оцінка моделей машинного навчання — особливо великих мовних моделей — вимагає спеціалізованого словника. Коли ваша команда обговорює готовність моделі до виробництва, розмова стосується метрик, компромісів і систем оцінки, які мають певне значення. Зловживання цими термінами може призвести до плутанини або поганих рішень. Цей пост охоплює основні слова для обговорення оцінки ML, з особливою увагою до простору оцінки LLM.

Ключовий словник

** Точність і відновлення ** — дві фундаментальні метричні класифікації, які часто знаходяться у конфлікті. ** Точність ** — це частка позитивних прогнозів, які є насправді правильними. ** Відновлення ** — це частка фактичних позитивних прогнозів, які модель правильно визначає. Приклад: «Ми налаштували модель на користь більшого відновлення за рахунок точності, тому що пропуск випадку шахрайства гірше, ніж хибна тривога»

** Оцінка F1 ** — середнє гармонійне значення точності і відновлення. Корисно, якщо вам потрібне одне число, яке балансує обидва. Приклад: «Рейтинг F1 покращився з 0,78 до 0,85 після тонкої настройки на наборі даних, специфічних для домену»

AUC-ROC — Площа під кривою характеристик роботи приймача. Вимірює здатність класифікатора розрізняти класи за всіма можливими порогами. Оцінка 1, 0 є ідеальною; 0, 5 — випадковою. Приклад: «AUC-ROC 0,92 свідчить про те, що модель є сильним дискримінатором навіть до того, як ми налаштуємо поріг рішення»

** BLEU / ROUGE ** — Автоматизовані метричні дані для оцінки створення тексту. ** BLEU ** (піддослідження двомовної оцінки) вимірює перекриття n- грам між сформованим і посиланням текстом, зазвичай використовується для перекладу. ** ROUGE ** (піддослідження з орієнтацією на відтворення для оцінки перекладу) використовується для підсумування. Приклад: «Рейтинг BLEU покращився на 4 бали, але люди, які оцінюють, все ще віддають перевагу вихідним даним попередньої моделі»

** LLM- as- judge ** — Метод, за якого велика мова моделі використовується для оцінки вихідних даних іншої моделі (або самої моделі). Приклад: «Ми використовуємо GPT-4 як суддю для оцінювання відповідей нашої моделі на когерентність і фактичну точність в масштабі»

** RAGAS framework ** — Рамка для оцінки систем з покращеним пошуком. Він вимірює такі показники, як вірність, відповідність відповіді і контекстна точність. Приклад: «Наш бал вірності RAGAS впав після того, як ми змінили модель пошуку, що свідчить про те, що отримані відповіді є галюцинативними деталями, а не в пошуку контексту»

** Частота галюцинацій ** — Частка вихідних даних моделі, які містять фактично неправильну або сфабриковану інформацію. Приклад: «Рівень галюцинацій при медичних запитах становить 12%, що занадто високо для клінічного застосування»

** Точність заземлення ** — Ступінь, у якій вивід моделі підтримується джерельними документами, які вона отримала. Приклад: «Ми вимірюємо точність заземлення, перевіряючи, чи можна відстежити кожну твердження в відповіді до отриманого контексту»

** Безпека eval ** — Оцінка, спрямована на те, чи моделі виробляють шкідливі, упереджені або порушують правила виводи. Приклад: «Ми проводимо оцінки безпеки на кожній контрольній точці моделі перед її продвиженням до виробництва»

** Red- teaming ** — Конфліктне тестування, де оцінювачі навмисно намагаються змусити модель виробляти шкідливі або небажані результати. Приклад: «Червона команда виявила, що модель можна було б взломати з певним підказкою ролевої гри»

** Насичення еталонів ** — точка, у якій моделі набирають такі високі оцінки у еталоні, що він більше не відрізняє їх значною мірою. Приклад: «Виробнича потужність рівня GPT-4 спричинила насичення еталонів на MMLU — нам потрібні складніші набори оцінки»

Як це використовувати на практиці

У дискусіях щодо оцінки вам часто доведеться обговорювати компромісні рішення щодо різних параметрів. Комбінація точності і відновлення є найпоширенішою: «Ми можемо збільшити відновлення, знижуючи поріг довіри, але це вдарить по точності і збільшить хибні позитивні результати»

При обговоренні оцінок LLM, особливо, розрізняйте між ** автоматизованими метриками ** (BLUE, ROUGE, RAGAS оцінки) і ** людською оцінкою **. Автоматизовані метричні дані масштабовані, але недосконалі. Людська оцінка - золотий стандарт, але дорогий. Команди часто використовують автоматизовані метричні дані як перший фільтр і людську оцінку для остаточних рішень.

Використовуйте red-teaming результати для повідомлення конкретних ризиків: “Red-teaming визначив три вектори jailbreak, які обходять фільтр контенту. У нас є заходи для двох з них»

Приклад розмови

** ML Engineer (Vira): ** “Нова модель має BLEU оцінку на 6 пунктів вище за базовою, але наш рейтинг вірності RAGAS фактично впав.”

“Це тривожна тенденція. Вищий BLEU може означати, що він звучить більш плавно, але нижча вірність свідчить про те, що він генерує вміст, який не ґрунтується на отриманому контексті»

Віра: “Точно - рівень галюцинацій збільшився на 4%. Я б не рекомендував пропагандувати цей контрольний пункт, поки ми не зрозуміємо, чому вірність погіршилася»

Рейтинг: “Згоден. Давайте також проведемо оцінку безпеки і пропуск червоної команди, перш ніж ми переглянемо підвищення»

Практичні поради

  1. ** Прочитати картку моделі: ** Основні моделі на Hugging Face включають картки моделі, які обговорюють оцінювані метричні дані. Прочитайте розділ оцінки картки моделі для моделі, яку ви знаєте (наприклад, BERT або LLaMA) і спробуйте пояснити три з показників на картці вашими власними словами.

  2. ** Вправлятися у використанні компромісу між точністю і відновленням: ** Уявіть реальну проблему класифікації (визначення спаму, виявлення шахрайства, медична діагностика). Напишіть два речення, у яких ви поясните, чому ви віддаєте перевагу точності перед відкликанням або навпаки, у цьому конкретному випадку використання.

  3. ** Перегляньте документацію RAGAS: ** У структурі RAGAS є публічна документація і приклади. Пройдіться одним з прикладів оцінки і спробуйте пояснити вихідні параметри — вірність, відповідність відповіді, контекстне відтворення — колегі простою англійською мовою.

Розробка навігаційних систем: розробка навігаційних систем для різних типів транспортних засобів

Основний словник, що оточує оцінку моделі машинного навчання - точність, відновлення, AUC-ROC і так далі - є життєво важливим для ефективного спілкування в команді науки про дані. Однак, коли ваша команда включає розробників з різними рівнями володіння англійською, можуть легко виникнути непорозуміння. Це не просто про те, щоб знати визначення; це про те, як ці терміни використовуються в розмові і документації. Розгляньмо тонкі зміни в значенні, які можуть відбутися на основі тону, контексту і навіть регіональних варіацій в англійській мові. Наприклад, «висока точність» може бути сприйнята по-різному кимось, хто звик до більш буквального тлумачення технічних термінів, ніж носієм рідної мови, який розуміє його наслідки для продуктивності моделі в різних підмножинах даних.

Поширеною проблемою є ефективне оформлення зворотнього зв’язку під час перегляду коду. Уявіть собі ситуацію, коли ви переглядаєте PR, який реалізує нову функцію, розроблену для поліпшення відновлення моделі виявлення шахрайства. Наприклад, розробник з Іспанії може відповісти простим твердженням: «Тепер відкликання становить 95%». Хоча це технічно правильно, але в цьому немає контексту. Рідний мовець, ймовірно, додасть щось на зразок: “Це великий прогрес у відновленні! Однак, давайте розберемося в хибних позитивних результатах - чи бачимо ми збільшення законних операцій, які позначаються як шахрайські? Нам потрібно розглянути компроміс між пам’яттю і точністю тут. “Це не про критику; це про заохочення глибшого обговорення впливу моделі на різні групи користувачів і проактивне зменшення потенційних негативних наслідків. Аналогічно, при описі продуктивності в описі запитів на завантаження, бути точним уникнути неоднозначності. Замість « Модель добре працює », спробуйте « Модель досягає оцінки AUC-ROC 0,85, що вказує на сильну дискримінантну силу в наборі даних »

Інша часта перешкода виникає під час обговорення таких концепцій, як «рівень галюцинацій» або «червоний-команда». Ці терміни, хоча і все більш поширені в спільноті ML, можуть бути важкими для не-рідних носіїв, щоб повністю зрозуміти без явного пояснення. Важливо розбити ці складні ідеї на менші, більш перетравлювані компоненти, використовуючи аналогії і конкретні приклади, коли це можливо. Не приймайте за звичку ознайомитися з жаргоном; завжди пояснюйте * чому * щось важливе або проблематичне. Крім того, активне запитання зворотнього зв’язку - “Чи має це пояснення сенс?” - демонструє готовність адаптувати свій стиль спілкування і вирішити будь-які нерозуміння.

Нарешті, пам’ ятайте, що документація, особливо описи та звіти PR, повинні бути написані ясною, доступною англійською мовою. Уникайте надто технічної мови, коли це можливо, і віддавайте перевагу ясності перед короткістю. Сфокусуйтеся на передачі * впливу * змін моделі, а не просто на технічних деталях.

Ось приклад, який показує, як використовувати scikit-learn для обчислення точності:

from sklearn.metrics import precision_score
y_true = [0, 1, 1, 0, 1] # True labels
y_pred = [0, 1, 0, 0, 1] # Predicted labels
precision = precision_score(y_true, y_pred)
print(f"Precision: {precision}")

Цей простий код демонструє основну метрику - точність. Ключовим є чітке повідомлення * результату * і пов’ язання його з більш широким контекстом оцінки моделі.

Поширені запитання

Про що ця стаття "Англійська мова для ML Model Evaluation Discussions"?

Вивчайте словниковий запас оцінки моделі машинного навчання: точність/ відновлення, AUC- ROC, BLEU/ ROUGE, LLM- як- суддя, RAGAS, частота галюцинацій, червона команда і насиченість еталонів.

Чи безкоштовна ця стаття?

Так. Усі статті на CoderSlingo, включно з цією, доступні безкоштовно без реєстрації.

Скільки часу займає читання "Англійська мова для ML Model Evaluation Discussions"?

Приблизно 7 min.