LLM Evaluation Vocabulary: Benchmarks, Metrics, and Model Cards (англійською)

MMLU, HumanEval, збентеження, частота галюцинацій, LLM- як- суддя, картка моделі, забруднення даних — словник, який вам потрібен для читання, обговорення і виконання оцінок LLM англійською мовою.

Оцінка великих мовних моделей є полем з власним щільним словником - і ставки високі. Незалежно від того, чи вибираєте ви модель для виробництва, переглядаєте дослідницьку роботу або створюєте систему оцінки для вашої функції ШІ, вам слід точно розуміти термінологію. Неправильне розуміння еталону або плутанина точності з розгубленістю може призвести до дорогих рішень.


Benchmarks

** Еталон** — стандартизований набір даних і завдання, що використовуються для вимірювання продуктивності моделі у відтворюваний, порівнянний спосіб. Фраза: “Рейтинг моделі виглядає вражаючим, але перевірте, чи ці завдання перетинаються з її тренувальними даними.”

** MMLU (Massive Multitask Language Understanding) ** — тестування знань з 57 академічних предметів: математики, медицини, права, історії тощо. Звичайна мірка загальних знань. Фраза: “Модель досягає 89% на MMLU — сильна в цілому, але розбивка за предметами має більше значення.”

** HumanEval ** — тестування задач програмування у Python, перевірка того, чи може модель генерувати функціонально правильний код. Pass@k (ймовірність того, що принаймні один з k вибірок пройде тестовий набір) є стандартною метрикою. Фраза: “HumanEval pass@1 становить 72% — він проходить тестовий набір при першій спробі приблизно три чверті часу.”

** GPQA (Graduate-Level Google-Proof Q&A) ** — Еталон дуже складних наукових питань, які вимагають висновків на рівні випускника і на які не можна відповісти за допомогою простого пошуку в інтернеті. Тест на глибинні розумові здібності.

** Evall harness ** — програмна платформа для виконання стандартизованих оцінок на декількох моделях. Приклади: lm-evaluation-harness (EleutherAI), promptfoo. Фраза: “Ми запускаємо eval harness щоночі — будь-яке оновлення моделі, яке знижує еталон більше ніж на 2% викликає перегляд.”

** Забруднення даних ** — коли тренувальні дані містять приклади з набору тестів, що використовуються для визначення рівня, результати будуть завищеними. Це є головною проблемою при інтерпретації результатів еталонів. Фраза: “Високий бал MMLU може бути через забруднення даних — тренувальний корпус не був повністю дедуплікований проти еталону.”


Кваліфікаційні вимоги

** Захопленість ** — вимір того, наскільки добре мова моделі передбачає зразок тексту. Менша неясність означає, що модель присвоїла тексту більшу ймовірність і є більш « впевненою ». Корисно для порівняння моделей у одному і тому ж домені. Фраза: “Збентеженість впала з 18 до 12 після тонкої настройки на даних домену — модель стала набагато плавнішою в цільовому домені.”

** Частота галюцинацій ** — Частка вихідних даних моделі, які містять фактично неправильну або сфабриковану інформацію, представлену як факт. Фраза: “Рівень галюцинацій на нашому RAG еталоні становить 4% — нам потрібно, щоб він був нижче 1% для медичного використання.”

** Заземленість ** — Вимір того, чи підтримується вивід моделі в наданому контексті (наприклад, отримані документи в системі RAG). Обґрунтована відповідь не вводить факти, які виходять за рамки того, що містить контекст.

** Верність ** — у оцінці RAG: наскільки точно сформована відповідь відображає отриманий контекст. Висока вірність = відповідь тримається джерел.

** Релевантність ** — чи відповідає отриманий контекст і сформована відповідь запитання користувача.

** Докладність і відновлення (у контексті IR) ** — * Докладність *: з отриманих документів, яка частина є актуальною. * Відновлення *: з усіх актуальних документів, яку частину було отримано. Вони торгують один з одним в системах пошуку.


Методи оцінки

** Null- shot vs few- shot eval ** — * Null- shot *: модель відповідає без будь- яких прикладів у запиті. * Few- shot *: запит містить невелику кількість прикладів перед питанням. Виконання декількох випусків часто значно краще. Фраза: “Ми оцінили як нуль-шот, так і три-шот — розрив говорить нам, наскільки модель користується прикладами.”

LLM-as-judge — Використання сильної LLM (наприклад, GPT-4) для оцінки виходів іншої моделі, оцінювання їх якості, актуальності або точності. Масштабований, але вводить свої власні відхилення. Фраза: * “Ми використовуємо LLM-як-суддя для відкритого покоління якості - людська анотація є занадто повільною і дорогою, щоб працювати в масштабі.” *

** Оцінка людських переваг ** — Запитання до людей, які оцінюють, порівняти два виводи моделі і обрати той, який вважається перевагою (порівняння по парах). Використовується для навчання моделей RLHF і перевірки LLM- as- judge.

** A/B eval ** — Запуск двох версій моделі на одних і тих же вхідних даних і порівняння метрик якості. Аналогічно до A/B тестування в розробці продукту.

** Карта моделі ** — артефакт документації, опублікований разом з моделлю, що описує її призначення, обмеження, результати оцінки, дані тренування і відомі упередження. Стандарт, запропонований компанією Google. Фраза: “Прочитайте карту моделі перед розгортанням — розділ обмежень часто розкриває режими невдач, які еталони не захоплюють.”


** Вправа: ** Виберіть модель з обійми обличчя і прочитайте картку моделі і результати тестування. Напишіть резюме довжиною 150 слів про сильні та слабкі сторони моделі, використовуючи словник з цього повідомлення — так, ніби ви рекомендуєте (або не рекомендуєте) її вашій команді.

Національний гімн: практичний посібник для мовців рідної мови

Поле оцінки великої мовної моделі (LLM) швидко розвивається, і з ним приходить спеціалізований словник. Зрозуміти ці терміни не просто про повторення визначення; це про розуміння тонких відмінностей у значенні, що впливають на те, як ви обговорюєте продуктивність, вносите вклад у дискусії, і, врешті-решт, приймайте обізнані рішення про розгортання цих потужних інструментів. Розглянемо деякі сценарії, де це нюансове розуміння стає критичним.

Уявіть, що ви переглядаєте запит на витягування, надісланий колегою, який використовував LLM для створення документації для нової кінцевої точки API. Опис PR говорить: «Використання GPT-4 для всеоб’ємного створення докштрихів, з метою 95% покриття на основі еталону MMLU». Як рецензент, простого зауваження «95% покриття» недостатньо. Вам потрібно зрозуміти, що насправді представляє * MMLU * - еталон масового багатозадачного розуміння мови, розроблений для оцінки загальних знань LLM по різних предметах. Крім того, «95% покриття» потребує контексту. Це 95% відносно певного набору вимог до документації? Чи точно вона відображає продуктивність задач, які не стосуються просто створення тексту? Також важливо розпізнати фразу «LLM-як-суддя» — це вказує на те, що сама модель використовується для оцінки якості свого власного генерованого виводу, що вводить ще один шар складності щодо потенційних упереджень і неточностей.

Інша ситуація може виникнути в каналі Slack, де обговорюється продуктивність LLM, якому доручено підсумувати квитки на підтримку клієнтів. Один з розробників пише: «Швидкість галюцинацій на диво висока; вона генерує повністю сфабриковані дані про облікові записи користувачів». Тут «швидкість галюцинацій» є ключовою. Це не просто * будь- яка * помилка; це конкретно стосується моделі, яка вигадує інформацію, що не була присутня у початкових даних квитка. Зрозуміти цю термінологію допоможе вам у визначенні проблеми — можливо, що вікно потребує вдосконалення або тренувальні дані потребують подальшого вивчення на предмет забруднення. Термін «зараження даними» сам по собі є життєво важливим тут - посилаючись на ненавмисні упередження або неточності, введені в тренувальний набір даних моделі, що призводить до викривлених виходів.

Нарешті, розглянемо карту моделі. Ці документи, що стають все більш стандартною практикою, мають на меті забезпечити прозорість можливостей і обмежень LLM. Хороша карта моделі буде детально описувати не тільки показники продуктивності (наприклад, заплутаність - мірою того, наскільки добре модель передбачає послідовність слів), але також інформацію про дані, використані для тренування, потенційні упередження і заплановані випадки використання. Це про перехід від простого затвердження «модель хороша» до надання доказового обґрунтування і визнання потенційних ризиків.

# Example: Checking perplexity using `evaluate` library (Python)
# This is a simplified example demonstrating the kind of metric often discussed in LLM evaluations.
import evaluate

perplexity = evaluate.load_metric("perplexity") # Using a placeholder for demonstration.  Actual implementations vary.
# In reality, this would involve feeding the model and calculating the perplexity score.
print(perplexity.compute())

Сфокусувавшись на цих конкретних термінах і зрозумівши їх контекст, ви можете активно брати участь у дискусіях щодо оцінки LLM, робити значний внесок у перегляд коду, і, врешті-решт, забезпечити, щоб ці моделі були розгорнуті відповідально і ефективно. Не бійтеся просити про пояснення - це спільний процес!

Поширені запитання

Про що ця стаття "LLM Evaluation Vocabulary: Benchmarks, Metrics, and Model Cards (англійською)"?

MMLU, HumanEval, збентеження, частота галюцинацій, LLM- як- суддя, картка моделі, забруднення даних — словник, який вам потрібен для читання, обговорення і виконання оцінок LLM англійською мовою.

Чи безкоштовна ця стаття?

Так. Усі статті на CoderSlingo, включно з цією, доступні безкоштовно без реєстрації.

Скільки часу займає читання "LLM Evaluation Vocabulary: Benchmarks, Metrics, and Model Cards (англійською)"?

Приблизно 9 min.