Англійська для команд оцінки LLM: Бенчмарки, RLHF і моделі оцінки
Вивчіть англійську лексику і фрази для обговорення оцінки LLM, еталонів, RLHF і якості моделей у міжфункціональних командах штучного інтелекту.
Оцінка великої мовної моделі (LLM) тепер є самостійною дисципліною. Якщо ви працюєте у команді, яка тренує, налаштовує або оцінює моделі ШІ — і ця команда працює англійською — вам потрібна вільна лексика для таких концепцій, як набори еталонів, конвеєри RLHF і аналіз режимів невдач.
Розмовляють на бенгалі
** Еталон** є стандартизованим тестом, який вимірює продуктивність моделі у визначеному завданні. Під час обговорення еталонів англійською використовуйте точну мову:
- «Модель набирає 78,4 на MMLU.» (не «здобуває 78»)
- «Ми ** запускаємо ** еталон після кожного тренувального контрольного пункту. »
- «Відповідь на запитання: що таке емоційне розчарування»
- «The model outperforms the baseline on HellaSwag.» (англійською)
Поширені назви еталонів і як їх використовувати
| Benchmark | What it tests | Example sentence |
|---|---|---|
| MMLU | Broad knowledge | ”MMLU covers 57 academic subjects.” |
| HumanEval | Code generation | ”The model achieves 65% pass@1 on HumanEval.” |
| TruthfulQA | Factual accuracy | ”TruthfulQA probes for hallucinations.” |
| MT-Bench | Multi-turn chat | ”MT-Bench uses GPT-4 as the judge.” |
** Зауваження щодо мови: ** Імена еталонів є власними іменниками — пишіть їх з великої літери. Ви * набираєте* бали за еталоном; ви не * отримуєте бали за * (надто багато слів для технічної розмови).
RLHF: підкріплення навчання від людського зворотного зв’язку
** RLHF ** (Reinforcement Learning from Human Feedback) — це метод, який використовується для вирівнювання моделей з людськими перевагами. Знання словника дасть вам змогу брати участь у обговоренні конвейєрів:
Три стадії
- Наглядова тонка настройка (SFT) — “Ми SFT’d базовою моделлю на кураторських демонстраціях.”
- Тренування моделі винагороди — “Людина-оцінювач анотує пари переваг; модель винагороди вчиться з цих порівнень.”
- Крок навчання підкріплення (RL) — “Ми використовували PPO для оптимізації проти сигналу винагороди.”
Ключові фрази
-
- дані про переваги * — пари виходів моделі, з яких оцінювачі обирають кращу
- модель вознаграждения - модель, тренированная для предсказания результатов предпочтений людей
-
- KL дивергентний штраф * — термін регуляризації, який зупиняє дрейфування політики RL занадто далеко від моделі SFT
- переоптимизация - когда модель использует слабые места модели вознаграждения
У розмові
- «Модель винагороди була надмірно адаптована до поверхневих характеристик, таких як довжина відповіді.»
- «Ми обмежили штраф KL на 0,1, щоб зберегти можливості базисної моделі»
- Анотатори показали низьку міжоцінювальну згоду на відкритих питаннях
Обговорення вимірів оцінки
Модель eval є багатовимірною. Використовуйте ці фрази для структурування дискусій:
Здатність проти безпеки
- «Модель здатна на розумові завдання, але схильна до** сікофанії»
- «Ми оцінюємо як корисність, так і безпеку окремо»
- «Існує компроміс між виконанням інструкцій і відмовою від шкідливих запитів.»
Режими відмови
- Галюцинація — «Модель галюцинувала цитування, якого не існує»
- Sycophancy — “Модель згодна з користувачами навіть тоді, коли вони неправі.”
- Refusal — “Модель over-refuses доброякісні запити в домені X.”
- Drift — “Ми побачили capability drift після другого раунду тонкої настройки.”
Статистическая точность
- Різниця статистично значуща при p < 0,05
- «Ми повідомляємо довірчі інтервали по п’яти оцінюючих пробігах.»
- «Набір eval може бути заражений тренувальною інформацією.»
Запуск зустрічі з перегляду Eval
Ось фрази для підсумкового звіту команди eval:
Вступ:
“Давайте пройдемося по останнім результатам оцінки. Я почну з номерів заголовків, а потім ми зануримося в категорії невдач»
Представлення даних:
«На MMLU, ми на 76,2, вгору з 73,8 минулого тижня — 2,4-пунктовий приріст. Однак, оцінка безпеки показує невелику регресію в точності відмови»
Вызывающие беспокойство:
«Я хвилююся про ризик витоку еталонів тут — деякі з цих прикладів можуть бути в перед-тренувальному корпусі»
Пропонуємо наступні кроки:
«Я б рекомендував запустити тримається-out eval suite і додати перевірку забруднення, перш ніж ми називаємо це перемогою.»
Записування звітів оцінки
Під час документування результатів оцінки англійською:
- Використовуйте ** пасивно** для методології: « Модель була оцінена на…»
- Використовуйте ** активний голос ** для результатів: “Модель винагороди перевершила базову модель на…”
- Зазначте точні числа з одиницями: «Проходження@1 поліпшився з 61,2% до 67,8%»
- Включити caveats: «Ці результати слід інтерпретувати з обережністю, враховуючи невеликий розмір вибірки.»
Ключеві моменти
- Використовуйте score, evaluate, benchmark і assess точно — не взаємозамінно.
- Словник RLHF: SFT, дані переваг, модель винагороди, KL штраф, надмірна оптимізація.
- Назвать явно режими невдачі: галюцинація, сікофанія, надмірна відмова, дрейф можливостей.
- Під час зустрічей, структуруйте ваш внесок за такими критеріями: номери заголовків → розбивка по помилках → наступні кроки.
- У письмових звітах, віддавайте перевагу пасивному для методології і активному для результатів.
Навигація Nuance: професійна англійська для оцінки великих моделей
Світ оцінки великої мовної моделі (LLM) швидко розвивається, наповнений спеціалізованою термінологією, яка може відчуватися пригнічуючим, особливо при співпраці між різними командами - інженерією, дослідженнями, продуктом і навіть маркетингом. Крім простого розуміння * що * оцінки моделей, оволодіння * як * через точне англійське спілкування є ключовим для ефективності, ясності і, врешті-решт, успішних результатів проекту. Цей розділ присвячено, зокрема, забезпеченню носіїв англійської мови словником і фразами, необхідними для впевненої участі у дискусіях щодо еталонів, навчання за допомогою підкріплення зворотнього зв’ язку від людини (RLHF) і загальної якості моделі. Це про те, щоб вийти за рамки буквальних перекладів і прийняти тонкі нюанси професійного дискурсу.
Однією з ключових областей є розуміння різниці між звітуванням про виявлення і запитом на пояснення. Зазвичай, ви отримуєте коментар перегляду коду на зразок: « Вивід цієї функції здається неоднозначним у різних підказках ». Безпосередній, можливо, заплутаний переклад з іншої мови може просто стверджувати « Результат не є послідовним ». Замість цього, ефективнішою відповіддю буде « Я спостерігаю змінність у виводі, засновану на варіаціях підказок. Чи можете ви розібратися, що означає «послідовний» в цьому контексті? Чи є певні набори запитань, на яких нам слід зосередитися під час тестування?» Зауважте використання мови, що захищає («Я спостерігаю», «Чи можете ви розкрити») і оформлення проблеми як запит на керівництво — техніка, часто використовується в професійній англійській мові, щоб уникнути надмірно критичного або обвинувального вигляду. Аналогічно, при описі проблеми з даними RLHF, заява «Модель не навчається добре» є занадто неясною. Краще було б сказати: «Ми спостерігали, що модель винагороди не ефективно захоплює бажану поведінку щодо [спеціфічного завдання]. Сигнали людського зворотного зв’язку вказують на невідповідність між поточним вихідним сигналом моделі і нашою метою»
Інша ситуація, з якою часто стикаються, пов’ язана з оновленням опису запитів на завантаження (PR). Уявіть, що ви документуєте результати запуску тесту. Погано сформулований опис може виглядати так: « Результати тестування хороші ». У цьому описі бракує відомостей і він не надає цінного контексту для переглядачів. Більш відшліфований підхід буде таким: «Модель досягла результату 85% на [Конкретна назва еталону] наборі даних, перевищивши цільовий показник 80%. Однак, продуктивність помітно погіршилася на протилежному підмножини (15% рівень невдач), що свідчить про потенційні вразливості, які вимагають подальшого розслідування. “Знову ж таки, кількісне оцінювання результатів і підсвічування ключових спостережень - особливо областей, що потребують уваги - є надзвичайно важливим. Також важливо використовувати активний голос, де це необхідно; «Модель була оцінена» звучить менш прямо, ніж «Ми оцінили модель».
Нарешті, розгляньте повідомлення Slack, яке обговорює потенційні вдосконалення RLHF: « Давайте спробуємо більше людського відгуку ». Хоча це зрозуміло, але в ньому не вистачає стратегічного напрямку. Сильнішою формулюванням було б: «Щоб уточнити модель винагороди, давайте реалізуємо цільову стратегію зворотнього зв’язку, зосереджену на [специфічних аспектах бажаної поведінки], використовуючи різноманітний набір підказок, розроблених для того, щоб викликати нюансовані відповіді». Це демонструє чітке розуміння проблеми і пропонує конкретний план дій - відмітку ефективного професійного спілкування. Пам’ятайте, точний словник і продумане формулювання - це ваші інструменти для будівництва довіри, сприяння співпраці і успішного оцінювання LLM.