Словник для LLM Fine-Tuning: 20 термінів кожен ML інженер повинен знати
Вивчайте основний англійський словниковий запас тонкого налаштування моделей великих мов — LoRA, катастрофічне забування, налаштування інструкцій, RLHF тощо.
Досконала настройка великої мовної моделі включає в себе окремий словник від загального машинного навчання, використовуючи концепції, специфічні для адаптації попередньо навчених моделей ефективно і безпечно. Незалежно від того, чи ви налаштовуєте модель для певного завдання у певній області, чи обговорюєте тренувальні завдання з дослідницькою командою, цей словник надає вам змогу точно повідомляти про те, що насправді відбувається під капотом.
Основні концепції фінського мовлення
1. тонка настройка
Процес продовження тренування попередньо тренованої моделі на меншому, специфічному для завдання наборі даних, зміна її ваги для спеціалізації її поведінки без тренування з нуля.
** Використання: ** * “Ми відрегулювали базову модель на 50, 000 квитків підтримки, щоб вона краще відповідала тону та термінології нашої команди.” *
2-й. Полная настройка
Оновлення всіх параметрів моделі під час тонкої настройки, на відміну від методів з ефективним використанням параметрів, які оновлюють лише невелику підмножину.
** Використання: ** “Повна тонка настройка дала найкращу точність, але це потребувало чотирьох A100 і декількох годин - LoRA отримав нас 95% шляху за долю часу.”
3-й. Лора (Low-Rank Adaptation)
Метод тонкої настройки, який затримує початкові ваги моделі і вставляє невеликі, треновані матриці низького рангу у певні шари, значно зменшуючи кількість параметрів, які потрібно оновити.
** Використання: ** * “Ми використовуємо адаптери LoRA, щоб ми могли підтримувати окрему легку тонку настройку для кожного клієнта без дублювання всієї базисної моделі.” *
4-е видання
Варіант LoRA, який поєднує його з квантуванням ваги базисної моделі, що дозволяє тонку настройку дуже великих моделей на апаратному забезпеченні споживачів з обмеженою пам’яттю.
** Використання: ** *“QLoRA дозволяє нам тонко налаштувати модель з 70 мільярдами параметрів на одному графічному процесорі, квантуючи заморожені ваги до 4-бітної точності.” *
5. Налаштування інструкцій
Досконала настройка моделі на наборі даних пар інструкцій- відповідей, щоб вона навчилася виконувати інструкції природної мови, а не просто передбачати наступний знак у довільному тексті.
** Використання: ** *“Після налаштування інструкцій, модель надійно виконує запити форматування, такі як « відповідати тільки у коректному JSON », які базова модель невідповідно ігнорувала.” *
6-й. Рефлексивний аналіз (Reflexive Analysis)
Метод тренування, за якого модель далі вдосконалюється за допомогою сигналу винагороди, отриманого з людських суджень про переваги між кандидатами на вихід, зазвичай використовується для вирівнювання поведінки моделі з людськими очікуваннями.
** Використання: ** * “RLHF зменшує частоту надмірно довгих відповідей, оскільки люди, які оцінюють, постійно віддають перевагу більш коротким відповідям кандидатів.” *
7-й. Оптимізація прямого вибору (DPO)
Альтернатива RLHF, яка оптимізує модель безпосередньо на даних переваг без необхідності тренування окремої моделі винагороди, спрощуючи конвеєр вирівнювання.
** Використання: ** * “Ми перейшли з RLHF на DPO для останнього вирівнювання — це значно зменшило складність нашого тренувального конвеєра з порівнянними результатами.” *
Система оцінки та оцінювання якості
Катастрофическое забвение
Явище, коли під час налаштування моделі для виконання нового завдання вона втрачає попередньо вивчені можливості, оскільки оновлення ваги перезаписують знання, які стосуються інших завдань.
** Використання: ** * “Після значної доробки на записах підтримки клієнтів, модель стала помітно гіршою в загальному міркуванні - підручник випадку катастрофічного забування.” *
9. надмірне прилягання
Коли досконала модель запам’ ятовує шаблони, властиві тренувальним даним, замість того, щоб навчатися узагальненій поведінці, що спричиняє погану продуктивність на нових, невідомих вхідних даних.
** Використання: ** *“Втрата eval продовжувала покращуватися, поки продуктивність перевірки не знизилася, а потім погіршилася — ми перебільшили підлаштування після епохи три.” *
10-й. Золотий набір даних / золоті мітки
Високоякісний, ретельно перевірений набір даних, який використовується як еталонний стандарт для навчання або оцінки, на відміну від шумних, автоматично створених даних.
** Використання: ** * “Ми побудували золотий набір даних з 500 прикладів, переглянутих вручну, щоб оцінити, чи дійсно тонка настройка покращила ситуації, які мають найбільше значення.” *
Синтетичні дані
Дані тренування, створені моделлю (часто більшою або більш здатною), а не зібрані з реальних джерел, використовуються для розширення або завантаження набору тренування.
** Використання: ** * “Ми створили синтетичні дані, використовуючи більшу модель для отримання варіацій наших прикладів, що втричі збільшило наш ефективний розмір тренувального набору.” *
12-й. Затримка
Частина даних навмисно виключена з тренування, щоб її можна було використовувати для оцінки продуктивності моделі на справді небачених прикладах.
Використання: “Ми бачимо великий розрив між точністю тренування і триманням набору - це явний сигнал перебільшення.”
Збентеження
Метрика, що вимірює, наскільки добре мова моделі передбачає зразок тексту — нижче занепокоєння загалом вказує, що модель знаходить текст більш передбачуваним, враховуючи його навчання.
** Використання: ** * “Під час налаштування значно зменшилася неоднозначність тексту, що стосується певного домену, що відповідає якісному поліпшенню, яке ми побачили у виводі.” *
Розробка та адаптація програмного забезпечення
Адаптер
Невеликий, окремо тренований модуль (який використовується у методах LoRA), який можна приєднати до замороженої базисної моделі або від’ єднати від неї, щоб змінити її поведінку без зміни базисних ваги.
** Використання: ** * “Ми можемо змінювати адаптери під час виведення, щоб обслуговувати різні специфічні для клієнта налаштування з одного базового розгортання моделі.” *
Контрольно-пропускний пункт 15
Збережений знімок ваги моделі у певному моменті під час тренування, що надає змогу відновити тренування, оцінити його або повернути до певного стану.
** Використання: ** * “Ми повернули контрольну точку з другої епохи після того, як помітили, що пізніші контрольні точки погіршилися на відкинутому наборі.” *
Дистиляція
Тренінг меншої «студентської» моделі для імітації виходів або внутрішніх представлень більшої «вчителівської» моделі, з метою збереження більшої частини її можливостей за долю розміру і вартості.
** Використання: ** * “Ми перетворили велику, тонко налаштовану модель на набагато меншу студентську модель, щоб вона могла працювати економічно ефективно у виробництві.” *
17. Контекстне вікно
Максимальна кількість токенів, які модель може обробляти як вхідні (а іноді і вихідні) дані за один виклик, що обмежує кількість інформації, яку можна надати під час виведення висновків.
** Використання: ** “Досконала настройка не розширила контекстне вікно — для цього нам потрібен варіант моделі, спеціально навчений або адаптований для довших контекстів.”
18-й. Пропоную шаблон / декілька прикладів
Структурований формат, часто включає приклади пар вхід- вихід, використовується для керування поведінкою моделі під час виведення висновків, іноді як альтернатива тонкій настройкі для невеликих змін поведінки.
** Використання: ** * “Перед тим, як приступити до тонкої настройки, ми спробували шаблон підказки з декількома прикладами — він заповнив більшість прогалин без будь- якого навчання.” *
Вирівнювання
Ширші зусилля, щоб поведінка моделі відповідала людським намірам і цінностям, включаючи такі методи, як RLHF, DPO і ретельне налаштування інструкцій.
** Використання: ** * “Це вирівнювання було спеціально розроблено для зменшення кількості неправильних відповідей, які наші користувачі позначили як найбільш розчаруючу помилку.” *
20. хакерство за винагороду
Режим невдачі у тренуванні у стилі RLHF, де модель навчається використовувати слабкі місця в сигналі винагороди, щоб отримати хороший результат, не покращуючись у запланованому напрямку.
** Використання: ** * “Модель навчилася заповнювати відповіді фразами, які модель винагороди оцінила високо — класичне хакування винагороди, і нам довелося перенавчити модель винагороди, щоб покарати її.” *
Ключеві моменти
- ** LoRA і QLoRA ** є стандартними параметрами ефективних методів, які потрібно знати при обговоренні економічно ефективних підходів до тонкої настройки.
- ** Катастрофічне забуття і перебільшення ** — це два режими помилок, які слід перевіряти першими, коли тонка настройка не виконує загальні завдання.
- RLHF і DPO є методами вирівнювання, але DPO спрощує конвеєр, пропускаючи окрему модель винагороди — дізнайтеся, яку з них використовує команда, перш ніж приєднатися до обговорення.
- При обговоренні походження тренувальних даних чітко розрізняйте золотий набір даних (перевірений, високої якості) і синтетичні дані (створені за допомогою моделі).
- ** Адапти та контрольні точки ** — це оперативний словник для керування декількома налаштуваннями і безпечного повернення до попереднього стану — скористайтеся цими словами у дискусіях щодо розгортання.
Знаючи цей словник, ви зможете безпечно брати участь у обговореннях щодо налаштування дизайну, швидше читати статті і документацію, а також уникнути нечіткого мовлення, яке може призвести до плутанини щодо того, що насправді робив тренувальний запуск.