Англійська мова для оцінки моделей штучного інтелекту Дискусії: Розмова про метрику і компроміси
Освоєння англійської мови для обговорення продуктивності моделей ШІ: точність, відновлення, F1, еталони, регресії і компроміси. Фрази для інженерів з машинного навчання і науковців з обробки даних під час зустрічей.
Обговорення оцінки моделі англійською є складнішим, ніж здається. Математика є універсальною, але слова — “модель регресія”, “точність зменшення”, “ми обмінюємо згадування за затримкою” — ідіомні, і отримання їх трохи неправильно робить гострий аналіз звучить нечітко. У цьому довіднику наведено словник і фрази, які вам знадобляться для обговорення параметрів моделі, як це роблять інженери з ML під час зустрічі з перегляду.
Говоря про основні показники
Ти знаєш, що означає точність і пам’ять. Ось як * сказати * їх природно:
- ** Точність ** — загальна точність дробу. * “Точність становить 92%, але це вводить у оману на цьому незбалансованому наборі даних.” *
- ** Точність ** — з позитивних результатів, які ми передбачили, скільки було правильних. * « Точність є високою — мало хибно позитивних результатів. » *
- Recall (чутливість) — з фактичних позитивних, скільки ми впіймали. “Recall is low — we’re missing real cases.”
- ** F1 бал ** — середнє гармонійне значення точності і відновлення.
- ** AUC / ROC ** — площа під кривою; ефективність незалежна від порогу.
Колокацій дієслова для руху:
- метрика ** підвищується / покращується / піднімається / піднімається **
- метрика ** падіння / підйом / зниження / зниження якості / падіння **
- метрика ** утримує стабільні / плато / рівні лінії **
- метрика ** стрілок ** (раптове підняття) або ** кратерів ** (раптове падіння)
«Пригадую піднявся на п’ять очок, але точність незначно знизилась — загальна F1 підскочила. Модель plateaued після епохи 12»
** Примітка щодо вимови: ** recall іменник наголошується на першому складі (REE- call) у використанні ML; дієслово RE- CALL. Обидва звучать - не хвилюйтеся, але будьте послідовними.
Компроміс між точністю і пам’яттю
Це найпоширеніша розмова у перегляді моделей, і вона має власну формулювання:
- «Є компроміс між точністю і пам’яттю тут.»
- «Ми можемо обміняти точність на відновлення, зменшивши поріг»
- Якщо ми звужуємо поріг, то точність підвищується, але ми жертвуємо пам’яттю
- «Це **залежить від вартості ** хибно позитивного проти хибно негативного.»
«Для виявлення шахрайства, фальшивий негативний дорогий — ми пропускаємо справжній шахрай — тому ми **упереджено ставимося до відкликання **, навіть за ціною більшого фальшивого позитивного для команди перегляду, щоб сортувати»
Словниковий запас: * хибно позитивний * (помилка типу I), * хибно негативний * (помилка типу II), * поріг *, * операційна точка *, * упередження *, * оптимізація для *.
Еталони і регресії
При порівнянні версій моделей:
- ** Базова модель ** — посилання на модель, з якою ви порівнюєте.
- Benchmark — стандартний набір даних/ завдання для порівняння.
- Регресія — метрика стала гіршою ніж раніше. “v3 regressed on the edge-case set.”
- ** Підняти / підняти ** — поліпшення порівняно з базовим рівнем.
- ** State of the art (SOTA) ** — поточний найкращий опублікований результат.
“Проти ** базової лінії **, v4 показує 3-х пунктів ** підйом ** на головному еталоні, але він ** регресував ** на довгих вхідних даних. Нет, це перемога, але регресію потрібно дослідити, перш ніж ми ** ship **. ”
Зауваження: в ML, “regression” має два значення — модель, що погіршується (вище) * і * тип моделі (передбачення неперервних значень). Контекст роз’яснює; будьте обережні, коли говорите.
Перебільшення, узагальнення, витік даних
Фрази для режимів невдачі:
- «Модель overfitting — чудова на поїзді, погана на перевірці»
- «Не слід плутати з «недоторканністю» (англ. non-disclosure)
- «Я підозрюю ** витік даних ** — тестовий набір занадто чистий.»
- «Ці результати виглядають занадто добре, щоб бути правдою — давайте перевіримо на утечку»
- «Performance falls off a cliff on real-world data» (англійською)
«Точність поїзда становить 99%, але перевірка становить 82% — що розрив кричить перебільшення. Або ми регуляризуємо більше, або у нас є витік, що роздуває номери поїздів»
Словниковий запас: generalize, distribution shift, out-of-distribution (OOD), regularise, the train–test gap, held-out set.
Для LLM: оціночні специфічні мови
Якщо ви працюєте з великими моделями мов, словник змінюється:
- Галюцинация - уверенное заявление чего-то ложного.
- ** Заземлення / вірність ** — чи підтримується вивід джерелом.
- ** Eval set / golden set ** — приклади з відповідями, які вважаються правильними.
- ** LLM- as- judge ** — використовує модель для оцінювання виходів.
- ** Коефіцієнт успішності ** — частка випадків, які відповідають вимогам.
- ** Регресія на оцінці ** — зниження якості між версіями команди або моделі.
“На золотому наборі, нова підказка покращила вірність, але підвищила рівень галюцинацій на неоднозначних запитах. Наш LLM-as-judge пропускний бал впав на два бали, тому я б утримав розгортання»
Хеджування: не перебільшуйте
Метрика заохочує перевищення. Калібрування:
| Overclaiming | Calibrated |
|---|---|
| ”The model is accurate." | "It performs well on this benchmark, but I’d caveat that it’s a narrow test set." |
| "This proves v4 is better." | "This suggests v4 is better; I’d want to confirm with a larger sample." |
| "It works." | "It clears the bar on our eval, subject to real-world validation.” |
Фрази: статистично значущі, в межах похибки, невелика вибірка, напрямно позитивні, я б зауважив, що цифри свідчать про це.
«Повнішня оцінка є напрямно позитивною, але в межах похибки на цьому зразок — я не назвав би це остаточним ще.»
Фрази для зустрічі з перегляду моделі
** Результати представлені: **
- «Дозвольте мені ** провести вас через ** ключові показники. ”
- «Головне число відкликане, яке покращилося до 88%»
- «цікавий розріз — це виконання за сегментами.»
** Отталкиваюсь:**
- «Я не переконаний в точності даних, враховуючи класовий дисбаланс.»
- «Чи можемо ми розрізати це за сегментами користувачів? Агрегат ** приховує ** регресію. ”
Решаю:
- “В балансі, ** підйом переважає ** регресію. Я б переправив його за прапор і монітор»
- «Я тримаю, поки ми не закриємо прогалину в тестуванні поїздів»
Часті помилки, які роблять не-національні інженери ML
- ** « Модель має хорошу точність ». ** Перевагу слід надати « моделі досягає / працює з точністю 92% »
- Сказати “це занадто добре” як іменник-дієслово. Це занадто добре (дієслово) або занадто добре (прикметник): “модель занадто добре” / “модель занадто добре”
- Плутанина точності та точності в звичайній мові - вони різні. Використовуйте правильне.
- ** « Метрика знизилась », коли ви маєте на увазі, що вона покращилася. ** Для помилок/ втрат, * зменшення є хорошим ; для точності, * збільшення є хорошим . Скажіть, що явно: ” втрата впала **, що добре.”
Ключевые вещи
- Вивчати ** колокації руху *: метричні * підйом, падіння, плато, кратер, підйом.
- Формувати точність-витягнення-компроміс з точки зору вартості хибно позитивних проти хибно негативних.
- Використовуйте regression / uplift / baseline для порівняння версій — і пам’ ятайте, що “regression” має два значення в ML.
- Для магістрів права, розмовляйте про **галюцинації, вірність, золоті набори і рівень успішності. **
- Калібруйте кожну заяву - напрямно позитивну, в межах похибки, я б зауважив це. Sharp інженери не перебільшують заяву з невеликого вибірки.
Наприклад, англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська мова: англійська
Будьмо чесними - навіть з глибоким розумінням основних концепцій, ефективне спілкування про модельні показники англійською мовою може здатися складним. Це не просто про те, щоб знати, що «точність» означає щось; це про те, як ви це кажете і як ви формуєте свою зворотню зв’язок, щоб забезпечити ясність і побудувати консенсус. Для не-рідних носіїв, особливо, це може бути поєднано з тонкими відмінностями у фразування і очікуванням певного рівня формальності в технічному контексті. Ключовим елементом є визнання того, що точність не тільки про точність чисел, але також про передачі вашого процесу мислення чітко.
Однією з поширених перешкод є використання надто прямої мови при обговоренні регресій — часто просто заявивши, що «модель гірша», не вдається. Замість цього спробуйте висловитися так: « Я спостерігав невелике зниження оцінки F1 у наборі перевірки після останніх змін у шарі 7. Давайте розслідуємо, чи корелює це з якими-небудь конкретними змінами даних. “Це пом’якшує критику і відразу ж пропонує напрямок для розслідування. Аналогічно, при перегляді опису PR не просто скажіть « Покращити точність ». Замість цього запропонуйте: « Чи можемо ми переформулювати цей опис PR, щоб включити ясніше визначення очікуваного поліпшення у відновленні разом з точністю цілі? » Це демонструє увагу до деталей і розуміння ширших цілей.
Інша область, де тонка фраза має значення, це при обговоренні компромісів - особливо при представленні результатів, які не є ідеальними. Сказати «Модель не працює так добре, як ми сподівалися» може звучати поразково. Кращий підхід: « Хоча досягнення 95% точності було неможливим з цією архітектурою, поточна продуктивність представляє значне поліпшення на X% порівняно з нашим базовим рівнем і дозволяє нам підтримувати сильний баланс між точністю і відновленням ». Це позитивно обрамляє ситуацію, підкреслюючи прогрес і визнаючи обмеження. Нарешті, пам’ ятайте, що активне слухання є критичним; не зосереджуйтеся тільки на формулюванні власної відповіді, але справді розумійте точку зору своїх колег.
Не бійтеся запитати про пояснення, якщо ви не впевнені щодо терміну або фрази. Набагато краще ввічливо запитати про пояснення — «Чи можете ви розібратися, що ви маєте на увазі під «маргінальним прибутком» в цьому контексті?» — ніж неправильно зрозуміти і, можливо, неправильно передати критичну інформацію. Ваші колеги, ймовірно, готові допомогти, і пошук ясності демонструє вашу відданість розумінню технічних деталей повністю. Створення культури відкритого спілкування, де заохочується запитання, значно поліпшить вашу здатність ефективно керувати цими обговореннями.