Інженер з питань безпеки праці

Основний англійський словник для інженерів безпеки штучного інтелекту: Red-teaming, adversarial prompts, hallucination, guardrails, alignment, RLHF, and constitutional AI explained.

ШІ безпеки інженерії є одним з найшвидше зростаючих спеціалізацій в програмному забезпеченні. Вона знаходиться на перетині машинного навчання, безпеки, етики і політики. Незалежно від того, чи ви оцінюєте великі мовні моделі для використання у виробництві, розробляєте генеративну систему штучного інтелекту або реалізуєте захисні заходи для чат-бота, що працює з клієнтами, цей словник допоможе вам точно спілкуватися.


Ред-Тімінг

** Red-teaming ** в контексті ШІ означає систематичну спробу знайти способи, щоб модель поводилася шкідливим, упередженим або ненавмисним чином. Термін походить з військової та кібербезпеки практики, де «червона команда» імітує супротивників.

“Перед выпуском модели, команда безопасности провела шести-недельные учения с красными командами, чтобы выявить неожиданные режимы отказа.” “Ред-команда показала, что модель предоставит подробные инструкции для небезопасных действий, если подсказка будет оформлена как вымышленная история.”


Конфліктні пропозиції

** Конфліктні підказки ** — це ретельно розроблені вхідні дані, призначені для того, щоб змусити модель створювати небажані виводи — обійти фільтри безпеки, розкрити системні підказки або створити шкідливий вміст. Поширені методи включають jailbreaks, prompt injection, і ролевий framework.

“Ми знайшли декілька суперечливих запитів, які призвели до того, що модель ігнорувала свою політику контенту, коли користувач заявив, що він є медичним фахівцем.”

  • “Введення підказки — це клас суперечливих підказок, у яких шкідливі інструкції приховано у вміст, який модель має обробляти — наприклад, у документі, який вона підсумовує.” *

Hallucination

** Галюцинація ** стосується моделі, що генерує інформацію, яка фактично неправильна, сфабрикована або не підтримується її тренувальними даними або наданим контекстом, але представлена з очевидною впевненістю.

  • “Модель галюцинировала три академические цитаты в резюме исследования. Імена авторів існували, але статті не існували.»*
  • “Частота галюцинацій є одним з наших ключових показників оцінки. Для інструмента юридичного дослідження, навіть 2% рівень галюцинацій є неприйнятним.”*

Guardrails

** Захисні смуги ** — це технічні елементи керування, які або вбудовано у модель, або додано як шар оболонки, які обмежують те, що модель може виводити. Вони включають фільтри вмісту, блокатори тем, перевірки виводу і класифікатори вводу.

  • “Ми реалізували захисні огорожі за допомогою вторинного класифікатора, який перевіряє виводи моделі на порушення правил перед поверненням їх користувачеві.” *
  • “Захисні заходи можна застосовувати на рівні вводу (блокування певних запитів), на рівні виводу (фільтрування відповідей) або на обох рівнях.” *

Alignment

Відповідність стосується виклику забезпечення того, щоб цілі, цінності і поведінка системи ШІ відповідали людським намірам і цінностям - особливо, коли системи стають більш здатними. Невідповідність відбувається, коли ШІ переслідує цілі, які відрізняються від того, що його дизайнери або користувачі мали на увазі.

“Проблема вирівнювання не тільки в тому, щоб запобігти шкідливим результатам сьогодні - це в тому, щоб забезпечити, що, оскільки моделі стають більш здатними, вони залишаються вирівняними з людськими цінностями.” “Наша команда з вирівнювання працює над системами оцінки, які перевіряють, чи відповідає поведінка моделі запланованій системі цінностей у широкому діапазоні сценаріїв.”


Corrigibility

Коректність описує властивість системи ШІ бути коректною і контрольованою людьми — приймати модифікацію, вимикання або корекцію без опору.

  • “Система, яка може бути виправлена, буде підкорятися людському нагляду, навіть якщо вона теоретично може діяти автономно. Виправність вважається ключовою властивістю безпеки для передових систем штучного інтелекту.”*
  • “Одна з проблем з високоздатними системами полягає в тому, що вони можуть чинити опір корекції, якщо їх навчили сильно переслідувати мету. Підтримка виправності стає важче, коли збільшується здатність.”*

Рефлексивний аналіз (Reflexive Analysis)

** RLHF ** — це методика тренування, за якої люди, які оцінюють результати моделі, використовують ці оцінки для тренування моделі винагороди, яку потім використовують для вдосконалення базисної моделі за допомогою навчання за допомогою підкріплення. RLHF широко використовується для того, щоб зробити моделі більш корисними, нешкідливими і чесними.

“Базова модель була попередньо тренована на текстових даних, а потім відлагоджена за допомогою RLHF, щоб вирівняти її відповіді з людськими перевагами для корисності і безпеки.” “RLHF може ввести свої власні проблеми вирівнювання, якщо люди, що оцінюють, мають упередження, або якщо модель винагороди занадто підходить до поверхневих особливостей “добре звучащих” відповідей.”


Конституційний суд

** Конституційний ШІ ** це тренувальний підхід, розроблений Anthropic, в якому набір принципів («конституція») використовується для керування процесом самокритики і перегляду моделі. Замість того, щоб покладатися виключно на людський зворотній зв’язок, модель навчається оцінювати і переглядати свої власні результати проти зазначених принципів.

“Конституційний ШІ зменшив потребу в людських маркерах для оцінювання шкідливих результатів безпосередньо - модель навчається ідентифікувати і переглядати відповіді, що порушують політику, використовуючи свою конституцію.” “Конституційний підхід до штучного інтелекту робить значення моделі більш прозорими і аудиторними, ніж чистий підхід RLHF.”


Оцінка (англ. Evaluation)

** Оцінки ** — це структуровані оцінки, які використовуються для вимірювання можливостей моделі і властивостей безпеки. Оцінки безпеки перевіряють на шкідливу поведінку у ряді сценаріїв; оцінки можливостей вимірюють продуктивність завдання.

“Наш набір eval включає понад дві тисячі запитань, що стосуються шкідливого вмісту, упередженості, порушення приватності та фактичної точності. Кожна модельна контрольна точка оцінюється перед продвиженням до виробництва.” “Оцінки не є вирішеною проблемою — модель може пройти еталон, не встигнувши на реальних краєвих випадках, які не були в тестовому наборі.”


Практичні фрази для інженерів безпеки AI

  • “Вправа “червоної команди” виявила вразливість введення вмісту в функцію резюме документа.”
  • “Ми повинні зменшити рівень галюцинацій, перш ніж цей продукт буде підходить для медичного або законного використання.” *
  • “Наші захисні огорожі працюють на двох рівнях: класифікація вхідних даних і фільтрація вихідних.”
    • “Вирівнювання не є одноразовим виправленням — воно потребує постійного оцінювання, оскільки модель оновлюється.” *
  • “Тренування RLHF покращило показники корисності, але ми спостерігали регресію в еталонах виправності.”
    • “Ми створюємо систему оцінки, яка тестує на провокації з десяти категорій атак.” *

Словник безпеки інженерії ШІ швидко розвивається, оскільки поле дозріває. Освоєння цих термінів допоможе вам робити внесок у перегляди безпеки, оцінювати випуски моделей, повідомляти про ризики команді розробників і керівництву, а також брати участь у зростаючому професійному співтоваристві фахівців з безпеки ШІ.

Розрізняють: мовлення, що не є мовленням мовця

Обговорені концепції — червона команда, суперечливі підказки, галюцинації, огорожі, вирівнювання, RLHF і конституційний ШІ — представляють собою значний зсув у тому, як ми підходимо до розробки і розгортання великих мовних моделей. Фантастично, що ви створюєте цей словник; однак, тонкощі професійної англійської, особливо в технічних дискусіях, часто можуть бути викликом для тих, чия перша мова не є англійською. Давайте зосередимося на деяких поширених областях, де виникають непорозуміння, і наведемо практичні приклади, щоб допомогти закріпити ваше розуміння.

Однією з найчастіших проблем є точне значення «вирівнювання», яке виходить далеко за рамки простого створення моделі «згодою» з людськими перевагами. У перегляді коду ви можете побачити коментар на зразок: « Цій реалізації бракує достатнього вирівнювання; відповіді моделі все ще мають тенденцію до надмірно довгих пояснень ». Це стосується не лише довжини — це стосується забезпечення того, щоб * обґрунтування * відповіді відповідало запланованій меті і правилам безпеки. Аналогічно, при створенні опису Запиту на витяг для нового тренувального компонента RLHF, заява « Ми поліпшили вирівнювання, збільшивши сигнал винагороди за фактичну точність » має більший вплив, ніж просто сказати « ми зробили його більш точним. » Перший негайно повідомляє стратегічний напрямок роботи і її зв’ язок з більш широкими цілями безпеки. Іншою поширеною пасткою є використання надмірно буквальних перекладів; фрази на кшталт «галюцинація» часто використовуються у переносному значенні, тобто генерована відповідь, яка впевнено представляє хибну інформацію як факт. Визнаючи це, потрібно розуміти контекст - це * буквально * галюцинація або демонстрабельна брехня?

Крім того, при обговоренні суперечливих підказок, пам’ятайте, що вони не просто “погані” вхідні дані, призначені для порушення моделі; вони спеціально розроблені для виявлення вразливостей і упереджень. Повідомлення Slack може звучати так: « Команда, давайте присвятимо деякий час цього тижня для роботи в команді з навмисно складними і неоднозначними запитами — подумайте про них як про контрольовані «суперечні підказки », розроблені для виявлення потенційних слабких місць у наших захисних рейках. » Акцент робиться на * навмисному * створенні і зосередженому дослідженні режимів невдач. Нарешті, термін «конституційний ШІ» — що представляє систему, керовану набором етичних принципів — часто вимагає ретельного пояснення, щоб переконатися, що кожен розуміє, що це не просто додавання обмежень, а вбудовування цінностей в архітектуру моделі.

# Example: Using `grep` to filter for potential hallucinated content in logs
grep -i "unverified" log_files/*.txt

Ця проста команда ілюструє практичне застосування - активний пошук показників неточності або сфабрикованої інформації, що відображає основну проблему при визначення і зменшенні галюцинацій. Не вагайтеся задати питання, щоб прояснити ситуацію; набагато краще шукати пояснення, ніж неправильно тлумачити важливий термін і, можливо, погіршити ситуацію з безпекою.

Поширені запитання

Про що ця стаття "Інженер з питань безпеки праці"?

Основний англійський словник для інженерів безпеки штучного інтелекту: Red-teaming, adversarial prompts, hallucination, guardrails, alignment, RLHF, and constitutional AI explained.

Чи безкоштовна ця стаття?

Так. Усі статті на CoderSlingo, включно з цією, доступні безкоштовно без реєстрації.

Скільки часу займає читання "Інженер з питань безпеки праці"?

Приблизно 8 min.