Словник для інженерів NLP: 22 терміни, які кожен інженер мови повинен знати
Вивчайте основний англійський словник з обробки природної мови — токенізацію, вбудовування, розпізнавання іменованих об’ єктів і багато іншого для інженерів NLP.
Інженерія обробки природної мови має багатий, точний словник, що описує, як текст розбивається, представлений і розуміється моделями. Оскільки ця область безпосередньо пов’язана з самою мовою, неточність термінології особливо помітна - використання неправильного терміну під час обговорення мовної технології може підірвати вашу довіру таким чином, що інші інженерні області можуть пробачити. Цей посібник містить 22 основних терміна НЛП з чіткими визначеннями і прикладами використання.
Основні принципи обробки тексту
1. Токенізація
Процес розбиття необробленого тексту на менші одиниці — знаки, які можуть бути словами, підсловами або символами, залежно від використаного символізатора.
** Використання: ** *“Цей токенізатор розділяє скорочення, такі як « don’ t », на два токени, що спричиняє невідповідність з нашою системою, заснованою на правилах.” *
2. Токенізація підслів
Стратегія символізації, яка розбиває рідкісні або невідомі слова на менші, частіші підсловні одиниці, що надає змогу моделі обробляти словниковий запас, який вона ніколи не бачилася цілою під час навчання.
** Використання: ** *“Саме слово « tokenization » розділене на підслова, такі як « token » і « # #ization », за допомогою цього конкретного символізатора.” *
3-й. Система виміру — лімфометрія
Стеммінг грубо розрізає кінці слів за допомогою правил (часто виробляючи не-слова); лемматизація використовує лінгвістичні знання, щоб зменшити слово до його правильної словникової бази.
** Використання: ** “Стемінг зменшив ‘running’ до ‘run’, але також зменшив ‘university’ до безглуздя ‘univers’ — ми перейшли на лематизацію для більш чітких результатів.”
4. Перестаньте говорити
Поширені, зазвичай низькоінформаційні слова (наприклад, «the», «is», «and»), які іноді фільтруються під час попередньої обробки в традиційних конвеєрах NLP.
** Використання: ** * « Ми вилучили слова- зупинки для цього завдання видобування ключових слів, але зберегли їх для моделі настрою, оскільки слова- заперечення, наприклад, « не », тут не мають значення. » *
5-й. Розпізнавання названих об’єктів (NER)
Задача ідентифікації і класифікації діапазонів тексту за заздалегідь визначеними категоріями, такими як люди, організації, місця і дати.
** Використання: ** “Модель NER правильно позначила «Amazon» як організацію в цьому реченні, але помилково класифікувала його як місцезнаходження в іншому.”
Представлення і вбудовування
6. Вбудування
Щільне, числове векторне представлення слова, речення або документа, розташоване у неперервному просторі таким чином, що семантично схожі елементи закінчуються поруч.
** Використання: ** *“Вбудування для « король » і « королева » близькі у векторному просторі, але вбудування для « банк » знаходиться між його фінансовим і річковим сенсом, оскільки воно не залежить від контексту.” *
7. Контекстне вбудовування
Вбудовування, яке змінюється залежно від навколишнього контексту, отже, одне і те ж слово отримує різне векторне представлення залежно від його значення у заданому реченні, на відміну від статичного вбудовування.
** Використання: ** * “На відміну від статичного вбудовування, контекстне вбудовування для « bank » відрізняється від « river bank » і « savings bank », оскільки модель враховує слова навколо.” *
8. База векторів
Спеціалізована база даних, оптимізована для зберігання і ефективного пошуку високовимірних вбудованих векторів, зазвичай використовується для семантично пошуку і отримання.
** Використання: ** * “Ми зберігаємо вбудовані документи у векторній базі даних, щоб ми могли отримати семантично схожі пасажири, а не лише відповідності ключових слів.” *
9. Семантична схожість
Вимірює, наскільки близькі за змістом два шматки тексту, зазвичай, обчислюється за допомогою відстані або кута між їх вбудуваннями.
** Використання: ** * « Семантична схожість показала, що ці два квитки підтримки майже ідентичні, хоча вони використовували абсолютно різні формулювання. » *
10. Схожість косинусів
Специфічна метрика, яку зазвичай використовують для вимірювання семантичної схожості між двома вбудованими векторами, заснована на куті між ними, а не на їх величині.
** Використання: ** * “Ми ранжуємо отримані пасажири за косинусною схожістю з вбудованим запитом перед передачею найкращих результатів до мовної моделі.” *
Мова розуміння завдань
11-й. Частина мови (POS) теґування
Позначити кожне слово у реченні його граматичною роллю — іменником, дієсловом, прикметником тощо.
** Використання: ** * « POS- теґер неправильно позначив « record » як іменник у цьому реченні, але насправді його використовують як дієслово. » *
Роздільна здатність
Визначення того, які слова або фрази в тексті відносяться до тієї ж сутності, наприклад, з’ясування того, що “вона” відноситься до “Марії”, згаданої два речення раніше.
** Використання: ** * “Розв’ язання кореспонденції пов’ язало ‘компанію’ з ‘Acme Corp’ три речення раніше, що дозволило підсумку зберегти посилання чітким.” *
13. Аналіз настрою
Класифікація тексту за емоційним тоном або думкою, яку він виражає, зазвичай, як позитивний, негативний або нейтральний.
** Використання: ** *“Аналіз настроїв на цих оглядах позначив їх як нейтральні, але людина читач чітко розпізнає сарказм як негативний.” *
14. класифікація намірів
Визначення основної мети або призначення частини тексту, зазвичай використовується у системах розмов, щоб визначити, як слід відповісти.
** Використання: ** * « Класифікатор інтенції правильно визначив це повідомлення як запит « скасувати підписку », навіть якщо користувач ніколи не використовував слово « скасувати ». » *
15-й. Абстракція (від лат. abstractio — «заперечення»)
Витягування підсумків вибирає і з’ єднує існуючі речення з тексту джерела; абстрагування підсумків створює нові речення, які передають те саме значення.
** Використання: ** * “Екстрактивне резюме просто витягнуло перше речення кожного абзацу, яке пропустило ключову точку, заховану посередині — абстрактна модель справлялася з цим набагато краще.” *
Походження і розвиток
16-й. Ретроспективний огляд (англ.)
Метод, який отримує відповідні документи або пасажири з зовнішнього джерела знань і надає їх мовній моделі як контекст перед тим, як створювати відповідь, покращуючи фактичне ґрунтування.
** Використання: ** * “Ми додали RAG, щоб модель могла цитувати нашу справжню документацію замість галюцинацій, що звучать правдоподібно, але неправильно параметри API.” *
Галюцинации
Коли мова моделі створює текст, який плавний і звучить правдоподібно, але фактично неправильний або не підтримується жодним джерелом.
Використання: “Модель галюцинувала назву функції, яка не існує в нашому SDK — вона звучала точно так само, як наші справжні конвенції іменування, що зробило її небезпечною.”
18.Чанкінг
Розділення довгих документів на менші, зрозумілі частини (фрагменти) перед їх вбудуванням і індексуванням, зазвичай для використання у системах пошуку.
** Використання: ** * “Ми розділяємо документи за заголовками розділів, а не за фіксованою кількістю символів, що зберігає семантичні зв’ язки між вмістом.” *
Зміна рангу
Процес другого етапу, який переупорядковує початковий набір отриманих кандидатів за допомогою більш точної (і зазвичай більш дорогої) моделі, щоб поліпшити якість остаточного ранжування.
** Використання: ** * “Початкове пошукове завдання швидко повертає 50 кандидатів, а переранкер сужає їх до 5 найважливіших пасажирів.” *
20-х років. Моделі мовлення (англ. Language Modeling)
Метрика, яка вимірює, наскільки добре мова моделі передбачає дану послідовність тексту — нижче занепокоєння вказує, що модель знаходить послідовність більш передбачуваною.
Використання: “Занепокоєння з приводу цього корпусу, специфічного для певної галузі, було набагато вищим, ніж у загальному тексті, що вказує на те, що моделі потрібна подальша адаптація до галузі.”
21-го. Блакитний/червоний рахунок
Автоматизовані параметри для оцінки сформованого тексту (наприклад, перекладів або резюме) за допомогою порівняння перетинів з одним або декількома текстами- джерелами — BLEU — спільний для перекладів, ROUGE — для резюме.
** Використання: ** * “Рейтинг ROUGE поліпшився після тонкої настройки, але вручну перегляд все ще виявив, що у підсумках пропали деякі нюанси, які метрика не вмістила.” *
22. Адаптація домену
Процес налаштування загальної моделі НПЗ для кращої роботи з текстом з певної області (наприклад, юридичної, медичної або технічної), яка відрізняється від її початкового тренувального розподілу.
** Використання: ** * “Ми зробили адаптацію доменів на медичних транскриптах, оскільки загальна модель неправильно інтерпретувала клінічні абревіатури як звичайні слова.” *
Ключеві моменти
- ** Вибір токенізації ** (підслово проти рівня слова) впливає на все нижче — дізнайтеся, який з них використовує ваша система, перш ніж зневаджувати неочікувану поведінку моделі.
- ** Вбудовування і семантична схожість ** є основою сучасного пошуку і отримання; відрізняти статичні вбудовування від контекстних точно.
- ** RAG, розбиття на шматки і перестановка у порядку ** — це стандартний словник для опису конвеєрів отримання, які виводяться моделлю мови основи у справжніх документах.
- ** Галюцинація ** є специфічним, добре визначеним режимом невдачі — використовуйте його точно, а не як загальний вираз для « модель була неправильною »
- Автоматизовані метричні дані, такі як ** BLEU, ROUGE і perplexity ** є корисними сигналами, але не замінюють людський розсуд — згадайте про їх обмеження під час повідомлення результатів.