AI and Machine Learning Vocabulary: LLM, RAG, Embeddings Explained (англійською)
Прості англійські визначення 35 термінів штучного інтелекту і машинного навчання: LLM, RAG, вбудовування, токени, галюцинації, тонка настройка, швидка інженерія, векторна база даних і багато іншого.
ШІ і машинне навчання мають свій власний щільний словник - і з 2022 року багато з них перейшли з дослідницьких статей в повсякденні інженерні розмови. Якщо ви працюєте з інструментами штучного інтелекту, LLM або конвеєрами ML, вам потрібно знати цю мову. У цьому підручнику пояснюється найважливіші терміни, без потреби знати математику.
Великі мови моделей (LLMs)
LLM (англійською)
Велика мова модель є типом моделі штучного інтелекту, навченої на величезних обсягах текстових даних, здатних генерувати, перекладати, підсумовувати і відповідати на запитання природною мовою. Приклади: GPT-4, Claude, Gemini, Llama.
«Ми використовуємо LLM для живлення чатбота підтримки.»
Token
У контексті LLM, ** токен ** є одиницю тексту, що модель обробляє. Токен становить приблизно 3-4 символи або близько ¾ слова англійською мовою. “Hello, world!” ≈ 4 токени.
Чому це важливо: LLM мають ** контекстне вікно ** - обмеження на кількість токенів, які вони можуть обробляти одночасно. Ціна на хмарні LLM API зазвичай за токеном.
Контекстне вікно
** контекстне вікно ** — це загальна кількість тексту (у знаках), який LLM може прийняти і розглянути в одному запиті. Більші контекстні вікна надають змогу отримувати більше відомостей про фон, тривалі розмови або більші документи.
Модель має 128k контекстне вікно — вона може обробляти всю базу коду за раз
Prompt
** запит ** це вхідні дані, які ви вводите в LLM. У інтерфейсі балачки це ваше повідомлення. У виклику API це текст, який ви надсилаєте до моделі.
Інженерні розробки
** Пром інженерія ** це практика проектування і вдосконалення підказок для отримання кращих результатів від LLM. Методи включають: надання прикладів (запитання з декількома випусками), призначення ролі («Ви старший інженер…»), і чітке структурування інструкцій.
Hallucination
Галюцинація це коли ЛЛМ впевнено генерує інформацію, яка фактично неправильна, вигадана або не відповідає контексту. Названа, але неіснуюча функція, цитата з неіснуючої статті або неправильна документація API - це галюцинації.
«Модель галюцинувала неіснуючий бібліотечний метод — завжди перевіряйте код, створений LLM»
Системний запит
** системний запит ** це спеціальна інструкція, яку надається LLM перед введенням даних користувачем, встановлює його поведінку, роль або обмеження. Зазвичай не видимий для кінцевих користувачів.
Досконалість
** Досконала настройка ** це процес продовження тренування попередньо тренованої моделі на меншому, специфічному наборі даних для спеціалізації її поведінки. Загальний LLM може бути налаштований на медичні записи, юридичні тексти або дані, специфічні для компанії.
RAG (Retrieval-Augmented Generation) — генерація з відновленням
** RAG ** — це метод, який покращує відповіді LLM за допомогою отримання відповідних документів з бази знань і включення їх у запит. Замість того, щоб покладатися на треновану пам’ять моделі, RAG отримує свіжий, відповідний контекст перед генерацією відповіді.
«Ми використовуємо RAG, щоб чатбот міг відповідати на запитання про нашу внутрішню документацію — він шукає останні документи перед тим, як дати відповідь»
Вбудовані пошукові векторні функції
Embedding
** Вбудоване ** — це числове представлення тексту (або зображень, або інших даних) як вектора чисел з рухомою комою. Семантично схожі тексти мають вектори, які близькі один до одного в математичному просторі. LLM і пошукові системи використовують вбудовування для розуміння значення, а не тільки ключових слів.
«Ми вбудовуємо запити користувачів і шукаємо найсхожіші вбудовування документів.»
База даних векторів
** Векторна база даних ** — це база даних, оптимізована для зберігання і пошуку вбудованих даних. Він може знайти вектори, які найбільш схожі на вектор запиту — увімкнення семантично пошуку. Приклади: Pinecone, Weaviate, Qdrant, pgvector (розширення PostgreSQL).
Семантичний пошук
** Семантичний пошук ** знаходить результати за * значенням *, а не лише за відповідністю ключових слів. За допомогою вбудованих елементів можна знайти документи, які концептуально схожі на запит, навіть якщо у них не буде спільних слів.
Концепція моделювання
Тренувальні дані
** Дані тренування ** — це набір даних, який використовується для тренування моделі машинного навчання. Якість і розмір тренувальних даних сильно впливають на якість моделі.
Overfitting
** Перебільшення** відбувається, коли модель вивчає дані тренування занадто специфічно — включаючи шум — і погано працює з новими, невідомими даними.
Underfitting
** Недостатньо відповідає ** означає, що модель не отримала достатньо знань з даних тренування і працює погано навіть на тренувальних прикладах.
Inference
** Виведення ** — це процес використання тренованої моделі для створення передбачень на основі нових даних. Тренінг виконується один раз (або періодично); виведення відбувається кожного разу, коли користувач робить запит.
Правда на землі
** Основна істина ** — це перевірена правильна відповідь, яку використовують для оцінки прогнозів моделі. У навчанні під наглядом, тренувальні дані включають мітки правди.
Мітка / анотація
** мітка ** (або ** анотація **) — це правильний вивід, пов’ язаний з тренувальним прикладом. У класифікації зображень мітка може бути « кіт » або « пес ». Люди часто анотують тренувальні дані вручну.
Наглядова проти Недосконала освіта
- ** Навчання під наглядом **: модель вчиться з позначених прикладів (вхід → відомий вивід)
- ** Навчання без нагляду **: модель знаходить шаблони у даних без міток (наприклад, кластеризація)
- ** Підсилення навчання **: модель вчиться, отримуючи винагороду або покарання за свої дії
Оцінка та оцінка
Accuracy
** Точність ** = відсоток правильних прогнозів серед усіх прогнозів. Але точність сама по собі є обманом, коли класи не збалансовані (наприклад, 99% електронних листів не є спамом).
Точність і відновлення
- ** Точність ** = з усіх передбачених позитивних результатів, скільки було насправді позитивних? (Уникнення хибно позитивних результатів)
- ** Пригадування ** = з усіх фактичних позитивних, скільки знайшла модель? (Уникнення хибних негативних)
Ф1-Спорт
** F1 бал ** є гармонічним середнім точності і відновлення - одне число, яке балансує обидва.
Benchmark
** Еталон** — це стандартизований тест, який використовується для вимірювання продуктивності моделі. LLM еталони: MMLU, HumanEval (кодування), HellaSwag, BIG-bench.
Інструменти та інструментальні системи
ГПУ/ТПУ
- ** GPU ** (Graphics Processing Unit) — спочатку призначався для відтворення, тепер є стандартним обладнанням для навчання і запуску нейронних мереж
- TPU (Tensor Processing Unit) — нестандартний мікросхема Google, оптимізований спеціально для машинного навчання
Моделі вагань
** Ваги моделі ** (або ** параметри **) — це числові значення, які вивчаються під час тренування. Коли хтось каже “модель 7B”, вони мають на увазі модель з 7 мільярдами параметрів.
Checkpoint
** контрольна точка ** — це збережений знімок ваги моделі під час тренування. Використовується для відновлення тренування і оцінки якості моделі на різних стадіях тренування.
Pipeline
У ML, конвейер є послідовністю кроків обробки даних — попередня обробка, перетворення, виведення моделі і післяобробка — зазвичай автоматизована.
MLOps
MLOps (Machine Learning Operations) застосовує практику DevOps до машинного навчання: версування моделей, автоматизація навчання і розгортання, моніторинг продуктивності моделі в виробництві.
Практичні терміни для інженерів, які використовують LLM APIs
| Term | Meaning |
|---|---|
| Temperature | Controls randomness (0 = deterministic, 1+ = creative) |
| Top-p (nucleus sampling) | Alternative to temperature for controlling output diversity |
| Max tokens | The maximum output length |
| Stop sequence | A string that tells the model to stop generating |
| Few-shot | Providing examples in the prompt |
| Zero-shot | No examples — just the instruction |
| Chain-of-thought | Prompting the model to reason step by step |
| Streaming | Receiving output token by token as it is generated |
| API rate limit | Max requests per minute/hour/day from the model provider |