Словник для AI Observability і LLM Tracing
Освоєння досконалої англійської лексики для спостережливості штучного інтелекту — сліди, діапазони, оцінки, бюджети токенів, виявлення галюцинацій і профілювання затримки для систем на базі LLM.
Оскільки LLM-powered програми переходять у виробництво, дисципліна спостережливості пристосовується до них. Традиційні метричні дані — процесор, пам’ять, затримка запиту — необхідні, але недостатні для розуміння того, як поводиться система ШІ. З’явився новий словник навколо LLM відстеження, оцінки і моніторингу. Цей посібник містить лексику, необхідну інженерам для створення і експлуатації систем штучного інтелекту.
При цьому значення рН є різним
У звичайній веб- службі запит надходить і виходить детермінована відповідь. Якщо щось не так, ви можете переглянути журнал помилок, запит бази даних або виклик повільної функції. Система піддається аудиту.
У системі, що працює на LLM, «обчислення» є розподілом ймовірності над токенами. Один і той же вхід може дати різні виходи. Система може бути впевнено неправильною — властивість, яку ми називаємо галюцинація. Не існує стека для помилкової відповіді. Спостережливість для LLM вимагає захоплення повного контексту виклику моделі: підказка, параметри моделі, вивід, затримка і ефект наслідків цього виводу.
Використовується лексичний аналіз
Trace
** Trace ** це повний запис одного запиту, який проходить через систему. У розподільному трасуванні (OpenTelemetry, Jaeger) трасування складається з ** розмахів **. Для систем LLM, трасування зазвичай захоплює весь ланцюг від вводу користувача до кінцевої відповіді, включаючи будь-які проміжні виклики інструментів, кроки отримання або виклики моделей.
- “Трак показує, що пік затримки був на кроці вбудовування, а не виклику генерації.” *
Span
span є однією одиницею роботи у межах трасування — один виклик функції, один запит HTTP або один виклик LLM. Проміжки мають час початку, час завершення і набір ** атрибутів ** (метадані ключ- значення).
- “Кожен LLM виклик має свій власний обсяг. Я можу бачити кількість токенів, ідентифікатор моделі і затримку для кожного виклику в ланцюзі.”*
Список астероїдів (10001-10100) 1001 Span
Для викликів LLM, окремо, діапазони часто збагачуються:
- model — назва моделі і версія (наприклад,
claude-sonnet-4-5) - ** вхідні знаки ** — кількість знаків у запиті
- ** output tokens ** — кількість токенів у завершенні
- ** загальна кількість жетонів ** — сумарна кількість
- ** latency ** — час від запиту до першого токену (TTFT, time- to- first- token) і час до завершення відповіді
- ** причина завершення ** — чому модель припинила створення (
stop,max_tokens,tool_use)
Бюджетний тиждень
** Бюджет токенів ** — це максимальна кількість токенів, які буде виділено для певної дії. Керування бюджетами токенів є критичним для контролю вартості і затримки.
- “Ми перевищуємо наш бюджет на кроці підсумування. Відновлений контекст занадто багатослівний — нам потрібно стиснути його перед тим, як передати його моделі.»*
** Ключові розташування: **
- ** вичерпати бюджет токенів ** — використовувати всі виділені токени
- ** обрізати контекст ** — зменшити розмір підказки, щоб вона вмістилася у бюджет
- ** truncate ** — обрізати вміст, який перевищує обмеження
Оцінка словникового запасу
** Evals ** (короткий термін для оцінок) є еквівалентом LLM для тестів на одиниці. Вони оцінюють якість вихідних даних моделі, або автоматично, або з людським переглядом.
Типи евалів
- ** Offline eval ** — запуск з фіксованим набором даних перед розгортанням; аналогічно до запуску тестів у CI
- ** Online eval ** — запуск у реальному режимі з поточним потоком; вибірка реальних вхідних даних і оцінок
- LLM-as-judge — використовуючи інший LLM для оцінювання виводу первинної моделі (“Ми використовуємо GPT-4o як суддю для оцінювання наших відповідей Claude за точністю, повністю і тоном.”)
- ** Людська оцінка ** — людина- анотатором оцінює вивід моделі, зазвичай, за високими ставками або суб’ єктивними критеріями
Ключеві метричні оцінки
- ** Достовірність ** — чи точно вивідний файл відображає джерельний матеріал? (Критичне значення для систем RAG)
- ** Заземлення ** — чи підтримується вивід у отриманому контексті?
- ** Релевантність ** — чи відповідає вивід фактичному запитання користувача?
- ** Галюцинація ** - відсоток виходів, що містять фактично неправильні або не підтверджені твердження
- ** Токсичність** — наявність шкідливого, образливого або порушуючого правила вмісту
“Наші офлайн-оцінки показують рівень вірності 0,87 на еталонному наборі даних, але наша онлайн-оцінка виявляє більшу кількість галюцинацій при запиті на недавні події — показує межу знань моделі.”
Професійний лексикограф-довідник
Затримка LLM має унікальну форму в порівнянні з традиційними послугами. Ключові показники:
- ** TTFT ** (Time to First Token) — затримка часу між запитом і появою першого токену у потоці. Критично важливо для програм, що працюють з користувачем, де використовується потокове перетворення.
- ** TPS ** (токенів на секунду) — швидкість створення; чим вище, тим швидше.
- ** Затримка E2E ** — затримка від запитів користувача до остаточної відповіді, включаючи отримання, виклики інструментів і створення.
- p50 / p95 / p99 — вимірювання процентильної затримки. “Наша p99 TTFT становить 4,2 секунди, що вище нашого SLO в 3 секунди.”
Латенційні джерела
У агентній або RAG- системі затримка накопичується протягом декількох кроків:
- ** Затримка отримання ** — час отримання документів зі сховища векторів або бази даних
- ** Затримка вбудовування ** — час перетворення тексту на вбудовані вектори
- ** Затримка генерації ** — час, який потрібно моделі для створення відповіді
- ** Затримка виклику інструменту ** — час, який знадобиться зовнішньому інструменту (API, базі даних) для відповіді
Система управління мовленням
- Пром версія — конкретна, збережена ітерація запитання. “Ми працюємо над запитом версії 12 для бот-підтримки. v11 мав більший рівень галюцинацій при запитах на повернення коштів.”
- ** Регресія підказки ** — коли нова версія підказки працює гірше за попередню під час вимірювань
- ** системний запит ** — запит на рівні інструкції, який надається моделі перед введенням даних користувачем
- ** Контекстове вікно ** — максимальний розмір вхідних даних, який модель може обробити за один виклик
- ** Заповнення контексту ** — заповнення контекстного вікна якомога більшою кількістю відповідної інформації (іноді це може бути ознакою поганого проектування пошуку)
Система виміру температури і вологості
- ** Температура ** — параметр, що керує випадковістю виводу. Вищий температурний режим = більш різноманітні, творчі відповіді. Нижче = більш детермінований.
- Top-p (вибірка ядра) — обмежує вибір токенів до найменшого набору токенів, чия сумарна ймовірність перевищує p
- Top- k — обмежує вибір токенів до k найімовірніших токенів
- ** Параметри вибірки ** — сукупний термін для температури, top- p, top- k і пов’ язаних з ними параметрів
- “Ми знизили температуру з 0, 8 до 0, 2 для завдання класифікації. Вищий рівень вводив занадто багато варіабельності.»*
Ключовий словниковий запас
- ** Trace ** — повний запис запиту, який пройшов через систему
- ** Обсяг ** — одиниця роботи у межах сліду
- ** TTFT ** — час до першого токену, затримка до першого потокового токену
- ** Бюджет токенів ** — обмеження щодо розміру токенів, що буде виділено для операції
- ** Оцінка ** — запуск оцінки, який оцінює якість виводу моделі
- ** Верність ** — чи точно вивід відображає джерельний матеріал
- ** Галюцинація ** — модель, що генерує неправильну або не підтверджену інформацію
- ** LLM- as- judge ** — використовує іншу модель для оцінки якості виводу
- ** Регресія підказки ** — нова версія підказки, яка працює гірше за стару
- Context window — максимальна кількість токенів, які модель може отримати за один виклик
- ** Температура ** — параметр вибірки, який керує випадковістю виводу
Спостережливість ШІ є швидко рухомою областю, але концептуальний словник вище є стабільним і все більш стандартним серед інструментів, таких як LangSmith, Arize Phoenix, Traceloop і OpenTelemetry’s LLM семантичні конвенції. Знаючи ці терміни, ви зможете брати участь у технічних переглядах проекту, читати панелі керування моніторингу і писати точніші підручники для систем штучного інтелекту.