Словник для AI Observability і LLM Tracing

Освоєння досконалої англійської лексики для спостережливості штучного інтелекту — сліди, діапазони, оцінки, бюджети токенів, виявлення галюцинацій і профілювання затримки для систем на базі LLM.

Оскільки LLM-powered програми переходять у виробництво, дисципліна спостережливості пристосовується до них. Традиційні метричні дані — процесор, пам’ять, затримка запиту — необхідні, але недостатні для розуміння того, як поводиться система ШІ. З’явився новий словник навколо LLM відстеження, оцінки і моніторингу. Цей посібник містить лексику, необхідну інженерам для створення і експлуатації систем штучного інтелекту.


При цьому значення рН є різним

У звичайній веб- службі запит надходить і виходить детермінована відповідь. Якщо щось не так, ви можете переглянути журнал помилок, запит бази даних або виклик повільної функції. Система піддається аудиту.

У системі, що працює на LLM, «обчислення» є розподілом ймовірності над токенами. Один і той же вхід може дати різні виходи. Система може бути впевнено неправильною — властивість, яку ми називаємо галюцинація. Не існує стека для помилкової відповіді. Спостережливість для LLM вимагає захоплення повного контексту виклику моделі: підказка, параметри моделі, вивід, затримка і ефект наслідків цього виводу.


Використовується лексичний аналіз

Trace

** Trace ** це повний запис одного запиту, який проходить через систему. У розподільному трасуванні (OpenTelemetry, Jaeger) трасування складається з ** розмахів **. Для систем LLM, трасування зазвичай захоплює весь ланцюг від вводу користувача до кінцевої відповіді, включаючи будь-які проміжні виклики інструментів, кроки отримання або виклики моделей.

  • “Трак показує, що пік затримки був на кроці вбудовування, а не виклику генерації.” *

Span

span є однією одиницею роботи у межах трасування — один виклик функції, один запит HTTP або один виклик LLM. Проміжки мають час початку, час завершення і набір ** атрибутів ** (метадані ключ- значення).

  • “Кожен LLM виклик має свій власний обсяг. Я можу бачити кількість токенів, ідентифікатор моделі і затримку для кожного виклику в ланцюзі.”*

Список астероїдів (10001-10100) 1001 Span

Для викликів LLM, окремо, діапазони часто збагачуються:

  • model — назва моделі і версія (наприклад, claude-sonnet-4-5 )
  • ** вхідні знаки ** — кількість знаків у запиті
  • ** output tokens ** — кількість токенів у завершенні
  • ** загальна кількість жетонів ** — сумарна кількість
  • ** latency ** — час від запиту до першого токену (TTFT, time- to- first- token) і час до завершення відповіді
  • ** причина завершення ** — чому модель припинила створення ( stop, max_tokens, tool_use )

Бюджетний тиждень

** Бюджет токенів ** — це максимальна кількість токенів, які буде виділено для певної дії. Керування бюджетами токенів є критичним для контролю вартості і затримки.

  • “Ми перевищуємо наш бюджет на кроці підсумування. Відновлений контекст занадто багатослівний — нам потрібно стиснути його перед тим, як передати його моделі.»*

** Ключові розташування: **

  • ** вичерпати бюджет токенів ** — використовувати всі виділені токени
  • ** обрізати контекст ** — зменшити розмір підказки, щоб вона вмістилася у бюджет
  • ** truncate ** — обрізати вміст, який перевищує обмеження

Оцінка словникового запасу

** Evals ** (короткий термін для оцінок) є еквівалентом LLM для тестів на одиниці. Вони оцінюють якість вихідних даних моделі, або автоматично, або з людським переглядом.

Типи евалів

  • ** Offline eval ** — запуск з фіксованим набором даних перед розгортанням; аналогічно до запуску тестів у CI
  • ** Online eval ** — запуск у реальному режимі з поточним потоком; вибірка реальних вхідних даних і оцінок
  • LLM-as-judge — використовуючи інший LLM для оцінювання виводу первинної моделі (“Ми використовуємо GPT-4o як суддю для оцінювання наших відповідей Claude за точністю, повністю і тоном.”)
  • ** Людська оцінка ** — людина- анотатором оцінює вивід моделі, зазвичай, за високими ставками або суб’ єктивними критеріями

Ключеві метричні оцінки

  • ** Достовірність ** — чи точно вивідний файл відображає джерельний матеріал? (Критичне значення для систем RAG)
  • ** Заземлення ** — чи підтримується вивід у отриманому контексті?
  • ** Релевантність ** — чи відповідає вивід фактичному запитання користувача?
  • ** Галюцинація ** - відсоток виходів, що містять фактично неправильні або не підтверджені твердження
  • ** Токсичність** — наявність шкідливого, образливого або порушуючого правила вмісту

“Наші офлайн-оцінки показують рівень вірності 0,87 на еталонному наборі даних, але наша онлайн-оцінка виявляє більшу кількість галюцинацій при запиті на недавні події — показує межу знань моделі.”


Професійний лексикограф-довідник

Затримка LLM має унікальну форму в порівнянні з традиційними послугами. Ключові показники:

  • ** TTFT ** (Time to First Token) — затримка часу між запитом і появою першого токену у потоці. Критично важливо для програм, що працюють з користувачем, де використовується потокове перетворення.
  • ** TPS ** (токенів на секунду) — швидкість створення; чим вище, тим швидше.
  • ** Затримка E2E ** — затримка від запитів користувача до остаточної відповіді, включаючи отримання, виклики інструментів і створення.
  • p50 / p95 / p99 — вимірювання процентильної затримки. “Наша p99 TTFT становить 4,2 секунди, що вище нашого SLO в 3 секунди.”

Латенційні джерела

У агентній або RAG- системі затримка накопичується протягом декількох кроків:

  • ** Затримка отримання ** — час отримання документів зі сховища векторів або бази даних
  • ** Затримка вбудовування ** — час перетворення тексту на вбудовані вектори
  • ** Затримка генерації ** — час, який потрібно моделі для створення відповіді
  • ** Затримка виклику інструменту ** — час, який знадобиться зовнішньому інструменту (API, базі даних) для відповіді

Система управління мовленням

  • Пром версія — конкретна, збережена ітерація запитання. “Ми працюємо над запитом версії 12 для бот-підтримки. v11 мав більший рівень галюцинацій при запитах на повернення коштів.”
  • ** Регресія підказки ** — коли нова версія підказки працює гірше за попередню під час вимірювань
  • ** системний запит ** — запит на рівні інструкції, який надається моделі перед введенням даних користувачем
  • ** Контекстове вікно ** — максимальний розмір вхідних даних, який модель може обробити за один виклик
  • ** Заповнення контексту ** — заповнення контекстного вікна якомога більшою кількістю відповідної інформації (іноді це може бути ознакою поганого проектування пошуку)

Система виміру температури і вологості

  • ** Температура ** — параметр, що керує випадковістю виводу. Вищий температурний режим = більш різноманітні, творчі відповіді. Нижче = більш детермінований.
  • Top-p (вибірка ядра) — обмежує вибір токенів до найменшого набору токенів, чия сумарна ймовірність перевищує p
  • Top- k — обмежує вибір токенів до k найімовірніших токенів
  • ** Параметри вибірки ** — сукупний термін для температури, top- p, top- k і пов’ язаних з ними параметрів
  • “Ми знизили температуру з 0, 8 до 0, 2 для завдання класифікації. Вищий рівень вводив занадто багато варіабельності.»*

Ключовий словниковий запас

  • ** Trace ** — повний запис запиту, який пройшов через систему
  • ** Обсяг ** — одиниця роботи у межах сліду
  • ** TTFT ** — час до першого токену, затримка до першого потокового токену
  • ** Бюджет токенів ** — обмеження щодо розміру токенів, що буде виділено для операції
  • ** Оцінка ** — запуск оцінки, який оцінює якість виводу моделі
  • ** Верність ** — чи точно вивід відображає джерельний матеріал
  • ** Галюцинація ** — модель, що генерує неправильну або не підтверджену інформацію
  • ** LLM- as- judge ** — використовує іншу модель для оцінки якості виводу
  • ** Регресія підказки ** — нова версія підказки, яка працює гірше за стару
  • Context window — максимальна кількість токенів, які модель може отримати за один виклик
  • ** Температура ** — параметр вибірки, який керує випадковістю виводу

Спостережливість ШІ є швидко рухомою областю, але концептуальний словник вище є стабільним і все більш стандартним серед інструментів, таких як LangSmith, Arize Phoenix, Traceloop і OpenTelemetry’s LLM семантичні конвенції. Знаючи ці терміни, ви зможете брати участь у технічних переглядах проекту, читати панелі керування моніторингу і писати точніші підручники для систем штучного інтелекту.

Поширені запитання

Про що ця стаття "Словник для AI Observability і LLM Tracing"?

Освоєння досконалої англійської лексики для спостережливості штучного інтелекту — сліди, діапазони, оцінки, бюджети токенів, виявлення галюцинацій і профілювання затримки для систем на базі LLM.

Чи безкоштовна ця стаття?

Так. Усі статті на CoderSlingo, включно з цією, доступні безкоштовно без реєстрації.

Скільки часу займає читання "Словник для AI Observability і LLM Tracing"?

Приблизно 8 min.