Англійська для пошукової системи Vespa
Вивчає англійську лексику для Vespa: схеми документів, профілі ранжування, тензорні поля і кластери вмісту.
Розмови Vespa поєднують словник пошукової системи, спільний з такими інструментами, як Elasticsearch (схема, індекс) з термінами, що характеризують рейтинг, які є більш незвичайними - тензорне поле, перший-фазовий рейтинг - і розмивання цих двох категорій ускладнює пояснення того, чи є проблема актуальності проблемою даних або проблемою оцінювання.
Ключовий словник
** Схема документа ** — визначення полів типу документа, їх типів, а також того, як кожне поле індексується, збігається і стає доступним для ранжування, оголошено мовою схеми Vespa.
“Це поле не з’ являється в результатах пошуку, тому що воно визначено як attribute тільки в схемі, а не index — воно не є токенізованим для текстового збігу.”
** Профіль ранжування ** — назване налаштування, яке визначає, як буде оцінюватися документ за заданим запитом, об’ єднуючи такі параметри, як збіг тексту, свіжість і популярність, у єдиний бал відповідності. “Ми додали новий профіль рейтингу для мобільного додатка, який більше враховує останні дати, ніж типовий веб- профіль рейтингу.”
** Тензорне поле ** — багатовимірний тип числового поля, який використовується для зберігання вбудованих або інших структурованих числових даних, що дозволяє виконувати такі дії, як добуток точок, безпосередньо всередині виразів ранжування.
- “Зберігати вбудування як поле тензорів, щоб ми могли обчислювати косинусну схожість з вектором запиту під час ранжування, замість того, щоб робити це у окремій службі.” *
** Кластер вмісту ** — група вузлів, відповідальних за зберігання і обслуговування набору типів документів, які можна налаштувати незалежно від кластера контейнера, який обробляє запити. “Ми масштабуємо кластер вмісту окремо від кластера контейнера, оскільки зростання обсягу зберігання і завантаження запитів не зростають з однаковою швидкістю.”
** Перший етап проти другого етапного ранжування ** — двоетапний підхід до оцінювання, де дешева функція першого етапу ранжує всі відповідні документи, а більш дорога функція другого етапу переранжує лише найкращих кандидатів. “Перенести ці дорогі обчислення властивостей у другу фазу ранжування — запуск цього обчислення на кожному відповідному документі в першій фазі збільшує затримку запиту.”
Звичайні фрази
- Чи це поле індексоване для текстового пошуку, чи це просто атрибут, який ми фільтруємо?»
- Який рейтинговий профіль цей запит насправді використовує — за замовчуванням, або нетиповий?»
- Чи можемо ми робити це, якщо ми маємо цю здатність?»
- Чи є кластер вмісту або кластер контейнерів в’язким місцем під цим навантаженням?»
- Чи можемо ми перенести цю дорогу функцію на другий етап рейтингу замість того, щоб запускати її на кожному кандидатові?»
Приклади висловлювань
Зневадження скарги на невідповідність: “Розрахунки не були виконані, оскільки запит викликав типовий профіль рейтингу замість нетипового, який враховує наш сигнал бізнес-пріоритетів — ми ще не встановили новий профіль у цю кінцеву точку.”
Пояснення виправлення затримки: “Ми скоротили затримку p99, перемістивши обчислення тензорної подібності з першої фази до другої фази ранжування, оскільки перша фаза потребує тільки дешевого приблизного результату, щоб сузити набір кандидатів.”
Обговорення рішення щодо масштабування: “Ми масштабували кластер вмісту незалежно від кластера контейнерів цього кварталу — обсяг зберігання швидко зростав від нових типів документів, але обсяг запитів був рівним.”
Професійні поради
- Розрізняти типи полів schema document (
indexпротиattribute) явно під час зневадження відсутніх результатів пошуку — це одне з найпоширеніших джерел плутанини « чому це не показано ». - Назвемо конкретний ранковий профіль, який використовується при обговоренні питання про актуальність — «результати пошуку погані» набагато менш дієвий, ніж «профіль рейтингу
mobileнедооцінює актуальність» - Використовувати ** поле тензорів ** тільки для вбудованих чи структурованих числових даних, а не як синонім будь- якого числового поля — це позначає, що поле підтримує векторні операції у виразах ранжування.
- Посилання ** перший-фаза ** і ** другий-фаза рейтинг ** за назвою, коли пропонується виправлення затримки — це показує, що ви розумієте конкретну двоетапну модель оцінювання Vespa, а не просто “пришвидшує рейтинг.”
Практичні вправи
- Поясніть різницю між полем
indexі полемattributeв одному реченні. - Описати, що контролює профіль ранжування і чому запит може потребувати більше одного профілю.
- Напишіть речення, у якому поясните, чому перший і другий етапи рейтингу існують як окремі етапи.
Поряд з цим, він використовує інші методики: вивчення мовлення, вивчення мовлення з використанням мовлення
Основний словник Vespa - визначення схем, профілі рейтингу, тензорні поля і кластери вмісту - є ключовою основою. Але просто знати, * що * це за речі, недостатньо; вміння ефективно обговорювати їх у професійному середовищі є ключовим для розробників, які працюють над складними проектами пошуку. У цьому розділі описано нюанси вимови, які використовуються у перегляді коду, розмовах у Slack і описах запитів на витягування, коли йдеться про потужні можливості Vespa. Це про перехід за межі простих визначення і продемонструвати складне розуміння того, як ці компоненти сприяють надійному пошуковому рішенні.
Однією з поширених пасток для носіїв мови, яка не є рідною, є надмірно формальна мова або використання жаргону надмірно без контексту. Хоча точність важлива, надто складні речення може бути важко розібрати швидко. Аналогічно, постійне викидання технічних термінів без пояснення * чому * вони актуальні може відчужувати колег. Подумайте про вашу аудиторію — члени вашої команди, ймовірно, є експертами з технологій пошуку, але вони не завжди оцінять докладне пояснення основної математики тензорних полів, якщо ви просто пропонуєте невелику зміну профілю рейтингу. Замість цього, зосередьтеся на ясному, короткому спілкуванні, яке підкреслює вплив ваших змін. Наприклад, замість того, щоб сказати « Розбіжність векторного поля перевищує прийнятні межі », розгляньте « Нам потрібно вдосконалити профіль ранжування, щоб зменшити вплив цієї властивості, оскільки на даний момент вона надмірно підкреслює [конкретний термін]. » Такий підхід негайно повідомляє про проблему і пропонує реальні рішення. Крім того, активний голос майже завжди є кращим — «Я скоригував вагу» є яснішим, ніж «Вага була скоригована мною»
Іншою областю, де можна поліпшити комунікацію, є описи запитів на завантаження. Хороший опис PR не просто говорить що ви змінили; він пояснює чому. Розробникам, які переглядають ваш код, потрібно розуміти мотиви ваших рішень, що дозволить їм швидко оцінити дійсність ваших змін і надати вам цілеспрямований зворотній зв’ язок. Не приймайте за правило, що вони автоматично знають, чому ви обираєте певний профіль рейтингу або змінюєте поле тензорів. Надати контекст — коротко описати проблему, яку ви намагаєтеся розв’ язати, і те, як ця зміна її вирішує. Добре структурований опис PR демонструє професіоналізм, полегшує співпрацю і, в кінцевому підсумку, прискорює процес перегляду.
Нарешті, пам’ятайте, що конструктивну критику часто найкраще донести з емпатією. Зворотній зв’ язок у вигляді бажаних результатів, а не вказівки на недоліки. Замість того, щоб сказати « Цей запит не працює добре », спробуйте сказати « Давайте дослідимо способи поліпшення рейтингу для цього певного типу запиту ». Невеликий такт може значно допомогти у створенні позитивного і продуктивного середовища для роботи команди.
# Vespa - Querying with Filters
This command demonstrates filtering results based on multiple criteria using Vespa's powerful filter syntax. The `query` command accepts a JSON payload containing the desired filters. The example below searches for documents that contain both "python" AND "programming" within their content, and also have a score greater than 0.8.
```json
{
« запит »: {
« filter »: [
{
« збіг »: {
« content »: « програмування на Python »
}
},
{
« діапазон »: {
« оцінка »: {
_gte: 0.8
}
}
}
[
}
}