Англійська мова для інженерії зростання: експериментування, метрика воронки і словник A / B-тестування
A/B тест, holdout group, statistical significance, north star metric, AARRR — англійська лексика для інженерів зростання в експериментальних оглядах і зустрічах з аналізу воронки.
Інженерія зростання знаходиться на перетині продукту, даних і інженерії - і має багатий власний словник. У зустрічах з перегляду експериментів, сесіях аналізу канатів і ретроспективах спринтів, інженери зростання використовують точну статистичну і продуктову мову, яка може бути незнайомою навіть досвідченим розробникам.
У цій статті ви дізнаєтесь, яким словниковим запасом вам слід володіти, щоб впевнено брати участь у обговореннях зростання англійською мовою, а також дізнаєтесь про фрази і слова, які використовують команди зростання.
A/B-тестування
** A/B тест ** (також відомий як * split test *) є експериментом, в якому користувачів випадково ділять на групи, які отримують різні версії функції, елемента інтерфейсу або потоку. Метою є вимірювання того, яка версія дає кращий результат.
«Ми провели A/B тестування на кольорі кнопки оплати. Варіант перевершив контроль на 4,2% за ступенем конверсії»
** Багатозначний тест ** розширює модель A/B для одночасного тестування декількох змінних — наприклад, кольору кнопки * і * тексту кнопки водночас.
«Мультиваріантний тест дозволяє нам оцінити ефекти взаємодії між заголовком і CTA копією. Недоліком є те, що нам потрібен набагато більший розмір вибірки»
контроль (або контрольна група) — це група користувачів, які бачать існуючі, незмінні інтерфейси. ** Група обробки ** (також відома як * група варіантів *) бачить нову версію.
“Контрольна група бачить поточний поток набору. Лікування А бачить скорочену версію. Лікування B бачить відео-проходження»
** Група, що не бере участі ** це набір користувачів, які навмисно виключені з тесту — а іноді з декількох експериментів — щоб служити довгостроковою базою. Вони використовуються для вимірювання кумулятивного ефекту всіх змін з часом.
“Ми підтримуємо 5% групу, що не бере участі у всіх експериментах. Порівняння стійкості до повної популяції кожного кварталу говорить нам, чи наша експериментальна програма дійсно рухає голку»
Статистика в простій англійській
** Статистична значущість ** означає, що результат експерименту малоймовірно буде отримано випадковим чином. Поріг зазвичай виражається як p-значення.
«Різниця статистично значуща на 95% рівні довіри — іншими словами, є менше ніж 5% шансів, що цей результат є шумом»
Будь обережні з цим терміном. Поширена помилка (навіть серед носіїв мови) — це стверджувати, що результат * є * значущим, коли він * статистично * значущий. Статистична значущість не означає, що ефект є великим або значущим на практиці.
p-значення є ймовірністю того, що спостережуваний результат (або більш екстремальний) відбудеться, якщо не буде реальної різниці між групами — нульова гіпотеза була б істинною. Низьке p-значення (зазвичай нижче 0,05) є доказом проти нульової гіпотези.
“Р-значення 0,03, тому ми можемо відкинути нульову гіпотезу. Але розмір ефекту невеликий — нам все ще потрібно вирішити, чи варто це відправляти»
** Довірчий інтервал ** — це діапазон значень, які з певною ймовірністю (зазвичай 95%) містять дійсний розмір ефекту.
“95% довірчий інтервал для підйому становить від +1,8% до +6,4%. Ми впевнені, що ефект позитивний, але величина невідома»
Функціональний аналіз мови
** Аналіз канавки ** — це процес відображення і вимірювання послідовності кроків, які користувачі роблять для досягнення мети (наприклад, реєстрації або здійснення покупки) і визначення місць, де користувачі відмовляються від цієї мети.
«Аналіз канавки показує, що 60% користувачів, які починають поток реєстрації, відмовляються на етапі перевірки електронної пошти. Це наш найбільший протікання»
** Коефіцієнт перетворення ** — це відсоток користувачів, які виконали бажану дію — від клацання кнопкою до придбання підписки.
“Наш рівень конверсії з безкоштовного на платний становить 3,2%. Індустріальний еталон для цієї категорії становить близько 5%, тому є місце для поліпшення»
** Метрика активації ** це певна подія або важлива подія, яка вказує на те, що новий користувач вперше відчув основну цінність продукту.
«Наша активація метрика є ‘користувач створює свій перший проект протягом 48 годин після реєстрації.’ Доки вони не досягнуть цього, вони знаходяться під дуже високим ризиком відмови»
Північна Зірка і AARRR
Метрика північної зірки (NSM) є єдиною метрикою, яка найкраще відображає основну цінність, яку продукт надає своїм користувачам. Це номер, навколо якого організована вся команда зростання.
“Наша північна зірка - це щотижневі активні проекти. Прибуток є відстаючим показником — WAP говорить нам, чи користувачі насправді отримують цінність»
** AARRR framework ** (також називається * pirate metrics *, тому що “AARRR” звучить як пірат) є моделлю воронки, що охоплює п’ять етапів: ** Acquisition ** (користувачі відкривають продукт), ** Activation ** (користувачі мають хороший перший досвід), ** Retention ** (користувачі повертаються), ** Revenue ** (користувачі платять) і ** Referral ** (користувачі рекомендують продукт).
«Ми відобразили наш воронку проти AARRR і виявили, що наш стадіон утримання є найслабшим. Ми добре залучаємо користувачів, але втрачаємо їх в перший тиждень»
Вимовляйте AARRR як літери: «A-A-R-R-R» або просто скажіть «піратські метрики» — використовуються обидва.
Фрази для перегляду експериментів і зустрічей
Використовуйте ці пункти під час зустрічей з читанням експериментів, переглядів спринтів і обговорень даних:
- “Експеримент досяг статистичного значення на 12 день. Ми рекомендуємо рішення корабля.»
- *“Рівень p є межею — 0,07. Я б запропонував провести його ще на тиждень, перш ніж ми його заберемо»
- “Лікування B змінило рівень конверсії на 2,1 відсоткових пунктів, але довірчий інтервал перекриває нуль, тому ми не можемо зробити висновок, що це реальний ефект.”
- “Ми визначили подію активації — користувачі, які підключаються до свого першого джерела даних протягом 24 годин, мають в 3 рази більшу ймовірність залишитися на 30 днів.”
- “Це наша метрика північної зірки. Кожен експеримент, який ми проводимо, повинен мати гіпотезу про те, як він рухає WAP, навіть якщо ми в основному вимірюємо конверсію. “
Ключові слова
| Collocation | Example |
|---|---|
| run an A/B test | ”We’re running an A/B test on the pricing page.” |
| reach statistical significance | ”The test reached significance after 14 days.” |
| move the north star metric | ”Will this experiment move the north star metric?“ |
| analyse the funnel | ”Let’s analyse the funnel to find the biggest drop-off point.” |
| ship the variant | ”We’re shipping the variant to 100% of users next Tuesday.” |
| measure conversion rate | ”We measure conversion rate at each step of the onboarding flow.” |
Practice
Виберіть програму, якою ви регулярно користуєтесь (програму новин, інструмент для створення списку завдань, програму для оплати). Означте, що, на вашу думку, є його ** метрикою північної зірки **. Потім відобразіть його потоки користувачів у AARRR — напишіть одне речення для кожного етапу. Нарешті, напишіть гіпотезу для A/ B- тестування, яке ви запустите для поліпшення стадії ** активації **: * « Якщо ми [змінимо X], ми очікуємо, що [метрика Y] збільшиться через [причину Z]. » * Це стандартний формат гіпотези, який використовується у командах зростання — практикуйтеся у використанні цього формату, поки ви не зможете вільно його говорити.
Навигація по нюансах: цикли зворотного зв’язку та ітеративне поліпшення
Основні поняття - експериментування, воронки, A / B тестування - є ключовими для інженерії зростання, але справжнє розуміння * як * вони комунікують і діють, де багато не-рідних англомовних людей знаходять себе в боротьбі. Це не просто про знання слів; це про розуміння тонких змін у наголосі, неявної невідкладності і очікуваної відповіді в швидкому середовищі. Розглянемо сценарій під час перегляду коду: Ваша колега Сара вказує на потенційну проблему з варіантом A/B-тестування, який Ви реалізували. Вона не просто каже: «Це не статистично значимо». Замість цього вона каже: «Я помітила, що група, що не погоджується, працює значно краще, ніж контрольна група – майже на 15% вище рівень конверсії з цієї функції. Давайте розслідуємо, чому ми не бачили цього в початковому наборі даних, перш ніж випустити це». Різниця очевидна. Друге твердження негайно обрамляє проблему в більшому контексті експерименту і підкреслює потенційний вплив, що призводить до більш фокусованої дискусії, ніж просто заява про відсутність статистичної значимості.
Інша поширена ситуація виникає під час розмов Slack, де обговорюються описи PR. Уявіть, що ви готуєтеся об’ єднати зміну, пов’ язану з новим потоком введення. Ви можете написати щось на зразок: « Об’ єднані зміни для покращення впровадження користувачів — з метою збільшення кількості активацій на 10% на основі нашої системи AARRR (Придбання, активація, утримання, посилання, прибуток). Ця публікація вводить [спеціальну функцію], яку ми відстежуємо за допомогою метрики Північної Зірки нових користувачів, які завершують свій перший урок. Ми будемо уважно стежити за ефективністю воронки протягом наступних двох тижнів, щоб перевірити вплив. “Зауважте, як використовуються такі фрази, як “метрика Північної зірки” і “ефективність воронки” - вони є скороченням для складного розуміння метрики зростання. Ці терміни не мають бути залякуванням; вони представляють зосереджений підхід до вимірювання успіху в рамках визначеного процесу.
Крім того, пам’ ятайте, що чітка, коротка мова * завжди * цінується, незалежно від вашої рідної мови. Надто багатослівні пояснення можуть затемнити основне повідомлення і сповільнити прийняття рішень. Сфокусуйтеся на тому, щоб сформулювати * чому * за вашими експериментами і очікуваним впливом - а не просто описувати * що * ви зробили. І не бійтеся прохання про пояснення! Це цілком прийнятно (і заохочується) сказати: «Чи можете ви розібратися, що означає «статистична значущість» в цьому контексті?» або «Чи можемо ми розбити цю метрику на сегменти користувачів?» Продемонструвати бажання вчитися і розуміти часто цінується більше, ніж бездоганно сформулювати складні ідеї.
Ось приклад використання gcloud CLI для аналізу даних експерименту (припустимо, що ви працюєте з Google Analytics 4):
gcloud beta analytics experiments run --experiment-id my-onboarding-abtest --metric conversions --segment users_completed_tutorial --duration 7d --target-value 0.15
Ця команда є практичною ілюстрацією того, як обговорені концепції — призначення, метрики і моніторинг — застосовуються в реальному світі. Це не стільки запам’ ятовування синтаксису, скільки розуміння * мет*, яка стоїть за командою: спостерігати вплив експерименту на ключову метрику у визначений проміжок часу.