Эталонные запросы: как измерять качество поиска, а не обещать его
Набор реальных запросов с заранее известным верным ответом — самый дешёвый способ понять, стало ли лучше после правки. Как его собрать за час и чем он отличается от метрик из аналитики.
«Поиск стал лучше» — это не факт, а ощущение. Проверить его можно только одним способом: заранее договориться, какой ответ считается верным, и смотреть, сохраняется ли он после каждой правки.
Как собрать набор за час
- Выпишите 15–20 реальных запросов из аналитики. Берите разные: простые, с ограничениями, заведомо безнадёжные.
- Для каждого руками укажите, какая позиция каталога является верным ответом. Спросите менеджера, если сомневаетесь — он отвечает на такое каждый день.
- Для безнадёжных верным ответом будет «ничего нет». Это важные строки: без них поиск быстро скатывается к тому, чтобы выдавать хоть что-то.
Что считать
Достаточно одной цифры: в скольких запросах верный ответ попал в тройку первых. Не средний ранг, не сложные метрики — просто «попал или нет». Такую цифру понимает и разработчик, и владелец площадки.
У нас правило простое: после любой правки поиска, ранжирования или обогащения каталога набор гоняется автоматически. Если верный ответ выпал из тройки, изменение дальше не едет.
Чем это отличается от аналитики
Аналитика показывает, что происходило вчера с реальными людьми, но не отвечает на вопрос «стало ли лучше от этой конкретной правки». Эталонный набор отвечает за секунды и до выкатки. Одно не заменяет другое: набор ловит регрессии, аналитика показывает, что вообще спрашивают.
Начните с двадцати запросов. Даже такой маленький набор ловит большинство поломок, которые иначе замечает клиент.