We optimize apps for natural-language store search using Transformers and Machine Learning — so your product is discovered through real user phrasing, not keyword matching
Короткие определения и инженерные разборы понятий, которые встречаются в поиске магазинов приложений, веб-поиске, рекомендательных системах и ИИ-поиске.
Семейство алгоритмов, которые находят почти ближайшие векторы без полного перебора, обменивая часть точности на скорость и экономию памяти. Точный поиск соседей требует сравнить запрос с каждым вектором коллекции. На миллионе...
Инжиниринг в нашем контексте охватывает сразу несколько направлений: • инжиниринг релевантности — направление в поиске, которое занимается тем, чтобы по запросу пользователя выдавались наиболее релевантные результаты. Мы изучаем его методы...
Архитектура, в которой запрос и документ кодируются независимо друг от друга, а соответствие оценивается близостью двух готовых векторов. Векторы всех документов считаются заранее и кладутся в индекс. Во время запроса...
Асимметричная мера: доля элементов одного множества, которые содержатся в другом. Тот же пример: запрос из двух слов, название из четырех. Покрытие запроса текстом равно двум из двух, то есть единице:...
Архитектура, в которой запрос и документ подаются модели одной последовательностью и оцениваются совместно. Модель видит обе части сразу и может учесть, какие именно слова документа отвечают на какие слова запроса....
Размер эффекта, выраженный в единицах стандартного отклонения: разность средних, деленная на объединенное стандартное отклонение. Сдвиг на три позиции при обычном разбросе в одну позицию это сильный эффект: d равен примерно...
DF это число документов коллекции, в которых встретился термин. IDF это обратная величина, показывающая редкость термина, обычно через логарифм. где N это общее число документов в коллекции, df(t) это число...
Отношение размера пересечения двух множеств к размеру их объединения. Расстояние Жаккара равно единице минус этот коэффициент. Множество A это слова запроса: «редактор», «фото». Множество B это слова названия: «фото», «редактор»,...
Метод, при котором для объекта сохраняются k наиболее близких к нему объектов по выбранной метрике. Вместо хранения всех попарных сравнений для каждого ключа оставляют, например, десять самых похожих. Получается компактная...
Раздел машинного обучения, в котором модель обучается упорядочивать список кандидатов, а целевой величиной служит порядок, а не отдельная оценка каждого объекта. Обычная модель регрессии предсказывает число для одного объекта. Чтобы...
Последовательность из n подряд идущих элементов: слов или символов. Для фразы «фоторедактор для сторис» биграммы по словам это «фоторедактор для» и «для сторис». Символьные триграммы для слова «фото» это «фот»...
Метрика качества ранжированного списка, которая суммирует полезность результатов с понижающим коэффициентом по позиции и нормирует сумму на идеальный порядок. Gain это полезность результата, например оценка релевантности от нуля до трех....
Задача выделения в тексте объектов определенных классов: организаций, продуктов, географических названий, дат, жанров. В строке «доставка еды в Алматы от Glovo» модель размечает «Алматы» как локацию, а «Glovo» как организацию....
Мера силы связи двух событий: логарифм отношения наблюдаемой вероятности их совместного появления к вероятности при условии независимости. Слова «машинное» и «обучение» по отдельности встречаются нечасто, но почти всегда рядом друг...
Метод объединения нескольких ранжированных списков, при котором вклад документа зависит от его позиции в каждом списке, а не от значения оценки. где rank(d) это позиция документа в конкретном списке, а...
Число вхождений термина в один документ или в одно поле, иногда в нормированном виде. Описание состоит из двухсот слов, слово «фото» встретилось в нем восемь раз. Это и есть частота...
Дорогой и громоздкий объект, который формально построен и требует постоянного содержания, но практической пользы почти не приносит. Выражение пришло из истории о правителях Сиама, которые дарили белого слона неугодному вельможе....
Структура данных, в которой для каждого термина хранится список документов, где этот термин встречается, часто вместе с частотами и позициями внутри документа. Обычная таблица устроена как «документ и его слова»....
Интент — скрытая переменная (z), описывающая цель пользователя в поисковой или рекомендательной сессии. Система не наблюдает интент напрямую, она оценивает его по запросу, сессионному контексту, показам, кликам, устройству, времени, географии...
Определение типа запроса до выбора стратегии ответа: навигационный, функциональный, обзорный или смешанный. Навигационный запрос – про конкретный продукт, и здесь сильнее всего работает точное совпадение с названием. Функциональный запрос описывает...
Скалярное произведение двух векторов, деленное на произведение их длин. Принимает значения от минус единицы до единицы и измеряет совпадение направления, а не величины. Возьмем короткое описание и длинное описание одного...
Лексическая плотность — семейство показателей, которые сопоставляют количество лексических единиц текста с выбранной единицей нормализации. В словной версии знаменателем служит число слов, в клаузальной — число ранговых клауз. Метрика обрабатывает...
Лексический поиск — это извлечение и ранжирование документов по совпадению термов запроса с термами, сохраненными в индексе. Запрос и документы проходят анализ текста: разбиение на токены, нормализацию, иногда стемминг, лемматизацию,...
Массовое индексирование — это построение или крупное обновление поискового индекса из большого пакета документов, записей, признаков или векторов. На выходе система получает структуры, по которым потом ищет: списки вхождений, словари...
Представление текста как набора слов с их количествами, без учета порядка и синтаксиса. Фразы «редактор фото» и «фото редактор» в модели мешка слов одинаковы, потому что порядок отброшен. Это выглядит...
Приведение разных написаний одной единицы к единой форме. Пользователь пишет «ФОТОРЕДАКТОР», «фоторедактор» и «Фоторедактор». Без нормализации это три разных термина и три разных списка документов. После приведения к нижнему регистру...
Числовой вектор небольшой фиксированной длины, у которого почти все координаты отличны от нуля и ни одна координата по отдельности не соответствует конкретному слову. Сравним два представления одного и того же...
Первый этап обработки запроса, где происходит быстрый отбор ограниченного набора объектов, среди которых имеет смысл искать ответ. В каталоге миллионы приложений, и запускать тяжелую модель для каждого невозможно ни по...
Препроцессинг это цепочка преобразований текста перед записью в индекс и перед сопоставлением с запросом. Токенизация это первый шаг цепочки: разбиение строки на минимальные единицы обработки, токены. Возьмем строку «Photo-Editor PRO...
Префикс это начальная последовательность символов незавершенного запроса. Автодополнение это подбор и сортировка кандидатов по этому префиксу до того, как пользователь закончил ввод. Система хранит отдельный словарь кандидатов с весами. При...
Измеримая характеристика объекта или пары «запрос и объект», которую модель получает на вход. Признаком может быть лексическая оценка BM25, косинусная близость эмбеддингов, длина названия, возраст приложения, доля отказов, средняя оценка....
Вектор, у которого подавляющее большинство координат равны нулю, поэтому хранят только ненулевые значения и их адреса. Например, словарь ниши содержит тридцать тысяч уникальных слов. Значит, у вектора описания тридцать тысяч...
Релевантная обратная связь — это изменение представления запроса или функции ранжирования по оценкам документов, полученным после начального поиска. В классической схеме пользователь помечает найденные документы как релевантные или нерелевантные, после...
В работе Sagi, Kaufmann и Clark термин обозначает компактность контекстных векторов, построенных для отдельных употреблений одного слова. Чем ближе эти векторы друг к другу, тем однороднее контексты употребления терма в...
Сумма произведений соответствующих координат двух векторов. Геометрически связано с углом между ними. Для векторов (2, 0, 1) и (3, 1, 0) скалярное произведение равно 23 + 01 + 1*0, то...
Числовая оценка кандидата, по которой строится порядок выдачи. Скор это внутренняя величина конкретной системы. Он не имеет универсальной шкалы: значение 12,7 в Lucene и значение 0,83 у нейросетевой модели несопоставимы....
Стемминг это грубое усечение слова до основы по формальным правилам. Лемматизация это приведение словоформы к словарной начальной форме с учетом морфологии. Стеммер превращает «фотографии», «фотографий», «фотографию» в «фотограф», не проверяя,...
В лексическом поиске токен — экземпляр последовательности символов, выделенный анализатором из конкретного поля документа или запроса. Токен может содержать текстовое значение, позицию, начальное и конечное смещения, тип и длину позиции....
Популярность – это накопленный объем: сколько всего установок и обращений собрал объект. Трендовость это характеристика движения: насколько быстро объем меняется и ускоряется ли рост в последние дни. Сначала по дням...
Запасная ветка обработки, которая включается, когда основная логика не дает уверенного результата. Пользователь ввел набор букв без смысла. Лексического совпадения нет, семантика не дает уверенной оценки. Вместо пустого экрана система...
Эмбеддинг, или векторное представление, — числовой вектор (z\in\mathbb R^d), поставленный в соответствие объекту так, чтобы его координаты или геометрические отношения с другими векторами были пригодны для некоторой вычислительной задачи. Объектом...