Препроцессинг это цепочка преобразований текста перед записью в индекс и перед сопоставлением с запросом. Токенизация это первый шаг цепочки: разбиение строки на минимальные единицы обработки, токены.
Возьмем строку «Photo-Editor PRO 2026». Анализатор может разбить ее на токены «photo», «editor», «pro», «2026». Другой анализатор оставит «photo-editor» одним токеном. От этого выбора зависит, найдется ли документ по запросу «editor» и будут ли слова считаться соседними.
Читать: Solr: анализаторы; Solr: фильтры; Обзор токенизаторов в Hugging Face