Структура данных, в которой для каждого термина хранится список документов, где этот термин встречается, часто вместе с частотами и позициями внутри документа.
Обычная таблица устроена как «документ и его слова». Инвертированный индекс переворачивает эту логику и хранит «слово и его документы». Если бы у нас была книга, обычный порядок соответствовал бы страницам, а инвертированный индекс соответствовал бы предметному указателю в конце: слово «релевантность», страницы 12, 45, 88. Именно поэтому поиск по слову отрабатывает за миллисекунды на миллиардах документов. Система не читает документы, она читает готовый список по термину. Все преобразования текста, которые случились до записи в индекс, нельзя отменить на этапе запроса. Если анализатор при индексации выбросил дефис, поиск с дефисом будет работать по тексту без дефиса.
Читать: Introduction to Information Retrieval, главы 1 и 2; Apache Lucene: модели релевантности