Представление текста как набора слов с их количествами, без учета порядка и синтаксиса.
Фразы «редактор фото» и «фото редактор» в модели мешка слов одинаковы, потому что порядок отброшен. Это выглядит примитивно, но дает быстрый и предсказуемый счет, поэтому лежит в основе TF-IDF и BM25. Ограничение видно сразу: «приложение для похудения» и «приложение против похудения» превращаются почти в одинаковые наборы. Там, где смысл зависит от порядка и отрицаний, нужны модели с контекстом.
Читать: Introduction to Information Retrieval, глава 6; Работа с текстом в scikit-learn