Мера силы связи двух событий: логарифм отношения наблюдаемой вероятности их совместного появления к вероятности при условии независимости.
pmi(x, y) = log( P(x, y) / (P(x) * P(y)) )Слова «машинное» и «обучение» по отдельности встречаются нечасто, но почти всегда рядом друг с другом, поэтому PMI у пары высокий.
Слова «хорошее» и «приложение» встречаются часто и рядом тоже, но лишь потому, что оба частотны сами по себе, поэтому PMI у пары низкий.
PMI отделяет устойчивые словосочетания от случайного соседства частотных слов. На малых выборках мера завышает редкие пары, встретившиеся один или два раза, поэтому в реальных расчетах ставят порог минимальной частоты и часто используют вариант PPMI, где отрицательные значения обнуляются.
Читать: Speech and Language Processing, глава 6 про векторную семантику и PPMI; Foundations of Statistical Natural Language Processing, глава про коллокации