"Рейтинг" слов в индексе Sphinx

Настроил Sphinx. Проиндексировал source. Решил оптимизировать список стоп-слов, а заодно посмотреть часто употребляемые слова в базе - т.е. вывести слова в моем индексе Sphinx в порядке убывания "встречаемости".

Нужно получить, что-то вроде списка "слово_в_приведенной_форме": количество_вхождений. Пример:

и: 1394783948
в: 3482575
дом: 23415
участок: 1241
синхрофазатрон: 1

Как это сделать?


Ответы (1 шт):

Автор решения: Manticore Search

Есть специальный режим индексации для этого - indexer --buildstops ... --buildfreqs. На уже построенном индексе в общем случае такое сделать невозможно, т.к. начальные формы могут быть потеряны при нормализации токенов (морфология, exceptions и пр).

→ Ссылка