TF-IDF

Term Frequency — Inverse Document Frequency

Метод оценки значимости слова в тексте относительно других документов.

TF-IDF — формула из двух частей. TF (term frequency) — как часто слово встречается в тексте. IDF (inverse document frequency) — насколько слово редкое во всей коллекции. Перемножив их, получаем вес: высокий — у слов, которые часто в этом тексте, но редки в остальных, то есть характерны именно для темы.

В SEO TF-IDF используют, чтобы понять, какими словами и формулировками топовые тексты раскрывают тему, и каких терминов не хватает вашему контенту. Это помощник для полноты раскрытия, а не прямой фактор ранжирования — поисковики давно считают релевантность сложнее, в том числе через эмбеддинги и LSI.

Суть
вес слова

Оценка значимости термина для конкретного текста

Формула
TF × IDF

Частота в тексте делится на распространённость в корпусе

Зачем
найти нехватку

Подсказывает, каких слов мало против топа конкурентов

TF-IDF помогает закрыть контентный разрыв
Пример

Слово «амортизатор» встречается в твоём тексте 8 раз, но редко на сайтах конкурентов — TF-IDF считает его значимым для темы. Добив такие слова, ты закрываешь контентный разрыв и обходишь топ.

Главная ошибка с TF-IDF — превратить его в чек-лист и набивать «недостающие» слова до зелёных галочек в сервисе. Алгоритм не понимает смысл: он считает совпадение токенов, поэтому переспам терминами легко даёт обратный эффект — текст становится нечитаемым, поведенческие падают, а Яндекс с его упором на релевантность через поведение это видит. Правильный режим — брать из анализа 5-10 действительно тематических слов, которых нет у вас, и вписывать их естественно в новые смысловые блоки, а не рассыпать по абзацам ради частоты.

TF-IDF — это упрощённая модель, которую поисковики переросли ещё в 2010-х. И Яндекс (Палех, Королёв), и Google (BERT, MUM) считают релевантность через нейросетевые эмбеддинги, понимая синонимы и контекст, а не голую частоту слов. Поэтому TF-IDF полезен не как формула ранжирования, а как дешёвый способ найти контентный разрыв с конкурентами из топа: какие подтемы и сущности они раскрывают, а вы упустили. Для семантики глубже работает связка с LSI и проработкой семантического ядра, где слова группируются по смыслу, а не по статистике.

Пример

Вы пишете гайд по подбору амортизаторов и прогоняете топ-10 Яндекса через TF-IDF-анализ в Топвизоре. Сервис показывает, что у конкурентов часто и значимо встречаются «шток», «отбойник», «газомасляный», «дорожный просвет», а у вас их нет. Добавив раздел про устройство амортизатора с этими терминами, вы закрываете разрыв по 4 подтемам и за месяц поднимаетесь с 14-й на 6-ю позицию по основному запрос