TF-IDF

TF-IDF (Term Frequency — Inverse Document Frequency) — это статистическая мера важности слова в конкретном документе относительно большой коллекции текстов (корпуса). Она объединяет частоту слова на странице с тем, насколько оно редкое во всём корпусе: частое в документе, но редкое в целом слово получает высокий вес. Формулу предложили ещё в 1970-х.

Простыми словами: TF-IDF вознаграждает слова, которые делают текст особенным, и обесценивает те, что есть везде. «Кроссовки» на странице про обувь весят много, а «и», «на», «это» — почти ничего, хоть и встречаются чаще.

Что такое TF-IDF и зачем он нужен

Показатель построен на простой идее: важное слово должно быть частым именно здесь и одновременно нечастым в других местах. Компоненту IDF (обратную документную частоту) описала британская исследовательница Карен Спарк Джонс ещё в 1972 году — и с тех пор TF-IDF стал классикой информационного поиска. Поисковые системы давно вышли за его пределы (нейросетевые модели вроде BERT понимают смысл глубже), но как инструмент анализа текста TF-IDF до сих пор жив и полезен.

Для SEO это способ сравнить свой текст с текстами конкурентов из топа: какие термины и связанные понятия они употребляют, а у вас их нет. Это не про «плотность ключа», а про полноту раскрытия темы — про текстовую релевантность.

Как считается TF-IDF

Формула — произведение двух частей:

TF-IDF = TF × IDF

  • TF (Term Frequency) — частота слова в конкретном документе.
  • IDF (Inverse Document Frequency) — логарифм отношения общего числа документов к числу тех, где слово встречается. Чем реже слово в корпусе — тем выше IDF.

Вместе они дают вес: высокий — когда слово частое в документе и редкое в корпусе; низкий — когда слово вездесущее.

Как TF-IDF применяют в SEO

  • Сравнить свою страницу с топ-конкурентами и найти термины, которых не хватает.
  • Расширить семантику текста естественными сопутствующими понятиями, а не повторами одного ключа.
  • Выявить переспам — слово с аномально высоким весом относительно нормы темы.

Пример

В статье про кофе слово «эспрессо» имеет высокий TF-IDF: оно частое в тексте и редкое в языке в целом. А союз «но» — низкий: встречается часто, но есть в каждом тексте, поэтому ничего не добавляет к теме. Анализ TF-IDF показал бы, что конкуренты ещё упоминают «помол» и «крема», а вы — нет. Это и есть зона для доработки.

Часто путают с…

  • Плотность ключевых слов — считает только повторы одного ключа; TF-IDF учитывает ещё и редкость слова в корпусе и работает со всем словарём темы.
  • LSI-копирайтинг — маркетинговое название «писать с сопутствующими словами»; TF-IDF — конкретная математическая мера, а не стиль письма.

Вопросы и ответы

TF-IDF — это фактор ранжирования Google?

Нет, не отдельный фактор. Google не «считает TF-IDF страницы» для позиций, но сам принцип (важное слово частое здесь и редкое в других местах) заложен в основы оценки релевантности. Для нас это прежде всего инструмент анализа.

Чем TF-IDF отличается от плотности ключей?

Плотность смотрит только на повторы одного слова в вашем тексте. TF-IDF добавляет второе измерение — насколько слово редкое во всём корпусе, поэтому не поощряет тупо увеличивать количество ключей.

Актуален ли TF-IDF в 2026 году?

Как инструмент анализа — да. Формуле больше 50 лет, и поиск ушёл дальше к нейросетям, но сравнение своего текста с топом по TF-IDF по-прежнему помогает найти пробелы в теме.

Хотите текст, полно раскрывающий тему, как у топ-конкурентов? Сделаем анализ контента и SEO-копирайтинг.

Похожие термины: Term Frequency, Текстовая релевантность, Плотность ключевых слов, Семантическое ядро.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-ads-color
    • icon-google-analytics
    • icon-google-partner