TF-IDF (Term Frequency — Inverse Document Frequency) — это статистическая мера важности слова в конкретном документе относительно большой коллекции текстов (корпуса). Она объединяет частоту слова на странице с тем, насколько оно редкое во всём корпусе: частое в документе, но редкое в целом слово получает высокий вес. Формулу предложили ещё в 1970-х.
Простыми словами: TF-IDF вознаграждает слова, которые делают текст особенным, и обесценивает те, что есть везде. «Кроссовки» на странице про обувь весят много, а «и», «на», «это» — почти ничего, хоть и встречаются чаще.
Что такое TF-IDF и зачем он нужен
Показатель построен на простой идее: важное слово должно быть частым именно здесь и одновременно нечастым в других местах. Компоненту IDF (обратную документную частоту) описала британская исследовательница Карен Спарк Джонс ещё в 1972 году — и с тех пор TF-IDF стал классикой информационного поиска. Поисковые системы давно вышли за его пределы (нейросетевые модели вроде BERT понимают смысл глубже), но как инструмент анализа текста TF-IDF до сих пор жив и полезен.
Для SEO это способ сравнить свой текст с текстами конкурентов из топа: какие термины и связанные понятия они употребляют, а у вас их нет. Это не про «плотность ключа», а про полноту раскрытия темы — про текстовую релевантность.
Как считается TF-IDF
Формула — произведение двух частей:
TF-IDF = TF × IDF
- TF (Term Frequency) — частота слова в конкретном документе.
- IDF (Inverse Document Frequency) — логарифм отношения общего числа документов к числу тех, где слово встречается. Чем реже слово в корпусе — тем выше IDF.
Вместе они дают вес: высокий — когда слово частое в документе и редкое в корпусе; низкий — когда слово вездесущее.
Как TF-IDF применяют в SEO
- Сравнить свою страницу с топ-конкурентами и найти термины, которых не хватает.
- Расширить семантику текста естественными сопутствующими понятиями, а не повторами одного ключа.
- Выявить переспам — слово с аномально высоким весом относительно нормы темы.
Пример
В статье про кофе слово «эспрессо» имеет высокий TF-IDF: оно частое в тексте и редкое в языке в целом. А союз «но» — низкий: встречается часто, но есть в каждом тексте, поэтому ничего не добавляет к теме. Анализ TF-IDF показал бы, что конкуренты ещё упоминают «помол» и «крема», а вы — нет. Это и есть зона для доработки.
Часто путают с…
- Плотность ключевых слов — считает только повторы одного ключа; TF-IDF учитывает ещё и редкость слова в корпусе и работает со всем словарём темы.
- LSI-копирайтинг — маркетинговое название «писать с сопутствующими словами»; TF-IDF — конкретная математическая мера, а не стиль письма.
Вопросы и ответы
TF-IDF — это фактор ранжирования Google?
Нет, не отдельный фактор. Google не «считает TF-IDF страницы» для позиций, но сам принцип (важное слово частое здесь и редкое в других местах) заложен в основы оценки релевантности. Для нас это прежде всего инструмент анализа.
Чем TF-IDF отличается от плотности ключей?
Плотность смотрит только на повторы одного слова в вашем тексте. TF-IDF добавляет второе измерение — насколько слово редкое во всём корпусе, поэтому не поощряет тупо увеличивать количество ключей.
Актуален ли TF-IDF в 2026 году?
Как инструмент анализа — да. Формуле больше 50 лет, и поиск ушёл дальше к нейросетям, но сравнение своего текста с топом по TF-IDF по-прежнему помогает найти пробелы в теме.
Хотите текст, полно раскрывающий тему, как у топ-конкурентов? Сделаем анализ контента и SEO-копирайтинг.
Похожие термины: Term Frequency, Текстовая релевантность, Плотность ключевых слов, Семантическое ядро.
Опишіть свій запит
і ми зробимо для Вас
пропозицію
Напишіть мені, щоб бути в ТОП
- Продвижение сайтов в Днепре
- Продвижение сайтов в Чернигове
- Продвижение сайтов в Николаеве
- Продвижение сайтов в Одессе
- Продвижение сайтов в Виннице
- Продвижение сайтов в Полтаве
- Продвижение сайтов в Черкассах
- Продвижение сайтов в Запорожье
- Продвижение сайтов в Ивано-Франковске
- Продвижение сайтов в Харькове