TF-IDF (Term Frequency — Inverse Document Frequency) — це статистична міра важливості слова в конкретному документі відносно великої колекції текстів (корпусу). Вона поєднує частоту слова на сторінці з тим, наскільки воно рідкісне в усьому корпусі: часте в документі, але рідкісне загалом слово отримує високу вагу. Формулу запропонували ще у 1970-х.
Простими словами: TF-IDF винагороджує слова, які роблять текст особливим, і знецінює ті, що є всюди. «Кросівки» на сторінці про взуття важать багато, а «і», «на», «це» — майже нічого, хоч трапляються частіше.
Що таке TF-IDF і навіщо він потрібен
Показник побудований на простій ідеї: важливе слово має бути частим саме тут і водночас нечастим деінде. Компоненту IDF (обернену документну частоту) описала британська дослідниця Карен Спарк Джонс ще у 1972 році — і відтоді TF-IDF став класикою інформаційного пошуку. Пошукові системи давно вийшли за його межі (нейромережеві моделі на кшталт BERT розуміють зміст глибше), але як інструмент аналізу тексту TF-IDF досі живий і корисний.
Для SEO це спосіб порівняти свій текст із текстами конкурентів у топі: які терміни й пов’язані поняття вони вживають, а у вас їх немає. Це не про «щільність ключа», а про повноту розкриття теми — про текстову релевантність.
Як рахується TF-IDF
Формула — добуток двох частин:
TF-IDF = TF × IDF
- TF (Term Frequency) — частота слова в конкретному документі.
- IDF (Inverse Document Frequency) — логарифм відношення загальної кількості документів до кількості тих, де слово зустрічається. Чим рідкісніше слово в корпусі — тим вищий IDF.
Разом вони дають вагу: висока — коли слово часте в документі та рідкісне в корпусі; низька — коли слово всюдисуще.
Як TF-IDF застосовують у SEO
- Порівняти свою сторінку з топ-конкурентами й знайти терміни, яких бракує.
- Розширити семантику тексту природними супутніми поняттями, а не повторами одного ключа.
- Виявити переспам — слово з аномально високою вагою відносно норми теми.
Приклад
У статті про каву слово «еспресо» має високий TF-IDF: воно часте в тексті й рідкісне в мові загалом. А сполучник «але» — низький: трапляється часто, але є в кожному тексті, тож нічого не додає до теми. Аналіз TF-IDF показав би, що конкуренти ще згадують «помел» і «крема», а ви — ні. Це і є зона для доопрацювання.
Часто плутають з…
- Щільність ключових слів — рахує лише повтори одного ключа; TF-IDF враховує ще й рідкісність слова в корпусі та працює з усім словником теми.
- LSI-копірайтинг — маркетингова назва «писати з супутніми словами»; TF-IDF — конкретна математична міра, а не стиль письма.
Питання та відповіді
TF-IDF — це фактор ранжування Google?
Ні, не окремий фактор. Google не «рахує TF-IDF сторінки» для позицій, але сам принцип (важливе слово часте тут і рідкісне деінде) закладений в основи оцінки релевантності. Для нас це передусім інструмент аналізу.
Чим TF-IDF відрізняється від щільності ключів?
Щільність дивиться лише на повтори одного слова у вашому тексті. TF-IDF додає другий вимір — наскільки слово рідкісне в усьому корпусі, тому не заохочує тупо збільшувати кількість ключів.
Чи актуальний TF-IDF у 2026 році?
Як інструмент аналізу — так. Формулі понад 50 років, і пошук пішов далі до нейромереж, але порівняння свого тексту з топом за TF-IDF досі допомагає знайти прогалини в темі.
Хочете текст, що повно розкриває тему, як у топ-конкурентів? Зробимо аналіз контенту та SEO-копірайтинг.
Схожі терміни: Term Frequency, Текстова релевантність, Щільність ключових слів, Семантичне ядро.