TF-IDF

TF-IDF (Term Frequency — Inverse Document Frequency) — це статистична міра важливості слова в конкретному документі відносно великої колекції текстів (корпусу). Вона поєднує частоту слова на сторінці з тим, наскільки воно рідкісне в усьому корпусі: часте в документі, але рідкісне загалом слово отримує високу вагу. Формулу запропонували ще у 1970-х.

Простими словами: TF-IDF винагороджує слова, які роблять текст особливим, і знецінює ті, що є всюди. «Кросівки» на сторінці про взуття важать багато, а «і», «на», «це» — майже нічого, хоч трапляються частіше.

Що таке TF-IDF і навіщо він потрібен

Показник побудований на простій ідеї: важливе слово має бути частим саме тут і водночас нечастим деінде. Компоненту IDF (обернену документну частоту) описала британська дослідниця Карен Спарк Джонс ще у 1972 році — і відтоді TF-IDF став класикою інформаційного пошуку. Пошукові системи давно вийшли за його межі (нейромережеві моделі на кшталт BERT розуміють зміст глибше), але як інструмент аналізу тексту TF-IDF досі живий і корисний.

Для SEO це спосіб порівняти свій текст із текстами конкурентів у топі: які терміни й пов’язані поняття вони вживають, а у вас їх немає. Це не про «щільність ключа», а про повноту розкриття теми — про текстову релевантність.

Як рахується TF-IDF

Формула — добуток двох частин:

TF-IDF = TF × IDF

  • TF (Term Frequency) — частота слова в конкретному документі.
  • IDF (Inverse Document Frequency) — логарифм відношення загальної кількості документів до кількості тих, де слово зустрічається. Чим рідкісніше слово в корпусі — тим вищий IDF.

Разом вони дають вагу: висока — коли слово часте в документі та рідкісне в корпусі; низька — коли слово всюдисуще.

Як TF-IDF застосовують у SEO

  • Порівняти свою сторінку з топ-конкурентами й знайти терміни, яких бракує.
  • Розширити семантику тексту природними супутніми поняттями, а не повторами одного ключа.
  • Виявити переспам — слово з аномально високою вагою відносно норми теми.

Приклад

У статті про каву слово «еспресо» має високий TF-IDF: воно часте в тексті й рідкісне в мові загалом. А сполучник «але» — низький: трапляється часто, але є в кожному тексті, тож нічого не додає до теми. Аналіз TF-IDF показав би, що конкуренти ще згадують «помел» і «крема», а ви — ні. Це і є зона для доопрацювання.

Часто плутають з…

  • Щільність ключових слів — рахує лише повтори одного ключа; TF-IDF враховує ще й рідкісність слова в корпусі та працює з усім словником теми.
  • LSI-копірайтинг — маркетингова назва «писати з супутніми словами»; TF-IDF — конкретна математична міра, а не стиль письма.

Питання та відповіді

TF-IDF — це фактор ранжування Google?

Ні, не окремий фактор. Google не «рахує TF-IDF сторінки» для позицій, але сам принцип (важливе слово часте тут і рідкісне деінде) закладений в основи оцінки релевантності. Для нас це передусім інструмент аналізу.

Чим TF-IDF відрізняється від щільності ключів?

Щільність дивиться лише на повтори одного слова у вашому тексті. TF-IDF додає другий вимір — наскільки слово рідкісне в усьому корпусі, тому не заохочує тупо збільшувати кількість ключів.

Чи актуальний TF-IDF у 2026 році?

Як інструмент аналізу — так. Формулі понад 50 років, і пошук пішов далі до нейромереж, але порівняння свого тексту з топом за TF-IDF досі допомагає знайти прогалини в темі.

Хочете текст, що повно розкриває тему, як у топ-конкурентів? Зробимо аналіз контенту та SEO-копірайтинг.

Схожі терміни: Term Frequency, Текстова релевантність, Щільність ключових слів, Семантичне ядро.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-partner
    • icon-google-analytics
    • icon-google-ads-color