TF-IDF / BM25 анализ
Анализ релевантности страницы на основе конкурентов

Вход

У меня есть код приглашения
TF-IDF / BM25 анализ

Смена пароля

Требования к паролю изменились: минимум 12 символов. Задайте новый пароль, чтобы продолжить.
После смены все остальные устройства будут разлогинены.

Интеграции

XMLRiver (xmlriver.com → настройки сбора)

Open PageRank (openpagerank.com → API)

TF-IDF/BM25
⎋ Выйти
🏠 Главная
👤 Личный кабинет
Профиль Интеграции Выход
🛠 Инструменты
Гибридный анализ релевантности Дизайн A/B эксперимента Сбор сезонности Поиск конкурентов Мониторинг изменений Проверка на каннибализацию Поиск дублей страниц
ⓘ Информация
Описание FAQ
🔧 Администрирование
Безопасность0 Логирование

Дашборд

Профиль · FAQ — инструкции

Профиль

Пароль

Минимум 12 символов. После смены все остальные устройства разлогинятся.

Активные устройства

Расход по инструментам

Безопасность

Пользователи

Приглашения

Регистрация в сервисе возможна только по одноразовому коду. Код показывается один раз при создании — в базе хранится только его хеш.

API-токены

Для машинных клиентов (Telegram-бот). На токены не действуют лимит устройств и автоблокировка — бот ходит в сервис за всех своих пользователей. Передаётся заголовком Authorization: Bearer ….

Журнал событий

Дизайн A/B эксперимента

ⓘ Как пользоваться инструментом

Инструмент решает две задачи: до теста — посчитать, сколько трафика и времени нужно, чтобы тест вообще имел смысл; после теста — понять, есть ли статистически значимая разница между вариантами. Считать дизайн до запуска обязательно: тест, запущенный «на глазок», чаще всего либо не доживает до значимости, либо даёт ложные выводы.

Шаг 1. До теста: рассчитайте выборку и длительность

Базовая конверсия — текущий показатель метрики, которую тестируете (конверсия в заказ, CTR, open rate). Возьмите из аналитики за последние 2–4 недели.

Ожидаемый эффект (MDE) — минимальный прирост, который вы хотите уметь замечать. Два режима: относительный — в процентах от базовой (база 5%, MDE +20% → целевая 6%); абсолютный — в процентных пунктах (база 5%, MDE 1 п.п. → целевая 6%). Чем меньше эффект хотите ловить, тем больше нужна выборка — зависимость квадратичная: эффект вдвое меньше → выборка вчетверо больше.

Количество вариантов — включая контроль. Для A/B/C-теста выберите 3: инструмент сам ужесточит порог значимости (поправка Бонферрони), иначе с ростом числа вариантов растёт шанс ложного «победителя».

Гипотеза: двусторонняя — «есть ли вообще разница?» (стандартный выбор); односторонняя — «вариант B лучше?» (требует меньше выборки, но не заметит ухудшения).

Достоверность — вероятность не принять случайный шум за эффект. 95% — стандарт. 90% допустимо для черновых продуктовых решений, 99% — когда цена ошибки высока.

Мощность — вероятность заметить эффект, если он на самом деле есть. 80% — стандарт: реальный эффект будет пойман в 4 случаях из 5.

Дневной трафик и доля в тесте — сколько визитов в день попадает на тестируемую страницу и какой процент вы готовы пустить в эксперимент.

Шаг 2. Как читать результат

Карточка справа покажет выборку в каждом варианте и всего, целевую конверсию и — главное — длительность в днях при вашем трафике. Ориентиры: тест короче недели держите неделю всё равно (внутринедельная сезонность: будни и выходные конвертят по-разному); тест длиннее 8 недель — практически нереален, увеличивайте MDE, долю трафика или берите более частую метрику (например, клик вместо заказа).

Таблица «Какой эффект можно поймать при вашем трафике» — это меню реалистичных дизайнов: строка, где длительность 2–4 недели, и есть ваш практичный MDE. Если даже +50% требует месяцев — на этой метрике тестировать нечего, трафика мало.

Шаг 3. После теста: подведите итоги

Дождитесь запланированной выборки (не останавливайте тест в момент, когда «разница появилась» — это классическая ошибка подглядывания, она надувает долю ложных побед). Затем внесите по каждому варианту визиты и конверсии, выберите ту же гипотезу и достоверность, что закладывали в дизайн.

В результате: конверсия каждого варианта, доверительный интервал (диапазон, в котором с выбранной достоверностью лежит истинная конверсия; если интервалы вариантов сильно пересекаются — разницы, скорее всего, нет), p-value против контроля (зелёное — значимо, красное — нет) и текстовый вывод: какой вариант значимо лучше или хуже и на сколько процентов.

Правила честного теста

Запускайте варианты одновременно (не «неделя А, потом неделя B»). Держите тест целое число недель. Не меняйте варианты по ходу. Не запускайте два эксперимента на одну и ту же аудиторию одной страницы. Зафиксируйте метрику и MDE до запуска — и не переобувайтесь после. Если тест не долетел до выборки — это «нет данных», а не «нет эффекта».

Словарик

MDE — минимальный обнаруживаемый эффект. α (уровень значимости) = 100% − достоверность; вероятность ложного срабатывания. Мощность (1−β) — вероятность поймать реальный эффект. p-value — вероятность получить такую (или большую) разницу случайно, если на самом деле разницы нет; сравнивается с α. Доверительный интервал — считаем методом Уилсона, корректен и на малых выборках. Поправка Бонферрони — деление α на число сравнений при 3+ вариантах, защита от ложных побед.

До теста

Рассчитать размер выборки и длительность

Подходит для тестирования конверсии в заказ, CTR, open rate. Укажите планируемый трафик — калькулятор посчитает выборку и срок теста.
Заполните параметры и нажмите «Рассчитать»
После теста

Подвести итоги теста

Проверьте, какой из вариантов лучше и можно ли считать результаты значимыми.
ВизитыКонверсии
Введите данные вариантов

FAQ — инструкции по инструментам

Гибридный анализ релевантности
Как запустить анализ, что означает каждая настройка и каждый блок результата, как применять в работе.
Дизайн A/B эксперимента
Инструкция встроена в инструмент — блок «ⓘ Как пользоваться» вверху страницы. Отдельная статья появится позже.
Сбор сезонности
Статья появится позже.
← к сервису · FAQ

Гибридный анализ релевантности — инструкция

Что это за инструмент

Инструмент сравнивает текст вашей страницы с текстами страниц из ТОПа выдачи по заданному запросу и показывает, чем ваша страница отличается от конкурентов на уровне слов: каких слов не хватает, какие недоиспользованы или переспамлены, как выглядят мета-теги и структура у лидеров. Это классический анализ текстовой релевантности (TF-IDF/BM25), дополненный рекомендациями.

Быстрый старт

1. Откройте «Гибридный анализ релевантности». 2. Укажите URL своей страницы. 3. Введите ключевой запрос. 4. На вкладке «Поиск» проверьте регион и глубину ТОПа (нужны ключи XMLRiver в «Интеграциях») — либо на вкладке «Список url-адресов» вставьте конкурентов вручную. 5. Нажмите «АНАЛИЗИРОВАТЬ». Через 10–30 секунд появится отчёт.

Настройки запуска

URL или код страницы вашего сайта

Релевантная страница на вашем сайте — обычный режим: страница будет скачана так же, как её видит поисковый бот.
Исходный код страницы или текст — вставьте HTML или просто текст: удобно проверить черновик до публикации.
Без страницы — анализ только конкурентов: колонки «ваш сайт», рекомендации и нормирование отключаются. Используйте на этапе, когда своей страницы ещё нет.

Поисковой запрос и дополнительные запросы

Основной запрос участвует в подсветке слов, покрытии URL и рекомендациях по BM25. Дополнительные запросы расширяют список «слов запроса» — полезно, когда страница продвигается по группе запросов.

Конкуренты: вкладка «Поиск»

Поисковая система — Яндекс, Google или обе (при «обеих» списки объединяются без дублей доменов). Регион и домен действуют для Яндекса. Устройство — чья выдача собирается. Анализировать ТОП — 10/20/30 результатов (каждая десятка = 1 лимит XMLRiver). Не учитывать домены — агрегаторы и маркетплейсы, которые бессмысленно сравнивать с обычным сайтом. Тип страниц по URL — можно оставить только главные или только внутренние. С домена берётся один URL, ваш сайт исключается автоматически.

Конкуренты: вкладка «Список url-адресов»

2–30 адресов, каждый с новой строки, желательно в порядке выдачи — тогда колонка «Позиция» будет отражать реальные места.

Страница главного конкурента

Необязательное поле. Указанный адрес станет «главным конкурентом»: его облака слов и линия на графиках выводятся отдельно. Если не уверены — не заполняйте.

Поисковый бот (загрузка страниц)

С каким User-Agent скачиваются страницы: YandexBot или Googlebot. Влияет на то, какую версию страницы отдают сайты.

Настройки анализа

Исключать текст в теге noindex — вырезает служебные блоки, которые Яндекс не индексирует.
Учитывать атрибуты alt и title — добавляет тексты атрибутов к тексту страницы.
Учитывать числа — считать ли числа словами.
Нормировать общие значения — медиана, переспам, среднее и «зона <a>» конкурентов умножаются на коэффициент = (слова вашей страницы) / (медиана слов конкурентов). Так показатели сравниваются в масштабе вашего объёма текста, а не «в лоб».
Выводить в процентах — повторы показываются как % от объёма текста.
Исключать союзы, предлоги, местоимения — стоп-слова не попадают в таблицы.
Свой список слов — ваши стоп-слова (единицы измерения, «руб», «шт» и т.п.).

Блоки результата и как их использовать

Гибридный ТОП униграм

Главная таблица: каждая строка — слово (объединены все словоформы, заголовок — самая частая форма; стрелка раскрывает формы). Колонки: TF-IDF ТОП / ваш сайт — важность слова у конкурентов и у вас (сравнивайте между собой: если ТОП заметно выше — слово недоиспользовано); BM25 — та же идея с учётом длины текста; IDF — редкость слова в собранной коллекции (высокий IDF = специфичный термин); Кол-во сайтов — у скольких страниц слово есть; Переспам — максимум повторов у конкурентов, ваш потолок; Среднее / Медиана — типичные повторы в ТОПе, ваша цель; Ваш сайт (повт.) — сколько у вас; <a> по ТОПу / ваш сайт — повторы внутри ссылок (меню, перелинковка). Красное подчёркивание — слова, которых у вас нет; жирное — слова запроса. Работайте сверху вниз: это самые значимые слова темы.

N-граммы

Та же логика для словосочетаний из 2–3 слов, включая предлоги («лизинг для юридических лиц»). Красные — фразы конкурентов, отсутствующие у вас: готовые кандидаты в подзаголовки и текст.

Информация по всем сайтам ТОПа

ТОП релевантности документов — сводная оценка каждой страницы: «Ширина» — % основных слов темы, которые есть на странице; «Глубина» — % слов с повторами не ниже медианы; «Общая» — среднее ширины и глубины; «BM25» — релевантность запросу; «SWBM25» — то же по началу документа (первый экран); «URL» — покрытие адреса транслитом слов запроса; «Общая × BM25» — итоговый рейтинг, по нему сортировка. Ваша строка оранжевая: видно, кому вы проигрываете и по какому параметру. Ниже — расшифровка формулы, покрытие URL, BM25 к запросу с рекомендациями по повторам слов запроса и график «Анализ релевантности выдачи» (клик по легенде включает/выключает линии).

Релевантные пассажи по SWBM25

Фрагменты текста (между html-тегами), наиболее релевантные запросу, с весом за близость к началу документа — у вас и у конкурентов. Смотрите, какими формулировками конкуренты «отвечают» на запрос в первом экране, и усиливайте свои первые абзацы.

Рекомендации по микроразметке

Типы schema.org, найденные у конкурентов и отсутствующие у вас (с перечнем сайтов), и ваша текущая разметка. Внедряйте типы, которые встречаются у нескольких конкурентов.

Сравнительные показатели

Пассажи, слова, символы, text/HTML ratio и медиана элементов каталога: сравнение объёма и структуры вашей страницы с ТОПом. Если у вас 300 слов при медиане 1200 — сначала догоняйте объём, потом тонкая настройка слов.

Анализ релевантности (графики)

Три графика: топ-20 слов вашей страницы, топ-20 по медиане ТОПа и TF-IDF/BM25 по зонам. Линия «Закон Ципфа» — эталонное убывание частот; сильные горбы «Переспама» над остальными линиями — слова, по которым в ТОПе есть спамящие сайты (не ориентируйтесь на них).

Рекомендации по улучшению

По глубине — две таблицы: диапазонная (минимум = медиана или среднее, максимум = переспам; «Общее/Тег А/Текст Добавить-Удалить» — сколько повторов добавить или убрать и в какой зоне) и по медиане для основных слов. Бары «Переспам» показывают, насколько вы выше минимума: красный — превышен максимум ТОПа. «Нерелевантные слова» — есть у вас, нет ни у одного конкурента: кандидаты на сокращение.
По ширине — слова, которых у вас нет: «основные» (у половины конкурентов и чаще) — внедрять обязательно; «дополнительные» — по смыслу.
Примеры внедрения — реальные предложения конкурентов с отсутствующими словами: как источник формулировок.
Мета-теги — ваши Title/Description/H1 с релевантностью запросу и примеры у конкурентов.

Облака слов

Визуальная сверка: если облако «Вашей страницы» заметно беднее облака ТОПа или в центре не те слова — тема раскрыта хуже конкурентов. 18 облаков: TF-IDF/BM25 × зоны (весь текст, ссылки, текст вне ссылок) × ТОП/вы, плюс медиана, переспам и главный конкурент.

Выгрузки

«СКАЧАТЬ XLSX» — таблица униграм со словоформами; у каждой таблицы рекомендаций и n-грамм — своя кнопка; «СКАЧАТЬ PDF ОТЧЁТ» — весь отчёт целиком с раскрытыми секциями.

Рабочий сценарий

1) Соберите ТОП по основному запросу в нужном регионе. 2) В «ТОП релевантности документов» поймите свой разрыв: ширина или глубина. 3) Если ширина — внедрите «основные связанные слова» и отсутствующие n-граммы, опираясь на «Примеры внедрения». 4) Если глубина — пройдите таблицу «Рекомендации по глубине» сверху вниз, доводя повторы до диапазона и распределяя между текстом и ссылками. 5) Приведите Title/Description/H1 к 100% релевантности. 6) Добавьте микроразметку конкурентов. 7) После правок вставьте новый текст через режим «Исходный код» и перепроверьте, не дожидаясь публикации.

Расход лимитов

Режим «Список URL» бесплатен (лимиты XMLRiver не тратятся). Режим «Поиск»: ТОП-10 = 1 лимит, ТОП-20 = 2, ТОП-30 = 3; «Яндекс + Google» — в два раза больше. Загрузка самих страниц лимиты не расходует.

Логирование

Последние 500 строк. Файл: data/app.log (ротация 2 МБ × 3). Раздел виден только владельцу.

  

Сбор сезонности

Выгрузка динамики показов из Яндекс Wordstat через XMLRiver. Расход: 1 фраза = 1 запрос Wordstat. История Вордстата — максимум 2 года.

Задачи

Задач пока нет.

Сезонность

Суммарная сезонность по списку фраз

Топ-10 фраз по объёму

Поиск конкурентов

ТОП-10 Яндекса по запросу: позиции в Яндексе и Google, возраст домена (WHOIS), ИКС, Open PageRank и страницы в индексе Яндекса. Расход: ~12 запросов XMLRiver. Количество страниц в Google не собирается — Google убрал счётчик результатов из выдачи.

Мониторинг изменений

Ежедневная проверка страниц: контент, Title/Description/Canonical/Robots, заголовки H1–H2, микроразметка schema.org, количество ссылок. Снимки сохраняются только при изменениях.

Страницы

Страниц пока нет.

История изменений

Проверка на каннибализацию

Сравнение целевой страницы с другими страницами вашего сайта, конкурирующими по запросу: сигналы релевантности, пересечение контента, перелинковка — и вердикт, почему поисковик их путает.

Вердикт

Сигналы релевантности по запросу

Мета-теги и H1

Слова запроса по страницам

Что уменьшить на нецелевых страницах

Слова, у которых на конкурирующей странице повторов не меньше, чем на целевой, — снизьте их, чтобы целевая доминировала по запросу.

ТОП слов по страницам

Пересечение с целевой страницей

Сравнение с ТОП-10 выдачи

Поиск дублей страниц

Проверка технических дублей: для каждого URL генерируются вариации (http/https, www, слэш, index.php/html, регистр, GET-параметры) и проверяется, что они отдают — 301 на оригинал и 404 это хорошо, 200 с тем же контентом это дубль. Внешние лимиты не тратятся.
Берите типовые страницы: главная, категория, товар, статья.

Гибридный анализ релевантности

ⓘ Описание
Сервис анализирует релевантность продвигаемой страницы относительно заданных конкурентов и указывает на слабые места.
Облака строятся по релевантным словам. Маленькое облако = слабая релевантность.
В таблице красным выделены слова, которые не были найдены на вашей странице.
Основные слова в таблице — общие по всем словоформам и обозначены самой популярной словоформой по заданной выборке. Точные данные по каждой словоформе — в раскрывающемся списке по стрелке.
Все данные таблиц можно выгрузить в Excel.
Нормирование затрагивает значения: «медиана», «переспам», «сред. по топу» и «зона <a> по топу». Коэффициент нормирования равен отношению количества слов на вашей странице к медиане слов по конкурентам — на него умножаются все общие показатели.
IDF уменьшает вес широкоупотребительных слов; считается по загруженной коллекции страниц (сглаженный, по формуле sklearn).
TF-IDF отражает важность использования каждого слова на продвигаемой странице.
Переспам — максимальные значения повторов слова по всем конкурентам.
Пассаж здесь — это часть текста на сайте, разделённая html-тегами.
Медиана количества элементов каталога — медиана количества элементов с одинаковым XPath, за исключением тега <p> (для категорий это список товаров, для галерей — список изображений и т.п.).
В рекомендациях на добавление показаны слова, которые встречаются хотя бы у половины конкурентов. Диапазон идёт от наименьшего значения (медиана или среднее) и до переспама.
Нерелевантные слова — те, которые не встречались ни у одного из конкурентов.
Страницы загружаются с user-agent поискового бота: YandexBot или Googlebot — на выбор.

Постановка новой задачи

Анализ только по конкурентам. Колонки «ваш сайт», рекомендации и нормирование будут отключены.
ТОП собирается через XMLRiver — ключи задаются один раз в «⚙ Интеграции». Сбор ТОП-10 = 1 лимит, ТОП-20 = 2, ТОП-30 = 3.
Каждый с новой строки
Пока работает в тестовом режиме
От 2 до 30 адресов, каждый с новой строки — в порядке выдачи.
Если не уверены — не заполняйте это поле! Конкурент станет первым в анализе.
⚙ Настройки анализа

Гибридный ТОП униграм

Показаны строк
Поиск:
слова, которых нет на вашей странице; жирным — слова из запроса

N-граммы (включая все словоформы)

Информация по всем сайтам ТОПа
Релевантные пассажи по SWBM25
Рекомендации по микроразметке
Сравнительные показатели

Анализ релевантности

Анализ релевантности на основе вашей страницы

На графике 20 самых популярных слов · клик по легенде скрывает/показывает линию

Анализ релевантности на основе медианы

На графике 20 самых популярных слов

Анализ релевантности на основе TF-IDF и BM25

На графике 20 самых популярных слов · серые линии включаются кликом по легенде

Рекомендации по улучшению Вашей страницы

Рекомендации по глубине (повторам слов)
Рекомендации по ширине (наличию слов)
Примеры внедрения
Информация по мета-тегам

Облака слов