Для ядра примерно на 10 000 запросов я бы вообще убрал из процесса ручную первичную кластеризацию в таблице. Человек здесь нужен не для перебора тысяч строк, а для настройки правил и проверки тех случаев, где алгоритм может ошибиться.
Основной рабочий подход — SERP-кластеризация: сервис получает поисковую выдачу по каждому запросу и сравнивает URL в ТОПе. Если по двум запросам поисковик показывает несколько одинаковых страниц, это сильный практический признак того, что оба запроса можно продвигать одной страницей. Именно на сравнении выдачи построена кластеризация в нескольких крупных SEO-инструментах.
Схема работы с большим ядром
1. Сначала очистить входные данные.
До платного сбора выдачи стоит удалить точные дубли, явно нерелевантные фразы, чужие регионы, мусорные модификаторы и другие запросы, которые всё равно не попадут на сайт.
Это не кластеризация, а снижение количества запросов, за которые придётся получать SERP. Rush Analytics, например, отдельно предусматривает стоп-слова именно для очистки «грязных» ядер до группировки.
Не стоит при этом автоматически склеивать запросы только потому, что они похожи словами. Например, близкие по формулировке коммерческий и информационный запросы могут требовать разных страниц.
2. Зафиксировать поисковик и регион.
Кластеризация должна собираться под ту выдачу, где вы реально продвигаетесь. Для Яндекса и Google результаты могут отличаться; локальная выдача также зависит от выбранного региона.
Если проект ориентирован в основном на Яндекс в конкретном регионе — группировать логичнее по этой выдаче. Если основной источник органического трафика Google — по Google. Для международных проектов отдельно фиксируются страна и язык. Некоторые системы дополнительно позволяют задать устройство.
3. Запустить автоматическую кластеризацию по ТОП-10.
Для 10 000 запросов это нормальный промышленный объём, а не экстремальный. Например, Keyword Insights документирует загрузку до 200 000 ключевых слов за одну задачу, Топвизор заявляет работу с ядрами вплоть до сотен тысяч запросов.
На выходе должны быть как минимум:
- запрос;
- кластер;
- маркерный запрос;
- частотность;
- число совпадений выдачи;
- желательно — целевой или уже ранжирующийся URL.
Hard или Soft?
Если результат нужен именно для проектирования посадочных страниц, я бы начинал с Hard-кластеризации либо другого строгого режима.
В распространённой реализации Soft запросы сравниваются прежде всего с центральным маркером. Поэтому запрос A может быть связан с маркером B, запрос C тоже связан с B, хотя непосредственно A и C имеют слабое пересечение.
Hard проверяет связи строже и обычно создаёт более узкие группы. Цена такой точности — больше некластеризованных запросов и больше отдельных кластеров. Rush Analytics и Arsenkin описывают это различие сходным образом.
Но названия Hard и Soft не являются единым стандартом SEO: конкретная логика алгоритмов отличается между сервисами. Поэтому сравнивать настройки разных инструментов только по названию метода неправильно.
Сколько совпадений ТОПа ставить?
Универсального числа нет.
Топвизор сейчас предлагает Hard со степенью 3 как стартовый вариант, Keyword Insights использует порог 4 по умолчанию. Rush Analytics рекомендует 3–4 для некоторых информационных проектов, около 5 для более строгой группировки товарной семантики и ещё более высокий порог для конкурентных тематик. Это рекомендации конкретных инструментов, а не стандарт Google или Яндекса.
Практически я бы сделал так:
- Взял 200–500 запросов из разных частей ядра.
- Получил варианты кластеризации, например с порогами 3 и 4.
- Проверил 20–30 крупнейших и наиболее коммерчески важных кластеров.
- Выбрал настройку, при которой запросы внутри группы действительно можно закрыть одной страницей.
- Только после этого прогнал все 10 000 запросов.
Это эффективнее, чем сначала кластеризовать всё ядро с произвольной настройкой, а затем вручную исправлять сотни ошибок.
Если структура сайта уже существует
Здесь можно ускориться ещё сильнее.
Сначала выделяются маркерные запросы существующих страниц, после чего остальные фразы автоматически распределяются вокруг этих маркеров. Запросы, которые не удалось привязать, идут во второй проход и формируют новые кластеры.
Такой подход одновременно решает две задачи:
- распределяет семантику по существующим URL;
- показывает, где текущей структуре не хватает отдельных страниц.
Подобную комбинированную схему с ручными маркерами и автоматическим формированием новых групп описывает Rush Analytics; инструменты Топвизора также позволяют работать с целевыми URL.
Где всё-таки нужна ручная работа
После автоматизации не нужно заново просматривать все 10 000 строк. Проверять следует точки с высокой ценой ошибки:
- крупные кластеры с десятками или сотнями запросов;
- смешение информационного и коммерческого интента;
- разные товары или услуги, попавшие в одну группу;
- запросы с несколькими возможными трактовками;
- некластеризованные высокочастотные или коммерчески важные фразы;
- кластеры, которым алгоритм назначил сомнительный существующий URL;
- соседние группы, которые по бизнес-логике хочется объединить.
Главный критерий проверки простой: можно ли создать одну страницу, которая естественно решает задачу пользователя по всем существенным запросам группы? Если нет — кластер нужно разделять, даже если автоматический алгоритм его объединил.
Обратная ситуация тоже возможна: два автоматически разделённых кластера иногда имеет смысл объединить после ручного просмотра выдачи.
Где использовать нейросеть
LLM или embeddings полезны для предварительной сортировки десятков тысяч запросов по тематике, поиска мусора, маркировки интента, формирования названий кластеров и проверки явных аномалий.
Но полностью заменять ими SERP-кластеризацию я бы не стал. Семантически похожие фразы могут иметь разные выдачи, а внешне разные формулировки — одну и ту же выдачу. Если задача кластеризации состоит именно в решении «одна посадочная или две», фактическое пересечение ранжирующихся страниц даёт более прямой сигнал, чем сходство текста запросов. Это соответствует подходу, который используют Semrush, Ahrefs и специализированные кластеризаторы.
Итоговая схема для 10 000 запросов получается не «ИИ вместо Excel», а:
очистка → SERP-кластеризация → калибровка порога → привязка к URL → ручной контроль спорных групп.
Так основная механическая работа автоматизируется, а ручное время тратится только там, где действительно требуется SEO-решение.