Robots.txt не является техническим барьером для сборщиков. WAF (веб-файрвол, который фильтрует входящий трафик) не умеет отличать реального посетителя от бота, который собирает контакты. Системы перехвата не взламывают сайты и не нарушают соглашение robots.txt - просто потому что нет технической причины его соблюдать.

По данным Вордстата (замер 13.08.2026), «robots.txt» точно ищут 326 раз в месяц в России. За каждым таким поиском - сайтовладелец, который хочет закрыть сайт от ботов. Большинство из них уверены: настроил файл - защищён. Это не так.

Ниже - 4 канала, через которые контакты уходят к конкурентам. Ни один из них не блокируется стандартными инструментами защиты.

Что делает robots.txt - и чего он не делает

Коротко: robots.txt просит поисковых роботов не индексировать определённые страницы. Это договорённость, не технический запрет.

Парсинг данных с сайта: 4 канала, которые защита не закрывает

Robots.txt - текстовый файл по адресу example.ru/robots.txt. В нём написано, каким ботам на какие страницы не заходить. Поисковые боты Яндекса и Google эти правила соблюдают - им это выгодно: нарушителей могут отрезать от доступа к сайту, и тогда индекс беднее.

Система, которая собирает контакты для конкурента, в такой выгоде не заинтересована. Она прочитает robots.txt и пойдёт дальше. Технически ничто не мешает: файл лежит открыто и ждёт тех, кто готов его уважать. Это добровольный протокол - RFC 9309 (Robots Exclusion Protocol, 2022) прямо указывает, что соблюдение правил «основано на доброй воле», а не на принуждении.

Запрет в robots.txt работает только если бот хочет его соблюдать.

Что делает WAF - и почему он не видит сборщиков

Коротко: WAF блокирует эксплойты и вредоносный трафик. Системы сбора контактов выглядят как обычные посетители - WAF их пропускает.

WAF проверяет каждый запрос к сайту и ищет признаки атаки: SQL-инъекцию, попытки XSS, перебор паролей, аномально высокую частоту запросов. Если запрос выглядит как нормальный браузер - проходит.

Системы перехвата контактов запрашивают страницы именно так: стандартный заголовок, разумная скорость запросов, обычный user-agent. Продвинутые из них добавляют случайные паузы и имитируют движение мыши. С точки зрения WAF - обычный пользователь. Разница в том, что система делает с данными после загрузки, а не в самом запросе.

WAF написан для защиты от тех, кто хочет сломать сайт. Сборщики контактов сайт не ломают - им нужны данные.

Посмотреть, как StopParsing закрывает каналы, которые WAF не видит

Канал 1: прогретый трафик снимают до того, как посетитель заполнил форму

Коротко: посетитель зашёл, изучил, ушёл подумать - и его контакт уже мог попасть в базу конкурента. В аналитике это выглядит как обычный отказ.

Человек зашёл на сайт, провёл несколько минут, никуда не кликнул и ушёл. В метрике - отказ. Конверсия - ноль.

Системы перехвата работают с трафиком через партнёрские сети больших данных - туда, куда robots.txt и WAF не дотягиваются. Часть информации о визите доступна через агрегаторов данных и провайдерские сети: это работает на уровне сетевых событий, до того как посетитель что-то заполнил.

Конкурент, у которого подключена такая система, получает контакт. Звонит сегодня. У вас в аналитике - минус один уникальный посетитель с нулём конверсий. У конкурента - потенциальный клиент в работе.

Ваши деньги на рекламу потрачены. Заявки нет. Зато у конкурента появился лид.

Канал 2: номера сотрудников собирают из открытых источников

Коротко: телефоны менеджеров попадают в базы из hh.ru, форумов, подписей писем, сайтов партнёров. По ним восстанавливают структуру компании и выходят напрямую на нужных людей.

Ваши менеджеры оставляют телефоны везде. Подписи в деловых письмах. Профили на hh.ru в старых вакансиях. Комментарии в профессиональных сообществах. Страницы партнёров и клиентов, где они упомянуты контактным лицом. Сборщик проходит по этим источникам и составляет справочник вашего отдела продаж.

Дальше две ситуации. Первая: конкуренты знают, кому из ваших позвонить напрямую, и переманивают людей или закрывают сделки раньше вас. Вторая: менеджеров заливают спамом именно в то время, когда они должны звонить вашим потенциальным клиентам.

WAF здесь бессилен - телефоны берут с hh.ru, форумов и подписей к деловым письмам. Ваш сайт тут ни при чём, поэтому и robots.txt не спасает.

Подробнее о том, как корпоративный мессенджер создаёт дополнительный канал сбора - в статье «Как корпоративный Telegram сдаёт структуру вашей команды».

Канал 3: данные о звонках читают через незащищённые каналы

Коротко: если каналы связи настроены без достаточной защиты, внешние системы могут знать, кому вы звоните - и зайти к вашим клиентам первыми.

Это не про взлом переговоров. Метаданные звонков - кому звонили, когда, как часто - могут быть доступны через смежные системы: телефонию, интеграции с CRM, API-соединения, которые настроил подрядчик год назад.

Если конкурент знает паттерн ваших звонков, он делает выводы о клиентской базе без прослушки. Достаточно частоты и времени. «Этот номер они набирают каждый вторник - значит, активный клиент в работе».

Robots.txt к этому каналу отношения не имеет. WAF - тоже: он контролирует HTTP-запросы к сайту, а телефония и API-соединения лежат вне его досягаемости.

Канал 4: рекламный бюджет оплачивает трафик, который конкурент уже снял

Коротко: вы платите за клик, посетитель приходит - а его контакт может уже быть у конкурента ещё до того, как он заполнил форму у вас. Конкурент звонит первым, вы ждёте заявку.

Вы запустили кампанию в Директе. Пользователь кликнул, зашёл, читает - и ушёл без заявки. Деньги списаны, конверсии нет.

Если у конкурента работает система перехвата, он получил контакт этого посетителя в процессе визита. Позвонил сегодня вечером, пока вы ждёте следующий визит. Ваш ретаргетинг догоняет его баннерами - но конкурент уже в разговоре.

Рекламный бюджет, по сути, финансирует трафик, который уходит мимо вашей воронки. Настройки кампании здесь ни при чём - канал перехвата работает параллельно с вашей рекламой.

Разобрать свой случай и понять, какие каналы открыты у вас

Почему robots.txt и WAF эти 4 канала не закрывают

Коротко: robots.txt регулирует индексацию, WAF блокирует эксплойты. Ни тот, ни другой не предназначен для защиты от систем сбора данных - это задача другого класса инструментов.

Если сформулировать коротко: robots.txt создан для ботов, которые хотят соблюдать правила. WAF создан для хакеров, которые хотят сломать сайт. Системы перехвата - третий тип: не хотят ломать, не обязаны соблюдать, ведут себя как обычные пользователи.

Это не дыра в ваших настройках. Это принципиальное несовпадение задач.

Антибот-правила WAF помогают против примитивных скриптов, которые грузят страницу слишком быстро или используют явные признаки бота. Продвинутые системы работают с человеческой скоростью, добавляют случайные паузы. WAF не отличит их от настоящего посетителя.

Robots.txt они читают - и игнорируют. Никакой технической причины соблюдать его нет, если вы не поисковый бот с репутацией.

Три из четырёх каналов выше вообще не касаются вашего сайта напрямую: телефоны сотрудников собирают из открытого интернета, данные о звонках берут из телефонии и API, партнёрские сети больших данных работают не через веб-запросы к вашему домену.

Как закрыть все 4 канала

Коротко: закрытие требует специализированной защиты - и по сайтам, и по телефонам сотрудников. StopParsing работает в двух направлениях сразу и закрывает все 4 канала.

Стандартная защита сайта закрывает стандартные угрозы. Для перехвата контактов нужен другой класс инструментов - тот, который работает с теми же источниками данных, что и сборщики.

StopParsing устроен так: вы передаёте список сайтов и телефонов сотрудников. Сначала показываем, что уже доступно системам сбора - без угрозы и без паники, просто факты. После этого составляем план: какие домены и номера закрыть, от каких конкретно каналов.

Дальше ваши данные вносятся под защиту в партнёрские и собственные источники - те самые, которые питают системы перехвата. Источники за каналом 1 (трафик) и каналом 3 (звонки). Канал 2 (телефоны сотрудников) закрывается отдельно: номера вносятся в реестры, которые защищают их от сбора из открытых источников. Канал 4 (рекламный бюджет) закрывается через то, что контакты посетителей перестают утекать на сторону до заявки.

Гарантий абсолютной защиты нет - честно. Есть «намного сложнее собрать», «значительно труднее восстановить оргструктуру». Риск снижается ощутимо, но не исчезает полностью - именно так и работает любая реальная защита.

Стоимость рассчитывается после анализа: зависит от числа сайтов, телефонов и того, что уже попало в открытый доступ. Пакетов вслепую нет.

Среди компаний, которые уже работают с этой защитой, - 87 брендов: автодилеры, недвижимость, производство, финансы. Сервис работает в рамках 152-ФЗ: закрываем только ваши данные.

Узнать, открыты ли эти каналы на вашем сайте

Источники

  • RFC 9309 - Robots Exclusion Protocol (2022), IETF. Определение добровольного характера соблюдения robots.txt. URL: https://www.rfc-editor.org/rfc/rfc9309
  • OWASP Top 10, 2021. Классификация угроз, от которых защищает WAF. URL: https://owasp.org/www-project-top-ten/
  • Яндекс Вордстат, точная частота, замер 13.08.2026, регион Россия. Запрос «robots.txt»: 326 показов в месяц.
  • StopParsing.ru - сервис защиты от парсинга и перехвата данных, работает в правовом поле 152-ФЗ.