Типовой разговор про защиту сайта заканчивается на одной строчке. «У нас в robots.txt всё закрыто». Дальше собеседник считает вопрос решённым.

robots.txt действительно нужен и действительно работает, только в очень узких границах. Он адресован роботам, которые сами решили его читать. Всем остальным он рассказывает, где у вас лежит интересное.

Ниже - что этот файл делает, что не делает и шесть каналов, по которым данные о компании и её клиентах уходят наружу мимо него.

Что robots.txt умеет на самом деле

Это текстовый файл в корне сайта с рекомендациями для роботов: каким агентам какие разделы обходить.

Три вещи, которые из этого следуют.

Это просьба, а не замок. Поисковые системы правила соблюдают. Сборщик данных читает файл ровно тогда, когда ему это выгодно: распределённые системы обычно соблюдают robots.txt не из уважения, а потому что нарушение файла - лишний сигнал для антибот-детекторов. Тот, кому сигнал безразличен, просто игнорирует строки.

Запрет обхода не равен запрету доступа. Страница, закрытая директивой Disallow, остаётся доступна по прямому адресу. Более того, она может остаться в поисковом индексе: чтобы убрать её из выдачи, нужен мета-тег noindex или удаление через панель вебмастера, но тогда роботу нужно разрешить страницу прочитать.

Файл публичный. Он лежит по адресу site.ru/robots.txt и открыт любому. Список закрытых разделов - это готовая карта того, что вы считаете чувствительным. Первое, что делает разведка перед сбором, - читает ваш robots.txt.

Практический смысл файла: управлять нагрузкой и индексацией. Считать его защитой периметра - ошибка масштаба.

Теперь про каналы, где robots.txt не участвует вообще.

Канал 1. Веб-архивы помнят то, что вы удалили

Три года назад вы убрали страницу со старыми ценами. Два года назад - раздел «Наша команда» с именами и прямыми телефонами. Год назад закрыли направление и убрали его из меню.

Всё это, скорее всего, доступно. Просто не на вашем сайте.

Wayback Machine сохраняет снимки страниц с 1996 года. Корпоративный сайт снимается от нескольких раз в неделю до раза в пару месяцев, за пять лет набегает несколько десятков снимков. У архива есть открытый CDX API: один запрос возвращает список всех когда-либо сохранённых адресов домена с датами. Дальше обход и извлечение телефонов, почт и имён обычными библиотеками.

Что из этого достают чаще всего: старые страницы команды с прямыми номерами, историю изменения цен, клиентские кейсы с названиями компаний, закрытые направления, вакансии с описанием внутренней кухни.

Директива для архивного робота помогает только на будущее:

User-agent: ia_archiver
Disallow: /

Сделанные снимки остаются. Плюс существуют Common Crawl, который выкладывают для скачивания целиком, и archive.ph, который принципиально не удаляет сохранённые копии.

Свои копии в архивах смотрят руками, за вечер. Остальные пять каналов так не проверишь: что показывает проверка открытых данных.

Канал 2. Скрипты на ваших же страницах

Пока посетитель заполняет форму, браузер отдаёт события ввода всем скриптам на странице. Их обычно от пяти до пятнадцати: счётчики аналитики, рекламные пиксели, виджеты чата и обратного звонка, тесты интерфейса, запись сессий.

Инструменты записи сессий по умолчанию пишут каждое нажатие клавиши, включая поля телефона и почты. Маскирование чувствительных полей есть почти у всех, но включается вручную. Если его не включали, данные ваших клиентов лежат в стороннем сервисе в открытом виде.

Отдельный механизм - сохранение прогресса и сценарии «бросил форму, напомним письмом». Им нужен адрес почты до отправки, поэтому они забирают его сразу при вводе.

Человек ничего не отправил, у вас в отчёте отказ, а данные уже покинули страницу. robots.txt в этой истории не участвует: скрипты работают в браузере, а не на вашем сервере.

Канал 3. Путь заявки до CRM

Между кнопкой «Отправить» и карточкой в CRM обычно 3-4 звена:

  1. Браузер со сторонними скриптами.
  2. Передача на сервер. При HTTPS содержимое зашифровано, но метаданные видны: домен, время, частота.
  3. Обработчик формы. Если форма собрана на конструкторе или в стороннем сервисе, данные сначала идут на его серверы.
  4. Интеграционный слой: вебхук или сервис-посредник. Любой, кто знает адрес вебхука, может в него писать.

Каждое звено - отдельное юрлицо с копией персональных данных ваших клиентов. Это не только вопрос перехвата: по 152-ФЗ передача данных обработчику оформляется поручением и должна быть покрыта согласием субъекта. Проверять эту цепочку обычно некому: маркетолог ставил виджет, подрядчик настраивал интеграцию, оба уже сменились.

Канал 4. Ваши цифры видимости лежат в открытом доступе

Сборщику незачем взламывать вашу аналитику, чтобы понять, что сайт стал интереснее. Динамика видимости, число страниц в индексе, позиции по коммерческим запросам, оценки посещаемости - всё это отдают публичные инструменты, которыми пользуется любой оптимизатор.

Логика приоритета простая: сайт с растущей органикой по коммерческой семантике - это поток людей, которые уже сформулировали запрос словами «купить», «цена», «заказать». Их не нужно прогревать. Чем лучше идёт ваше продвижение, тем выше приоритет вашего домена у тех, кто настраивает сбор.

Парадокс, с которым приходится жить: тот же рост, который приводит клиентов, делает сайт заметной целью.

Отсюда и приоритет: чем заметнее домен, тем раньше его закрывают. Посмотреть, какие каналы открыты у вашего.

Канал 5. Поведение посетителей, а не только страницы

Снимают не всех подряд, это дорого и бессмысленно. Фильтруют по трём признакам готовности к покупке:

Платный трафик. Человек искал, кликнул, пришёл. Первичный фильтр он уже прошёл, причём за ваши деньги.

Просмотр коммерческих страниц. Цены, тарифы, кейсы, условия работы. Случайный посетитель туда не заходит.

Повторный визит. В B2B это один из сильнейших маркеров: человек вернулся, значит сравнивает и решает.

Все три типа объединяет одно: тому, кто позвонит первым, останется меньше работы. Поэтому у них наивысший приоритет в любой системе сбора, а у вас в отчёте они выглядят как отказ без конверсии.

Канал 6. Порог входа в сбор данных упал до одного вечера

Раньше сбор требовал программиста: язык, прокси, обход проверок. Это отсекало большинство конкурентов.

Сейчас есть облачные сервисы по подписке и визуальные конструкторы: показываешь мышкой на элемент страницы, говоришь «собирай вот это», нажимаешь запуск. Прокси подешевели, боты научились имитировать паузы и маршруты живого человека, инструкции лежат в открытом доступе.

Практический вывод: рассчитывать, что технический порог отсеет соседа по нише, больше нельзя. Отсеивает только стоимость обхода вашей защиты.

Что делать по порядку

За 30 минут своими силами:

  1. Откройте web.archive.org, введите свой домен, просмотрите ленту снимков. Особое внимание старым страницам «Команда», «Контакты», «Цены» и кейсам с названиями клиентов.
  2. Добавьте директиву для архивного робота, чтобы сократить объём будущих снимков.
  3. Откройте настройки сервиса записи сессий и отметьте поля телефона, почты и имени как чувствительные. Занимает 15-30 минут, закрывает канал целиком.
  4. Соберите список сторонних скриптов на страницах с формами. По каждому ответьте: кто поставил, зачем, что делает с полями.

За неделю с подрядчиком:

  1. Пройдите цепочку заявки до CRM и выпишите всех, у кого есть копия данных. Лишние звенья убрать, оставшиеся оформить документами.
  2. Уберите с живого сайта прямые номера сотрудников и почты по узнаваемому шаблону. Чем меньше данных на живых страницах, тем беднее будущие архивные снимки.
  3. Внесите все домены, поддомены и номера в защиту периметра и держите список актуальным.

Коротко

robots.txt управляет обходом и индексацией. Он не закрывает архивы, чужие скрипты на ваших страницах, цепочку передачи заявки, публичные метрики видимости и поведенческие данные ваших посетителей.

Удаление страницы не удаляет данные: к моменту удаления снимок уже сделан. Отсюда правило простое - не публиковать лишнего сейчас дешевле, чем убирать следы потом.

Стопроцентной защиты не существует, честный ориентир другой: сделать сбор ваших данных дороже и медленнее, чем у соседей по нише.

Посмотреть, что из перечисленного открыто именно у вас, можно с бесплатной проверки открытых данных: передаёте список сайтов и телефонов, получаете перечень каналов: Посмотреть, как закрывают периметр.

Источники

  • Стандарт robots.txt (RFC 9309, Robots Exclusion Protocol).
  • Справка Яндекса и Google по robots.txt: запрет обхода не гарантирует отсутствие страницы в индексе.
  • Internet Archive, Wayback Machine и CDX API: web.archive.org.
  • Common Crawl: commoncrawl.org.
  • Документация Hotjar, Microsoft Clarity, FullStory по маскированию чувствительных полей.
  • Федеральный закон от 27.07.2006 № 152-ФЗ, ч. 3 ст. 6 (поручение обработки).