Типовой разговор про защиту сайта заканчивается на одной строчке. «У нас в robots.txt всё закрыто». Дальше собеседник считает вопрос решённым.
robots.txt действительно нужен и действительно работает, только в очень узких границах. Он адресован роботам, которые сами решили его читать. Всем остальным он рассказывает, где у вас лежит интересное.
Ниже - что этот файл делает, что не делает и шесть каналов, по которым данные о компании и её клиентах уходят наружу мимо него.
Что robots.txt умеет на самом деле
Это текстовый файл в корне сайта с рекомендациями для роботов: каким агентам какие разделы обходить.
Три вещи, которые из этого следуют.
Это просьба, а не замок. Поисковые системы правила соблюдают. Сборщик данных читает файл ровно тогда, когда ему это выгодно: распределённые системы обычно соблюдают robots.txt не из уважения, а потому что нарушение файла - лишний сигнал для антибот-детекторов. Тот, кому сигнал безразличен, просто игнорирует строки.
Запрет обхода не равен запрету доступа. Страница, закрытая директивой Disallow, остаётся доступна по прямому адресу. Более того, она может остаться в поисковом индексе: чтобы убрать её из выдачи, нужен мета-тег noindex или удаление через панель вебмастера, но тогда роботу нужно разрешить страницу прочитать.
Файл публичный. Он лежит по адресу site.ru/robots.txt и открыт любому. Список закрытых разделов - это готовая карта того, что вы считаете чувствительным. Первое, что делает разведка перед сбором, - читает ваш robots.txt.
Практический смысл файла: управлять нагрузкой и индексацией. Считать его защитой периметра - ошибка масштаба.
Теперь про каналы, где robots.txt не участвует вообще.
Канал 1. Веб-архивы помнят то, что вы удалили
Три года назад вы убрали страницу со старыми ценами. Два года назад - раздел «Наша команда» с именами и прямыми телефонами. Год назад закрыли направление и убрали его из меню.
Всё это, скорее всего, доступно. Просто не на вашем сайте.
Wayback Machine сохраняет снимки страниц с 1996 года. Корпоративный сайт снимается от нескольких раз в неделю до раза в пару месяцев, за пять лет набегает несколько десятков снимков. У архива есть открытый CDX API: один запрос возвращает список всех когда-либо сохранённых адресов домена с датами. Дальше обход и извлечение телефонов, почт и имён обычными библиотеками.
Что из этого достают чаще всего: старые страницы команды с прямыми номерами, историю изменения цен, клиентские кейсы с названиями компаний, закрытые направления, вакансии с описанием внутренней кухни.
Директива для архивного робота помогает только на будущее:
User-agent: ia_archiver
Disallow: /
Сделанные снимки остаются. Плюс существуют Common Crawl, который выкладывают для скачивания целиком, и archive.ph, который принципиально не удаляет сохранённые копии.
Свои копии в архивах смотрят руками, за вечер. Остальные пять каналов так не проверишь: что показывает проверка открытых данных.
Канал 2. Скрипты на ваших же страницах
Пока посетитель заполняет форму, браузер отдаёт события ввода всем скриптам на странице. Их обычно от пяти до пятнадцати: счётчики аналитики, рекламные пиксели, виджеты чата и обратного звонка, тесты интерфейса, запись сессий.
Инструменты записи сессий по умолчанию пишут каждое нажатие клавиши, включая поля телефона и почты. Маскирование чувствительных полей есть почти у всех, но включается вручную. Если его не включали, данные ваших клиентов лежат в стороннем сервисе в открытом виде.
Отдельный механизм - сохранение прогресса и сценарии «бросил форму, напомним письмом». Им нужен адрес почты до отправки, поэтому они забирают его сразу при вводе.
Человек ничего не отправил, у вас в отчёте отказ, а данные уже покинули страницу. robots.txt в этой истории не участвует: скрипты работают в браузере, а не на вашем сервере.
Канал 3. Путь заявки до CRM
Между кнопкой «Отправить» и карточкой в CRM обычно 3-4 звена:
- Браузер со сторонними скриптами.
- Передача на сервер. При HTTPS содержимое зашифровано, но метаданные видны: домен, время, частота.
- Обработчик формы. Если форма собрана на конструкторе или в стороннем сервисе, данные сначала идут на его серверы.
- Интеграционный слой: вебхук или сервис-посредник. Любой, кто знает адрес вебхука, может в него писать.
Каждое звено - отдельное юрлицо с копией персональных данных ваших клиентов. Это не только вопрос перехвата: по 152-ФЗ передача данных обработчику оформляется поручением и должна быть покрыта согласием субъекта. Проверять эту цепочку обычно некому: маркетолог ставил виджет, подрядчик настраивал интеграцию, оба уже сменились.
Канал 4. Ваши цифры видимости лежат в открытом доступе
Сборщику незачем взламывать вашу аналитику, чтобы понять, что сайт стал интереснее. Динамика видимости, число страниц в индексе, позиции по коммерческим запросам, оценки посещаемости - всё это отдают публичные инструменты, которыми пользуется любой оптимизатор.
Логика приоритета простая: сайт с растущей органикой по коммерческой семантике - это поток людей, которые уже сформулировали запрос словами «купить», «цена», «заказать». Их не нужно прогревать. Чем лучше идёт ваше продвижение, тем выше приоритет вашего домена у тех, кто настраивает сбор.
Парадокс, с которым приходится жить: тот же рост, который приводит клиентов, делает сайт заметной целью.
Отсюда и приоритет: чем заметнее домен, тем раньше его закрывают. Посмотреть, какие каналы открыты у вашего.
Канал 5. Поведение посетителей, а не только страницы
Снимают не всех подряд, это дорого и бессмысленно. Фильтруют по трём признакам готовности к покупке:
Платный трафик. Человек искал, кликнул, пришёл. Первичный фильтр он уже прошёл, причём за ваши деньги.
Просмотр коммерческих страниц. Цены, тарифы, кейсы, условия работы. Случайный посетитель туда не заходит.
Повторный визит. В B2B это один из сильнейших маркеров: человек вернулся, значит сравнивает и решает.
Все три типа объединяет одно: тому, кто позвонит первым, останется меньше работы. Поэтому у них наивысший приоритет в любой системе сбора, а у вас в отчёте они выглядят как отказ без конверсии.
Канал 6. Порог входа в сбор данных упал до одного вечера
Раньше сбор требовал программиста: язык, прокси, обход проверок. Это отсекало большинство конкурентов.
Сейчас есть облачные сервисы по подписке и визуальные конструкторы: показываешь мышкой на элемент страницы, говоришь «собирай вот это», нажимаешь запуск. Прокси подешевели, боты научились имитировать паузы и маршруты живого человека, инструкции лежат в открытом доступе.
Практический вывод: рассчитывать, что технический порог отсеет соседа по нише, больше нельзя. Отсеивает только стоимость обхода вашей защиты.
Что делать по порядку
За 30 минут своими силами:
- Откройте web.archive.org, введите свой домен, просмотрите ленту снимков. Особое внимание старым страницам «Команда», «Контакты», «Цены» и кейсам с названиями клиентов.
- Добавьте директиву для архивного робота, чтобы сократить объём будущих снимков.
- Откройте настройки сервиса записи сессий и отметьте поля телефона, почты и имени как чувствительные. Занимает 15-30 минут, закрывает канал целиком.
- Соберите список сторонних скриптов на страницах с формами. По каждому ответьте: кто поставил, зачем, что делает с полями.
За неделю с подрядчиком:
- Пройдите цепочку заявки до CRM и выпишите всех, у кого есть копия данных. Лишние звенья убрать, оставшиеся оформить документами.
- Уберите с живого сайта прямые номера сотрудников и почты по узнаваемому шаблону. Чем меньше данных на живых страницах, тем беднее будущие архивные снимки.
- Внесите все домены, поддомены и номера в защиту периметра и держите список актуальным.
Коротко
robots.txt управляет обходом и индексацией. Он не закрывает архивы, чужие скрипты на ваших страницах, цепочку передачи заявки, публичные метрики видимости и поведенческие данные ваших посетителей.
Удаление страницы не удаляет данные: к моменту удаления снимок уже сделан. Отсюда правило простое - не публиковать лишнего сейчас дешевле, чем убирать следы потом.
Стопроцентной защиты не существует, честный ориентир другой: сделать сбор ваших данных дороже и медленнее, чем у соседей по нише.
Посмотреть, что из перечисленного открыто именно у вас, можно с бесплатной проверки открытых данных: передаёте список сайтов и телефонов, получаете перечень каналов: Посмотреть, как закрывают периметр.
Источники
- Стандарт robots.txt (RFC 9309, Robots Exclusion Protocol).
- Справка Яндекса и Google по robots.txt: запрет обхода не гарантирует отсутствие страницы в индексе.
- Internet Archive, Wayback Machine и CDX API: web.archive.org.
- Common Crawl: commoncrawl.org.
- Документация Hotjar, Microsoft Clarity, FullStory по маскированию чувствительных полей.
- Федеральный закон от 27.07.2006 № 152-ФЗ, ч. 3 ст. 6 (поручение обработки).
