Компания поставила защиту. Капча, антибот, WAF. Генеральный спокоен: данные закрыты. А через неделю менеджер конкурента звонит вашему ключевому клиенту - и называет ваши цены. Точь в точь из прайс-листа, который вы считали закрытым.

Речь про парсинг - автоматический сбор данных с сайтов. Отличие от взлома: никто не взламывал основной сайт. Его даже не трогали.

Дело в том, что прайс-лист и каталоги с контактами сотрудников - это отдельные цели. Они живут по своим URL-адресам, часто в виде файлов, иногда на других доменах. И у большинства компаний они открыты - даже когда основной сайт под защитой.

Что именно парсят конкуренты - не только главную страницу

Коротко: парсеры идут туда, где лежат нужные данные - это может быть любой URL, не только главная страница.

Данные о вашей компании рассыпаны по десяткам точек. Основной сайт - одна из них. Прайс-лист в PDF - другая. Каталог в Excel на файловом хостинге - третья. Страница с менеджерами и их телефонами - четвёртая. Корпоративный профиль в 2ГИС - пятая.

Стандартная защита сайта работает иначе, чем думают большинство руководителей. Она защищает конкретные страницы сайта от автоматических запросов - закрывает форму входа от брутфорса, главную от скрейпинга, каталог товаров от массового сбора. Это нужная защита. Но она ничего не знает про файл прайс-лист-март-2026.xlsx, который ваш менеджер разместил в облаке и дал ссылку партнёрам.

Конкурент, которому нужны ваши цены, не ломится через защищённый сайт. Он идёт в обход.

Почему прайс-листы чаще всего оказываются вне защиты?

Коротко: прайс - это файл, файлы живут отдельно от сайта, и защита сайта до них не доходит.

Смотрите на типичную схему. Отдел продаж ведёт прайс в Excel. Когда нужно отправить партнёру - загружают в облако (Google Drive, Яндекс.Диск, корпоративный файловый сервер) и отправляют ссылку. Ссылка живёт в письмах, в мессенджерах, в коммерческих предложениях. Через полгода она гуляет в нескольких десятках мест.

Вот эта ссылка - открытая. Никакой защиты на ней нет: облачный сервис не знает, что это корпоративный секрет, и отдаёт файл по прямой ссылке любому, кто её получит. Парсер находит такую ссылку через поиск, через кэш поисковика, через утёкший документ - и забирает файл.

Вторая схема: компания публикует прайс прямо на сайте в разделе для партнёров или для дилеров. URL вида /price.pdf или /catalog/download. Сам сайт стоит за CDN или WAF. Но статические файлы - PDF, Excel, изображения - CDN часто отдаёт напрямую, минуя правила защиты от ботов. Потому что защита настроена для HTML-страниц, а не для файлов. Это частая слепая зона в конфигурации.

Третья схема - прайс на поддомене. Price.company.ru или files.company.ru - технически это отдельный сервер, и настройки безопасности там могут быть другими. Особенно если поддомен создавали быстро, под конкретную задачу, без согласования с теми, кто отвечает за безопасность основного сайта.

Именно поэтому защита сайта и защита данных - разные задачи. Прайс могут снять, не зайдя на основной сайт ни разу.

Посмотреть, как устроена защита периметра - и что входит в аудит

Как собирают данные из каталогов - даже когда страница требует авторизацию

Коротко: каталоги часто передаются через несколько рук, и контроль над ними теряется быстро.

Допустим, каталог доступен только после входа в личный кабинет. Казалось бы, данные защищены. Но каталог скачивают легитимные пользователи - дилеры, дистрибьюторы, партнёры. Среди них может оказаться кто-то, кто передаёт файл конкуренту. Или сам конкурент зарегистрировался как партнёр.

В юридическом смысле здесь нет взлома - это утечка через авторизованный доступ. Парсинг тут работает иначе: скрипт под реальной учётной записью планомерно скачивает обновления каталога. Или это вообще живой человек, зарегистрировавшийся как партнёр.

Отдельная история - прайсы для сравнительных сервисов. Многие компании подключены к агрегаторам: Яндекс.Маркет, price.ru, аналогичные площадки. Для них генерируется YML-фид или CSV-выгрузка. Этот файл обновляется автоматически и часто доступен по прямому URL. Конкурент находит его - и получает актуальные цены в реальном времени. Без капчи, без авторизации, потому что файл создавался для другой цели.

Как конкурент собирает контакты сотрудников - без захода на сайт

Коротко: контакты сотрудников появляются в открытом доступе через несколько разных каналов, каждый из которых - отдельная точка сбора.

Начнём с очевидного. На сайте компании часто есть страница «Команда» или «Контакты отдела продаж» с именами, должностями и телефонами. Эту страницу защищает WAF? Может быть. Но данные с неё уже появились:

  • В Google-кэше и в кэше Яндекса - поисковики периодически сохраняют снимки страниц. Даже если завтра вы закроете страницу, её кэш может жить месяцами.
  • В LinkedIn и других профессиональных сетях - сотрудники сами публикуют своё место работы и контактные данные. Корпоративный телефон в профиле LinkedIn - распространённая практика.
  • В 2ГИС, Яндекс.Справочнике, аналогичных сервисах - при регистрации компании часто указывают имена и телефоны менеджеров. Эти данные открыты для всех.
  • В подписях к письмам - менеджеры рассылают коммерческие предложения, в подписи стоит имя, должность, прямой номер. Получатель письма может передать его, пересылать или просто не удалять. Парсеры собирают подписи из публичных источников.
  • В старых документах - прайсы, КП, договоры, попавшие в открытый доступ, содержат подписи и контактные данные конкретных людей.

Каждый из этих каналов - отдельная точка входа. Ни один из них не связан с вашим основным сайтом. Защита сайта не знает про LinkedIn и не контролирует то, что ваш менеджер вписал в профиль три года назад.

Когда конкурент получает номер телефона менеджера по продажам, он получает прямой канал к человеку, который работает с вашими клиентами. Это уже персонализированная атака на ваш отдел продаж - совсем другой уровень угрозы, чем ценовой демпинг.

Какие данные утекают через сторонние сервисы, которые вы сами подключили

Коротко: интеграции с внешними сервисами часто передают данные наружу - и это предусмотрено технически, просто компании не всегда думают о последствиях.

Счётчики веб-аналитики. Большинство сайтов стоят на Яндекс.Метрике и Google Analytics. Сами по себе они не публикуют ваши данные. Но если конкурент подключил агрегатор трафика (а такие сервисы существуют), он может видеть косвенные показатели - откуда идёт трафик на ваш сайт, какие рекламные кампании работают.

CRM-интеграции. Если ваша CRM синхронизируется с внешними базами данных, а у интеграции слабые настройки доступа - данные могут утекать через API. Это не парсинг в классическом смысле, но результат тот же.

Партнёрские программы. Если ваши партнёры имеют доступ к вашим данным через личный кабинет - каждый партнёр потенциально является каналом утечки. Просто данные слишком легко передать случайно - даже без умысла.

Рекламные пиксели. Ретаргетинговые пиксели собирают данные о посетителях вашего сайта - это их работа. Но в определённых схемах (пиксели перехвата, которые конкурент встраивает через сторонние инструменты) эти данные уходят не только в ваш рекламный кабинет. Именно этот вектор описывается в материалах о перехвате трафика: посетитель ещё не оставил заявку, но его контакт уже у конкурента.

Разобраться в своём случае - что именно открыто для сбора данных в вашем периметре

Чем защита периметра отличается от защиты одного сайта

Коротко: периметр - это все точки, через которые данные о вашей компании уходят наружу. Сайт - только одна из них.

Когда говорят «защитить сайт», подразумевают конкретные меры: капча на формах, WAF от DDoS и скрейпинга, защита от перебора паролей, мониторинг подозрительных запросов. Это правильные меры - но они работают только в рамках того домена, на который они установлены.

Периметр шире. Он включает:

  • Все домены и поддомены, которые есть у компании
  • Файлы, доступные по прямым ссылкам (прайсы, каталоги, документы)
  • Номера телефонов сотрудников, которые используются в рабочих целях
  • Страницы компании в справочниках и агрегаторах
  • Корпоративные профили сотрудников в профессиональных сетях
  • API-эндпоинты и технические интеграции

Конкурент, который хочет собрать данные о вашей компании, идёт по всем этим точкам - по той, которая наименее защищена. Это как замки на дверях: усилить одну дверь, оставив другую открытой, - не решение.

Реальная защита данных означает знать весь периметр - и сделать каждую точку намного сложнее для автоматического сбора. Это значительно повышенный барьер, который делает сбор данных экономически нецелесообразным. 100%-й защиты не существует - но разница в трудозатратах для атакующего вполне ощутима.

Что происходит, если периметр не закрыт

Коротко: конкурент получает информацию, которая позволяет ему действовать раньше вас - зная ваши цены и ваших людей.

Первый сценарий - ценовой демпинг. Конкурент видит ваш прайс-лист в актуальном состоянии. Он знает вашу себестоимость лучше, чем ваши менеджеры знают его. На каждом тендере он делает предложение ровно на столько ниже вашего, чтобы выиграть - не угадывает, а знает.

Второй сценарий - охота за менеджерами. Имея базу телефонов ваших сотрудников, конкурент может предлагать им вакансии с зарплатой чуть выше вашей. Не всем - только ключевым. Тем, кто работает с крупными клиентами или знает особенности вашего продукта.

Третий сценарий - атака на ваших клиентов. Конкурент звонит вашему менеджеру под видом хедхантера, вытаскивает информацию о клиентской базе и выходит на этих клиентов напрямую. Иногда менеджер сам уходит и уводит клиентскую базу. Это тоже начинается с того, что чужие люди получают прямой доступ к вашим сотрудникам.

Четвёртый сценарий - потеря бюджета. Каждый клик, оплаченный вами в рекламе, мог превратиться в заявку. Если посетитель перехвачен до того, как оставил контакт - вы оплатили чужую продажу.

Как проверить, что именно открыто у вас

Коротко: начать с инвентаризации - собрать всё, что потенциально доступно снаружи.

Простой способ - пройти по списку вопросов:

  • Есть ли прайс-листы или каталоги в виде файлов на внешних серверах или в облаке? Кто имеет ссылку?
  • Есть ли поддомены, которые настраивались отдельно от основного сайта? Какая у них защита?
  • Есть ли страница с контактами менеджеров на сайте? Есть ли телефоны сотрудников в открытом доступе в справочниках?
  • Компания зарегистрирована в агрегаторах цен или каталогах для сравнения? Как часто обновляются данные?
  • Используются ли ретаргетинговые пиксели сторонних сервисов?

Каждый «да» - потенциальная точка входа для сбора данных. Не каждая из них сразу опасна: контекст важен. Но чтобы закрыть дыры, их нужно сначала найти.

Именно с этого начинается работа по защите данных: аудит периметра - передаёте список своих сайтов и номеров сотрудников, система показывает, какие данные доступны системам сбора. Без аудита непонятно, где именно строить защиту.

Первый шаг - понять реальный периметр

Защита сайта и защита данных компании - разные задачи с разным охватом. Первая закрывает один домен. Вторая закрывает всё, через что данные могут уйти наружу: файлы, поддомены, номера телефонов, справочники, интеграции.

Пока компания думает, что защищена, потому что на сайте стоит WAF, конкурент снимает прайс через прямую ссылку на файл. Пока менеджеры уверены, что их данные закрыты, их номера уже в базах для обзвона.

Разница между ситуацией «данные собирают» и «данные собирать намного сложнее» начинается с понимания, где именно периметр дырявый.

Посчитать, что именно открыто в вашем периметре - и разобрать защиту под вашу ситуацию на stopparsing.ru


Источники

  • STOPPARSING-FACTS.md - единственный источник фактов о сервисе StopParsing (периметр защиты, четыре шага работы, ценообразование, правовая рамка 152-ФЗ)
  • Общедоступные сведения о механике парсинга файлов, работе WAF и CDN, каналах утечки корпоративных данных