Три года назад вы убрали с сайта страницу со старыми ценами. Два года назад - раздел «Наша команда» с именами и телефонами менеджеров. Год назад закрыли направление, которое не выстрелило, и убрали его из меню.
Высокая вероятность, что всё это до сих пор доступно. Просто не на вашем сайте.
Публичные веб-архивы хранят снимки сайтов годами - и системы, которые парсят эту историю, умеют извлекать из неё конкретные данные: имена сотрудников, контакты, историю ценообразования, список клиентов из старых кейсов. Это не взлом и не нарушение закона - данные были публично доступны, когда их сняли.
Разбираю, что именно там хранится, как это используется и что можно сделать.
Если вы только разбираетесь с защитой периметра, полезно начать с общей картины: что о вашей компании видно системам сбора данных.
Что такое веб-архив и как он устроен?
Публичные архивы вроде Wayback Machine автоматически сохраняют снимки страниц интернета. Они не спрашивают разрешения - берут то, что публично доступно. Хранят годами. Дают открытый доступ любому.
Wayback Machine (web.archive.org) - проект Internet Archive, некоммерческой организации из Сан-Франциско. Работает с 1996 года. Роботы-краулеры обходят сайты по всему интернету и сохраняют снимки страниц. Снимок - это копия HTML-страницы с её текстом на конкретную дату.
Как часто снимается конкретный сайт? Зависит от его активности и популярности. Крупные и часто обновляемые сайты - несколько раз в неделю. Небольшие корпоративные сайты - раз в несколько месяцев. Но даже при такой частоте за пять лет набирается несколько десятков снимков.
Помимо Wayback Machine:
- Common Crawl (commoncrawl.org) - некоммерческий архив, данные из которого открыты для скачивания. Используется для обучения языковых моделей, академических исследований, коммерческих датасетов.
- archive.ph (бывший archive.is) - сервис, где страницы сохраняют по запросу, и принципиально не удаляет их.
- Google Cache - кеш поисковика, хранит более свежие снимки, не многолетнюю историю.
Ваш сайт с высокой вероятностью присутствует хотя бы в одном из этих архивов - если он работает дольше пары лет.
Какие именно данные о компании хранятся в архивах?
В архив попадает всё, что было публично доступно: страницы команды с контактами, исторические цены, кейсы с упоминанием клиентов, закрытые направления бизнеса, вакансии с технической начинкой компании.
Разберу по категориям:
Страницы «Команда» и «Контакты»
Многие компании держали страницу с именами, должностями и прямыми телефонами. Потом убрали - выросли, поменялся состав, или решили, что это лишнее. Снимок трёхлетней давности с именами и номерами - в архиве. Часть этих людей уже не работает у вас. Их данные всё ещё там.
Исторические цены и тарифы
Старые прайс-листы показывают, как менялось ценообразование. Когда поднимали цены, насколько, с каким интервалом. По этой хронологии можно понять логику ваших наценок и оценить, где у вас есть пространство для манёвра.
Кейсы с клиентами
Если на старой версии сайта были клиентские истории с названиями компаний - они в архиве. Это прямой список потенциальных контактов для конкурента, который хочет понять, с кем вы работаете.
Закрытые направления и продукты
Запускали направление, не пошло, убрали из меню - страница с описанием и ценами могла быть заархивирована. Конкурент видит, куда вы заходили, как позиционировали, почему, предположительно, не получилось.
Технические страницы и субдомены
Тестовые окружения, страницы с инструментами для внутреннего использования, временные лендинги, старые субдомены - если они возвращали HTTP 200 для любого посетителя, роботы их обошли.
Вакансии
Архивные страницы с вакансиями рассказывают о технологическом стеке, о том, кого искали в конкретный период, какие компетенции считались приоритетными. Это чтение стратегии через кадровую политику.
Как автоматизированные системы парсят историю сайта?
Wayback Machine предоставляет открытый API. Один запрос возвращает список всех снимков домена за любой период. Дальше - автоматический обход страниц и извлечение данных. Без ручного труда.
Это не хакерская атака. Wayback Machine сам предоставляет CDX API - документированный программный интерфейс для разработчиков. Один запрос к нему возвращает список всех URL, которые когда-либо были заархивированы для конкретного домена, с датами снимков и статус-кодами.
Дальше парсер проходит по этому списку, скачивает нужные страницы и применяет инструменты извлечения данных. Телефоны, email-адреса, имена - всё это вычленяется через регулярные выражения или библиотеки обработки текста. Python-библиотеки для этого открытые, доступны любому разработчику.
За несколько часов автоматизированной работы можно получить полную историю изменений сайта: кто работал в компании в каждый из периодов, что предлагали, каких клиентов упоминали, как менялось позиционирование.
«Я удалил страницу» не равно «данные исчезли». К моменту удаления снимок уже мог быть сделан - и остался в базе навсегда.
StopParsing работает с защитой живого периметра - сайтов и телефонов сотрудников. Часть вопросов про архивную историю входит в аудит периметра, с которого начинается работа.
Что конкурент реально узнаёт о вас через историю домена?
Историческая лента сайта - это хронология развития компании. Конкурент читает её как аналитический отчёт: кто работал, с кем работали, как менялась стратегия.
Несколько конкретных сценариев:
Сценарий: выход на бывших сотрудников
Конкурент находит в архивной странице «Команда» имена менеджеров, которые работали у вас два года назад. Находит их в LinkedIn. Пишет им напрямую - с предложением о переходе или просто с вопросами о рынке. Человек уже не работает у вас, никакого нарушения нет. Информация уходит.
Сценарий: прямой контакт с вашими клиентами
Архивные кейсы содержат названия компаний. Конкурент обращается к ним: «мы знаем, что вы работали с компанией Х». Это лучше, чем холодный звонок - есть контекст и точка входа.
Сценарий: реконструкция структуры продаж
Из архивных страниц с ценами виден весь путь ценообразования. Из вакансий - кого нанимали и когда. Из новостей - какие партнёрства заключали. Вместе это даёт понимание, как устроен ваш бизнес изнутри.
Сценарий: история домена
Некоторые компании покупают домены, которые раньше использовались под другие проекты. Или один домен переходил между несколькими бизнесами. История этого домена в архиве - вся. Это может создавать неожиданные ассоциации.
Контакты сотрудников в архиве: что там ищут на самом деле?
Системы ищут не только прямые телефоны, но и шаблоны - email-форматы, структуру имён, схемы именования. По одному найденному контакту вычисляются все остальные.
Открытые контакты сотрудников создают несколько уязвимостей одновременно.
Первая: данные устаревают неравномерно. Телефон двухлетней давности может принадлежать человеку, который сейчас работает у конкурента. Через него можно узнать многое о внутренних процессах.
Вторая: из списка имён и должностей строится карта принятия решений. Кто был коммерческим директором, кто руководил технической службой, кто подписывал контракты. Это понимание, кому звонить, когда заходишь в компанию.
Третья: шаблоны email. Если в архиве виден адрес вида ivan.petrov@company.ru, с высокой вероятностью можно угадать email действующих сотрудников по той же схеме. Это стандартная практика разведки перед холодным обращением в B2B.
Подробнее о том, как персональные данные сотрудников утекают через открытые источники - в отдельном разборе: как данные сотрудников утекают через сторонние сервисы.
StopParsing закрывает два вектора: сайты от систем сбора данных и телефоны сотрудников от парсинга. Начинается с бесплатного аудита периметра - вы передаёте список сайтов и номеров, получаете картину того, что доступно прямо сейчас.
Цена считается индивидуально по результатам аудита - по числу сайтов и номеров, без пакетов вслепую. Записаться на аудит можно на stopparsing.ru.
Что вы убрали с сайта, но не удалили из архивов?
Запросы на исключение из Wayback Machine существуют, но работают на будущее, не на прошлое. Существующие снимки остаются в базе - и данные могут быть уже скачаны.
Распространённое заблуждение: удалил страницу - данных нет.
С точки зрения вашего сайта - да. С точки зрения архивов - нет. Снимок существует. Его можно найти через поиск по дате, через CDX API, через зеркала и кеши.
Wayback Machine позволяет подать запрос на исключение контента - через robots.txt (директива для бота ia_archiver) или через форму на сайте. Это официальный механизм. Работает он преимущественно в отношении новых снимков - существующие исторические копии остаются дольше и могут не удаляться полностью.
Данные к тому же могли быть уже скачаны и сохранены в других базах до того, как вы подали запрос.
Почему самостоятельно «зачистить» архивную историю не получится?
Архивов несколько. Данные уже могут находиться в других базах. Даже если один архив исключит ваш домен - другие продолжат хранить то, что успели скопировать.
Даже при идеальной настройке robots.txt для Wayback Machine остаются другие источники:
- Common Crawl - открытый для скачивания архив, нет механизма удаления по запросу.
- archive.ph - принципиально не удаляет сохранённые копии.
- Перекрёстные ссылки - если другие сайты процитировали ваши страницы, фрагменты существуют в этих источниках независимо от вашего домена.
- Уже скачанные копии - данные, которые были забраны до вашего запроса на исключение, хранятся там, куда их скопировали.
Архив - это не то, что можно откатить.
Как снизить риск утечки через веб-архивы?
Полностью закрыть историю нельзя. Можно сократить поверхность атаки для новых данных и понять, что именно уже доступно, - чтобы принять осознанные меры.
Несколько конкретных шагов:
1. Сделать аудит того, что есть в архивах прямо сейчас
Зайти на web.archive.org, ввести свой домен. Посмотреть ленту снимков. Открыть несколько - особенно старые страницы «Команда», «Контакты», «Цены», кейсы. Это займёт 20-30 минут и даст чёткую картину того, что хранится.
2. Настроить robots.txt для архивных ботов
Добавить директиву, которая ограничит новые снимки для бота Wayback Machine:
User-agent: ia_archiver
Disallow: /
Это не удалит существующие снимки, но сократит объём новых данных, которые попадут в базу.
3. Убрать избыточные данные с живого сайта
Прямые телефоны сотрудников, email-адреса по узнаваемому шаблону, полные имена вместе с должностями на публичных страницах - всё это снижает ценность будущих архивных снимков. Форма обратной связи вместо прямого контакта уменьшает объём данных, доступных для сбора.
4. Понять, что уже утекло
Проверка архивов помогает оценить масштаб. Это нужно не для того, чтобы паниковать, а чтобы принять конкретные решения: с какими бывшими сотрудниками стоит поговорить о конфиденциальности, какие клиентские кейсы больше не должны появляться на живом сайте.
5. Ограничить видимость для систем сбора данных на живом сайте
Это отдельная задача - закрыть текущий сайт от парсинга. То, что не попадает в новые снимки, не пополняет архивы. Чем меньше открытых данных на живом сайте, тем меньше ценных данных в будущих снимках.
Подробнее о методах защиты живого сайта: как закрыть сайт от парсеров конкурентов.
Веб-архивы - один из каналов, через который данные о вашей компании становятся доступны конкурентам. Не единственный, но часто недооцениваемый: большинство думают «удалил - значит нет», хотя данные продолжают существовать в архивных базах.
Если хотите понять, какой объём данных о вашем сайте и сотрудниках сейчас доступен системам сбора, - StopParsing начинает с аудита. Передаёте список сайтов и телефонов, получаете реальную картину периметра.
Стоимость рассчитывается индивидуально по результатам аудита - по числу сайтов и номеров, которые нужно закрыть. Без фиксированных пакетов вслепую.
Узнать подробнее об аудите: stopparsing.ru.
StopParsing входит в платформу LEADLIFE - сервисы для B2B-компаний, которым нужен постоянный поток тёплых контактов: перехват клиентов конкурентов, идентификация посетителей сайта, квалифицирующий обзвон и защита от аналогичного перехвата.
Источники
- Internet Archive / Wayback Machine: web.archive.org - публичный веб-архив с 1996 года
- Common Crawl: commoncrawl.org - открытый архив данных веба, доступен для скачивания
- Wayback Machine CDX API: github.com/internetarchive/wayback - документация по программному интерфейсу
- StopParsing: stopparsing.ru - сервис защиты сайта и телефонов сотрудников от парсинга и перехвата
