Парсинг сайтов: как собирать данные легально

Все статьи
Все статьи
Редакция Neurounit
12 июля 2026
Обновлено 22 августа 2026
SEO
Парсинг сайтов: как собирать данные легально
Парсинг данных с сайтов без штрафов и блокировок: что законно, а что нет, правила по robots.txt, персональным данным и 152-ФЗ, чек-лист сбора.

Парсинг сайтов перестал быть серой зоной в 2024 году, когда за незаконный сбор компьютерной информации с персональными данными в УК РФ появилась статья 272.1 с санкцией до четырёх лет лишения свободы. Техническая сторона поменялась не меньше: по данным Imperva, в 2024 году автоматический трафик впервые за десять лет обогнал человеческий и занял 51% обращений к сайтам, а доля вредоносных ботов выросла до 37% всего трафика против 32% годом ранее. Ниже разбор того, что можно забирать, какие нормы это ограничивают и как построить сбор, который переживёт первую неделю.

Парсинг данных с сайта: где проходит граница дозволенного

Нормы со словом «парсинг» в российском праве нет. Есть четыре рамки, и проверять задачу нужно по каждой отдельно.

Рамка Норма Что ограничивает
Смежные права на базу данных ст. 1334 ГК РФ Извлечение существенной части содержимого чужой базы
Персональные данные 152-ФЗ, ст. 10.1 и ст. 22 Сбор и дальнейшую обработку сведений о людях
Неправомерный доступ ст. 272 и 272.1 УК РФ Обход авторизации и защиты, оборот добытых так данных
Договорная Пользовательское соглашение площадки Автоматический доступ как нарушение условий сервиса

Открытый прайс и каталог характеристик проходят по всем четырём рамкам почти всегда. Профили людей, резюме и контакты из объявлений не проходят по второй. Всё, что видно только после входа в аккаунт, не проходит по третьей.

База данных как объект охраны: почему выгрузка каталога стоит дороже, чем кажется

Статья 1334 ГК РФ даёт изготовителю базы данных, создание которой потребовало существенных затрат, исключительное право извлекать материалы и использовать их дальше. Вся соль в презумпции: база считается требующей существенных затрат, если содержит не менее десяти тысяч самостоятельных информационных элементов. Доказывать бюджет владельцу не нужно, порог работает автоматически.

Право действует пятнадцать лет с 1 января года, следующего за годом создания базы, и по пункту 2 статьи 1335 ГК РФ срок возобновляется при каждом обновлении. Для живого каталога маркетплейса это означает бессрочную охрану на практике.

Исключения перечислены в статье 1335.1 ГК РФ: правомерный пользователь обнародованной базы может извлекать материалы для личных, научных и учебных целей в оправданном объёме, а для прочих целей в объёме, составляющем несущественную часть базы. Слово «несущественную» и есть главный риск: критерия в цифрах закон не даёт, оценивать будет суд.

Как это выглядит в споре, показало дело № А40-18827/2017. «ВКонтакте» требовала от Double Data прекратить извлечение данных пользовательских профилей и уничтожить собранное. Иск подан в январе 2017 года, а 23 сентября 2022 года спор закончился мировым соглашением, которое утвердил Суд по интеллектуальным правам. Соглашение не признаёт ни ответственности, ни требований истца, так что однозначной позиции высшей инстанции рынок не получил.

Персональные данные: самая дорогая ошибка в парсинге

Публичность не снимает защиту: телефон, который человек сам выложил в объявление, остаётся персональными данными. Пункт 2 статьи 10.1 152-ФЗ формулирует жёстко: если субъект раскрыл данные неопределённому кругу лиц без предоставления оператору согласия, обязанность доказать законность последующей обработки лежит на каждом, кто её осуществил. Пункт 8 закрывает лазейку: молчание или бездействие субъекта ни при каких обстоятельствах согласием не считается.

Цена ошибки по действующей редакции статьи 13.11 КоАП РФ для юрлиц:

  • обработка персональных данных в случаях, не предусмотренных законодательством (ч. 1): от 150 000 до 300 000 рублей;
  • обработка без письменного согласия там, где оно обязательно (ч. 2): от 300 000 до 700 000 рублей;
  • неуведомление Роскомнадзора о намерении обрабатывать персональные данные (ч. 10): от 100 000 до 300 000 рублей.

Про последний пункт забывают чаще всего. С 1 сентября 2022 года уведомление по статье 22 152-ФЗ подаётся до начала обработки почти всегда: исключений осталось три, и «мы просто собрали открытые контакты скриптом» среди них нет.

Выше по шкале уголовная ответственность. Статья 272 УК РФ карает неправомерный доступ к охраняемой законом компьютерной информации, если он повлёк её уничтожение, блокирование, модификацию либо копирование: штраф до 200 000 рублей или лишение свободы до двух лет. Введённая законом от 30.11.2024 № 421-ФЗ статья 272.1 УК РФ бьёт по сценарию перепродажи спарсенных баз: незаконные использование, передача, сбор и хранение компьютерной информации с персональными данными, полученной путём неправомерного доступа, наказываются штрафом до 300 000 рублей либо лишением свободы до четырёх лет.

Рабочее правило: если задача решается без имён, телефонов и email, не собирайте их вовсе. Цена, остаток, категория и рейтинг товара к персональным данным не относятся.

robots.txt: чего он на самом деле требует

Файл robots.txt описан стандартом RFC 9309 и остаётся протоколом добровольного соблюдения, а не договором. Читать его перед запуском всё равно обязательно.

  • Google парсит только первые 500 кибибайт файла и кеширует содержимое, как правило, до 24 часов.
  • Директиву Crawl-delay не поддерживают ни Google, ни Яндекс: последний перестал её учитывать 22 февраля 2018 года, заменив настройкой «Скорость обхода сайта» в Вебмастере.
  • В robots.txt видно позицию площадки по ИИ-краулерам. На 22 августа 2026 года hh.ru закрывает /vacancy/* и /resume отдельными блоками для одиннадцати ИИ-агентов: GPTBot, ChatGPT-User, OAI-SearchBot, OAI-Fetcher, ClaudeBot, Claude-Web, Anthropic-ai, PerplexityBot, CCBot, Google-Extended и FacebookBot. Вакансии при этом остаются открытыми для Yandex и Googlebot, а резюме закрыты для всех.

Игнорирование robots.txt не преступление, но в переписке с юристами площадки работает против вас как признак недобросовестности. И это самый быстрый способ получить бан по IP.

Пользовательское соглашение: там, где живут прямые запреты

robots.txt просит, соглашение обязывает. В Условиях использования сервиса Яндекс Карты пункт 4.6 запрещает любое копирование Данных, их воспроизведение, переработку, распространение и доведение до всеобщего сведения в интернете, а также использование в СМИ и в коммерческих целях без предварительного письменного разрешения правообладателя. Слова «парсинг» там нет, и оно не нужно: автоматический сбор попадает под «копирование и воспроизведение».

В соглашении смотрят три вещи: есть ли прямой запрет на автоматизированный доступ, касается ли он неавторизованных посетителей или только зарегистрированных, и предусмотрен ли платный способ получить те же данные. Третий пункт закрывает вопрос чаще, чем принято думать: лицензия дешевле судебного спора.

Публичный API против скрейпинга: считаем честно

Официальный интерфейс выигрывает у HTML-парсинга по трём параметрам: не ломается при редизайне, отдаёт готовую структуру и законен по умолчанию. Цена вопроса обычно только регистрация приложения и лимиты.

Проверка занимает минуту. Возьмём hh.ru: запрос к api.hh.ru/vacancies без заголовка User-Agent возвращает {"description":"Bad User-Agent header"}, а с браузерным User-Agent приходит {"errors":[{"type":"forbidden"}]}. API требует, чтобы вы представились названием приложения и контактом разработчика, и наказывает маскировку под браузер. Это и есть граница между «пришёл по правилам» и «пришёл тайком».

Второй маркер лимитов: код 429 Too Many Requests из RFC 6585 и заголовок Retry-After, сообщающий, через сколько секунд повторить. Корректный клиент читает это значение и ждёт. Игнорирование 429 в цикле переводит сбор из категории «нагрузка» в категорию «атака на доступность», и слово «парсинг» там уже не защищает.

Как парсить данные, чтобы сбор пережил первую неделю

Разберём на Scrapy: его дефолты задокументированы и проверяемы. В версии 2.18.0 (релиз 20 августа 2026 года) они такие: DOWNLOAD_DELAY = 1 секунда между запросами к одному домену, CONCURRENT_REQUESTS_PER_DOMAIN = 1, общий CONCURRENT_REQUESTS = 16, ROBOTSTXT_OBEY = True, User-Agent Scrapy/VERSION (+https://scrapy.org). В проектах, поднятых на старых наборах настроек, действуют прежние значения: задержка 0, восемь потоков на домен и ROBOTSTXT_OBEY = False, их придётся выставить руками.

Это готовый регламент вежливого сбора:

  1. Один поток на домен и секунда паузы. Потолок в шестьдесят страниц в минуту: средний каталог собирается за ночь и не попадает ни в один порог антифрода.
  2. Честный User-Agent с контактом. Владелец сайта, увидев в логах имя робота и адрес, скорее напишет вам, чем забанит подсеть.
  3. Реакция на коды ответа. 429 и 503 это пауза по Retry-After, 403 это стоп и разбор причины, а не смена прокси.
  4. Кеш и инкремент. Обновляйте по расписанию только изменившееся: ежедневная выкачка всего каталога это главный источник и нагрузки, и банов.
  5. Сначала sitemap.xml и внутренние JSON-эндпоинты. Карта сайта отдаёт список URL без обхода листингов, а вкладка Network показывает готовый JSON, который страница грузит для себя.
  6. Узкий забор полей. Три поля из карточки вместо полного HTML сокращают и трафик, и юридический след.

Парсинг сайтов конкурентов: что снимать можно и чем

Самый частый и самый безопасный сценарий, если держаться товарных данных. Цена, наличие, ассортимент, сроки доставки, тексты публичных карточек, количество и тональность отзывов персональными данными не являются. Опасные поля там, где появляется человек: авторы отзывов, контакты менеджеров, профили продавцов.

Инструменты и цены на 22 августа 2026 года:

Инструмент Формат Цена Когда брать
Scrapy 2.18.0 Python-фреймворк, open source Бесплатно Свой пайплайн и полный контроль
A-Parser Десктоп, Windows/Linux/Docker Lite $179, Pro $299, Enterprise $479, пожизненная лицензия; обновления $49 за 3 месяца, $149 за год, $399 пожизненно 110+ парсеров, до 3000 потоков, выдача и маркетплейсы
Octoparse Облако, без кода Free: 10 задач и до 50 000 строк экспорта в месяц; Standard $69/мес, Professional $249/мес при помесячной оплате Разовые задачи без разработчика
Bright Data Web Unlocker API-прослойка доступа Pay-as-you-go $1.5 за 1000 успешных запросов; бесплатный уровень 5000 запросов в месяц Цель закрыта антиботом, нужен вендор с договором

Прокси считаются отдельно: у A-Parser премиум-прокси идут от $0.9 за гигабайт, микс дешевле, от $0.3 за гигабайт, безлимитные по трафику от $10 в неделю. На объёме прокси выходят дороже лицензии, это надо закладывать в смету сразу.

Нужен не скрипт, а поток данных

Разовая выгрузка делается за вечер. Проблемы начинаются на второй неделе: меняется вёрстка, приходит 429, растёт счёт за прокси, данные надо чистить и складывать в систему. Собираем такие пайплайны под ключ, с реакцией на лимиты и юридической рамкой на входе.

Обсудить задачу

Парсинг чужого сайта и сканирование своего это разные задачи

Их путают, хотя юридически они противоположны. Когда вы обходите собственный сайт краулером, вы владелец: robots.txt писали вы, лимиты ставили вы, данные в базе ваши, цель диагностическая. Ни одна рамка из первого раздела не включается, единственное ограничение это нагрузка на свой же сервер.

На чужом ресурсе вы гость без приглашения, и все четыре рамки включаются разом. Настройки, с которыми вы гоняете сканер по своему сайту, на чужом домене приведут к бану в первые минуты. Как устроена диагностика собственного проекта, разбирали отдельно в материале про SEO-аудит сайта своими руками.

Защита от парсинга сайта: что стоит на другой стороне

Оборону полезно знать обеим сторонам: собирающему, чтобы не биться в стену, владельцу, чтобы не отдавать каталог даром. Слои такие.

  • Ограничение частоты на веб-сервере. В nginx это ngx_http_limit_req_module: limit_req_zone $binary_remote_addr zone=one:10m rate=1r/s; плюс limit_req zone=one burst=5 nodelay;. Отклонённый запрос по умолчанию получает 503, на 429 меняют явно через limit_req_status.
  • Челлендж вместо капчи. Cloudflare Turnstile на бесплатном плане даёт до 20 виджетов на аккаунт и неограниченное число проверок в трёх режимах: managed, non-interactive и invisible.
  • Ловушки для краулеров. Cloudflare AI Labyrinth при обнаружении неправомерной активности подсовывает боту связанный набор сгенерированных страниц: тот тратит ресурсы впустую и выдаёт себя. Масштаб задачи Cloudflare оценивает в 50 миллиардов запросов ИИ-краулеров в сутки, чуть меньше 1% трафика своей сети.
  • Новые правила для ИИ. 1 июля 2025 года Cloudflare добавила пресет «Block AI bots» в один клик и маркетплейс Pay Per Crawl, где издатель назначает цену за обход. С 15 сентября 2026 года для всех новых доменов краулеры категорий Training и Agent блокируются по умолчанию на страницах с рекламой, а Search остаётся разрешённым.
  • Антибот перед выдачей контента. Проверка 22 августа 2026 года: curl с браузерным User-Agent к wildberries.ru/robots.txt возвращает не текстовый файл, а HTML-страницу челленджа из каталога /__wbaas/challenges/antibot/ с идентификатором запроса и вашим IP. На маркетплейсе закрыт даже robots.txt.

К техническим мерам добавьте юридическую: следите, чтобы каталог проходил порог в десять тысяч элементов, и зарегистрируйте базу в Роспатенте по правилам статьи 1262 ГК РФ. Право возникает и без регистрации, но с ней разговор с нарушителем начинается не с просьбы, а со ссылки на статью 1334 ГК РФ.

Чек-лист перед запуском парсера

  1. Выпишите нужные поля. Если среди них имя, телефон, email или профиль человека, вычеркните их либо готовьте правовое основание и уведомление в Роскомнадзор.
  2. Откройте robots.txt домена и найдите блок для своего агента, а не только для *. Там же проверьте пункт пользовательского соглашения про автоматический доступ.
  3. Проверьте, есть ли официальный API или лицензия на те же данные, и сравните цену с расходами на прокси и поддержку парсера.
  4. Оцените объём: свыше десяти тысяч элементов чужого каталога вы работаете с охраняемой базой, и риск по статье 1334 ГК РФ становится реальным.
  5. Прогоните тест на 50 страницах с одним потоком и задержкой в секунду. Обработку 429 по Retry-After, кеш и инкремент закладывайте до масштабирования, а не после.

Частые вопросы

Законен ли парсинг сайтов в России?

Отдельного запрета нет, действуют четыре ограничения: статья 1334 ГК РФ на извлечение существенной части чужой базы, 152-ФЗ на персональные данные, статьи 272 и 272.1 УК РФ на неправомерный доступ и пользовательское соглашение площадки. Сбор открытых товарных данных без обхода авторизации проходит по всем четырём.

Сколько записей можно забрать без риска?

Формального лимита нет, но статья 1334 ГК РФ презюмирует: база из десяти тысяч и более самостоятельных информационных элементов требовала существенных затрат и охраняется. Этот порог и есть ориентир для оценки риска.

Что грозит за парсинг персональных данных?

По статье 13.11 КоАП РФ юрлицу от 300 000 до 700 000 рублей за обработку без обязательного письменного согласия и от 100 000 до 300 000 рублей за неуведомление Роскомнадзора. По статье 272.1 УК РФ за незаконные сбор, хранение и передачу таких данных, полученных путём неправомерного доступа, штраф до 300 000 рублей либо до четырёх лет лишения свободы.

Обязательно ли соблюдать robots.txt?

Юридически это протокол добровольного соблюдения по RFC 9309, а не договор. Практически это первый документ, на который сошлётся площадка в претензии. Директиву Crawl-delay из него не читают ни Google, ни Яндекс, отказавшийся от неё 22 февраля 2018 года.

Как понять, что сайт защищён от парсинга?

По ответу на первый же запрос. Признаки: код 429 с заголовком Retry-After, код 503 от limit_req в nginx, HTML-страница челленджа вместо контента (как у Wildberries на пути /__wbaas/challenges/antibot/), требование пройти Turnstile, однотипные страницы без полезных данных (ловушка вроде AI Labyrinth).

Поделиться:
X
Редакция Neurounit

Разборы инструментов, гайды и новости про нейросети, AI-маркетинг и автоматизацию. Материалы готовит редакция агентства Neurounit.

Факты и цифры проверяет редакция агентства Neurounit. Вопросы и уточнения: Telegram.

Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга
Разборы, механика и результаты AI-маркетинга