Парсинг сайтов перестал быть серой зоной в 2024 году, когда за незаконный сбор компьютерной информации с персональными данными в УК РФ появилась статья 272.1 с санкцией до четырёх лет лишения свободы. Техническая сторона поменялась не меньше: по данным Imperva, в 2024 году автоматический трафик впервые за десять лет обогнал человеческий и занял 51% обращений к сайтам, а доля вредоносных ботов выросла до 37% всего трафика против 32% годом ранее. Ниже разбор того, что можно забирать, какие нормы это ограничивают и как построить сбор, который переживёт первую неделю.
Нормы со словом «парсинг» в российском праве нет. Есть четыре рамки, и проверять задачу нужно по каждой отдельно.
| Рамка | Норма | Что ограничивает |
|---|---|---|
| Смежные права на базу данных | ст. 1334 ГК РФ | Извлечение существенной части содержимого чужой базы |
| Персональные данные | 152-ФЗ, ст. 10.1 и ст. 22 | Сбор и дальнейшую обработку сведений о людях |
| Неправомерный доступ | ст. 272 и 272.1 УК РФ | Обход авторизации и защиты, оборот добытых так данных |
| Договорная | Пользовательское соглашение площадки | Автоматический доступ как нарушение условий сервиса |
Открытый прайс и каталог характеристик проходят по всем четырём рамкам почти всегда. Профили людей, резюме и контакты из объявлений не проходят по второй. Всё, что видно только после входа в аккаунт, не проходит по третьей.
Статья 1334 ГК РФ даёт изготовителю базы данных, создание которой потребовало существенных затрат, исключительное право извлекать материалы и использовать их дальше. Вся соль в презумпции: база считается требующей существенных затрат, если содержит не менее десяти тысяч самостоятельных информационных элементов. Доказывать бюджет владельцу не нужно, порог работает автоматически.
Право действует пятнадцать лет с 1 января года, следующего за годом создания базы, и по пункту 2 статьи 1335 ГК РФ срок возобновляется при каждом обновлении. Для живого каталога маркетплейса это означает бессрочную охрану на практике.
Исключения перечислены в статье 1335.1 ГК РФ: правомерный пользователь обнародованной базы может извлекать материалы для личных, научных и учебных целей в оправданном объёме, а для прочих целей в объёме, составляющем несущественную часть базы. Слово «несущественную» и есть главный риск: критерия в цифрах закон не даёт, оценивать будет суд.
Как это выглядит в споре, показало дело № А40-18827/2017. «ВКонтакте» требовала от Double Data прекратить извлечение данных пользовательских профилей и уничтожить собранное. Иск подан в январе 2017 года, а 23 сентября 2022 года спор закончился мировым соглашением, которое утвердил Суд по интеллектуальным правам. Соглашение не признаёт ни ответственности, ни требований истца, так что однозначной позиции высшей инстанции рынок не получил.
Публичность не снимает защиту: телефон, который человек сам выложил в объявление, остаётся персональными данными. Пункт 2 статьи 10.1 152-ФЗ формулирует жёстко: если субъект раскрыл данные неопределённому кругу лиц без предоставления оператору согласия, обязанность доказать законность последующей обработки лежит на каждом, кто её осуществил. Пункт 8 закрывает лазейку: молчание или бездействие субъекта ни при каких обстоятельствах согласием не считается.
Цена ошибки по действующей редакции статьи 13.11 КоАП РФ для юрлиц:
Про последний пункт забывают чаще всего. С 1 сентября 2022 года уведомление по статье 22 152-ФЗ подаётся до начала обработки почти всегда: исключений осталось три, и «мы просто собрали открытые контакты скриптом» среди них нет.
Выше по шкале уголовная ответственность. Статья 272 УК РФ карает неправомерный доступ к охраняемой законом компьютерной информации, если он повлёк её уничтожение, блокирование, модификацию либо копирование: штраф до 200 000 рублей или лишение свободы до двух лет. Введённая законом от 30.11.2024 № 421-ФЗ статья 272.1 УК РФ бьёт по сценарию перепродажи спарсенных баз: незаконные использование, передача, сбор и хранение компьютерной информации с персональными данными, полученной путём неправомерного доступа, наказываются штрафом до 300 000 рублей либо лишением свободы до четырёх лет.
Рабочее правило: если задача решается без имён, телефонов и email, не собирайте их вовсе. Цена, остаток, категория и рейтинг товара к персональным данным не относятся.
Файл robots.txt описан стандартом RFC 9309 и остаётся протоколом добровольного соблюдения, а не договором. Читать его перед запуском всё равно обязательно.
Crawl-delay не поддерживают ни Google, ни Яндекс: последний перестал её учитывать 22 февраля 2018 года, заменив настройкой «Скорость обхода сайта» в Вебмастере./vacancy/* и /resume отдельными блоками для одиннадцати ИИ-агентов: GPTBot, ChatGPT-User, OAI-SearchBot, OAI-Fetcher, ClaudeBot, Claude-Web, Anthropic-ai, PerplexityBot, CCBot, Google-Extended и FacebookBot. Вакансии при этом остаются открытыми для Yandex и Googlebot, а резюме закрыты для всех.Игнорирование robots.txt не преступление, но в переписке с юристами площадки работает против вас как признак недобросовестности. И это самый быстрый способ получить бан по IP.
robots.txt просит, соглашение обязывает. В Условиях использования сервиса Яндекс Карты пункт 4.6 запрещает любое копирование Данных, их воспроизведение, переработку, распространение и доведение до всеобщего сведения в интернете, а также использование в СМИ и в коммерческих целях без предварительного письменного разрешения правообладателя. Слова «парсинг» там нет, и оно не нужно: автоматический сбор попадает под «копирование и воспроизведение».
В соглашении смотрят три вещи: есть ли прямой запрет на автоматизированный доступ, касается ли он неавторизованных посетителей или только зарегистрированных, и предусмотрен ли платный способ получить те же данные. Третий пункт закрывает вопрос чаще, чем принято думать: лицензия дешевле судебного спора.
Официальный интерфейс выигрывает у HTML-парсинга по трём параметрам: не ломается при редизайне, отдаёт готовую структуру и законен по умолчанию. Цена вопроса обычно только регистрация приложения и лимиты.
Проверка занимает минуту. Возьмём hh.ru: запрос к api.hh.ru/vacancies без заголовка User-Agent возвращает {"description":"Bad User-Agent header"}, а с браузерным User-Agent приходит {"errors":[{"type":"forbidden"}]}. API требует, чтобы вы представились названием приложения и контактом разработчика, и наказывает маскировку под браузер. Это и есть граница между «пришёл по правилам» и «пришёл тайком».
Второй маркер лимитов: код 429 Too Many Requests из RFC 6585 и заголовок Retry-After, сообщающий, через сколько секунд повторить. Корректный клиент читает это значение и ждёт. Игнорирование 429 в цикле переводит сбор из категории «нагрузка» в категорию «атака на доступность», и слово «парсинг» там уже не защищает.
Разберём на Scrapy: его дефолты задокументированы и проверяемы. В версии 2.18.0 (релиз 20 августа 2026 года) они такие: DOWNLOAD_DELAY = 1 секунда между запросами к одному домену, CONCURRENT_REQUESTS_PER_DOMAIN = 1, общий CONCURRENT_REQUESTS = 16, ROBOTSTXT_OBEY = True, User-Agent Scrapy/VERSION (+https://scrapy.org). В проектах, поднятых на старых наборах настроек, действуют прежние значения: задержка 0, восемь потоков на домен и ROBOTSTXT_OBEY = False, их придётся выставить руками.
Это готовый регламент вежливого сбора:
Retry-After, 403 это стоп и разбор причины, а не смена прокси.Самый частый и самый безопасный сценарий, если держаться товарных данных. Цена, наличие, ассортимент, сроки доставки, тексты публичных карточек, количество и тональность отзывов персональными данными не являются. Опасные поля там, где появляется человек: авторы отзывов, контакты менеджеров, профили продавцов.
Инструменты и цены на 22 августа 2026 года:
| Инструмент | Формат | Цена | Когда брать |
|---|---|---|---|
| Scrapy 2.18.0 | Python-фреймворк, open source | Бесплатно | Свой пайплайн и полный контроль |
| A-Parser | Десктоп, Windows/Linux/Docker | Lite $179, Pro $299, Enterprise $479, пожизненная лицензия; обновления $49 за 3 месяца, $149 за год, $399 пожизненно | 110+ парсеров, до 3000 потоков, выдача и маркетплейсы |
| Octoparse | Облако, без кода | Free: 10 задач и до 50 000 строк экспорта в месяц; Standard $69/мес, Professional $249/мес при помесячной оплате | Разовые задачи без разработчика |
| Bright Data Web Unlocker | API-прослойка доступа | Pay-as-you-go $1.5 за 1000 успешных запросов; бесплатный уровень 5000 запросов в месяц | Цель закрыта антиботом, нужен вендор с договором |
Прокси считаются отдельно: у A-Parser премиум-прокси идут от $0.9 за гигабайт, микс дешевле, от $0.3 за гигабайт, безлимитные по трафику от $10 в неделю. На объёме прокси выходят дороже лицензии, это надо закладывать в смету сразу.
Нужен не скрипт, а поток данных
Разовая выгрузка делается за вечер. Проблемы начинаются на второй неделе: меняется вёрстка, приходит 429, растёт счёт за прокси, данные надо чистить и складывать в систему. Собираем такие пайплайны под ключ, с реакцией на лимиты и юридической рамкой на входе.
Их путают, хотя юридически они противоположны. Когда вы обходите собственный сайт краулером, вы владелец: robots.txt писали вы, лимиты ставили вы, данные в базе ваши, цель диагностическая. Ни одна рамка из первого раздела не включается, единственное ограничение это нагрузка на свой же сервер.
На чужом ресурсе вы гость без приглашения, и все четыре рамки включаются разом. Настройки, с которыми вы гоняете сканер по своему сайту, на чужом домене приведут к бану в первые минуты. Как устроена диагностика собственного проекта, разбирали отдельно в материале про SEO-аудит сайта своими руками.
Оборону полезно знать обеим сторонам: собирающему, чтобы не биться в стену, владельцу, чтобы не отдавать каталог даром. Слои такие.
ngx_http_limit_req_module: limit_req_zone $binary_remote_addr zone=one:10m rate=1r/s; плюс limit_req zone=one burst=5 nodelay;. Отклонённый запрос по умолчанию получает 503, на 429 меняют явно через limit_req_status.curl с браузерным User-Agent к wildberries.ru/robots.txt возвращает не текстовый файл, а HTML-страницу челленджа из каталога /__wbaas/challenges/antibot/ с идентификатором запроса и вашим IP. На маркетплейсе закрыт даже robots.txt.К техническим мерам добавьте юридическую: следите, чтобы каталог проходил порог в десять тысяч элементов, и зарегистрируйте базу в Роспатенте по правилам статьи 1262 ГК РФ. Право возникает и без регистрации, но с ней разговор с нарушителем начинается не с просьбы, а со ссылки на статью 1334 ГК РФ.
*. Там же проверьте пункт пользовательского соглашения про автоматический доступ.Retry-After, кеш и инкремент закладывайте до масштабирования, а не после.Отдельного запрета нет, действуют четыре ограничения: статья 1334 ГК РФ на извлечение существенной части чужой базы, 152-ФЗ на персональные данные, статьи 272 и 272.1 УК РФ на неправомерный доступ и пользовательское соглашение площадки. Сбор открытых товарных данных без обхода авторизации проходит по всем четырём.
Формального лимита нет, но статья 1334 ГК РФ презюмирует: база из десяти тысяч и более самостоятельных информационных элементов требовала существенных затрат и охраняется. Этот порог и есть ориентир для оценки риска.
По статье 13.11 КоАП РФ юрлицу от 300 000 до 700 000 рублей за обработку без обязательного письменного согласия и от 100 000 до 300 000 рублей за неуведомление Роскомнадзора. По статье 272.1 УК РФ за незаконные сбор, хранение и передачу таких данных, полученных путём неправомерного доступа, штраф до 300 000 рублей либо до четырёх лет лишения свободы.
Юридически это протокол добровольного соблюдения по RFC 9309, а не договор. Практически это первый документ, на который сошлётся площадка в претензии. Директиву Crawl-delay из него не читают ни Google, ни Яндекс, отказавшийся от неё 22 февраля 2018 года.
По ответу на первый же запрос. Признаки: код 429 с заголовком Retry-After, код 503 от limit_req в nginx, HTML-страница челленджа вместо контента (как у Wildberries на пути /__wbaas/challenges/antibot/), требование пройти Turnstile, однотипные страницы без полезных данных (ловушка вроде AI Labyrinth).