ГлавнаяГлоссарийПарсинг сайта

Парсинг сайта

Parsing, скрейпинг, краулинг

Автоматический сбор данных со страниц сайта программой.

Парсинг — это когда программа обходит страницы и вытаскивает с них нужные данные: заголовки, мета-теги, цены, ссылки, коды ответа. Вручную проверить тысячи URL невозможно, а парсер делает это за минуты — поэтому это базовый рабочий инструмент SEO-специалиста.

В SEO парсингом делают технический аудит (Screaming Frog, Netpeak Spider находят битые ссылки, дубли, проблемы с мета-тегами), собирают структуру и цены конкурентов, выгружают семантику. Важно не злоупотреблять: агрессивный парсинг чужого сайта создаёт нагрузку и может блокироваться.

Суть
авто-сбор

Программа обходит страницы и вытаскивает нужные данные

Пример
цены, мета

Сбор title, цен конкурентов или битых ссылок пачкой

Зачем
SEO-аудит

За минуты находит проблемы, на которые ушли бы дни

Парсер так же обходит сайт, как и поисковый робот
Пример

Запускаешь Screaming Frog на 5000 страниц магазина — за 20 минут получаешь таблицу всех Title, кодов ответа и заголовков H1. Сразу видно 120 страниц с битыми ссылками на удалённые товары.

У парсинга в SEO две стороны: парсят свой сайт для аудита и чужие — для разведки. На своём проекте краулер сопоставляют с логами сервера: парсер видит, какие страницы доступны по ссылкам, а логи — какие реально обходит робот. Расхождение вскрывает страницы, которые тратят краулинговый бюджет впустую, или, наоборот, важные URL, до которых робот не доходит из-за глубокой вложенности.

Перед парсингом крупного сайта проверьте, как настроен инструмент, иначе данные будут мусорными. Screaming Frog по умолчанию рендерит без JavaScript — на сайтах с подгрузкой контента через JS включайте режим рендеринга, иначе парсер увидит пустые страницы. Учитывайте rel=canonical и директивы robots.txt: если их игнорировать, в выгрузку попадут дубли и служебные URL, которые исказят картину. При парсинге чужих сайтов не выкручивайте скорость на максимум — поток в 20+ потоков создаёт нагрузку, ловит бан по IP и капчу; ставьте 1–2 запроса в секунду и user-agent, по которому вас можно опознать. Для сбора цен и ассортимента конкурентов из крупных магазинов чаще берут не Frog, а связку Python с requests и BeautifulSoup или сервисы вроде XMLRiver.

Пример

После переезда магазина на новый движок Netpeak Spider на 12 000 URL за полчаса показал 800 страниц с кодом 200, которые отдавали canonical на удалённые карточки, и 340 цепочек редиректов 301→301→200; правка канониклов и спрямление цепочек вернули в индекс Яндекса 600 товаров за следующий апдейт.