Получить видео-разбор
Основная
17.06.2026
Время чтения: 30 минут
alt27

Парсинг конкурентов в Screaming Frog

Содержание статьи

Парсинг конкурентов в screaming frog

Парсинг сайта конкурента в Screaming Frog SEO Spider позволяет за 10–15 минут получить полную карту его структуры, мета-теги, заголовки и битые ссылки. В этой статье — пошаговая инструкция от настройки программы до анализа результатов, с примерами регулярных выражений и советами, как не попасть под блокировку.

Технический аудит чужих проектов дает мощное преимущество в поисковой выдаче. Понимание того, как работают лидеры ниши, позволяет избежать их ошибок и внедрить лучшие практики на собственном ресурсе.

Что такое парсинг конкурентов и зачем он нужен

Парсинг конкурентов — это автоматизированный процесс сбора данных со страниц чужого веб-ресурса для выявления его сильных и слабых сторон. Этот метод помогает понять, как выстроена структура сайта, какие мета-теги используются и где скрыт технический мусор.

Глубокий анализ сайта конкурентов позволяет не просто скопировать чужие решения, но и найти неочевидные точки роста для собственного проекта. Проводя комплексный seo анализ сайта, вы собираете огромный массив информации: от иерархии разделов до скрытых ошибок в коде. Регулярный анализ конкурентов дает четкое представление о том, какие посадочные страницы приносят трафик и как распределен ссылочный вес.

Пошаговая настройка Screaming Frog для парсинга

01
Шаг

Правильная screaming frog настройка начинается с установки лимитов сканирования, выбора подходящего User-Agent и конфигурации пауз. Это гарантирует, что программа соберет нужные данные без перегрузки целевого сервера.

02
Настройка User-Agent и задержек

По умолчанию сканер представляется собственным именем, что часто приводит к отказам в доступе. Грамотная user-agent смена на стандартный Googlebot или Chrome позволяет обойти базовые защиты. Одновременно с этим необходимо настроить задержки между запросами (вкладка Speed), чтобы имитировать поведение реального пользователя или поискового робота.

03
Лимиты сканирования: глубина, страницы, время

Крупные порталы могут сканироваться сутками. Чтобы этого избежать, установите лимиты сканирования в разделе Configuration -> Spider -> Limits. Ограничьте глубину обхода (Crawl Depth) до 3-4 кликов от главной или задайте максимальное количество URL (Max URI), например, 5000 страниц.

04
Уважение robots.txt и использование XML-карты

Корректный robots.txt парсинг — признак профессионального подхода. Программа автоматически считывает директивы из файла robots.txt, но вы можете переопределить их в настройках (Configuration -> robots.txt). Для ускорения процесса можно загрузить готовую XML-карту сайта, чтобы краулер сразу пошел по приоритетным адресам.

Чтобы запустить сканирование, достаточно ввести начальный URL в верхнюю строку программы и нажать кнопку Start. Эта базовая screaming frog инструкция поможет быстро получить первые результаты даже без глубоких технических знаний.

Как спарсить сайт конкурента: инструкция для новичков

01
Шаг 1

Шаг 1. Откройте Screaming Frog SEO Spider и убедитесь, что выбран режим Spider (Mode -> Spider).

02
Шаг 2

Шаг 2. Введите начальный URL конкурента в текстовое поле рядом с кнопкой Start.

03
Шаг 3

Шаг 3. Нажмите Start и следите за панелью прогресса в правом нижнем углу.

04
Шаг 4

Шаг 4. Дождитесь завершения сканирования (индикатор достигнет 100%) или нажмите Pause, если собрано достаточно данных.

Такой быстрый запуск идеален для оценки небольших сайтов-визиток или блогов.

Топ-5 фильтров Screaming Frog для анализа конкурентов

Встроенные фильтры screaming frog позволяют мгновенно отделить важные HTML-страницы от служебных файлов и найти технические ошибки. Самые полезные из них — фильтрация по статусам ответов, типу контента и дубликатам.

Фильтр по статусам ответов (HTTP-коды)

На вкладке Response Codes можно быстро отсортировать статусы ответов. Это лучший способ найти битые ссылки (коды 4xx) и цепочки редиректов (коды 3xx), которые конкурент забыл исправить.

Фильтр по типу контента (HTML, CSS, JS, изображения)

Вкладка Internal содержит фильтр по столбцу Content. Оставив только text/html, вы уберете из выдачи скрипты и стили, сосредоточившись исключительно на контентных страницах.

Фильтр по дублям (Duplicate Content)

Вкладки Page Titles и Meta Description позволяют выявить дубли страниц. Одинаковые заголовки или описания часто указывают на проблемы с генерацией мета-тегов или наличие мусорных страниц в индексе.

Кастомный поиск: как найти нужные страницы конкурента

Функция кастомный поиск (Custom Search) дает возможность находить страницы по заданным ключевым словам в исходном коде, заголовках или URL. Это идеальный инструмент для точечной фильтрации товаров, статей или страниц с определенными скриптами.

Настроив поиск по url, вы можете вычленить все страницы определенной категории. Также кастомный поиск отлично справляется с проверкой наличия микроразметки, кодов аналитики или специфических слов в текстовых блоках. Анализируя h1 заголовки и meta description через этот инструмент, можно быстро собрать семантическое ядро конкурента.

Регулярные выражения для SEO: практические примеры

Регулярные выражения seo (regex) помогают создавать сложные шаблоны url для поиска страниц с определенными параметрами, артикулами или датами. Использование regex для парсинга значительно расширяет возможности кастомного поиска и фильтрации.

Поиск страниц с параметрами в URL

Для выявления страниц сортировки или пагинации настройте поиск по параметрам. Регулярное выражение вида ?.*(sort|page|filter)= найдет все адреса, содержащие эти ключи после вопросительного знака.

Поиск товаров по артикулу или ID

Если структура сайта конкурента включает числовые идентификаторы, используйте шаблон /product/d+. Это позволит собрать базу исключительно товарных карточек, отсеяв информационные статьи.

Поиск статей по дате в URL

Для блогов актуален поиск по датам. Шаблон вида /202[0-4]/d{2}/ выявит все публикации за последние несколько лет, что полезно для оценки контент-плана.

Чтобы избежать блокировки при сборе данных, необходим этичный парсинг: маскировка под обычный браузер, настройка пауз и строгое соблюдение правил обхода. Блокировка парсинга чаще всего происходит из-за слишком агрессивных запросов к серверу.

Смена User-Agent на мобильный браузер

Многие сайты отдают разный контент для десктопов и смартфонов. Смена User-Agent на Googlebot Smartphone не только снижает риск бана, но и позволяет увидеть мобильную версию ресурса.

Настройка задержек между запросами

Слишком высокая скорость сканирования воспринимается сервером как DDoS-атака. Установите лимит в 1-2 URI в секунду, чтобы процесс шел плавно и незаметно.

Использование прокси и ротация IP

Для крупных проектов с жесткой защитой (например, e-commerce гигантов) потребуется ротация IP-адресов через прокси-серверы.

Мнение эксперта
Главный по SEO
10 лет

Мнение эксперта. Многие новички думают, что достаточно сменить User-Agent на мобильный и поставить задержку в 1 секунду. Но современные системы защиты (Cloudflare, Akamai) анализируют поведение: если запросы идут строго каждую секунду, это выдает бота. Нужно использовать случайные задержки (от 2 до 5 секунд) и ротацию User-Agent из пула реальных браузеров.

практикующий SEO-аналитик с 8-летним опытом технического аудита

Что делать с результатами парсинга: анализ данных

После завершения сканирования необходимо выполнить экспорт данных csv и очистить таблицу от нерелевантных URL. Глубокий анализ структуры сайта и мета-тегов позволяет выявить точки роста для вашего проекта.

Экспорт в CSV и Excel

Любой экспорт данных из программы осуществляется в пару кликов. Выгружайте только нужные вкладки (например, Internal HTML), чтобы не перегружать таблицу. Формат CSV удобен для последующей обработки в Excel или Google Таблицах.

Фильтрация технического мусора

В выгрузке обязательно окажется технический мусор: страницы авторизации, корзины, пустые теги. Отфильтруйте их по размеру контента или наличию тега noindex, чтобы оставить только полезные посадочные страницы.

Выявление структуры сайта конкурента

Сортировка URL по алфавиту в Excel позволяет визуально восстановить иерархию папок. Анализ структуры сайта покажет, какие категории конкурент считает приоритетными и как распределяет ссылочный вес внутри разделов.

Типичные ошибки при парсинге и как их избежать

Самые частые ошибки парсинга связаны с игнорированием лимитов сервера и неправильной интерпретацией собранных данных. Избежать их поможет предварительная проверка настроек и аккуратность при выгрузке.

Многие забывают исключить из сканирования внешние ссылки, из-за чего программа начинает обходить весь интернет. Также частой ошибкой является парсинг без учета JavaScript-рендеринга на SPA-сайтах, что приводит к получению пустых страниц вместо реального контента. Всегда проверяйте исходный код целевого ресурса перед запуском масштабного обхода.

Часто задаваемые вопросы

Сколько времени занимает парсинг сайта конкурента в Screaming Frog?

Обычно 10–15 минут для сайта до 5000 страниц. Время зависит от размера сайта, скорости сервера и настроек задержек.

Можно ли спарсить сайт, если он защищен Cloudflare?

Да, но потребуется дополнительная настройка: ротация User-Agent, случайные задержки, использование прокси и, возможно, обход через headless-браузер.

Какие данные о конкуренте можно получить с помощью парсинга?

Полную структуру сайта, все URL, мета-теги (title, description), заголовки H1, статусы ответов, битые ссылки, дубли страниц, размер страниц и скорость загрузки.

Что такое регулярное выражение и как его написать для поиска страниц с параметрами?

Регулярное выражение (regex) — это шаблон для поиска текста. Для поиска страниц с параметрами используйте ? (вопросительный знак) или конкретный параметр, например, utm_.

Как отличить важные страницы от технического мусора в результатах парсинга?

Отфильтруйте страницы с кодом 200, исключите служебные URL (login, cart, admin, wp-admin), удалите дубли по H1 и title, оставьте только HTML-страницы.

Сколько стоит Screaming Frog и есть ли бесплатная версия?

Бесплатная версия ограничена 500 страницами. Полная лицензия стоит около £149 в год. Для большинства задач анализа конкурентов бесплатной версии достаточно.

Итоги

  • Парсинг в Screaming Frog позволяет быстро получить структуру сайта и мета-теги конкурента.
  • Правильная настройка лимитов и задержек защищает от блокировки.
  • Фильтры и кастомный поиск помогают отсеять мусор и найти нужные страницы.
  • Регулярные выражения расширяют возможности поиска по параметрам и артикулам.

Заключение

Регулярный сбор данных о конкурентах — залог успешной SEO-стратегии. Используйте полученные знания для выявления технических ошибок у лидеров ниши и улучшения собственного ресурса. Грамотный подход к парсингу сэкономит вам десятки часов ручной работы.