Корисне

Парсимо контент конкурента програмою Screaming Frog

Виходити на будь-який ринок без аналізу ніші – безглуздо. Але сьогодні ми поговоримо не про це.

У цьому пості я розповім, як за допомогою програми Screaming Frog SEO Spider можна парсити контент конкурента. Наприклад:

  • опис, характеристики та ціну продукту;
  • зображення;
  • наявність та кількість відгуків;
  • кількість переглядів статті;
  • наявність seo текстів;
  • і т.д..

Інструкція із застосування

Вибираємо сайт із якого хочемо спарсити дані. Я візьму на приклад сайт habr.com. І сьогодні ми спробуємо знайти матеріал, який має найбільше коментарів.

Переходимо на будь-яку сторінку матеріалу, скролимо до блоку відгуків. Правою кнопкою миші клікам за кількістю коментарів та вибираємо "Переглянути код":

количество комментариев

Далі вибираємо код, який відповідає за виведення кількості та знову клацаємо правою кнопкою миші на вибраному елементі. Копіюємо XPath:

копируем XPath

Відкриваємо Screaming Frog, копіюємо адресу сайту у полі:

screaming frog

Не поспішайте клацати на кнопку "Start". Переходимо в меню Configuration – Custom – Extraction:

конфигурация парсинга

Вибираємо налаштування як на скрині (1) та вставляємо скопійований код XPath у поле (2):

настройка парсинга

Після цього необхідно додати правило парсингу тільки по постах, щоб не тягнути сміттєві сторінки. Переходимо знову в меню Configuration – Include:

include

І додаємо правило парсингу лише постів (.* – будь-які символи):

Після цього це тиснемо ОК і починаємо парсинг натисканням на кнопку Start.

Хабр сайт дуже великий, чекати поки жаба спарсит усі сторінки ми не будемо, тому покажемо результат на тому, на що у мене вистачило терпіння чекати).

Скролимо праве меню до блоку "Custom", вибираємо Extaction:

extraction

Ось ми і знайшли пост, у якого найбільша кількість коментарів:

результат парсинга конкурента

Що ще

А ще ми можемо діставати необхідну нам інформацію за шаблоном, наприклад, мило або номер телефону. Розберемо ситуацію із милом.

Спарсим за допомогою RDS ТОП 100 видачі:

выдача по запросу обои москва

У спайдері вибираємо LIST:

Spider - List

Налаштовуємо вибірку:

выборка в спайдере

І додаємо наступний код - [a-zA-Z0-9-_.]+@[a-zA-Z0-9-]+.[a-zA-Z0-9-.]+

парсинг мыла

Завантажуємо в спайдер спарсовані сайти:

добавление сайтов

І отримуємо базу мила:

итоговый результат

Як зібрати ціни із сайту конкурента

Вибираємо жертву, у мене це буде сайт цитрусу. Ну і звичайно ж парсить одні ціни це безглуздо, тому разом із ціною будемо брати і назву товару.
Що б не парити зайве вибираємо розділ, у мене це "Смартфони" і задаємо наступні правила, що обмежують жабу:


цитрус фильтр
Копіюємо xPath елемента ціни:цитрус цена
Вставляємо в Custom Extraction:цитрус кастом

Додаємо аналогічно і назву товару, запукаємо парсинг. Я, як завжди, весь сайт не паршив. Мені це не потрібно:)
Експортуємо та дивимося що вийшло:
цитрус финал

Висновок

Використовуйте дані лише на благі цілі. Грайте чесно та поважайте чужу працю.
Пишіть у коментарі як ще можна використовувати цей парсинг.

Author

Владислав Политай

Leave a comment

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *