Виходити на будь-який ринок без аналізу ніші – безглуздо. Але сьогодні ми поговоримо не про це.
У цьому пості я розповім, як за допомогою програми Screaming Frog SEO Spider можна парсити контент конкурента. Наприклад:
- опис, характеристики та ціну продукту;
- зображення;
- наявність та кількість відгуків;
- кількість переглядів статті;
- наявність seo текстів;
- і т.д..
Інструкція із застосування
Вибираємо сайт із якого хочемо спарсити дані. Я візьму на приклад сайт habr.com. І сьогодні ми спробуємо знайти матеріал, який має найбільше коментарів.
Переходимо на будь-яку сторінку матеріалу, скролимо до блоку відгуків. Правою кнопкою миші клікам за кількістю коментарів та вибираємо "Переглянути код":

Далі вибираємо код, який відповідає за виведення кількості та знову клацаємо правою кнопкою миші на вибраному елементі. Копіюємо XPath:

Відкриваємо Screaming Frog, копіюємо адресу сайту у полі:

Не поспішайте клацати на кнопку "Start". Переходимо в меню Configuration – Custom – Extraction:

Вибираємо налаштування як на скрині (1) та вставляємо скопійований код XPath у поле (2):

Після цього необхідно додати правило парсингу тільки по постах, щоб не тягнути сміттєві сторінки. Переходимо знову в меню Configuration – Include:

І додаємо правило парсингу лише постів (.* – будь-які символи):

Після цього це тиснемо ОК і починаємо парсинг натисканням на кнопку Start.
Хабр сайт дуже великий, чекати поки жаба спарсит усі сторінки ми не будемо, тому покажемо результат на тому, на що у мене вистачило терпіння чекати).
Скролимо праве меню до блоку "Custom", вибираємо Extaction:

Ось ми і знайшли пост, у якого найбільша кількість коментарів:

Що ще
А ще ми можемо діставати необхідну нам інформацію за шаблоном, наприклад, мило або номер телефону. Розберемо ситуацію із милом.
Спарсим за допомогою RDS ТОП 100 видачі:

У спайдері вибираємо LIST:

Налаштовуємо вибірку:

І додаємо наступний код - [a-zA-Z0-9-_.]+@[a-zA-Z0-9-]+.[a-zA-Z0-9-.]+

Завантажуємо в спайдер спарсовані сайти:

І отримуємо базу мила:

Як зібрати ціни із сайту конкурента
Вибираємо жертву, у мене це буде сайт цитрусу. Ну і звичайно ж парсить одні ціни це безглуздо, тому разом із ціною будемо брати і назву товару.
Що б не парити зайве вибираємо розділ, у мене це "Смартфони" і задаємо наступні правила, що обмежують жабу:

Копіюємо xPath елемента ціни:
Вставляємо в Custom Extraction:
Додаємо аналогічно і назву товару, запукаємо парсинг. Я, як завжди, весь сайт не паршив. Мені це не потрібно:)
Експортуємо та дивимося що вийшло:
Висновок
Використовуйте дані лише на благі цілі. Грайте чесно та поважайте чужу працю.
Пишіть у коментарі як ще можна використовувати цей парсинг.

