Как пользоваться Data Miner: подробное руководство без кода

Кратко: если вы копируете данные вручную из сайтов в таблицы, Data Miner поможет автоматизировать задачу без написания кода. Это особенно полезно для маркетологов, аналитиков и исследователей, которым нужно быстро собрать ссылки, цены, описания продуктов и другие структурированные данные.
Что такое веб‑скрапинг
Веб‑скрапинг — процесс извлечения структурированных данных из веб‑страниц. Простая формулировка: браузер читает HTML, а вы указываете шаблоны, какие элементы собрать. Определение: HTML — язык структуры страниц; CSS селекторы — короткие «адреса» элементов.
Важно: скрапинг отличается от парсинга API. API обычно предоставляет официальные данные; скрапинг — работа по модели визуального или селекторного извлечения с сайта.
Как работает Data Miner
Data Miner анализирует DOM (структуру HTML) загруженной страницы и извлекает повторяющиеся фрагменты, которые вы обозначаете как строки и столбцы. Для большинства задач достаточно базовых знаний HTML и CSS‑селекторов. Для динамических или сильно защищённых сайтов иногда придётся использовать дополнительные шаги: клик‑действия, прокрутку или собственный JavaScript.
Коротко о терминах:
- Рецепт — набор правил (строки, столбцы, навигация), который Data Miner выполняет, чтобы получить таблицу.
- List Page — страница со списком элементов (много строк).
- Detail Page — страница с подробной информацией об одном объекте (несколько полей в одной строке).
1. Установка и первая настройка

- Откройте Chrome или другой Chromium‑браузер.
- Установите расширение Data Miner из магазина Chrome.
- Нажмите на значок кирки в панели инструментов. Вас перенаправит на страницу регистрации/входа.
- Бесплатный план даёт ограниченное число запросов в месяц — этого обычно хватает для эпизодических задач.
Подсказка: если план закончился, можно экспортировать уже собранные данные и затем отключить автоматический сбор.
2. Подготовка страницы и выбор примера

Перейдите на страницу, откуда нужно собрать данные. Желательно иметь репрезентативный пример — страницу, на которой есть несколько элементов, похожих на те, что вы будете собирать. Если данные распределены по страницам, начните с первой.
Совет: отключите блокировщики контента и логины, которые мешают отображению элементов.
3. Поиск готового рецепта

Откройте Data Miner и посмотрите вкладку «Public» (Публичные рецепты). Для популярных сайтов часто уже есть готовые рецепты. Если есть — запустите их кнопкой “Run” (Запустить) и проверьте превью таблицы. При необходимости нажмите “Edit” (Редактировать) и скорректируйте.
Когда использовать готовый рецепт: при работе с крупными платформами (Google, Amazon, Twitter, маркетплейсы). Это экономит время и снижает вероятность ошибок.
4. Выбор типа страницы

Выберите “List Page” если вы собираете множество похожих записей (каждая запись — отдельная строка). Пример: результаты поиска, список товаров, лента постов.
Выберите “Detail Page” если на странице содержится большое количество полей об одном объекте (требуется собрать все в одну строку).
Mermaid: выбор типа страницы
flowchart TD
A[Начало] --> B{Есть ли повторяющиеся элементы?}
B -- Да --> C[List Page]
B -- Нет --> D[Detail Page]
C --> E[Создать строки и столбцы]
D --> E
E --> F[Настроить навигацию и действия]
F --> G[Запустить рецепт]5. Создание строк (блоки записи)

- Нажмите “Find” (Найти).
- Наведите мышь и удерживайте Shift, чтобы выделить прямоугольник вокруг данных, которые должны составлять одну запись таблицы (например заголовок, URL и описание).
- В разделе “Element’s Classes” или “HTML Element Type” отметьте соответствующие классы/типы, чтобы селектор применялся ко всем похожим элементам на странице.
Если селектор не покрывает все записи:
- Попробуйте выделить один элемент и нажать “Select Parent” (Выбрать родителя). Это расширит область.
- Откройте “View Element’s HTML” чтобы увидеть структуру.
- При необходимости укажите собственный CSS‑селектор, например a.product.
Data Miner покажет “Row Count” — сколько строк будет получено. Если число меньше ожидаемого, проверьте селектор.

6. Разбиение на столбцы

Каждая колонка должна быть подмножество блока записи. Процесс:
- Создайте колонку и задайте ей имя (например “Название”, “Ссылка”, “Цена”, “Описание”).
- Нажмите “Find” и выделите элемент внутри выбранной строки для этой колонки.
- Укажите тип данных: текст, URL, image URL.
Пример селектора для ссылок: a.product — означает все с классом product.
Проверьте превью колонки, нажав на иконку глаза справа от названия колонки. Это покажет все значения по строкам.

7. Настройка навигации по страницам

Если данные распределены по страницам, укажите селектор для кнопки «Next» (Следующая). Важно указать селектор на элемент или
Нажмите “Test Navigation” чтобы проверить, что Data Miner правильно нажимает кнопку и переходит дальше.

8. Действия: клики и прокрутка

Некоторые сайты загружают данные после клика или при прокрутке (infinite scroll). Data Miner поддерживает имитацию клика и прокрутки:
- Используйте “Find”, чтобы выбрать элемент, который нужно кликнуть или до которого нужно проскроллить.
- Вставьте селектор в соответствующее поле действий и протестируйте.
- При необходимости добавьте паузу (wait) между действиями.
Большинство взаимодействий реализуются через CSS‑селекторы. Для сложных сценариев можно добавить собственный JavaScript, но это уже продвинутый этап.
9. Сохранение и запуск рецепта

- Сохраните рецепт.
- Нажмите “Run” для локальной проверки.
- Проверьте превью данных. Исправьте колонки и селекторы при необходимости.

Настройте скорость и число страниц для обхода. Идите аккуратно: слишком высокая скорость может привести к блокировке по подозрению в бот‑поведении.
После окончания выберите формат выгрузки: CSV или Excel.
Если что‑то пошло не так — быстрые решения
- Рецепт не находит элементы: откройте HTML‑просмотр и проверьте классы. Часто контент находится внутри с динамическими классами.
- Пустые колонки: убедитесь, что вы выделили подмножество внутри блока записи, а не соседний элемент.
- Навигация не работает: проверьте, кликается ли реальная кнопка, или сайт использует JS‑роутинг (тогда селектор может быть на элементе, который не обновляет URL).
- Сайт блокирует: снизьте скорость, используйте прокси или переключитесь на другой инструмент.
Альтернативные инструменты
Если Data Miner не подходит:
- ParseHub — визуальный инструмент с поддержкой сложной логики.
- Octoparse — удобен для пользователей без навыков кодирования.
- Import.io — платформа для корпоративных задач.
- Scraper, VisualScraper — простые расширения для быстрых задач.
Каждый инструмент имеет свои ограничения. Data Miner хорош для быстрого старта и краудсорсинга рецептов.
Когда Data Miner не подойдёт
- Строгая защита от скрапинга (CAPTCHA, динамические токены). Тогда нужно использовать API или headless‑браузер с анти‑CAPTCHA.
- Контент, доступный только после входа (частные аккаунты). Потребуется сессия пользователя и осторожность с конфиденциальностью.
- Динамически генерируемый контент, где селекторы постоянно меняются. Тут лучше писать скрипты на Python (Selenium/Playwright) и строить устойчивую логику.
Мини‑методология для эффективного сбора данных
- Определите цель и поля, которые вам нужны.
- Найдите репрезентативную страницу (несколько вариантов, если сайт меняется по регионам).
- Поиск готового рецепта. Если есть — тестируйте и правьте.
- Создайте рецепт: строки → столбцы → навигация → действия.
- Протестируйте на 3–5 страницах, проверьте примеры значений.
- Настройте скорость и длину обхода.
- Выгрузите данные, проверьте на дубликаты и ошибки.
- Документируйте рецепт и сохраните бэкап.
Роль‑ориентированные чек‑листы
Аналитик:
- Определил поля и типы данных.
- Проверил превью колонок.
- Экспортировал в CSV и загрузил в BI‑инструмент.
Маркетолог:
- Собрал цены и ссылки конкурентов.
- Проверил обновление данных (cron/ручной запуск).
- Убедился в соответствии политики сайта.
Исследователь продукта:
- Собрал отзывы и рейтинги.
- Убедился, что даты и авторы корректны.
- Обработал текст (очистка HTML, нормализация).
Критерии приёмки
- Все обязательные поля заполнены в ≥95% строк.
- Формат дат и чисел соответствует требованиям (ISO или локальный формат).
- Нет дублирующихся строк (проверка по уникальному идентификатору или URL).
- Скрипт проходит тест навигации по N страниц без ошибок.
- Экспортированный файл открывается в Excel/Google Sheets без потери кодировки.
Тестовые сценарии и приёмочные тесты
Тест 1: Стандартный листинг
- Данные: страница с 10 элементами.
- Ожидание: Row Count = 10, столбцы Title и URL заполнены.
Тест 2: Пагинация
- Данные: 3 страницы по 10 элементов.
- Ожидание: при запуске на 3 страницы получено 30 строк.
Тест 3: Клик‑инициируемая подгрузка
- Данные: страница, где при нажатии «Загрузить ещё» подгружаются элементы.
- Ожидание: селектор клика работает, все элементы собраны.
Тест 4: Страница с динамическими классами
- Данные: классы элементов меняются.
- Ожидание: на помощь приходит XPath или более устойчивый CSS‑селектор; скрипт собирает данные корректно.
SOP: стандартный рабочий процесс (короткая инструкция)
- Откройте страницу и снимите локальные блоки (AD/BLOCKER).
- Проверьте вкладку Public на наличие рецепта.
- Если нет — нажмите New Recipe → List Page.
- Find → выделите блок строки → убедитесь в Row Count.
- Добавьте колонки через Find → проверьте preview.
- Укажите Next navigation и тестируйте.
- Добавьте click/scroll, если нужно.
- Сохраните и запустите; экспортируйте.
Инцидентный план и откат
Проблема: рецепт начал возвращать пустые строки после обновления сайта. Шаги:
- Откатить скорость до безопасной (задержка 2–5 с).
- Отключить автоматический запуск и провести ручную проверку селекторов.
- Сохранить копию старого рецепта.
- Отметить в документе изменения DOM, уведомить команду.
- При необходимости временно перейти на manual экспорт или другой инструмент.
Примеры CSS‑селекторов и приёмы
- Все ссылки товара: a.product
- Заголовки в карточке: div.card h2.title
- Класс изображения: img[itemprop=”image”]
Пример XPath (если CSS не работает): //div[contains(@class,’product’)]/a
1‑строчный глоссарий
- DOM: структура документа HTML.
- CSS‑селектор: выражение для выбора элементов в DOM.
- Row Count: число записей, которые создаст рецепт.
- Public recipes: библиотека готовых рецептов.
Этические и правовые заметки
- Уважайте правила использования сайта и robots.txt. Сбор общедоступных данных чаще законен, но нужно учитывать условия сайта и приватность.
- Не используйте собранные персональные данные в нарушение законодательства.
Итог и рекомендации
Data Miner — хороший стартовый инструмент для безкодового извлечения данных. Он сочетает визуальную настройку, библиотеку готовых рецептов и возможности для тонкой настройки через селекторы и JS. Для сложных задач переходите на инструменты типа Selenium/Playwright или специализированные сервисы.
Короткие рекомендации:
- Начинайте с Public recipes.
- Используйте “Select Parent” чтобы правильно захватить блоки.
- Тестируйте навигацию и скорость.
- Документируйте рецепты и храните бэкапы.

Дополнительные ресурсы: официальная документация Data Miner, форумы и видео‑уроки по CSS‑селекторам и основам HTML.
Авторский совет: если вы собираетесь регулярно обновлять данные, заведите версионирование рецептов и автоматический мониторинг изменений DOM — это сэкономит часы на отладке в будущем.
Похожие материалы
Несколько аккаунтов Skype: Multi Skype Launcher
Журнал для работы: повысить продуктивность
Персональные звуки уведомлений на Android
Скачивание шоу Hulu для офлайн‑просмотра
Microsoft Start: персонализированная новостная лента