Введение

В этом пошаговом гайде вы научитесь запускать парсинг без программирования в двух популярных no-code инструментах — Octoparse и ParseHub — с использованием мобильных прокси. Мы настроим окружение, подключим мобильный прокси-провайдер, разберем реальную задачу сбора данных, отладим антибан и лимиты, а затем проверим и экспортируем результат. В конце вы получите устойчивый к блокировкам процесс парсинга, готовый к масштабированию и регулярному обновлению данных.

Для кого этот гайд: для начинающих, кто хочет быстро стартовать без кода; для маркетологов, аналитиков и специалистов по данным, кому нужен надежный и понятный процесс сбора информации; для продвинутых пользователей — в разделе «Дополнительные возможности» есть советы по оптимизации.

Что нужно знать заранее: базовые навыки работы с компьютером и браузером. Программирование не требуется.

Сколько времени потребуется: 2–4 часа на полный цикл, включая установку, настройку прокси и тестовый парсинг. Если опыт в инструментах уже есть — 60–90 минут.

Предварительная подготовка

Необходимые инструменты и доступы:

  • Учётная запись в Octoparse (Windows, macOS; доступна облачная версия). Любая актуальная версия 2025–2026 годов подойдёт.
  • Учётная запись в ParseHub (настольное приложение под Windows/macOS и веб-аккаунт). Выберите актуальную сборку.
  • Аккаунт и доступ к мобильным прокси от надёжного провайдера. Подойдет сервис с реальными мобильными IP, авторизацией по логину и паролю и гибким управлением ротацией. Уместный пример — mobileproxy.space как поставщик мобильных прокси и инструментов автоматизации.
  • Тестовый сайт, который разрешает учебный парсинг. Мы будем использовать демонстрационный ресурс для учебных целей — «Books to Scrape» (публичный демо-сайт для практики). Вы можете заменить пример на иной сайт, если у вас есть разрешение и это не нарушает правила ресурса.

Системные требования:

  • ПК с Windows 10/11 или macOS 12+ с 8 ГБ ОЗУ и свободными 2–4 ГБ на диске.
  • Стабильный интернет 10 Мбит/с и выше.
  • Возможность установки ПО и доступа к настройкам сети для проверки прокси.

Что нужно скачать и установить:

  1. Скачайте и установите Octoparse с официального сайта разработчика. Во время установки выберите язык интерфейса и каталог установки. По окончании войдите в аккаунт или создайте новый.
  2. Скачайте и установите ParseHub. Запустите приложение и войдите в аккаунт.
  3. Оформите тариф у провайдера мобильных прокси. В личном кабинете получите адрес прокси (хост и порт), логин и пароль. Если доступна панель ротации IP, отметьте интервал смены адреса, например каждые 3–10 минут.

Создание резервных копий (актуально для проектов):

  • В Octoparse экспортируйте проект в файл .otd после каждого крупного изменения.
  • В ParseHub после настройки сохраните проект и сделайте локальную копию файла проекта через меню «File» → «Save As».

Совет: Храните данные авторизации прокси отдельно от проектов. Используйте менеджер паролей и создавайте отдельные доступы для учебных и боевых задач.

Базовые понятия

Ключевые термины простым языком:

  • No-code парсер — программа, которая позволяет собирать данные с сайтов без программирования. Пользователь настраивает кликами: что открыть, что нажать, что извлечь.
  • Прокси — промежуточный сервер, через который идут ваши интернет-запросы. Сайт видит не ваш реальный IP, а IP прокси.
  • Мобильные прокси — прокси, использующие реальные IP-адреса сотовых операторов (3G/4G/5G). Они чаще меняются и выглядят естественно для сайтов, что снижает риск блокировок при бережном использовании.
  • Ротация IP — периодическая смена IP адреса. В мобильных прокси она может быть автоматической по таймеру или по API-переключателю в панели провайдера.
  • Селектор — способ указать на странице, какой элемент извлечь (например, заголовок товара, цену). В Octoparse и ParseHub это делается кликами по элементам страницы.
  • Пагинация — переход по страницам со списком результатов (кнопки «Next», номера страниц).
  • Сессия — последовательность запросов с одного IP. «Липкая» или sticky-сессия хранит IP на время, чтобы завершить задачу без смены адреса в середине.

Основные принципы работы:

  • Парсер открывает страницу, дожидается загрузки, находит необходимые элементы, извлекает текст, ссылки или атрибуты, переходит на следующую страницу и повторяет процесс.
  • Прокси добавляется один раз в настройки проекта. Затем все сетевые запросы идут через него.
  • Для стабильности используйте умеренные скорости, паузы между действиями и ротацию IP.

Что важно понимать перед началом:

  • Соблюдайте правила сайта-источника и законодательство вашей страны. Уважайте robots.txt и условия использования ресурса. Получайте разрешение, если планируете интенсивную выгрузку.
  • Не извлекайте персональные данные, не предназначенные для автоматического сбора. Работайте только с открытой и разрешенной информацией.
  • Цель мобильных прокси — стабильная и корректная работа, а не обход ограничений, установленных законом или владельцем сайта.

⚠️ Внимание: Никогда не используйте прокси и инструменты парсинга для действий, которые запрещены локальным законодательством или правилами сайта. Этот гайд предназначен для легитимных учебных и рабочих сценариев с разрешенным доступом к данным.

Шаг 1: Планируем задачу и подготавливаем структуру данных

Цель этапа

Определить, какие данные нужны, где они находятся на странице, как переходить по страницам, и согласовать правила частоты запросов. Результат — простой план поля → селектор → источник и список URL для старта.

Детальная инструкция

  1. Откройте учебный сайт с товарами (пример: Books to Scrape). Убедитесь, что это демо-ресурс, разрешающий учебный сбор данных.
  2. Определите поля для извлечения: название товара, цена, рейтинг, доступность (In stock), ссылка на карточку и обложка (URL изображения).
  3. Зафиксируйте структуру данных: создайте таблицу в Google Sheets или Excel с колонками Title, Price, Rating, Availability, ProductURL, ImageURL.
  4. Проверьте пагинацию: найдите кнопку «next» или номера страниц внизу списка. Запишите CSS-класс или текст кнопки (например, «li.next a»).
  5. Оцените глубину: сколько страниц и товаров. Для учебного прогона возьмите 3–5 страниц.
  6. Определите частоту запросов: начните с 1 запроса в 2–4 секунды и постепенных пауз перед пагинацией.

Совет: Чем проще и чище начальная цель, тем легче отладка. Начните с 1–2 полей (например, название и цена), затем добавляйте остальные.

Ожидаемый результат

У вас есть список URL-страниц для старта, список полей и понимание, как переходить по страницам.

Возможные проблемы и решения

  • Неясно, где находится нужный элемент. Решение: наведите курсор на элемент в браузере и используйте «Просмотр кода» для поиска уникального атрибута или класса.
  • Нестабильная пагинация. Решение: используйте кнопку «next» вместо номеров страниц, это проще и устойчивее.

✅ Проверка: В вашей таблице есть список полей и 3–5 стартовых URL. Понимание пагинации подтверждено.

Шаг 2: Получаем и проверяем мобильный прокси

Цель этапа

Оформить мобильный прокси, получить адрес, порт, логин и пароль, выбрать режим ротации IP и убедиться, что прокси работает стабильно.

Детальная инструкция

  1. Войдите в личный кабинет провайдера мобильных прокси. Уместный пример сервиса: mobileproxy.space, где доступны мобильные IP операторов, настраиваемая ротация и документация по форматам авторизации.
  2. Создайте прокси-учетную запись. Укажите необходимый пул городов или стран, если это нужно для задачи. Для учебного проекта используйте дефолтный регион.
  3. Скопируйте настройки: хост (например, gw.provider.example), порт (например, 10000–20000), логин и пароль. Сохраните данные в менеджер паролей.
  4. Настройте ротацию IP: выберите интервал 3–10 минут. Для стабильной сборки по страницам используйте sticky-сессию на 5–15 минут, чтобы IP не менялся в середине извлечения карточки товара.
  5. Проверьте прокси на работоспособность: откройте браузер и установите системный прокси (HTTP) на выданный хост:порт с логином и паролем. Зайдите на страницу «показать IP» или любой разрешенный сервис, где видно ваш внешний адрес, и убедитесь, что IP изменился на мобильный.
  6. Отключите системный прокси в браузере после проверки, чтобы не помешать дальнейшей работе инструментов.

Совет: Если провайдер предлагает API-кнопку «сменить IP», отметьте её URL-адрес. Это пригодится для ручной смены IP между запусками задач.

Ожидаемый результат

У вас есть активные реквизиты мобильного прокси и подтверждение, что IP корректно подменяется и ротация настроена.

Возможные проблемы и решения

  • Ошибка авторизации в браузере. Решение: проверьте правильность логина и пароля, учтите регистр символов.
  • Сайт не открывается через прокси. Решение: смените узел или порт в кабинете провайдера, либо обратитесь в поддержку. Убедитесь, что используете поддерживаемый протокол (HTTP/HTTPS).

✅ Проверка: Вы подтверждаете внешний IP мобильного прокси и знаете, как запустить ротацию при необходимости.

Шаг 3: Настройка мобильного прокси в Octoparse

Цель этапа

Подключить мобильный прокси к конкретному проекту в Octoparse, чтобы все запросы шли через него с нужной ротацией и задержками.

Детальная инструкция

  1. Запустите Octoparse и войдите в аккаунт. На главном экране нажмите «+ New» или «Create Task».
  2. Введите стартовый URL из вашего списка (например, главную страницу раздела «Books»). Нажмите «Save URL» или «Start» для предпросмотра.
  3. Откройте настройки проекта. В левой панели найдите раздел «Settings», «Advanced» или «Task Settings» (название может отличаться по версии). Перейдите к блоку «Proxy» или «IP Rotation».
  4. Выберите «Use my proxy» или «Custom proxy». Введите хост и порт вашего мобильного прокси.
  5. Укажите авторизацию: введите логин и пароль. Если есть опция «Remember credentials», включите её.
  6. Активируйте IP-ротацию в Octoparse (если доступно), либо оставьте ротацию на стороне провайдера. Если Octoparse позволяет «Change IP every X minutes», синхронизируйте интервал с настройками в кабинете прокси (например, 5 минут).
  7. Задайте скорость: в «Speed» или «Execution settings» поставьте задержки 2–4 секунды между действиями и 5–8 секунд перед пагинацией. Включите опцию «Randomize delay», если доступна.
  8. Сохраните настройки. Нажмите «Test connection» (если есть), чтобы убедиться, что проект видит интернет через прокси.

Совет: Храните разные профили прокси для разных проектов. В названиях указывайте регион и интервал ротации, чтобы избежать путаницы.

⚠️ Внимание: Не включайте параллельный запуск множества потоков на одном мобильном IP. Это может привести к подозрительной активности. Лучше масштабировать по количеству прокси.

Ожидаемый результат

Проект в Octoparse сохраняется, через «Test connection» проходит проверка соединения, а предпросмотр страниц открывается стабильно.

Возможные проблемы и решения

  • «Failed to connect via proxy». Решение: перепроверьте хост:порт, авторизацию, убедитесь, что нет системного прокси в ОС, конфликтующего с приложением.
  • Страница грузится слишком медленно. Решение: увеличьте таймаут загрузки в «Advanced» и снизьте количество одновременных запросов.

✅ Проверка: В предпросмотре Octoparse страницы открываются без ошибок, а лог соединений указывает обращения через ваш прокси.

Шаг 4: Настройка мобильного прокси в ParseHub

Цель этапа

Подключить мобильный прокси к проекту ParseHub так, чтобы все сетевые вызовы шли через указанный IP-адрес с авторизацией и задержками.

Детальная инструкция

  1. Откройте ParseHub и создайте новый проект: кнопка «New Project», введите стартовый URL. Дождитесь загрузки страницы в окне предпросмотра.
  2. Перейдите к настройкам проекта. В правой панели или через иконку «шестерёнки» откройте «Project Settings» или «Network» (название может отличаться в зависимости от версии).
  3. Найдите раздел «Proxy» или «Use proxy server». Выберите протокол HTTP/HTTPS, введите хост и порт вашего мобильного прокси.
  4. Укажите логин и пароль для авторизации. Если есть чекбокс «Save credentials», активируйте его.
  5. Задайте задержки в настройках выполнения: «Delay before actions» 2–4 секунды, «Page load timeout» 20–40 секунд, «Randomize delays» при наличии такой опции.
  6. Сохраните настройки. Если доступна кнопка «Test proxy» или «Test connection», выполните проверку.
  7. Вернитесь в окно предпросмотра и обновите страницу. Убедитесь, что контент загружается стабильно и без ошибок авторизации.

Совет: Если у вашего провайдера есть разные точки выхода (города), под отдельные проекты ParseHub используйте разные хосты. Это упростит анализ логов и повысит устойчивость.

Ожидаемый результат

Проект ParseHub открывает страницы без ошибок, а режим прокси активен.

Возможные проблемы и решения

  • Авторизация всплывает многократно. Решение: повторно введите логин и пароль в настройках, проверьте, нет ли лишних пробелов при копировании.
  • Страница не загружается в предпросмотре. Решение: увеличьте таймаут, убедитесь, что прокси работает (проверьте в браузере), при необходимости поменяйте узел у провайдера.

✅ Проверка: В предпросмотре ParseHub страницы стабильно открываются через прокси. Ошибок 407 Proxy Authentication Required нет.

Шаг 5: Создаём и запускаем задачу в Octoparse (пример)

Цель этапа

Настроить цепочку действий в Octoparse для извлечения названия, цены, рейтинга, наличия, ссылки и изображения на примере списка товаров. Получить устойчивый сценарий с пагинацией и экспортом.

Детальная пошаговая инструкция

  1. В проекте с уже подключенным прокси введите стартовый URL раздела каталога. Нажмите «Go» для предпросмотра.
  2. Нажмите «Auto-detect web page data» (Автоопределение). Дождитесь, пока Octoparse подсветит блоки списка товаров и предложит поля.
  3. Проверьте предложенные поля. Если нужно, кликните по заголовку товара и выберите «Extract text»; по цене — «Extract text»; по ссылке — «Extract URL»; по изображению — «Extract image URL»; по рейтингу — извлеките атрибут класса, затем преобразуете его в читаемый рейтинг.
  4. Создайте «Loop Item» по карточкам: убедитесь, что Octoparse определил повторяющийся список. Если нет, вручную выберите два одинаковых элемента списка и нажмите «Select all» для создания петли.
  5. Добавьте пагинацию: кликните по кнопке «next» внизу и выберите «Click to Paginate». Установите ограничение по количеству страниц, например 3 для теста.
  6. Задайте паузы: в настройках «Click» для пагинации добавьте «Wait before next action» 5–8 секунд.
  7. Откройте «Data preview». Проверьте, что у вас есть столбцы Title, Price, Rating (возможно, как класс «star-rating Three» и т. п.), Availability, ProductURL, ImageURL.
  8. При необходимости добавьте «Clean data» шаги: удаление валютного символа из цены, маппинг класса рейтинга в число (One–Five → 1–5), обрезка пробелов.
  9. Сохраните проект и запустите «Run» со следующими параметрами: «Local run» для теста; интервалы задержек — по умолчанию из настроек, потоков — 1.
  10. После завершения экспорта выберите формат CSV или Excel. Укажите путь сохранения и название файла, например octoparse_books_test.xlsx.

Совет: Если автоопределение выбрало лишние элементы, удалите их вручную в панели «Fields». Оставьте только нужные столбцы, это ускорит работу и упростит постобработку.

Совет: Для корректного «Availability» извлекайте не только текст, но и проверяйте наличие элемента «availability» на карточке. Если у элемента есть атрибут с количеством, добавьте его как отдельное поле.

Ожидаемый результат

Вы получаете корректный набор данных за 3–5 страниц: не менее 60–100 строк со всеми полями и валидными ссылками.

Возможные проблемы и решения

  • Не создаётся «Loop Item». Решение: выберите два соседних одинаковых элемента карточки вручную и нажмите «Select all». Затем добавьте «Extract data» для каждого нужного подэлемента.
  • Рейтинг извлекается как текст класса. Решение: используйте «Clean data» с функцией «Replace» для маппинга «star-rating Three» → «3».
  • Пагинация не кликается. Решение: увеличьте «Wait for element» и «Timeout», убедитесь, что выбран именно элемент ссылки, а не контейнер.

✅ Проверка: В предпросмотре и финальном экспорте значения столбцов соответствуют ожиданиям. Нет пустых строк сплошь, ссылки кликабельны, изображения открываются.

Шаг 6: Создаём и запускаем задачу в ParseHub (пример)

Цель этапа

Собрать аналогичный набор данных в ParseHub, настроив выбор элементов, пагинацию и экспорт.

Детальная пошаговая инструкция

  1. В открытом проекте ParseHub нажмите инструмент «Select» и кликните по заголовку первого товара. Затем кликните по заголовку второго товара, чтобы задать шаблон повторяющегося элемента. Список подсветится зелёным.
  2. В панели справа нажмите «Extract» для извлечения текста заголовка. Переименуйте поле в Title.
  3. Аналогично выберите цену на первой и второй карточке. Нажмите «Extract», выберите тип «Text», назовите поле Price.
  4. Для ссылки на карточку выберите заголовок товара и в свойствах поля укажите «Extract» → «URL» вместо текста. Поле назовите ProductURL.
  5. Для изображения выделите картинку на карточке и выберите «Extract» → «Image URL». Поле назовите ImageURL.
  6. Для рейтинга кликните по значку звёзд или текстовому блоку рейтинга. Если он зашит в класс, извлеките атрибут «class», затем настройте «Transform» правилом замены «One»–«Five» на числа.
  7. Добавьте «Availability»: кликните по блоку наличия и извлеките текст. Назовите поле Availability.
  8. Настройте пагинацию: кликните по кнопке «next» или номеру следующей страницы и выберите «Click». Установите «Repeat current template» до 3–5 страниц.
  9. Добавьте задержки в действия «Click» и «Wait» на 4–8 секунд перед переходом по страницам. Включите «Randomize» при наличии.
  10. Нажмите «Run» для локального запуска. Дождитесь завершения и экспортируйте результат в CSV/Excel.

Совет: Если ParseHub выделяет слишком широкий контейнер, сузьте выбор: кликните по нужному подэлементу ещё раз или используйте «Empty selection» и добавляйте элементы постепенно.

Совет: Для сложных страниц добавьте шаг «Wait for element» с конкретным CSS-атрибутом, чтобы дождаться нужного блока перед извлечением.

Ожидаемый результат

Вы получаете аналогичный набор данных, сопоставимый с выгрузкой из Octoparse, что подтверждает корректность логики и стабильность работы прокси.

Возможные проблемы и решения

  • Список не определяется. Решение: выберите две одинаковые карточки подряд, чтобы ParseHub увидел паттерн повторения.
  • Поля периодически пустые. Решение: увеличьте задержки после загрузки страницы и используйте «Wait for element» для контента.

✅ Проверка: Данные выгружаются последовательно без пропусков, экспорт в CSV/Excel открывается и соответствует структуре.

Шаг 7: Антибан и лимиты: как сохранить стабильность

Цель этапа

Защитить процессы от излишних блокировок за счёт бережного темпа, правильной ротации и контроля качества запросов.

Рекомендованные настройки

  1. Темп запросов: поддерживайте 1–2 запроса в секунду максимум, но лучше спокойнее — 1 запрос каждые 2–4 секунды.
  2. Задержки при пагинации: 5–10 секунд, желательно с рандомизацией.
  3. Ротация IP: каждые 3–10 минут. Для длинных карточек используйте sticky-сессию 5–15 минут, чтобы не потерять контекст.
  4. Параллелизм: 1 поток на 1 мобильный IP. Для масштабирования добавляйте новые прокси, а не потоки на один IP.
  5. Таймауты: Page Load Timeout 20–45 секунд, повторные попытки загрузки 1–2 раза при неудаче.
  6. Пауза между запусками: 3–5 минут, чтобы дать сети «остыть» после длинной сессии.

Совет: Ведите журнал: фиксируйте интервал ротации, объём собранных страниц и показатели ошибок. Это поможет точно подобрать лимиты.

⚠️ Внимание: Избегайте обходов технических ограничений сайта. Если ресурс явно запрещает автоматизированный сбор, не используйте парсинг. Работайте только там, где это разрешено, и с объёмом, который сайт способен поддержать без ущерба.

Ожидаемый результат

Снижение ошибок загрузки, отсутствие всплесков капчи и блокировок, равномерный сбор данных.

Возможные проблемы и решения

  • Появляется частая капча. Решение: уменьшите скорость, увеличьте задержки, сократите параллелизм, при необходимости поменяйте регион прокси у провайдера.
  • Случайные 403/429 ответы. Решение: добавьте больше пауз, уменьшите глубину за один запуск, используйте планировщик с интервалами.

✅ Проверка: В логах снижается количество отказов. Среднее время на страницу стабильно, а общий процент заполненных полей растёт.

Шаг 8: Экспорт, валидация и структурирование данных

Цель этапа

Корректно выгрузить результаты, проверить их целостность и привести к удобной для анализа структуре.

Детальная инструкция

  1. Экспортируйте результаты из Octoparse в Excel (XLSX) и из ParseHub в CSV. Переименуйте файлы с датой, например books_octoparse_2026-06-22.xlsx и books_parsehub_2026-06-22.csv.
  2. Откройте выгрузку и проверьте наличие всех столбцов. Сверьте 5–10 случайных записей с сайтом вручную.
  3. Проверьте дубликаты: отсортируйте по ProductURL и удалите повторяющиеся строки.
  4. Очистите данные: уберите символ валюты, приведите цену к числу, нормализуйте рейтинг от 1 до 5, обрежьте пробелы.
  5. Сохраните финальный файл как master-версию. Сделайте копию для работы и отдельную для архива.

Совет: Введите простые правила контроля качества: не менее 95% заполненности ключевых полей и не более 2% дубликатов в тестовом прогоне.

Ожидаемый результат

Чистый и полный датасет, готовый для анализа или загрузки в BI/CRM.

Возможные проблемы и решения

  • Неверная кодировка CSV. Решение: откройте файл в редакторе, выберите UTF-8 или импортируйте в Google Sheets с указанием кодировки.
  • Смешение разделителей. Решение: экспортируйте в XLSX или укажите точку с запятой как разделитель.

✅ Проверка: Ручная сверка 10 записей подтверждает корректность. Поля соответствуют ожидаемому формату.

Шаг 9: Автоматизация запусков и контроль стабильности

Цель этапа

Настроить регулярные запуски задач, логи и мониторинг, чтобы поддерживать результат без ручного участия.

Детальная инструкция

  1. В Octoparse откройте «Schedule» или «Task Scheduler». Создайте расписание, например ежедневно в 02:00. Укажите ограничения глубины и лимит строк на запуск.
  2. В ParseHub настройте «Schedule Runs» через веб-кабинет: выберите периодичность (раз в день или неделю), ограничьте время выполнения и количество страниц.
  3. Настройте уведомления: включите email-оповещения о завершении задач и об ошибках.
  4. Добавьте контроль ротации IP: в панели провайдера установите автообновление IP по таймеру, синхронизируйте его со стартом расписания. При необходимости поставьте смену IP перед запуском.
  5. Храните логи: экспортируйте журнал запусков в CSV раз в неделю для анализа. Фиксируйте время, количество собранных строк, число ошибок загрузки.

Совет: Делайте контрольный небольшой прогон за 10–15 минут до основного расписания, чтобы убедиться, что сайт доступен, а прокси работает.

Ожидаемый результат

Задачи стабильно запускаются по расписанию, данные пополняются, а при ошибках вы получаете уведомления и быстро реагируете.

Возможные проблемы и решения

  • Задача падает ночью. Решение: включите повторный запуск при ошибках, добавьте более длинные таймауты, уменьшите глубину.
  • Иногда IP не успевает смениться. Решение: поставьте смену IP на 1–2 минуты раньше старта расписания.

✅ Проверка: В журнале есть успешные ночные прогоны, письма об окончании приходят, а объём данных растёт согласно плану.

Проверка результата

Чек-лист: что должно работать

  • Octoparse и ParseHub открывают стартовые страницы без ошибок, прокси активен.
  • Поля извлекаются корректно, пагинация кликается и дожидается загрузки.
  • Экспорт в CSV/XLSX создаёт читаемые файлы без искажений.
  • Средний процент пустых полей не превышает 5% в тестовом наборе.
  • Ротация IP работает по заданному интервалу, ошибок авторизации нет.

Как протестировать

  1. Запустите короткий прогон на 2–3 страницы и проверьте логи: доля успешных загрузок не менее 95%.
  2. Проверьте десять случайных записей вручную, сравнив с сайтом.
  3. Посмотрите, меняется ли внешний IP согласно расписанию в панели провайдера.

Показатели успешного выполнения

  • Запуск без ошибок аутентификации прокси.
  • Отсутствие частых капч и ответов 403/429.
  • Стабильное время на страницу и предсказуемый объём данных за запуск.

Типичные ошибки и решения

  • Проблема: «407 Proxy Authentication Required». Причина: неверный логин/пароль. Решение: перепроверьте реквизиты, удалите лишние пробелы при копировании, сохраните настройки и протестируйте снова.
  • Проблема: страницы не загружаются или загружаются очень медленно. Причина: слишком короткий таймаут, перегруженный узел, высокая скорость запросов. Решение: увеличьте таймаут, снизьте скорость, смените узел у провайдера.
  • Проблема: поля пустые в части строк. Причина: элементы не успевают отрисоваться. Решение: добавьте «Wait for element», увеличьте задержки и включите рандомизацию.
  • Проблема: пагинация кликается, но данные не меняются. Причина: выбран не тот элемент или нужно дождаться обновления. Решение: выберите ссылку внутри кнопки «next», добавьте «Wait for navigation».
  • Проблема: повторяющиеся записи. Причина: сбор одинаковых карточек на соседних страницах из-за фильтров. Решение: фильтруйте по ProductURL, включите проверку дубликатов при экспорте.
  • Проблема: внезапные баны IP. Причина: слишком агрессивный темп. Решение: снизьте параллелизм до одного потока на IP, увеличьте паузы, используйте sticky-сессию разумной длины.
  • Проблема: неправильная кодировка CSV. Причина: системные настройки локали. Решение: используйте XLSX или импортируйте CSV с явной установкой UTF-8.

Дополнительные возможности

Продвинутые настройки:

  • Планирование ротации: настройте автосмену IP в кабинете провайдера перед началом каждого расписанного запуска. Это уменьшит вероятность накопления поведенческих следов на одном IP.
  • Sticky-сессии для карточек: при переходе в карточку товара закрепляйте IP на 5–10 минут, чтобы закончить сбор с одного адреса. Это снижает риск несоответствий.
  • Очистка данных на лету: используйте «Clean data» в Octoparse и «Transform» в ParseHub для стандартизации цены, рейтинга и ссылок уже во время сбора.
  • Разделение задач: разбивайте сбор на два этапа — список и карточки. Сначала собирайте ProductURL, затем отдельно проходите по ним. Это упрощает контроль качества и перезапуски.
  • Интеграции: выгружайте напрямую в Google Sheets или базы данных, если ваш тариф это поддерживает. Настройте уведомления о качестве данных.

Оптимизация:

  • Скорость против стабильности: не гонитесь за максимальной скоростью. Стабильные 1–2 страницы в минуту часто лучше, чем рывки с риском блокировок.
  • Регионность: если сайт геочувствителен, выбирайте мобильные прокси из конкретного региона для консистентных результатов.

Совет: Ведите «паспорт проекта»: перечислите сайт, частоту, лимиты, ротацию, точки отказа и контакты поддержки прокси. Это ускоряет реакцию на инциденты.

FAQ

Вопрос: Как понять, что прокси действительно мобильный?
Ответ: В кабинете провайдера указывается тип сети (3G/4G/5G) и оператор. Также мобильные IP часто меняются при ротации и имеют характерные диапазоны операторов связи.

Вопрос: Можно ли использовать один мобильный прокси сразу в двух задачах?
Ответ: Не рекомендуется. Один поток на один мобильный IP — оптимально для устойчивости. Масштабируйте количеством прокси.

Вопрос: Что выбрать: ротацию в провайдере или в парсере?
Ответ: Надёжнее ротация у провайдера. В парсере оставляйте базовые паузы и таймауты, а смену IP делайте в панели прокси, чтобы избежать конфликтов.

Вопрос: Как обрабатывать капчи?
Ответ: Снизьте скорость, увеличьте задержки, используйте более плавную ротацию и меньший параллелизм. Работайте только в рамках допустимых правил сайта и законодательства.

Вопрос: Что делать, если сайт меняет верстку?
Ответ: Перенастройте селекторы: в Octoparse обновите «Extract data» на новые элементы; в ParseHub создайте уточнённые выборки. Всегда тестируйте на 2–3 страницах.

Вопрос: Как хранить пароли от прокси безопасно?
Ответ: Используйте менеджер паролей и отдельные учётные записи для обучающих и боевых проектов. Не сохраняйте пароли в открытых документах.

Вопрос: Как быстро проверить, что ротация сработала?
Ответ: Сверьтесь с панелью провайдера или выполните короткий запрос к сервису показа IP в браузере через этот же прокси перед запуском задачи.

Вопрос: Как избежать дубликатов при регулярных запусках?
Ответ: Сохраняйте ключевое поле (например, ProductURL) и сравнивайте с историей. В выключенных дубликатах используйте фильтрацию при импорте в хранилище.

Вопрос: Можно ли объединить данные из Octoparse и ParseHub?
Ответ: Да. Сведите выгрузки по ключу ProductURL и приоритетно оставляйте поле, где заполненность выше. Это помогает валидировать результат.

Вопрос: Где посмотреть все шаги по настройке прокси в этом гайде?
Ответ: Перейдите к разделам «Шаг 3» и «Шаг 4» по внутренним ссылкам: настройка прокси в Octoparse и настройка прокси в ParseHub.

Заключение

Итог: вы установили и настроили Octoparse и ParseHub, подключили мобильные прокси, создали рабочие шаблоны парсинга с пагинацией и валидацией, настроили антибан, экспорт и регулярные запуски. На выходе — воспроизводимый процесс сбора данных без кода с устойчивостью к блокировкам за счёт аккуратного темпа и мобильных IP.

Что делать дальше: масштабируйте объём через добавление мобильных прокси и расписаний, повышайте качество через трансформации данных, интегрируйте выгрузки в BI или CRM. Если вы используете сервисы класса mobileproxy.space, изучите дополнительные функции панели ротации и журналы активности.

Куда развиваться: учитесь анализировать структуру сложных страниц, используйте расширенную очистку и нормализацию данных, добавляйте контроль качества с порогами заполненности. Для продвинутых задач рассмотрите каскадные пайплайны: сбор списка, затем карточек, затем медиа. Напоминаем: всегда работайте в рамках правил сайта и законодательства.

Совет: Перед любым крупным изменением делайте резервную копию проекта и сохраняйте текущие настройки прокси отдельно. Это сэкономит время при откате.