简介

在这个逐步指南中,您将学习如何在两个流行的无代码工具 Octoparse 和 ParseHub 中启动解析,使用移动代理。我们将设置环境,连接移动代理供应商,逐步分析真实数据收集任务,调试抗封禁和流量限制,然后检查并导出结果。最后,您将拥有一个能够抵御封禁的解析流程,准备好进行规模化和定期更新数据。

这个指南适合:想要快速无代码入门的初学者;需要可靠、清晰信息收集流程的市场营销人员、分析师和数据专家;进阶用户在“附加功能”一节里可以找到优化建议。

需要提前了解的内容:基本的计算机和浏览器操作技能。不需要编程知识。

预计耗时:完整周期 2-4 小时,包括安装、设置代理和测试解析。如果您已经熟悉工具,则仅需 60-90 分钟。

准备工作

所需工具和访问权限:

  • Octoparse 账户(支持 Windows 和 macOS;云版本可用)。任何最新的 2025-2026 版本均可。
  • ParseHub 账户(Windows/macOS 桌面应用和网络账户)。选择最新版本。
  • 来自可靠供应商的移动代理账户和访问权限。合适的服务包括真实的移动 IP、基于用户名和密码的授权以及灵活的代理轮换管理。例如,mobileproxy.space 作为移动代理和自动化工具的供应商。
  • 允许进行学习解析的测试网站。我们将使用名为“Books to Scrape”的示例资源作为学习目的。您可以将示例替换为其他网站,只要您获得了许可且不违反该资源的规则。

系统要求:

  • 支持 Windows 10/11 或 macOS 12+ 的计算机,至少 8 GB 内存,并有 2-4 GB 的可用磁盘空间。
  • 稳定的互联网连接,速度为 10 Mbps 及以上。
  • 安装软件和访问网络设置以测试代理的权限。

需要下载和安装的内容:

  1. 从开发者的官方网站下载并安装 Octoparse。安装时选择界面语言和安装目录。安装完成后,登录您的账户或创建新账户。
  2. 下载并安装 ParseHub。启动应用并登录账户。
  3. 向移动代理供应商申请套餐。在个人账户中获取代理地址(主机和端口)、用户名和密码。如果 available,选择 IP 轮换的时间间隔,例如每 3-10 分钟。

备份项目(适用于项目):

  • 在 Octoparse 中,每次重大更改后将项目导出为 .otd 文件。
  • 在 ParseHub 中,设置后保存项目并通过菜单“文件” → “另存为”创建项目文件的本地副本。

建议:将代理的授权数据与项目分开存储。使用密码管理器,实现学习和生产任务的不同权限。

基本概念

简单解释的关键术语:

  • 无代码解析器 — 一种允许您在无需编程的情况下从网站收集数据的程序。用户通过点击来设置:打开什么、点击什么、提取什么。
  • 代理 — 一个中间服务器,您的互联网请求通过它进行。目标网站看到的不是您的真实 IP,而是代理的 IP。
  • 移动代理 — 使用运营商(3G/4G/5G)真实 IP 地址的代理。它们通常变化频繁,看起来很自然,降低了被封禁的风险。
  • IP 轮换 — 周期性更换 IP 地址。在移动代理中,可以通过计时器或提供商面板中的 API 切换器自动进行。
  • 选择器 — 指定要从页面中提取的元素(例如,商品标题、价格)的方式。在 Octoparse 和 ParseHub 中,通过对页面元素的点击实现。
  • 分页 — 在结果列表之间切换(例如“下一页”按钮、页码)。
  • 会话 — 从一个 IP 发出的请求序列。“粘性”或 sticky 会话在一定时间内保持 IP,完成任务时不会中途更换地址。

基本工作原理:

  • 解析器打开页面,等待加载,找到所需元素,提取文本、链接或属性,然后转到下一页并重复该过程。
  • 代理在项目设置中只需添加一次。之后,所有网络请求通过它进行。
  • 为了稳定性,使用适中的速度,在操作之间设置暂停并进行 IP 轮换。

在开始之前需要理解的内容:

  • 遵守源网站的规定和您所在国家的法律。尊重 robots.txt 和资源的使用条款。如果您计划进行大量下载,则需要获得许可。
  • 不要提取不适合自动收集的个人数据。只处理开放和获得许可的信息。
  • 移动代理的目的是保持稳定和正确的工作,而不是 bypass 法律或网站所有者设置的限制。

⚠️ 注意:切勿将代理和解析工具用于任何违反当地法律或网站规则的行为。本指南旨在提供合法的学习和工作场景,前提是可以访问数据。

步骤 1:规划任务和准备数据结构

阶段目标

确定需要什么数据,数据在页面上的位置,如何分页,以及协商请求频率规则。结果——简单的字段计划 → 选择器 → 来源以及启动的 URL 列表。

详细说明

  1. 打开带有产品的学习网站(例如:Books to Scrape)。确保这是演示资源,允许学习数据收集。
  2. 确定要提取的字段:产品名称、价格、评级、库存情况(在售)、链接和封面(图像 URL)。
  3. 固定数据结构:在 Google Sheets 或 Excel 中创建包含 Title、Price、Rating、Availability、ProductURL、ImageURL 的表格。
  4. 检查分页:找到列表底部的“下一步”按钮或页码。记录 CSS 类或按钮文本(例如,“li.next a”)。
  5. 评估深度:有多少页面和产品。为了学习演练,选择 3-5 页。
  6. 确定请求频率:从 2-4 秒发 1 次请求开始,并在分页前逐渐增加暂停。

建议:开始时目标越简单,调试越容易。首先选择 1-2 个字段(例如标题和价格),然后再添加其余字段。

预期结果

您有一个起始的页面 URL 列表、字段列表以及如何分页的理解。

可能的问题和解决方案

  • 不清楚所需元素的位置。解决方案:将光标悬停在浏览器中的元素上,使用“查看代码”来查找唯一的属性或类。
  • 分页不稳定。解决方案:使用“下一步”按钮而不是页码,这样更简单且更稳定。

✅ 检查:您的表格中有字段列表和 3-5 个起始 URL。对分页的理解得到了验证。

步骤 2:获取并检查移动代理

阶段目标

申请移动代理,获取地址、端口、用户名和密码,选择 IP 轮换模式,并确保代理稳定工作。

详细说明

  1. 登录到移动代理供应商的个人账户。合适的服务示例:mobileproxy.space,提供可配置的移动 IP、文档以及授权格式设置。
  2. 创建代理账户。指定所需的城市或国家范围,如果任务需要。对于学习项目,使用默认区域。
  3. 复制设置:主机(例如,gw.provider.example)、端口(例如,10000-20000)、用户名和密码。将数据存储在密码管理器中。
  4. 配置 IP 轮换:选择 3-10 分钟的时间间隔。对于长商品,使用 5-15 分钟的 sticky 会话,以便在提取商品卡时不更换 IP。
  5. 检查代理的有效性:在浏览器中设置系统代理(HTTP)到提供的主机:端口以及用户名和密码。访问“显示 IP”页面或任何允许的服务,查看您的外部地址,并确保 IP 更改为移动的。
  6. 检查完毕后,关闭浏览器中的系统代理,以免影响后续工具的工作。

建议:如果供应商提供 API 按钮“更换 IP”,请记录其 URL。这对于在任务之间手动更换 IP 会很有用。

预期结果

您拥有活跃的移动代理凭据,并确认 IP 能够正确替换且轮换配置正常。

可能的问题和解决方案

  • 浏览器中的授权错误。解决方案:检查用户名和密码的正确性,注意字符大小写。
  • 通过代理无法打开网站。解决方案:更换提供商账户中的节点或端口,或联系支持。确保使用的协议(HTTP/HTTPS)受支持。

✅ 检查:您确认了移动代理的外部 IP,并知道在必要时如何启动轮换。

步骤 3:在 Octoparse 中设置移动代理

阶段目标

将移动代理连接到 Octoparse 中的特定项目,以便所有请求都通过它,并配备所需的轮换和延迟。

详细说明

  1. 启动 Octoparse 并登录账户。在主屏幕上点击“+ 新建”或“创建任务”。
  2. 输入您列表中的起始 URL(例如,书籍部分的主页)。点击“保存 URL”或“开始”进行预览。
  3. 打开项目设置。在左侧面板中找到“设置”、“高级”或“任务设置”(名称可能因版本而异)。转到“代理”或“IP 轮换”部分。
  4. 选择“使用我的代理”或“自定义代理”。输入您的移动代理的主机和端口。
  5. 输入授权信息:输入用户名和密码。如果有“记住凭据”的选项,请启用它。
  6. 在 Octoparse 中激活 IP 轮换(如果可用),或者将轮换保留在供应商端。如果 Octoparse 允许“每 X 分钟更换 IP”,请确保与代理设置中的时间间隔一致(例如,5 分钟)。
  7. 设定速度:在“速度”或“执行设置”中设置 2-4 秒的操作延迟和 5-8 秒的分页前延迟。如果可用,请启用“随机延迟”选项。
  8. 保存设置。点击“测试连接”(如有)以确保项目能通过代理访问互联网。

建议:为不同的项目保存不同的代理配置。在名称中标注区域和轮换时间,以避免混淆。

⚠️ 注意:切勿在一个移动 IP 下同时启动多个线程。这可能导致可疑活动。最好通过增加代理的数量来扩大规模。

预期结果

Octoparse 中的项目被保存,并且通过“测试连接”验证连接成功,预览页面稳定打开。

可能的问题和解决方案

  • 通过代理“连接失败”。解决方案:检查主机:端口、授权,确保操作系统中没有与应用系统代理冲突。
  • 页面加载过慢。解决方案:在“高级”中增加加载超时并减少并发请求数。

✅ 检查:在 Octoparse 的预览中,页面能够稳定打开,并且连接日志指示通过您的代理进行了请求。

步骤 4:在 ParseHub 中设置移动代理

阶段目标

将移动代理连接到 ParseHub 项目,使所有网络请求通过指定的 IP 地址、授权和延迟。

详细说明

  1. 打开 ParseHub 并创建新项目:点击“新建项目”,输入起始 URL。等待页面在预览窗口加载。
  2. 转到项目设置。在右侧面板或通过“设置图标”打开“项目设置”或“网络”(名称可能不同,取决于版本)。
  3. 找到“代理”或“使用代理服务器”部分。选择 HTTP/HTTPS 协议,输入您的移动代理的主机和端口。
  4. 输入用户名和密码进行授权。如果有“保存凭据”的复选框,请启用它。
  5. 在执行设置中设定延迟:为“操作前延迟”设定 2-4 秒,“页面加载超时”设定为 20-40 秒,如果可以使用,请启用“随机化延迟”。
  6. 保存设置。如果提供“测试代理”或“测试连接”按钮,请运行测试。
  7. 返回预览窗口,刷新页面。确保内容能够稳定加载,并且没有授权错误。

建议:如果您的供应商有不同的出口点(城市),请为不同的 ParseHub 项目使用不同的主机。这将简化日志分析,提高稳定性。

预期结果

ParseHub 项目能无误地打开页面,代理模式已激活。

可能的问题和解决方案

  • 频繁出现授权请求。解决方案:在设置中重新输入用户名和密码,检查复制时是否有多余空格。
  • 预览中页面无法加载。解决方案:增加超时,确保代理正常工作(在浏览器上检查),如有必要,换掉提供商的节点。

✅ 检查:在 ParseHub 的预览中,页面通过代理稳定打开,没有 407 代理授权错误。

步骤 5:在 Octoparse 中创建和启动任务(示例)

阶段目标

在 Octoparse 中设置操作链,以提取标题、价格、评级、库存、链接和图片,基于商品列表示例。获取一个稳定的场景,包括分页和导出。

详细逐步说明

  1. 在已经连接代理的项目中,输入分类目录的起始 URL。点击“前往”进行预览。
  2. 点击“自动识别网页数据”。等待 Octoparse 高亮商品列表模块并提供字段。
  3. 检查建议的字段。如果需要,点击商品标题并选择“提取文本”;点击价格 - “提取文本”;点击链接 - “提取 URL”;点击图片 - “提取图片 URL”;点击评级 - 提取类属性,然后将其转换为可读的评级。
  4. 创建“循环项”:确保 Octoparse 确定了可重复的列表。如果没有,请手动选择两个相同的列表元素并点击“全选”以创建循环。
  5. 添加分页:点击底部的“下一步”按钮,选择“点击以分页”。设定页面数量限制,例如进行测试时设定为 3。
  6. 设置暂停:在分页的“点击”设置中,添加“下一动作前暂停” 5-8 秒。
  7. 打开“数据预览”。确保有 Title、Price、Rating(可能作为“star-rating Three”等类)、Availability、ProductURL、ImageURL 列。
  8. 如有必要,添加“清理数据”步骤:删除价格中的货币符号,将评级类映射到数字(One-Five → 1-5),去掉多余空格。
  9. 保存项目,并以参数“本地运行”启动“运行”;延迟时间为默认设置,流数量——1。
  10. 导出完成后选择 CSV 或 Excel 格式。指定保存路径和文件名称,例如 octoparse_books_test.xlsx。

建议:如果自动识别选择了多余的元素,请在“字段”面板中手动删除它们。只保留所需列,这样可以加快处理速度并简化后期处理。

建议:在正确显示“可用性”时,不仅提取文本,还要检查卡片上是否存在“availability”元素。如果该元素具有数量属性,请将其作为单独字段添加。

预期结果

您将获得针对 3-5 页的正确数据集:不低于 60-100 行,包含所有字段及有效链接。

可能的问题和解决方案

  • 无法创建“循环项”。解决方案:手动选择两个相邻的相同项并点击“全选”。然后对每个需要的子元素添加“提取数据”。
  • 评级作为类文本提取。解决方案:使用“清理数据”功能的“替换”来映射“star-rating Three” → “3”。
  • 无法点击分页。解决方案:增加“等待元素”和“超时”,确保选择的是链接元素,而不是容器。

✅ 检查:在预览和最终导出中,列的值与预期相符。没有全空行,链接可点击,图片能打开。

步骤 6:在 ParseHub 中创建和启动任务(示例)

阶段目标

在 ParseHub 中收集同样的数据集,设置元素选择、分页和导出。

详细逐步说明

  1. 在打开的 ParseHub 项目中点击“选择”工具,点击第一个商品的标题。然后点击第二个商品的标题,以设定重复元素的模板。列表将会高亮显示。
  2. 在右侧面板上点击“提取”,提取标题文本。将字段重命名为 Title。
  3. 同样选择前两个商品的价格。点击“提取”,选择“文本”类型,将字段命名为 Price。
  4. 对于商品链接,选择商品标题,并在字段属性中选择“提取” → “URL”而不是文本。将字段命名为 ProductURL。
  5. 对于图片,选择卡片上的图片并选择“提取” → “图片 URL”。将字段命名为 ImageURL。
  6. 对于评级,点击星星图标或评级文本块。如果它嵌入在类中,提取“class”属性,然后用转换规则将“One”-“Five”替换为数字。
  7. 添加“可用性”:点击可用性模块并提取文本。将字段命名为 Availability。
  8. 设置分页:点击“下一步”按钮或下一页的页码并选择“点击”。设置“重复当前模板”的页面数为 3-5。
  9. 在“点击”和“等待”操作中添加 4-8 秒的延迟。在可用的情况下,启用“随机化”。
  10. 点击“运行”以进行本地启动。等待完成并导出结果为 CSV/Excel。

建议:如果 ParseHub 选择了过于宽泛的容器,请缩小选择:再次点击所需子元素,或使用“空选择”逐步添加元素。

建议:对于复杂页面,添加“等待元素”步骤,使用具体的 CSS 属性,以便在提取前等待所需模块的加载。

预期结果

您将获得类似的数据集,与 Octoparse 的导出数据相当,验证了逻辑的正确性和代理的稳定性。

可能的问题和解决方案

  • 列表未能识别。解决方案:选择两个相同的相邻卡片,以便 ParseHub 看到重复模式。
  • 字段偶尔为空。解决方案:在页面加载后增加延迟并使用“等待元素”来等待内容。

✅ 检查:数据稳定导出且无遗漏,CSV/Excel 导出与结构相符。

步骤 7:抗封禁和限制:如何保持稳定性

阶段目标

通过温和的节奏、正确的轮换和请求质量控制,保护流程免受过多封禁。

推荐设置

  1. 请求速率:每秒保持最多 1-2 个请求,但更好是每 2-4 秒 1 个请求。
  2. 分页延迟:5-10 秒,最好带有随机化。
  3. IP 轮换:每 3-10 分钟。对于长产品使用 5-15 分钟的 sticky 会话,以免丢失上下文。
  4. 并行:每个移动 IP 1 个线程。要扩大规模,请增加新代理,而非在单个 IP 上增加线程。
  5. 超时:页面加载超时设置为 20-45 秒,如果失败,重试次数为 1-2 次。
  6. 启动间隔:长会话后为 3-5 分钟,给网络“冷却”时间。

建议:记录日志:记录轮换时间间隔、收集页面数量和错误指标。这有助于准确设置限制。

⚠️ 注意:避免绕过网站的技术限制。如果网站明确禁止自动化收集,请勿使用解析。只在允许的情况下工作,并确保网站能够支持的容量。

预期结果

减少加载错误,不出现 CAPTCHA 和封禁激增,稳定收集数据。

可能的问题和解决方案

  • 出现频繁的 CAPTCHA。解决方案:降低速度,增加延迟,减少并行性。如有必要,换掉提供商的地区代理。
  • 随机出现 403/429 响应。解决方案:增加更多暂停,减少每次运行的深度,利用计划任务设置时间间隔。

✅ 检查:日志中的拒绝次数减少。每个页面的平均时间稳定,总体填充字段的比例增加。

步骤 8:导出、验证和结构化数据

阶段目标

正确导出结果,检查其完整性,并将其转换为方便分析的结构。

详细说明

  1. 从 Octoparse 导出结果为 Excel(XLSX)和从 ParseHub 导出为 CSV。根据日期重命名文件,例如 books_octoparse_2026-06-22.xlsx 和 books_parsehub_2026-06-22.csv。
  2. 打开导出文件,检查所有列的存在。手动核对 5-10 条随机记录与网站。
  3. 检查重复项:按 ProductURL 排序并删除重复行。
  4. 清理数据:去除货币符号,将价格转换为数字,将评级标准化到 1 到 5,去掉多余空格。
  5. 将最终文件保存为主版本。制作一个工作副本和一个归档副本。

建议:设定简单的质量控制规则:关键字段的填充率不低于 95%,测试运行中的重复率不超过 2%。

预期结果

清晰且完整的数据集,准备好进行分析或上传到 BI/CRM。

可能的问题和解决方案

  • CSV 编码错误。解决方案:在编辑器中打开文件,选择 UTF-8 编码,或在 Google Sheets 中导入时设置编码。
  • 分隔符混合。解决方案:导出为 XLSX,或指定分号作为分隔符。

✅ 检查:手动核对 10 条记录证实其正确性。字段符合预期格式。

步骤 9:自动化启动和稳定性控制

阶段目标

设置任务的定期启动、日志和监控,以便无须手动干预即可保持结果。

详细说明

  1. 在 Octoparse 中打开“任务安排”或“调度任务”。创建安排,例如每天 02:00。指定深度的限制和启动行的数量。
  2. 在 ParseHub 通过在线账户设置“安排运行”:选择频率(每天或每周),限制执行时间和页面数量。
  3. 设置通知:启用关于任务完成和错误的电子邮件通知。
  4. 添加对 IP 轮换的控制:在提供商面板中设置按计时器自动刷新 IP,并将其与计划启动同步。如果需要,可以在启动前更改 IP。
  5. 保存日志:每周将运行日志导出为 CSV 以进行分析。记录时间、收集的行数和加载错误数量。

建议:在主要时间表前10-15分钟进行小规模检查运行,以确保网站可用并且代理正常工作。

预期结果

任务根据安排稳定运行,数据不断更新,如果出现错误,您会收到通知并及时响应。

可能的问题和解决方案

  • 任务在晚上崩溃。解决方案:启用错误重启功能,增加超时长度,减少深度。
  • 有时 IP 未及时更新。解决方案:在启动安排前 1-2 分钟设置更换 IP。

✅ 检查:日志中有成功的夜间运行,收到完成邮件,数据量按计划增长。

检查结果

检查清单:以下内容应正常工作

  • Octoparse 和 ParseHub 能够无误地打开起始页面,代理活跃。
  • 字段能正常提取,分页能正常点击并等待加载。
  • CSV/XLSX 的导出生成可读文件,无任何扭曲。
  • 测试集中平均空字段比例不超过 5%。
  • IP 轮换按照指定间隔工作,无授权错误。

如何进行测试

  1. 在 2-3 页上启动短刺激测试,并检查日志记录:成功加载占比不低于 95%。
  2. 手动检查十条随机记录,并与网站进行比较。
  3. 查看代理面板中的外部 IP 是否根据时间表发生变化。

成功执行的指标

  • 无代理身份验证错误。
  • 没有频繁出现 CAPTCHA 或 403/429 响应。
  • 每页加载时间稳定,数据获得量可预测。

常见错误与解决方案

  • 问题:“407 代理身份验证要求”。原因:用户名/密码不正确。解决方案:检查凭据,删除复制时的多余空格,保存设置并重新测试。
  • 问题:页面无法加载或加载非常缓慢。原因:超时设置过短,节点过载,请求速率过高。解决方案:增加超时,降低速率,更换提供商的节点。
  • 问题:部分行字段为空。原因:元素未能及时渲染。解决方案:添加“等待元素”,增加延迟并启用随机化。
  • 问题:分页能点击,但数据不变。原因:选择了错误的元素或需要等待更新。解决方案:选择“下一步”按钮内的链接,增加“等待导航”。
  • 问题:重复记录。原因:由于过滤器,收集相同的邻近页面上的相似卡片。解决方案:按 ProductURL 过滤,在导出时启用重复检查。
  • 问题:突发 IP 禁封。原因:代价高的请求节奏。解决方案:将并行性降至每个 IP 一个线程,增加暂停,使用合理持久性的 sticky 会话。
  • 问题:CSV 编码错误。原因:系统语言设置问题。解决方案:使用 XLSX,或以明确设置 UTF-8 的方式导入 CSV。

附加功能

高级设置:

  • 轮换计划:设置业务提供商控制面板中的 IP 自动更换,在每次预定启动之前。这将减少在同一 IP 上累积行为痕迹的可能性。
  • 卡片中的粘性会话:在进入产品卡片时,锁定 IP 5-10 分钟,以完成从一个地址的采集。这降低了不一致的风险。
  • 实时数据清洗:使用 Octoparse 的“清理数据”和 ParseHub 的“转换”,在收集过程中立即标准化价格、评级和链接。
  • 任务分解:将收集工作分为两个阶段——列表和卡片。首先收集 ProductURL,然后单独处理。这将简化质量控制和重新启动。
  • 集成:如果您的套餐支持,将数据直接导出到 Google Sheets 或数据库。设置数据质量通知。

优化:

  • 速度与稳定性:不要追求最大速度。稳定的每分钟 1-2 页通常比高峰期风险更小。
  • 区域性:如果网站对地理位置敏感,请选择特定区域的移动代理来获得一致的结果。

建议:维护“项目护照”:列出网站、频率、限制、轮换、故障点和代理支持联系方式。这将加快对事件的响应。

常见问题

问题:如何判断代理确实是移动的?
答案:在供应商面板中会指出网络类型(3G/4G/5G)及运营商。此外,移动 IP 通常在轮换时发生更改,并具有特定的运营商范围。

问题:能否同时在两个任务中使用同一个移动代理?
答案:不建议。每个移动 IP 对应一个线程最为理想。通过增加代理数量来扩展规模。

问题:选择供应商的轮换还是解析器的轮换?
答案:供应商的轮换更为可靠。在解析器中保持基本的暂停和超时,将 IP 的更换放在代理面板中,以避免冲突。

问题:如何处理 CAPTCHA?
答案:降低速度,增加延迟,使用更流畅的轮换和低并行度。仅在网站和法律允许的范围内操作。

问题:如果网站更改了布局该怎么办?
答案:调整选择器:在 Octoparse 中更新“提取数据”到新元素;在 ParseHub 中创建更精细的选择。始终在 2-3 页上进行测试。

问题:如何安全存储代理的密码?
答案:使用密码管理器,并为学习和实际项目创建不同的账户。不要将密码保存在公开文件中。

问题:如何快速确认轮换是否已生效?
答案:参照供应商面板,或在浏览器通过此代理执行针对 IP 显示服务的简单请求。

问题:如何在定期启动时避免重复记录?
答案:保留关键字段(例如 ProductURL)并与历史比较。在关闭的重复数据记录中,在导入存储时启用过滤。

问题:是否可以将 Octoparse 和 ParseHub 中的数据合并?
答案:可以。通过 ProductURL 将导出相汇聚,并优先保留填充率较高的字段。这有助于验证结果。

问题:查看本指南中所有代理设置步骤在哪里?
答案:访问“步骤 3”和“步骤 4”的内部联系:在 Octoparse 中设置代理在 ParseHub 中设置代理

结论

总结:您已经安装并配置了 Octoparse 和 ParseHub,连接了移动代理,创建了带有分页和验证的解析模板,设置了解封禁、导出和定期启动。最终,您得到一个无代码的可复制数据收集流程,通过温和的节奏和移动 IP 保持免封禁。

接下来该做什么:通过增加移动代理和时间表来扩增数量,通过数据转型提升质量,将导出集成到 BI 或 CRM 中。如果您使用 mobileproxy.space 之类的服务,请研究轮换面板和活动日志的附加功能。

发展方向:学习分析复杂页面的结构,使用高级清理和数据标准化,增加以填充率为标准的质量控制。对于更复杂的任务,考虑使用级联管道:先收集列表,然后是卡片,最后是媒体。记住:始终在网站和法律的规定范围内工作。

建议:在进行任何重大更改之前,备份项目并单独保存当前代理的设置。这样在回退时可以节省时间。