浏览器采集扩展操作说明:让采集能操作真实网页

免费扩展的用途、安装方式,以及录制式网页操作与数据采集的配置要点。

所属模块:浏览器采集扩展 最后更新:2026-09-15 38 次阅读

这个扩展是干什么的

「数据采集」模块里的定时采集流程图采集需要能操作网页。而操作网页依赖一个浏览器运行时(约 203MB)

S3 就是这个运行时所在的免费扩展:

  • 免费,不额外收费
  • 按需下载,不用采集功能的人不用下这 203MB
  • 装完,「采集」模块的网页操作能力才能用

什么时候需要它

你要做的事需要 S3 吗
采集数据清洗(纯 Excel 处理)不需要
定时采集网页数据需要
流程图配置化采集需要
表格处理、公文、PDF 等其他模块不需要

安装与启用

  1. 先安装主程序。
  2. 进入「数据采集」模块,首次使用网页采集功能时会提示需要下载扩展。
  3. 按提示完成下载与安装。
  4. 回到采集模块,即可使用网页采集能力。
下载体积较大,建议在网络条件好的时候进行。安装完成后不需要重复下载。

采集方式一:定时采集

适合结构固定的页面,配置一次长期使用。

  1. 新建定时任务,填目标网址。
  2. 选择要提取的字段。
  3. 设置频率(每分钟 / 每小时 / 每天 / 每周)。
  4. 先点「立即执行」验证配置,确认字段采到正确的值。
  5. 启用定时。

采集方式二:流程图采集

适合需要交互的页面:要先输入条件、点查询、翻几页才能采全。

  1. 添加步骤:
  • 打开页面:填网址
  • 输入:在输入框填查询条件
  • 等待:设置等待秒数
  • 提取数据:选择页面元素
  • 翻页:设置翻页规则与页数上限
  1. 流程图形式展示步骤,可调整顺序。
  2. 回放执行,结果导出 Excel/JSON。

最容易踩的坑:忘了加「等待」。页面没加载完就提取,采到一片空值。

关于浏览器自动化

这个扩展的本质是嵌入式浏览器 + 自动化控制:软件内嵌一个浏览器内核,按你配置的步骤去操作页面,像人工一样点击、输入、翻页。

与普通抓接口的区别

  • 抓接口:直接请求数据接口,快,但有些网站拿不到
  • 浏览器自动化:真的打开页面操作,慢一些,但什么页面都能处理

合规提醒

使用前请确认:

  1. 遵守目标网站的 robots 协议与使用条款
  2. 不要高频访问,避免给对方网站造成压力(这也是建议用「每天/每周」而不是「每分钟」的原因)。
  3. 不要采集非公开数据,不要用于获取他人隐私信息。
  4. 不要绕过访问控制,不采集需要越权才能看到的内容。
  5. 采集结果的使用需符合相关法律法规。

未来规划

这个 203MB 的浏览器运行时是个体积负担。长期方案是:把采集模块改为驱动你系统里已安装的 Edge / Chrome,这样就不需要再下载运行时了。

这是一个明确的优化方向,实施后 S3 扩展将不再需要下载。

常见问题

Q:这个扩展收费吗? A:免费。它是采集能力的依赖项,不单独收费。

Q:装了会占多少硬盘? A:解压后约 203MB 左右。

Q:能不装吗? A:如果只用「采集数据清洗」或其他模块,完全可以不装。

Q:为什么采集速度和手工操作差不多? A:因为是真实的浏览器操作,需要等页面加载、等元素渲染,速度天然接近人工。定时采集的价值在于「自动」而不是「快」。

Q:可以用它做别的浏览器自动化吗? A:当前定位是数据采集。更通用的自动化场景建议使用专业的 RPA 工具。

这篇说明对应的模块:浏览器采集扩展
让采集模块能操作网页

边看边试,比只看快得多

下载后先拿你自己的表格试一个功能,卡在哪一步再来对照说明。