Skip to content
产品动态

从手动提取到定时采集:Colbot Scheduled 正式上线

Colbot Team ·
scheduledweb-scrapingai-data-extractiongoogle-sheets

除了提交文件,现在也能让 Parser 定时获取内容 ​

Colbot Scheduled 已正式上线。除了手动选择文件进行解析,现在还可以为已有的 Parser 配置定时输入,在云端自动获取来源内容,并将发生变化的内容交给 AI 提取,按原有字段整理到 Google Sheets。

手动提交适合处理手头的一份文件;如果需要反复关注同一个信息来源,每次重新获取和提交内容就成了重复工作。Scheduled 将这部分工作交给云端:配置好来源和运行间隔后,无需保持电脑或浏览器开启。

Scheduled 是 Colbot Parsers 的能力扩展。它沿用 Parser 已有的提取指令、去重和审核设置,当前支持网页和 JSON API 两种输入来源。

一个网页案例:持续整理产品更新公告 ​

假设你正在跟踪一个产品的更新公告,希望把每次发布的标题、日期、摘要和原文链接保存在同一张 Google Sheet 中,便于之后筛选、比较和回看。

有了 Scheduled,就可以让这个网页成为 Parser 的定时输入。下面用一个公告演示案例,看看这条链路如何建立。

以下截图采集自 Colbot 的本地演示环境,网页地址与公告内容为示例数据。点击图片可查看原图。

1. 打开 Scheduled ​

这个 Parser 已经定义好了 Title、Date、Summary、URL 四个字段。原来的文件输入仍然可用,Scheduled 则让它能够持续接收来自固定来源的内容。

Product updates Parser 页面,突出显示 Scheduled 入口,下方保留 Select files 文件输入
① 从已有 Parser 的 Scheduled 入口,添加定时输入。

2. 选择 Web page ​

这个例子的来源是公开的产品公告页面,因此选择 Web page。对于通过接口提供内容的来源,也可以选择 JSON API;两种方式获取的内容都会交给同一个 Parser 处理。

Scheduled 的 Type 页面,已选中 Web page,下方显示 JSON API 选项
② 选择 Web page,获取公开网页中的公告内容。

3. 配置网页 URL ​

URL 指向要持续关注的公告页,后续每次运行都会从这个地址获取内容。

Scheduled 的 Source 页面,填写产品更新公告的示例网页 URL
③ 配置公告页 URL,确定要持续获取的来源。

4. 设定运行间隔 ​

Interval 决定两次获取之间的间隔。本例选择 24 小时,适合不需要频繁检查的产品更新。

Scheduled 的 Settings 页面,Interval 设为 24 hours,Display name 为 Product announcements
④ 在 Settings 中设定间隔,本例为 24 小时。

更多网页获取选项与适用条件,见 Scheduled 文档的 Web page 介绍。

5. 启用云端定时运行 ​

启用 Scheduled 后,云端会按设定间隔自动获取内容。也可以使用 Run now 手动触发一次运行,查看获取与解析的效果。

Scheduled 详情页,显示 Run now、已开启的 Schedule enabled 开关和 Submitted 运行记录
⑤ 启用后由云端定时运行,也可使用 Run now 手动触发。

6. 查看解析结果 ​

获取到的公告会交给 Parser,整理成相同的四列。本例采用自动通过审核的设置;需要人工审核的团队,也可以沿用已有的审核流程,在通过后再写入 Google Sheets。

公告解析结果,按 Title、Date、Summary、URL 展示 CSV exports 和 Search filters 两条示例更新
⑥ 网页中的两条公告,被整理成可筛选和比较的字段。

后续获取时,如果输入内容没有变化,Scheduled 不会重复创建解析任务;内容变化后则会再次交给 Parser。变化判断与去重的具体行为,见 内容没有变化或变化很小时的规则。

Scheduled 与 Web Clipper:定时自动获取,或浏览时按需采集 ​

Scheduled 适合持续关注已确定的来源:启用后由云端定时获取,也能使用 Run now 手动触发。Web Clipper 则适合在自己的浏览器中,采集正在查看的网页或选定区域。两者可以配合使用。

Scheduled 与 Web Clipper 的触发方式、登录态、内容选择和网页交互能力比较
比较项ScheduledWeb Clipper
手动触发支持支持
定时自动触发支持不支持
关闭电脑后自动采集支持不支持
获取内容的位置云端本地浏览器
采集浏览器中已登录的网页不支持支持
鼠标框选页面区域不支持支持
按 CSS selector 包含或排除内容支持不支持
抓取前等待网页内容按配置自动等待用户手动等待
抓取前点击或滚动页面按配置自动执行用户手动操作
AI 字段提取支持支持
沿用 Parser 审核流程支持支持
结果写入 Google Sheets支持支持

支持 不支持

Scheduled 在云端以未登录身份获取网页,不携带你本地浏览器的登录态。Web Clipper 直接采集当前浏览器中已显示的内容,因此适合需要登录后才能查看的页面,也可以通过鼠标框选,只提交感兴趣的区域进行解析。

对于需要等待内容或交互后才显示信息的网页,Scheduled 可以配置等待指定时长、等待 CSS selector 对应的元素出现,以及依次点击、滚动等动作,再获取内容;还可以通过 CSS selector 包含或排除指定内容。Web Clipper 则由你先等待页面加载,完成所需点击或滚动,再手动发起采集。

两种方式获取的内容都会交给 Parser,按已有字段、去重和审核设置处理,再整理到 Google Sheets。可以用 Scheduled 持续跟踪公开来源,用 Web Clipper 补充浏览时发现的信息、登录后可见的内容或临时选定的区域。

为你的 Parser 添加定时输入 ​

如果你已经用 Colbot 将文件内容整理到 Google Sheets,现在可以从一个需要持续关注的来源开始,为同一个 Parser 添加 Scheduled 输入。

运行 Scheduled 需要 Parser 所属团队具有有效的 Basic 订阅,抓取和 Parser 解析分别计费。可以查看 运行与计费说明 或 常见问题,了解具体规则。

了解 Colbot Parsers →