自动采集工作台

从目标 URL 解析网页结构、字段候选、工具选择和清洗计划

自动采集工作台把工具情报转化为采集执行路径:先识别网站结构,再选择字段和工具,最后形成可保存、可调度、可追溯的数据源草稿。

结构解析字段筛选清洗计划工具路由

01

采集入口

目标与授权

02

复核

字段与策略

03

持久化

资产写入

04

监控

质量与漂移

05

诊断

浏览器证据

01 采集入口

采集入口与授权边界

选择目标平台、确认公开授权边界,并启动结构分析或 API-first 采集。

采集入口

URL 到结构化采集计划

针对公开网页、电商页面和 GitHub API-first 主题先做结构解析。结构预检用于判断授权与 DOM 基础字段,商品发现用于提取候选 URL,GitHub 主题雷达用于把公开仓库元数据写入采集源、任务和运行结果。

授权边界

待确认

目标字段

7 个

结构保存

待分析

字段目标

02 复核

能力评估与平台包选择

先看能力边界和平台包,再决定当前目标应走结构预检、商品发现、GitHub API 或后续浏览器诊断。

Capability Probe

平台能力探测

展示每个平台当前可用后端、凭据模式、执行边界和禁止动作;probe 只做体检,不创建采集资源。

0 probes
Platform Packages

平台包矩阵

每个平台包绑定采集目标、字段 contract、工具策略、风险边界和 SOP 入口。

0 packages

02 复核

历史采集方案

回看已保存的站点分析与采集计划,避免重复创建低质量草稿。

历史分析

已保存的站点分析会在这里形成可复用采集计划。

暂无历史分析。完成一次商品页分析后,系统会保存默认采集计划。

02 复核

字段候选与采集源草稿

复核字段、工具建议、清洗草稿和可入库采集源草稿。

等待 URL 分析

商品页分析会明确字段能否结构化保存,以及是否需要浏览器运行时复核。