自动采集工作台把工具情报转化为采集执行路径:先识别网站结构,再选择字段和工具,最后形成可保存、可调度、可追溯的数据源草稿。
结构解析字段筛选清洗计划工具路由
01
采集入口
目标与授权
02
复核
字段与策略
03
持久化
资产写入
04
监控
质量与漂移
05
诊断
浏览器证据
01 采集入口
采集入口与授权边界
选择目标平台、确认公开授权边界,并启动结构分析或 API-first 采集。
采集入口
URL 到结构化采集计划
针对公开网页、电商页面和 GitHub API-first 主题先做结构解析。结构预检用于判断授权与 DOM 基础字段,商品发现用于提取候选 URL,GitHub 主题雷达用于把公开仓库元数据写入采集源、任务和运行结果。
授权边界
待确认
目标字段
7 个
结构保存
待分析
02 复核
能力评估与平台包选择
先看能力边界和平台包,再决定当前目标应走结构预检、商品发现、GitHub API 或后续浏览器诊断。
Capability Probe
平台能力探测
展示每个平台当前可用后端、凭据模式、执行边界和禁止动作;probe 只做体检,不创建采集资源。
Platform Packages
平台包矩阵
每个平台包绑定采集目标、字段 contract、工具策略、风险边界和 SOP 入口。
02 复核
历史采集方案
回看已保存的站点分析与采集计划,避免重复创建低质量草稿。
历史分析
已保存的站点分析会在这里形成可复用采集计划。
暂无历史分析。完成一次商品页分析后,系统会保存默认采集计划。
02 复核
字段候选与采集源草稿
复核字段、工具建议、清洗草稿和可入库采集源草稿。
等待 URL 分析
商品页分析会明确字段能否结构化保存,以及是否需要浏览器运行时复核。