Stable Playbook · 2026-06-17

Data Achieve 数据采集工作台使用操作手册

这份手册面向培训和日常使用。它把网站每个页面讲成一套清楚的操作 SOP: 先看工具和方法,再建项目、接数据源、跑任务、看原始证据、产出情报,最后生成报告、预警和通知。

生产站点:scrapy.lute-tlz-dddd.top 核心目标:数据采集培训 + 情报闭环 适用对象:讲师、学员、采集执行者、管理员
← 返回上一层

快速上手

不要把这个网站当成普通内容站。它的正确打开方式是:先确认数据链路是否有内容,再围绕一个采集主题完成从工具学习到报告交付的闭环。

Step 1

登录系统

进入 /login,使用管理员或培训账号登录。账号由管理员提供,不在手册中写入密码。

Step 2

先看仪表盘

进入 /dashboard,确认任务、数据源、信号、情报、报告都有数据。这里是判断系统是否正常的第一站。

Step 3

按链路演示

按“工具库 → 项目 → 数据源 → 任务 → 原始数据 → 情报 → 报告”的顺序演示,学员最容易理解。

培训提醒:如果某个页面为空,不要直接跳过。先去项目、数据源、任务三个页面确认是否有启用的数据链路。

业务闭环总图

网站的价值不是单个页面,而是这些页面连起来形成一条可追溯的数据采集工作流。

工具学习闭环

采集工具库课程包讲义授权预检方法卡

用来培训“该选什么工具、怎么安装、怎么验收、哪里不能做”。

采集执行闭环

项目数据源采集任务原始数据实体快照

用来把一个采集主题变成可以持续运行的数据链路。

情报生产闭环

原始数据实体库信号中心情报中心情报详情

用来解释“为什么这条变化值得关注”,并保留证据。

交付闭环

情报报告中心预警中心站内通知复盘

用来把结论送到人手里,并留下阅读、发送和预警记录。

分模块 SOP

下面每个模块都按同一套方式说明:这个页面解决什么问题、怎么操作、验收什么结果。

登录

账号入口

登录后才能看到真实项目、任务、报告和通知。没有登录时不要判断页面是否为空。

/login

标准操作

  1. 打开登录页。
  2. 输入管理员或培训账号邮箱。
  3. 输入密码并提交。
  4. 登录成功后进入仪表盘。

验收标准

  • 页面跳转到 /dashboard
  • 左侧导航显示业务域、全局中心、工程中心。
  • 仪表盘可以看到采集、情报或报告数据。

全局仪表盘

总览页

用于快速判断整套系统是否稳定:有没有任务、有没有新鲜数据、有没有情报和报告。

/dashboard

标准操作

  1. 查看顶部摘要,确认项目、数据源、情报、报告不是 0。
  2. 查看 Top Intelligence,优先点击分数高、证据多的情报。
  3. 查看任务健康,定位失败任务和过期任务。
  4. 查看业务域拆解,判断当前数据覆盖哪些训练方向。

培训讲法

告诉学员:仪表盘不是结论本身,而是“今天先看哪里”的导航盘。看到异常后,要继续进入任务、信号或情报详情。

看板通过:有启用任务、有数据源、有情报、有最近采集记录。

采集工具库

培训主入口

集中展示 AI 采集工具、Agent 浏览器、爬虫框架、RPA、平台采集方法和风险边界。

/toolkit

标准操作

  1. 先看“训练源、GitHub 工具、方法卡、情报证据”四个指标。
  2. 使用搜索框查工具名,例如 Firecrawl、Crawl4AI、Browser Use、Playwright、影刀 RPA。
  3. 按分类、风险、阶段筛选工具。
  4. 点击工具卡,阅读适用场景、安装 SOP、验收命令、输出形态和边界限制。
  5. 使用授权 URL 预检向导,只检查自有、授权或明确允许分析的公开 URL。

重点区域

  • 工具雷达:看工具价值和适用场景。
  • 授权 URL 预检:看 robots、headers、DOM、network 和授权门禁。
  • 附件寻源诊断:用图片线索回到真实信息源。
  • 浏览器解析实验室:学习页面、网络、存储和指纹面。
  • 授权采集检查清单:判断能不能采、采什么、留什么证据。
禁止把反检测工具当作绕过风控教程。这里只用于浏览器解析、风险识别和合规边界训练。

培训课程包

讲师材料

把工具雷达、平台方法、风险边界和课堂讲义组织成一套可交付课程。

/toolkit/course-pack

标准操作

  1. 打开课程目录,确认当前课程包含工具、方法、边界和实操。
  2. 选择一张讲义,进入讲义详情。
  3. 按讲义中的讲解顺序、实操步骤、验收步骤开展培训。
  4. 需要离线交付时,用浏览器打印导出 PDF。

适合场景

  • 培训开场:先讲工具分类。
  • 课堂实操:按讲义完成安装和验收。
  • 课后复盘:让学员解释工具边界和证据链。

项目

组织边界

项目定义了要长期跟踪的主题,例如开源工具雷达、竞品网站采集、平台方法库。

/projects

标准操作

  1. 按业务域筛选项目:开源、电商、社媒、竞品、Agent、平台、合规。
  2. 查看项目下的数据源数量和情报数量。
  3. 需要新增主题时点击 New Project。
  4. 填写项目名称、说明和业务域。
  5. 保存后继续去数据源页面接入来源。

验收标准

  • 项目名称清楚表达采集主题。
  • 业务域选择正确。
  • 项目能关联数据源、任务、信号和情报。

数据源

入口配置

数据源记录不同平台和采集方法的接入配置。没有数据源,就不会有任务和原始数据。

/sources

标准操作

  1. 按项目或业务域筛选数据源。
  2. 查看数据源类型,例如 GitHub repo、GitHub topic、Generic web、Manual JSON。
  3. 检查 Collector 配置和授权说明。
  4. 需要修改时编辑数据源配置。
  5. 修改后重新测试或等待任务调度。

常见误区

  • 只添加 URL,不说明授权边界。
  • 字段配置不稳定,导致后续实体识别失败。
  • 把临时实验源混入正式项目。

采集任务

运行控制台

采集任务展示每个数据源的调度状态、最近运行、失败原因和新鲜度。

/tasks

标准操作

  1. 先看任务状态:新鲜、需刷新、失败、已暂停。
  2. 按业务域或关键字筛选任务。
  3. 点击任务查看运行历史、失败诊断和最新记录数量。
  4. 如果任务失败,先看错误信息,再回到数据源检查配置。
  5. 如果任务过期,确认调度器是否开启、数据源是否启用。

培训讲法

任务页负责回答“数据为什么没进来”。它不是情报页,而是运行排障页。

好任务的标准:启用、最近运行成功、有 records 和 entities。

原始数据

证据底座

保留采集返回的事实、来源 URL、内容哈希和时间戳。后续实体、信号和报告都要能追到这里。

/raw-records

标准操作

  1. 按记录类型筛选,例如 GitHub Repo、GitHub Topic、Generic Web、Manual JSON。
  2. 点击记录查看来源、字段摘要、采集时间和校验信息。
  3. 确认记录能解释后续实体和信号。
  4. 培训时选择一条记录,讲清“这是系统看到的第一手事实”。

注意

不要把原始数据直接当最终结论。它只是证据,需要经过实体标准化、信号检测和情报判断。

实体库

对象管理

实体是持续追踪的对象,例如一个 GitHub 仓库、一个品牌、一个商品、一个网站。

/entities

标准操作

  1. 按业务域、类型或外部 ID 搜索实体。
  2. 点击实体查看快照时间线。
  3. 比较不同时间点的指标变化。
  4. 查看关联信号,判断哪些变化已经进入情报层。

验收标准

  • 实体能对应到明确外部对象。
  • 实体有最新快照。
  • 快照能连接到原始数据和信号。

信号中心

变化检测

信号由快照变化、指标阈值或规则匹配触发,用来筛选值得进入情报层的变化。

/signals

标准操作

  1. 按信号类型、严重度、实体关键字筛选。
  2. 点击信号查看规则元数据、快照绑定和检测值。
  3. 重点看 previous/current、delta、confidence、severity。
  4. 确认它是否已经生成情报或预警。

培训讲法

信号页讲的是“变化发生了”。情报页讲的是“这个变化意味着什么”。

情报中心与情报详情

判断结论

情报把信号转化为可阅读的判断,并保留证据数量、业务域、状态和可追溯来源。

/intelligence · /intelligence/[id]

标准操作

  1. 在情报中心按类型、状态、关键词筛选。
  2. 优先打开分数高、证据数量多的情报。
  3. 进入详情后查看结论摘要、证据链、快照对比和来源信息。
  4. 根据处理结果修改状态,例如 reviewed、following、dismissed。
  5. 提交反馈,帮助后续培训复盘。

验收标准

  • 每条重要情报都有证据。
  • 能追到信号、实体、数据源和原始事实。
  • 状态能反映处理进度。

报告中心与报告详情

交付材料

报告中心把情报、证据引用和派发状态整理成可培训、可分发、可审计的日报和周报。

/reports · /reports/[id]

标准操作

  1. 在报告生成区选择生成项目和生成周期。
  2. 点击“生成日报”。
  3. 在报告队列按项目、状态、关键字筛选报告。
  4. 打开报告详情,核对正文分段、证据引用和派发状态。
  5. 需要培训材料时,下载 Markdown 或复制链接。
  6. 在自动分发区配置订阅规则、发送时间、站内通知和邮件。

验收标准

  • “生成项目”字段可见。
  • 报告队列有日报或培训报告。
  • 报告详情能看到证据引用。
  • 自动分发只保留清楚的一套订阅规则说明。

预警中心

主动提醒

预警中心展示信号规则、触发事件和交付状态,用于追踪哪些变化需要主动提醒。

/alerts

标准操作

  1. 查看现有规则和预警事件流。
  2. 创建规则时填写规则名称、Signal Type、Channel、Field、Op、Value。
  3. 培训时可套用培训模板,演示高风险信号如何触发通知。
  4. 查看事件状态、触发信号和交付事实。

验收标准

  • 页面展示规则配置和事件流。
  • 事件说明面向业务,不暴露技术 ID 噪音。
  • 能说明预警来自哪类信号。

站内通知

消息收件箱

站内通知收敛报告派发、预警触达和训练工作台状态,帮助确认系统消息是否送达。

/notifications

标准操作

  1. 用 All / Unread 查看全部或未读消息。
  2. 按消息类型或关键词筛选。
  3. 打开通知查看关联对象。
  4. 处理完后标记已读,或批量 Read All。
  5. 检查偏好设置,确认报告和预警通知是否开启。

使用建议

每天培训或运营开始前先清一遍通知,确认昨天的报告、预警和任务状态是否已送达。

业务域页面

主题入口

业务域页面把不同采集场景聚合起来,适合培训时按主题讲解。

/domain/osint · /domain/ecommerce · /domain/social · /domain/competitor · /domain/agent · /domain/platform · /domain/governance

标准操作

  1. 选择一个业务域,例如开源雷达或 Agent 生态。
  2. 查看该域下的项目、数据源、信号和报告入口。
  3. 用该页面串起一套完整案例。
  4. 回到工具库补充该业务域适合使用的采集工具。

七个业务域

  • 开源雷达:GitHub、开源工具、社区趋势。
  • 电商风向:商品、店铺、价格、评价。
  • 社媒脉搏:公开话题、传播线索、内容趋势。
  • 竞品守望:官网、产品页、定价、发布节奏。
  • Agent 生态:AI Agent、Skill、MCP、浏览器工具。
  • 平台采集:不同平台的数据接入方法。
  • 合规边界:授权、禁止项、证据留存。

培训路线

30 分钟演示

  1. 登录并打开仪表盘。
  2. 展示采集工具库和课程包。
  3. 打开一个项目和数据源。
  4. 查看任务运行状态。
  5. 打开一条情报和报告。

60 分钟实操

  1. 讲解工具分类和授权边界。
  2. 学员选择一个采集主题。
  3. 创建项目并查看数据源。
  4. 运行或观察采集任务。
  5. 从原始数据追到情报和报告。

半天工作坊

  1. 先讲数据采集方法论。
  2. 分组选择业务域。
  3. 完成工具选择、URL 预检、项目配置。
  4. 解释证据链、信号和情报。
  5. 每组提交一份报告并复盘风险边界。

数据采集工具分类

培训时不要只背工具名。先判断场景,再选工具。

类别适合场景网站里怎么看边界
AI 原生采集把网页转成 Markdown、JSON、结构化信息。工具库搜索 Firecrawl、Crawl4AI、ScrapeGraph AI、AgentQL。先确认授权和字段契约。
浏览器自动化需要真实浏览器执行 JS、点击、滚动、截图。工具库查看 Playwright、Puppeteer、Browser Use、Stagehand。不要绕过登录墙、验证码和风控。
Agent 浏览器让 AI 执行网页任务、拆解流程、辅助调研。工具库查看 Nanobrowser、Browser Use、Skyvern 等。必须限制任务范围和数据输出。
RPA / no-code业务人员录制流程、处理重复网页操作。工具库查看影刀 RPA、Power Automate 等类别。适合稳定流程,不适合复杂反复变化页面。
专业爬虫框架长期生产采集、队列、重试、导出。工具库查看 Scrapy、Colly、Katana、Heritrix。需要工程维护和合规审查。
网站侦察与预检采集前看 DNS、技术栈、robots、安全声明、页面结构。工具库查看 Web-Check、授权 URL 预检、浏览器实验室。只做公开信息诊断,不做攻击。
MCP / Agent 接入把数据源或工具接到 AI 助手和 Agent 工作流。工具库查看 MCP、Agent skill、工具标准化内容。注意凭据、权限和审计日志。

合规与风险边界

允许讲

  • 公开页面的信息结构分析。
  • 自有或客户授权网站的数据采集。
  • robots、sitemap、security.txt、headers、DOM、network 的预检。
  • 工具安装、字段映射、数据质量验收。
  • 证据链留存和报告复盘。

不允许讲成操作步骤

  • 绕过 Cloudflare、DataDome、Kasada、验证码、登录墙。
  • 规避平台风控、限流和访问控制。
  • 采集未授权的个人敏感信息。
  • 隐藏身份进行滥用式抓取。
  • 把反检测工具包装成通用突破方案。

故障排查

现象先检查下一步
登录失败账号、密码、网络、Cookie。联系管理员重置账号,不在群里公开密码。
页面看起来为空是否已登录;项目、数据源、任务是否有数据。进入仪表盘看全局指标,再去任务页查运行状态。
任务不运行数据源是否启用;任务是否暂停;最近错误。修数据源配置,或检查调度器状态。
没有原始数据任务是否有成功运行;数据源类型是否正确。从任务详情回溯到数据源。
没有情报是否有实体和信号;信号严重度是否达到规则。检查信号中心,再看情报生成逻辑。
报告未生成报告中心生成项目、周期、报告队列状态。手动生成日报,再检查报告详情。
邮件未发送报告中心邮件通道诊断和订阅规则。先确认站内通知是否送达,再查 SMTP 配置。
预警没有触发规则条件、Signal Type、Field、Op、Value。用培训模板测试一条高风险信号。

培训前检查清单

讲师开课前

  • 能登录生产站点。
  • 仪表盘有数据。
  • 采集工具库有工具、方法、证据和讲义。
  • 项目、数据源、任务、原始数据都能打开。
  • 报告中心能看到报告队列。
  • 预警中心和通知中心有可演示数据。

学员完成标准

  • 能解释一个采集工具适合什么场景。
  • 能说清一个 URL 采集前要检查什么。
  • 能从项目追到数据源、任务、原始数据。
  • 能从原始数据追到实体、信号、情报。
  • 能生成或阅读一份报告。
  • 能指出至少三条合规边界。
最终判断:如果学员能用自己的话讲清“工具选择 → 授权预检 → 数据入库 → 证据追溯 → 情报报告”,这次培训就是闭环的。