采集工具库

汇聚高质量数据采集工具、平台方法和安装 SOP

采集工具库面向培训场景,集中展示 AI 采集工具、Agent 浏览器、爬虫框架、平台采集方法和合规边界,让学员能直接看到工具价值、安装步骤、适用场景和风险限制。

工具雷达安装 SOP平台方法风险边界
2026-06-15 核验本地兜底

数据采集培训工具与方法库

这里不是任务日志,而是培训主入口:每个工具都给出适用场景、安装命令、核验命令、输出形态、风险边界和来源链接。

训练源

12

GitHub 工具

10

方法卡

5

情报证据

12

培训定位

目标不是堆工具名,而是让学员掌握“公开来源识别、工具选择、安装验收、字段契约、风险复核”的完整闭环。

授权 URL 预检向导

输入自有、授权或明确允许分析的公开 URL,生成 robots、headers、DOM 和 network 预检报告。 系统会拒绝 localhost、私网、metadata 和带凭据的 URL。

草稿需人工确认

预检报告会显示主文档状态、授权门禁、公开声明、DOM 字段线索、network 摘要和下一步动作。

真实浏览器诊断

browser_structure_diagnostic.v1 · JSON 证据导入 · 不触发页面采集

方法卡草稿箱

这里保存由授权预检生成的候选方法卡;它们不计入正式方法卡,直到人工转正。

0 条草稿

暂无方法卡草稿。先完成一次授权 URL 预检,再保存为草稿。

分类
风险
阶段

附件寻源诊断

6 张附件图片只作为线索锚点;页面展示的是回到 GitHub、官网和文档后的核验结果。 高风险反检测工具只进入浏览器解析、站点预检和合规边界训练,不提供绕过访问控制的操作步骤。

当前显示 0 / 6

API 寻源诊断加载后会显示在这里。

浏览器解析实验室

训练学员先读懂浏览器看到的页面、网络、存储和指纹面,再决定采集器;反检测内容只做风险诊断。

0 个实验

授权采集检查清单

任何采集任务先判断授权、字段、禁止项和证据要求;没有授权记录时,不进入实现。

0 张清单

工具雷达

当前显示 10 / 10

Firecrawl

中风险

适合把公开网页转成 Markdown、HTML、结构化 JSON 或 Agent 可消费上下文,培训时用于讲解“API 化采集”和“LLM-ready 数据入口”。

Stars

132,972

License

AGPL-3.0

Language

TypeScript

Source Score

API 待加载

Updated

2026-06-15

培训讲法

先用 Firecrawl 演示从 URL 到清洁文本,再讲 API key、成本、许可、自托管和平台条款边界。

适用场景
  • 公开网页转 Markdown
  • 网站地图和批量 crawl
  • Agent 通过 MCP 访问网页
输出形态
  • markdown
  • html
  • structured json
  • screenshot
  • MCP tools
边界限制
  • 云 API 需要密钥和费用控制
  • 自托管要评估 AGPL 义务
  • 不能绕过登录和访问控制

安装 SOP

npm install firecrawl
export FIRECRAWL_API_KEY=fc-...
node scripts/collect-firecrawl-page.js

验收命令

node -e "console.log(process.env.FIRECRAWL_API_KEY ? 'key loaded' : 'missing key')"
curl -fsS https://docs.firecrawl.dev/llms.txt | head

课堂讲义卡

当前显示 0 / 0

没有匹配讲义,调整关键词或风险筛选。

API 讲义卡加载后会显示在这里。

平台采集方法卡

训练重点是公开来源、字段契约和禁止边界,不提供规避限制的操作步骤。

当前显示 5 / 5
github_repo / github_topic低风险

GitHub 工具雷达

发现高热度爬虫、Agent、MCP、浏览器自动化工具,并跟踪 stars、issues、更新时间。

来源GitHub REST API / GitHub topics / 仓库 README / release notes

字段repo / stars / forks / open_issues / updated_at / license / language

边界只采集公开元数据和公开 README,不抓取私有仓库、不采集个人邮箱和账号画像。

generic_web低风险

官方文档更新监控

跟踪工具官方文档、安装命令、能力变化和 breaking change,保证培训材料不过期。

来源docs pages / llms.txt / changelog / API reference

字段title / url / last_checked_at / headings / install_commands / capability_notes

边界只抽取公开文档,不抓取账号后台、付费内容和受访问控制页面。

manual_json / approved_api中风险

电商公开信息采集方法

沉淀 Amazon、Shopify、独立站公开商品、价格、评论和榜单的合规采集路线。

来源官方 API / 公开页面 / 站点 sitemap / 商家自有导出

字段platform / object_type / public_url / fields / rate_limit / allowed_use

边界优先官方 API 和自有数据导出;不处理绕过反爬、验证码、登录态或受限评论数据。

manual_json高风险

社媒与内容平台方法卡

把 TikTok、YouTube、Reddit、X 等平台的公开趋势、官方 API、限制和禁止项做成培训卡。

来源官方 API 文档 / 公开趋势页 / 开发者政策 / 平台 ToS

字段platform / approved_paths / blocked_paths / data_sensitivity / review_required

边界不提供登录态采集、个人数据采集、绕过限流或批量账号操作步骤。

generic_web / playwright中风险

竞品站点公开变更监控

监控竞品官网、价格页、文档、招聘页和新闻稿公开变化。

来源robots.txt / sitemap.xml / pricing page / docs / blog

字段url / page_type / hash / changed_at / diff_summary / evidence_url

边界遵守 robots、限速和缓存;不抓取账号后台、不绕过访问控制。

培训课程路径

当前显示 5 / 5
1

生态地图与合规边界

入门实操中风险

先识别工具类别、可采范围、数据敏感度和风险等级。

工具

2

方法

1

情报

0

证据

0

GitHub 工具雷达MCP Servers合规方法卡公开来源识别
  • 学员能判断一个采集需求应该用 API、爬虫、浏览器还是 Agent。
2

网页到 Markdown/JSON

生产工程中风险

用 Crawl4AI 和 Firecrawl 完成公开网页结构化抽取。

工具

2

方法

1

情报

0

证据

0

Crawl4AIFirecrawl官方文档监控
  • 输出包含来源 URL、采集时间、正文摘要和字段化结果。
3

动态页面和浏览器采集

生产工程中风险

用 Playwright、Crawlee、agent-browser 处理 JS 渲染与交互。

工具

3

方法

1

情报

0

证据

0

PlaywrightCrawleeagent-browser公开页面变更监控
  • 保留截图、selector、等待条件和失败原因。
4

Agent 化采集工作流

Agent 编排中风险

把采集工具接入 browser-use、OpenAI Agents SDK 和 MCP。

工具

3

方法

1

情报

0

证据

0

browser-useOpenAI Agents SDKFirecrawl MCPMCP 工具接入
  • Agent 输出必须有工具调用轨迹、预算限制和人工复核节点。
5

平台方法库沉淀

入门实操高风险

把 GitHub、电商、社媒、竞品站点抽象成可复用方法卡。

工具

1

方法

4

情报

0

证据

0

manual_jsongeneric_webapproved_apiGitHub跨境电商社媒竞品站点
  • 每张方法卡说明来源、字段、限制、禁止项和培训话术。

后端情报摘要

API 情报摘要加载后会显示在这里。

来源索引

本页内容来自官方文档、官方 GitHub 仓库和 未核验 GitHub API 快照;所有指标由增量脚本刷新。