GitHub 工具雷达
发现高热度爬虫、Agent、MCP、浏览器自动化工具,并跟踪 stars、issues、更新时间。
来源:GitHub REST API / GitHub topics / 仓库 README / release notes
字段:repo / stars / forks / open_issues / updated_at / license / language
边界:只采集公开元数据和公开 README,不抓取私有仓库、不采集个人邮箱和账号画像。
汇聚高质量数据采集工具、平台方法和安装 SOP
采集工具库面向培训场景,集中展示 AI 采集工具、Agent 浏览器、爬虫框架、平台采集方法和合规边界,让学员能直接看到工具价值、安装步骤、适用场景和风险限制。
这里不是任务日志,而是培训主入口:每个工具都给出适用场景、安装命令、核验命令、输出形态、风险边界和来源链接。
训练源
12
GitHub 工具
10
方法卡
5
情报证据
12
输入自有、授权或明确允许分析的公开 URL,生成 robots、headers、DOM 和 network 预检报告。 系统会拒绝 localhost、私网、metadata 和带凭据的 URL。
预检报告会显示主文档状态、授权门禁、公开声明、DOM 字段线索、network 摘要和下一步动作。
browser_structure_diagnostic.v1 · JSON 证据导入 · 不触发页面采集
这里保存由授权预检生成的候选方法卡;它们不计入正式方法卡,直到人工转正。
暂无方法卡草稿。先完成一次授权 URL 预检,再保存为草稿。
6 张附件图片只作为线索锚点;页面展示的是回到 GitHub、官网和文档后的核验结果。 高风险反检测工具只进入浏览器解析、站点预检和合规边界训练,不提供绕过访问控制的操作步骤。
API 寻源诊断加载后会显示在这里。
训练学员先读懂浏览器看到的页面、网络、存储和指纹面,再决定采集器;反检测内容只做风险诊断。
任何采集任务先判断授权、字段、禁止项和证据要求;没有授权记录时,不进入实现。
当前显示 10 / 10
适合把公开网页转成 Markdown、HTML、结构化 JSON 或 Agent 可消费上下文,培训时用于讲解“API 化采集”和“LLM-ready 数据入口”。
Stars
132,972
License
AGPL-3.0
Language
TypeScript
Source Score
API 待加载
Updated
2026-06-15
先用 Firecrawl 演示从 URL 到清洁文本,再讲 API key、成本、许可、自托管和平台条款边界。
npm install firecrawl export FIRECRAWL_API_KEY=fc-... node scripts/collect-firecrawl-page.js
node -e "console.log(process.env.FIRECRAWL_API_KEY ? 'key loaded' : 'missing key')" curl -fsS https://docs.firecrawl.dev/llms.txt | head
当前显示 0 / 0
API 讲义卡加载后会显示在这里。
训练重点是公开来源、字段契约和禁止边界,不提供规避限制的操作步骤。
发现高热度爬虫、Agent、MCP、浏览器自动化工具,并跟踪 stars、issues、更新时间。
来源:GitHub REST API / GitHub topics / 仓库 README / release notes
字段:repo / stars / forks / open_issues / updated_at / license / language
边界:只采集公开元数据和公开 README,不抓取私有仓库、不采集个人邮箱和账号画像。
跟踪工具官方文档、安装命令、能力变化和 breaking change,保证培训材料不过期。
来源:docs pages / llms.txt / changelog / API reference
字段:title / url / last_checked_at / headings / install_commands / capability_notes
边界:只抽取公开文档,不抓取账号后台、付费内容和受访问控制页面。
沉淀 Amazon、Shopify、独立站公开商品、价格、评论和榜单的合规采集路线。
来源:官方 API / 公开页面 / 站点 sitemap / 商家自有导出
字段:platform / object_type / public_url / fields / rate_limit / allowed_use
边界:优先官方 API 和自有数据导出;不处理绕过反爬、验证码、登录态或受限评论数据。
把 TikTok、YouTube、Reddit、X 等平台的公开趋势、官方 API、限制和禁止项做成培训卡。
来源:官方 API 文档 / 公开趋势页 / 开发者政策 / 平台 ToS
字段:platform / approved_paths / blocked_paths / data_sensitivity / review_required
边界:不提供登录态采集、个人数据采集、绕过限流或批量账号操作步骤。
监控竞品官网、价格页、文档、招聘页和新闻稿公开变化。
来源:robots.txt / sitemap.xml / pricing page / docs / blog
字段:url / page_type / hash / changed_at / diff_summary / evidence_url
边界:遵守 robots、限速和缓存;不抓取账号后台、不绕过访问控制。
先识别工具类别、可采范围、数据敏感度和风险等级。
工具
2
方法
1
情报
0
证据
0
用 Crawl4AI 和 Firecrawl 完成公开网页结构化抽取。
工具
2
方法
1
情报
0
证据
0
用 Playwright、Crawlee、agent-browser 处理 JS 渲染与交互。
工具
3
方法
1
情报
0
证据
0
把采集工具接入 browser-use、OpenAI Agents SDK 和 MCP。
工具
3
方法
1
情报
0
证据
0
把 GitHub、电商、社媒、竞品站点抽象成可复用方法卡。
工具
1
方法
4
情报
0
证据
0
API 情报摘要加载后会显示在这里。
本页内容来自官方文档、官方 GitHub 仓库和 未核验 GitHub API 快照;所有指标由增量脚本刷新。