Web数据采集 · web scraping
「Web数据采集 · web scraping」是「Web数据采集」类数据技能,提供该场景下可复用的结构化工作流、分析框架与产出模板。
提供商:
技能资料库
· 资产证书 DA-20260807-42267C26
交付形态:文件包
适用场景
1 / 4场景说明
本数据技能「Web数据采集 · web scraping」适用于以下场景:
1
需要「Web数据采集」相关能力,并希望按说明文档快速落地时
2
在 Agent / IDE 中导入「Web数据采集 · web scraping」技能包完成对应工作流
3
希望先阅读要点再下载技能包本地使用,而不是平台在线调用
不适用于:未获授权的转售;未评估工具权限与密钥风险时对生产系统执行脚本;将本目录演示当作在线托管运行时。
使用方式(说明式)
2 / 4
说明式导入
可下载技能包
非在线执行
本技能的使用方式为说明式:平台交付技能说明与技能包文件, 由你在本地 Agent / IDE 按文档导入使用;平台不在线执行技能。
-
1
阅读要点
先看「适用场景」与「技能说明」确认是否匹配你的任务。
-
2
领取并下载
免费领取 / 订购后,在右侧下载技能包(含
SKILL.md及附属文件)。 -
3
按说明导入
解压后将技能目录放到 Agent Skills 加载路径,按
SKILL.md配置依赖并在对话中触发。
技能内容
3 / 4技能简介
「Web数据采集 · web scraping」是「Web数据采集」类数据技能,提供该场景下可复用的结构化工作流、分析框架与产出模板。
能做什么
- 按 6 步工作流推进(详见下方「工作流程」)
- 最终形成:concise bullet summary、JSON array of objects、CSV/TSV when the user wants exportable rows
工作流程
- Identify the target site and exact fields to collect.
- Test one page first.
- Decide the extraction method:
- webfetch for readable article/listing text
- browser snapshot for dynamic DOM inspection
- Normalize the output into a stable schema.
- If scraping multiple pages, avoid tight loops and serialize requests.
- Deduplicate by URL or stable item id.
交付产出
- concise bullet summary
- JSON array of objects
- CSV/TSV when the user wants exportable rows
使用边界
4 / 4数据技能采用「说明文档」使用方式:订购后可下载技能包,按包内 SKILL.md 在 Agent / IDE 中导入。平台提供目录与文件下载,不托管在线运行时、不代为执行技能脚本;请遵守来源许可与工具安全策略。
1 / 4