defuddle
使用 Defuddle CLI 从网页中提取干净的 Markdown 内容,去除杂乱元素和导航以节省 Token。当用户提供 URL 供阅读或分析时、涉及在线文档、文章、博客帖子或任何标准网页时,请使用此技能而非 WebFetch。不要用于
技能说明kepano/obsidian-skills
使用 Defuddle CLI 从网页中提取干净的 Markdown 内容,去除杂乱元素和导航以节省 Token。当用户提供 URL 供阅读或分析时、涉及在线文档、文章、博客帖子或任何标准网页时,请使用此技能而非 WebFetch。不要用于以 .md 结尾的 URL——那些已经是 Markdown 格式,应直接使用 WebFetch。
技能简介
defuddle 是一款基于 Defuddle CLI 的网页内容提取工具,能将标准网页中的正文内容转换为干净的 Markdown 格式,去除导航、广告等杂乱元素,帮助 AI Agent 节约 Token 消耗。在处理普通网页 URL 时,建议优先使用本技能替代 WebFetch。
使用场景
- 用户提供 URL 要求阅读或分析网页内容
- 提取在线文档、技术文章或博客帖子的正文内容
- 需要去除网页广告、导航等干扰信息时
- 需要从网页中获取标题、描述等元数据时
- 需要将网页内容保存为 Markdown 文件时
使用方法
安装:
npm install -g defuddle
提取 Markdown 内容(始终使用 --md 参数):
defuddle parse <url> --md
保存为文件:
defuddle parse <url> --md -o content.md
提取元数据:
defuddle parse <url> -p title
defuddle parse <url> -p description
defuddle parse <url> -p domain
输出格式支持:
| 参数 | 格式 |
|---|---|
--md | Markdown(默认推荐) |
--json | JSON 格式(包含 HTML 和 Markdown) |
| (无参数) | HTML |
-p <name> | 指定元数据属性 |
注意事项
- 不要用于以
.md结尾的 URL——这些已经是 Markdown 格式,应直接使用 WebFetch - 提取标准网页内容时优先使用本技能而非 WebFetch,以节省 Token