乔木仓库

defuddle

从网页或本地 HTML 中提取干净正文,去掉噪音后用于阅读、总结或再加工。

分类
乔木阅读研究
榜单排名
#4
GitHub Stars
107

它能做什么

中文摘要

「defuddle」来自 joeseesun/defuddle-skill 的公开 SKILL.md。原文定位是:从网页或本地 HTML 中提取干净正文,去掉噪音后用于阅读、总结或再加工。它适合抓取网页、论文、电子书、Newsletter 或知识库资料。

为什么推荐

推荐理由

推荐它,是因为这是 joeseesun 仓库中可直接追溯到原始 SKILL.md 的条目,文档路径为「skills/defuddle/SKILL.md」。相比只看仓库名,原文给出了触发场景、执行边界或操作步骤,适合在需要这类能力时直接安装或作为模板改造。

什么时候用

适用场景

  • 抓取网页、论文、电子书、Newsletter 或知识库资料
  • 把多源内容转成 Markdown、NotebookLM、PPT 或长文素材
  • 需要先读原文再进行结构化总结和二次创作的任务

使用前先看

主要亮点

  • 01

    Extract clean 文章 内容 来自 web pages or local HTML files。

  • 02

    Title: 来自 JSON title field。

  • 03

    Author: 来自 JSON author field。

  • 04

    文档重点章节:Prerequisites、Default Workflow、Step 1: Extract content as Markdown +。

原始文档

原文摘录

Extract clean article content from web pages or local HTML files.