前言¶
在 DSH 裏做內容精讀,常見做法是手動拆文檔、逐段讓模型總結,再自己拼 Markdown。長文一多,分塊策略、引用出處、輸出格式都要反覆調,很難穩定複用。
deep-read-summarize 把這條鏈路做成工作流插件:輸入鏈接或本地文件,自動解析、分塊、並行精讀、合併成稿,輸出帶 YAML frontmatter 的 Obsidian 筆記。維護者是 PensiveFei,GitHub 上 21 stars,分類爲工作流,當前版本 0.3.3,MIT 許可證。
這是什麼¶
一句話:deep-read-summarize 是給 DSH 寫的精讀與摘要工作流——輸入一本書、一篇論文、一個視頻鏈接或網頁,輸出結構化 Obsidian 筆記。
項目聲明爲 unofficial third-party tool,與 DeepSeek / DSH 官方無從屬關係;它編排的是你 DSH 環境裏已有的 workflow 工具,不重新分發 DeepSeek 軟件。DSH 目前處於 developer preview,接口可能變化,插件針對特定版本的 workflow 工具語義編寫,升級 DSH 後建議先跑 npm test 驗證。
核心功能¶
下面介紹插件已文檔化的能力,均來自倉庫 README。
支持的輸入類型¶
- 書籍:PDF / EPUB / MOBI
- 論文:arXiv / PDF / HTML
- 視頻:YouTube / B 站字幕(需本機安裝 yt-dlp)
- 網頁:正文提取
MapReduce 精讀流程¶
內容經解析器註冊表按類型分發,分三個波次執行:
輸入(鏈接或文件路徑)
│
▼
解析器註冊表 ── book / paper / video / web
│
▼
波次1 獲取內容 → 寫入臨時文件 → 生成分塊計劃
│
▼
波次2 N 個子代理並行精讀各塊(Map)
│
▼
波次3 合併成稿 + 質量校驗(Reduce)
│
▼
Obsidian 筆記
子代理總數約 N+2 個,N 爲分塊數。各子任務輸出受 JSON Schema 約束,不合格自動重試;關鍵結論需標註頁碼、章節或段落,降低編造風險。
解析器與擴展¶
內置四種解析器:book.js、paper.js、video.js、web.js,由 parsers/index.js 註冊與回退。若要替換某類型的處理方式,在 custom-parsers/ 放同接口解析器即可,同名類型覆蓋內置實現。接口字段爲 name、types、buildPrompt(input, opts)。
失敗與輸出策略¶
- 配置錯誤(缺 input、type 非法、options 格式錯):直接拋異常終止,不產出半成品。
- 內容問題(抓取失敗、某塊精讀失敗):返回
{ ok: false, stage, fatal: false };單塊失敗時跳過並在成稿標註缺口,不整體中斷。
輸出可直接放進 Obsidian,配合 Dataview 使用。一篇論文、6 塊、完整模式,文檔估算約 15–25k token;fastMode 配合調低 maxChunks 可省約四成。
安裝與啓用¶
deep-read-summarize 是 DSH 插件,可通過 npm 或本地包安裝。SkillHub 目錄頁標記爲可安裝,版本 v0.3.3;具體命令以倉庫 README 爲準。
先做 npm 安裝(已發佈到 registry,無第三方依賴):
npm install deep-read-summarize
若從本地包安裝,可執行:
pnpm add ./deep-read-summarize-0.3.3.tgz
然後在 dsh 配置的 dsh.profile.bundles 追加 deep-read-summarize,重啓 dsh web(POST /dsh-market/restart)。
安裝後自動註冊:
deep-read-summarizeworkflow(meta + script)deep-read-summarize技能(skills/deep-read-summarize/SKILL.md)- 四種解析器(
parsers/)與 JSON Schema(schemas/)
驗證環境(離線,不需要 API key):
npm test
看到 TOTAL: 25 passed, 0 failed 即環境就緒。Node.js 要求 >= 18。
典型用法¶
把 JSON 傳給 DSH 的 workflow 工具即可觸發。完整參數示例:
{
"input": "https://arxiv.org/abs/2307.09042",
"type": "auto",
"options": {
"minWords": 2500,
"fastMode": false,
"maxChunks": 6,
"requireCitations": true,
"includeTimestamps": false,
"outputDir": "./output",
"tempDir": "./.tmp"
}
}
type 可選 auto | book | paper | video | web。fastMode: true 時跳過部分章節,速度更快。maxChunks 範圍 1–12,爲分塊上限。
常見 input 示例:
| 類型 | input |
|---|---|
| 論文 | https://arxiv.org/abs/2307.09042 |
| 書籍 | 本地路徑,如 ~/books/xxx.pdf |
| 視頻 | https://youtube.com/watch?v=xxx |
| 網頁 | https://example.com/article |
工作流返回結構化結果:{ ok, kind, title, filePath, qualityPassed, note },其中 note 爲最終 Markdown 筆記。筆記寫到 options.outputDir(默認 ./output,可指向 Obsidian 倉庫),文件名取自內容標題。
快速試跑可用:
{ "input": "https://arxiv.org/abs/2307.09042", "type": "paper", "options": { "maxChunks": 4, "fastMode": true } }
適用場景與注意¶
適合誰: 需要把長文(書、論文、視頻、網頁)系統精讀並落盤爲 Obsidian 筆記的 DSH 用戶;希望分塊並行、引用可追溯、輸出格式穩定的工作流場景。
運行權限: 插件以當前 dsh 進程權限運行。抓取視頻/網頁會發起外部請求,由子代理在 DSH 沙箱和審批策略下執行;子代理寫文件需要相應權限,權限不足時 workflow 會把內容返回,由主代理負責落盤。安裝前應閱讀源碼與 MIT 許可證,確認符合你的安全與版權要求。
其他注意:
- 視頻字幕依賴 yt-dlp;未安裝不影響其他類型,抓不到字幕時會提示手動提供轉寫文本。
- 倉庫帶
dsh-plugintopic 和package.json的dsh字段,可被 dsh.so 註冊表索引;SkillHub 爲獨立社區目錄,與 DeepSeek / 幻方無官方從屬關係。 - 處理有版權材料時,產出物使用責任在你;倉庫不含任何受版權保護內容的提取結果。
結尾¶
經過上面的步驟,deep-read-summarize 的價值可以概括爲:把「解析 → 分塊 → 並行精讀 → 合併校驗 → Obsidian 筆記」封裝成可安裝的 DSH 工作流,減少手工編排子代理的成本。
- 目錄頁:https://www.skillhub.cn/plugins/PensiveFei/deep-read-summarize
- GitHub:https://github.com/PensiveFei/deep-read-summarize