知识库「剪藏」工作流:看到好文章,怎么干净地存进 Obsidian
上一篇讲了怎么把手头的核心插件用透,这篇来说说知识库的入口:网上看到一篇好文章,怎么干净地存进来。
直接复制粘贴是最省事的,也是最埋雷的。网页里的样式、广告位、嵌套链接、乱七八糟的空行,一起带进笔记,存的是脏数据。等哪天要用,翻出来还得先花十分钟清理。更常见的是把链接丢进收藏夹,以为存了,其实只是记了个地址。链接会失效,页面会改版,三个月后点开就是 404。
干净剪藏,说到底是解决三件事:正文提取、格式清洗、信息补全。三件事都有现成工具,不用自己造轮子。

方案一:官方 Web Clipper
Obsidian 官方有个浏览器扩展,叫 Obsidian Web Clipper,Chrome 和 Edge 都能装。装完在网页上点一下图标,正文、标题、作者、发布时间就都提取出来了,存成 Markdown 放进指定目录。
它的厉害之处是模板。可以写一个模板,让每次剪藏自动生成 frontmatter,把来源 URL、剪藏时间、原文标题都填进去。比如:
---
title: {{title}}
source: {{url}}
clipped: {{date}}
tags: [inbox]
---
{{content}}
这样每条剪藏进知识库就自带身份证,之后做检索、做溯源都有据可查。
方案二:MarkDownload
不想装太重的东西,可以用 MarkDownload 这个扩展。它干的事更纯粹:把当前网页转成 Markdown,可以下载,也可以复制到剪贴板。适合偶尔剪一篇、剪完自己动手整理的情况。
两种扩展怎么选,看频率。每天剪好几篇的,用 Web Clipper,模板自动补 frontmatter;一周剪一两篇的,MarkDownload 就够了,少一个配置项少一份维护。
方案三:公众号文章走自动采集
网页剪藏解决的是「看到就存」,公众号文章是另一条路。微信里看到好文,手动复制很麻烦,还得处理图片防盗链。这个系列第三篇讲过,用 RSS 服务订阅公众号,新文章自动进知识库,标题、正文、图片全部本地化,一条命令都不用敲。剪藏管主动,采集管被动,两条路互补。
剪藏之后的三道工序

存进来只是开始,后面三道工序才是知识库不乱的关键。
第一道,查重。剪藏前先搜一下标题,库里有的就直接删掉剪藏版。重复条目是知识库最隐蔽的杀手,攒多了清理成本指数上升。
第二道,补元数据。扩展自动生成的 frontmatter 只有基础字段,阅读时顺手补上主题标签、状态字段,后面检索全靠这些。
第三道,图片本地化。剪藏进来的图片大多还是外链,原网页挂了图片就裂。本地化的做法是把图片下载到附件目录,正文引用改成相对路径。一次批量跑完,别留到以后。
剪藏区怎么设计
所有剪藏先进一个「收集箱」目录,不要直接进正式分类。原因很简单:剪藏时判断力最差,看到啥都想存,存完才发现大多没用。收集箱里的东西每周清一次,有用的归位,没用的删掉,留下的基本都是精华。

到这里,「看到好文章 → 干净入库 → 定期消化」这条链路算是齐了。工具管手速,工序管质量,收集箱管筛选。哪一环都别省。
系列写到这里,还剩一个有意思的话题:怎么让知识库里的内容反过来支撑写作。下一篇来说说。