网页剪藏

网页怎么保存成 Markdown?
把文章剪藏成 .md 文件

用浏览器剪藏扩展。打开文章,点剪藏按钮,扩展把正文从页面里抽出来转成 Markdown,你再选一个文件夹,它就存成 .md 文件。两下点完。拿到的是文章正文,标题层级、列表、链接都还在,就躺在你硬盘上,哪个编辑器都能打开。

下面说清楚:转换过程里什么留得下、什么留不下,以及哪些页面剪出来是坏的。

哪些东西能带过来

剪藏是一次转换,转换就会丢东西。Markdown 描述的是内容结构:它有标题的语法、列表的语法、链接和图片的语法,但没有「左边两栏右边一个悬浮侧边栏」的语法,所以那些东西过不来。

网页上的 存进 .md 之后
标题、段落、列表 带过来,转成对应的 Markdown 结构
链接 带过来,地址还在
代码块、表格 带过来,转成 Markdown 的代码围栏和表格
图片 带过来,是指向原地址的图片引用
字体、配色、页面排版 丢掉,Markdown 没有这些语法
广告、Cookie 弹条、侧边栏 抽正文的时候就被剔掉了
评论区 丢掉,那不算文章正文
视频播放器、各种要点的组件 丢掉,纯文本装不下

存长文、专栏文章、文档页、教程,这笔买卖挺划算:你要的本来就是那些字,把周边杂七杂八剥掉正好是目的之一。但要是想存一张带悬停效果的价格表、或者一个数据看板,那还是截图靠谱,剪成 Markdown 只会拿到一堆散字。

具体怎么剪

NoteLoom 这块是浏览器扩展在做。装完工具栏上会多个图标,剪一篇文章是这样:

  • 第一步,用 Chrome、Edge 或 Arc 打开文章,普通网页都行。
  • 第二步(可选,但挺有用):先开阅读视图,从工具栏弹窗点,或者按 Alt+R。它会跑一遍抽正文,把文章单独摊开给你看,你能确认抓对了块再动手。阅读视图的头部也有剪藏按钮,看着没问题就直接在那儿剪。
  • 第三步,点剪藏到 NoteLoom。页面 HTML 在浏览器里就地转成 Markdown。
  • 第四步,剪藏内容在 NoteLoom 里弹出预览。扫一眼,看标题层级还在不在,确认。
  • 第五步,选一个本地文件夹。内容写进去成为一个真正的 .md 文件,从这一刻起它就是个普通文本文件,什么 Markdown 编辑器都能接着打开。

抽正文用的是 Defuddle,它看页面结构找文章主体,把导航、广告、页脚留在外面。整个过程没有一步经过服务器:扩展读你当前这个标签页,本地转换,写进你授权的文件夹。

会翻车的几类页面

扩展只能看到你的浏览器已经渲染出来的东西,这条决定了它的天花板。

  • 要登录、收费墙。页面上你自己都看不到那些字,扩展也拿不到。先登录,再剪就正常。
  • 无限滚动。信息流是一段一段加载的,剪到的就是已经加载出来的那部分,下面没有的就是没有。先滚到底再剪能解决一部分,滚不到底的那种就没辙。
  • 重 JS 页面。正文是加载完才拼出来的,或者散在几个标签页和折叠面板里,抽正文可能只抓到一段,也可能整个抓错块。这种情况阅读视图会提前告诉你:那儿看着不对,剪出来就是不对。
  • 本来就没多少字的页面。相册、地图、嵌一个网页应用。剪是能剪成功,但你会得到一个近乎空的文件。

还有一条最好提前知道:剪下来的是全文,长度跟原文一样。NoteLoom 目前不做总结、也不改写,文件里就是作者写的那些字,只是换成了 Markdown。想砍到你真正在意的那两段,得你存完之后自己在编辑器里动手。

存下来之后

剪藏产出的就是文件夹里一个普通的 .md,平时你怎么用 Markdown,现在还怎么用。NoteLoom 里能打开,VS Code 里能打开,随便哪个编辑器都行。改完直接写回原文件。

攒到三十来篇之后,有两个习惯特别值:在文件开头写上原文链接和日期;文件名起得让你在一列文件里一眼认得出。剪藏来的东西比自己写的笔记更需要命名和归档,因为半年后你记得的是那个观点,不是那篇文章的标题。

FAQ

怎么把网页保存成 Markdown 文件?
装一个浏览器剪藏扩展。打开文章,点剪藏按钮,扩展会把正文从页面里抽出来、转成 Markdown。NoteLoom 里会先弹出预览让你看一眼,你选一个本地文件夹,它就存成 .md 文件。手动全选复制粘进记事本当然也行,但那样拿到的是一坨纯文本,标题层级、链接、列表结构全没了。
剪藏会保留图片和网页的排版吗?
Markdown 保的是内容结构,不是网页长相。标题还是标题,列表还是列表,链接带着地址,图片以图片引用的形式指向原地址。字体、配色、分栏、广告、评论区、以及任何要点要拖的交互,都带不过来,因为 Markdown 里根本没有描述这些东西的语法。
哪些网页剪不全?
大概三类。一是要登录或者收费墙后面的内容,你的浏览器都没渲染出来,扩展自然也拿不到,先登录再剪就正常了。二是无限滚动的信息流,加载了多少就只有多少,剪之前得先滚到底。三是重 JS 的页面,正文是加载完之后才拼出来的,或者被折叠在标签页里,抽正文可能只抓到一段、甚至抓错块。先开阅读视图看一眼,剪之前就能发现。
剪藏会顺便帮我总结吗?
不会。NoteLoom 目前不做总结、改写、也不自动打标签。剪藏就是把正文原样转成干净的 Markdown,一字不改。删口水话、补个小标题,这些是你存完之后在编辑器里自己动手的事。
.md 文件存在哪儿?内容会上传吗?
存在你自己硬盘上,存的时候你选哪个文件夹就存哪儿。内容不上传 NoteLoom 服务器。扩展读的是你当前这个标签页,在浏览器里本地转换,再通过浏览器的文件系统接口把文件写进你授权的那个文件夹,全程不出你这台机器。
Firefox、Safari 或者手机上能用吗?
目前不行。剪藏扩展是 Chromium 系的,Chrome、Edge、Arc 可以用。存进本地文件夹靠的是浏览器的 File System Access API,这个接口目前只在桌面端的 Chromium 浏览器上完整支持。

剪一篇试试,看看拿到什么

NoteLoom 扩展给 Chrome、Edge、Arc 加一个剪藏按钮。任意文章剪下来,先预览 Markdown,再存成你自己文件夹里的 .md 文件。不用账号,也不过服务器。

装到 Chrome 打开网页版