网页怎么保存成 Markdown?
把文章剪藏成 .md 文件
用浏览器剪藏扩展。打开文章,点剪藏按钮,扩展把正文从页面里抽出来转成 Markdown,你再选一个文件夹,它就存成 .md 文件。两下点完。拿到的是文章正文,标题层级、列表、链接都还在,就躺在你硬盘上,哪个编辑器都能打开。
下面说清楚:转换过程里什么留得下、什么留不下,以及哪些页面剪出来是坏的。
哪些东西能带过来
剪藏是一次转换,转换就会丢东西。Markdown 描述的是内容结构:它有标题的语法、列表的语法、链接和图片的语法,但没有「左边两栏右边一个悬浮侧边栏」的语法,所以那些东西过不来。
| 网页上的 | 存进 .md 之后 |
|---|---|
| 标题、段落、列表 | 带过来,转成对应的 Markdown 结构 |
| 链接 | 带过来,地址还在 |
| 代码块、表格 | 带过来,转成 Markdown 的代码围栏和表格 |
| 图片 | 带过来,是指向原地址的图片引用 |
| 字体、配色、页面排版 | 丢掉,Markdown 没有这些语法 |
| 广告、Cookie 弹条、侧边栏 | 抽正文的时候就被剔掉了 |
| 评论区 | 丢掉,那不算文章正文 |
| 视频播放器、各种要点的组件 | 丢掉,纯文本装不下 |
存长文、专栏文章、文档页、教程,这笔买卖挺划算:你要的本来就是那些字,把周边杂七杂八剥掉正好是目的之一。但要是想存一张带悬停效果的价格表、或者一个数据看板,那还是截图靠谱,剪成 Markdown 只会拿到一堆散字。
具体怎么剪
NoteLoom 这块是浏览器扩展在做。装完工具栏上会多个图标,剪一篇文章是这样:
- 第一步,用 Chrome、Edge 或 Arc 打开文章,普通网页都行。
- 第二步(可选,但挺有用):先开阅读视图,从工具栏弹窗点,或者按
Alt+R。它会跑一遍抽正文,把文章单独摊开给你看,你能确认抓对了块再动手。阅读视图的头部也有剪藏按钮,看着没问题就直接在那儿剪。 - 第三步,点剪藏到 NoteLoom。页面 HTML 在浏览器里就地转成 Markdown。
- 第四步,剪藏内容在 NoteLoom 里弹出预览。扫一眼,看标题层级还在不在,确认。
- 第五步,选一个本地文件夹。内容写进去成为一个真正的
.md文件,从这一刻起它就是个普通文本文件,什么 Markdown 编辑器都能接着打开。
抽正文用的是 Defuddle,它看页面结构找文章主体,把导航、广告、页脚留在外面。整个过程没有一步经过服务器:扩展读你当前这个标签页,本地转换,写进你授权的文件夹。
会翻车的几类页面
扩展只能看到你的浏览器已经渲染出来的东西,这条决定了它的天花板。
- 要登录、收费墙。页面上你自己都看不到那些字,扩展也拿不到。先登录,再剪就正常。
- 无限滚动。信息流是一段一段加载的,剪到的就是已经加载出来的那部分,下面没有的就是没有。先滚到底再剪能解决一部分,滚不到底的那种就没辙。
- 重 JS 页面。正文是加载完才拼出来的,或者散在几个标签页和折叠面板里,抽正文可能只抓到一段,也可能整个抓错块。这种情况阅读视图会提前告诉你:那儿看着不对,剪出来就是不对。
- 本来就没多少字的页面。相册、地图、嵌一个网页应用。剪是能剪成功,但你会得到一个近乎空的文件。
还有一条最好提前知道:剪下来的是全文,长度跟原文一样。NoteLoom 目前不做总结、也不改写,文件里就是作者写的那些字,只是换成了 Markdown。想砍到你真正在意的那两段,得你存完之后自己在编辑器里动手。
存下来之后
剪藏产出的就是文件夹里一个普通的 .md,平时你怎么用 Markdown,现在还怎么用。NoteLoom 里能打开,VS Code 里能打开,随便哪个编辑器都行。改完直接写回原文件。
攒到三十来篇之后,有两个习惯特别值:在文件开头写上原文链接和日期;文件名起得让你在一列文件里一眼认得出。剪藏来的东西比自己写的笔记更需要命名和归档,因为半年后你记得的是那个观点,不是那篇文章的标题。
FAQ
怎么把网页保存成 Markdown 文件?
剪藏会保留图片和网页的排版吗?
哪些网页剪不全?
剪藏会顺便帮我总结吗?
.md 文件存在哪儿?内容会上传吗?
Firefox、Safari 或者手机上能用吗?
剪一篇试试,看看拿到什么
NoteLoom 扩展给 Chrome、Edge、Arc 加一个剪藏按钮。任意文章剪下来,先预览 Markdown,再存成你自己文件夹里的 .md 文件。不用账号,也不过服务器。