X书签囤了几千条却永远找不到?开源工具Siftly把收藏变成可搜索的本地知识库

Siftly是一个本地运行的开源X/Twitter书签管理器。它能读取推文、图片和视频缩略图,自动打语义标签、分类,并生成可点击的思维导图。无需云端、订阅或浏览器插件。本文讲清它解决什么问题、四阶段AI流程怎么工作、适合谁,以及使用前要注意的隐私和成本。

X的书签有一种很奇怪的仪式感。

看见一条有用的推,手指比大脑快,先点收藏。心里那句台词永远一样:“以后肯定用得上。”

然后就没有然后了。

过三个月你想找回那张加密货币崩盘的梗图、某个开源工具的仓库、某条讲透获客的长帖,打开书签页,面对的是几千条按时间堆起来的碎片。没有分类,没有语义,图片里的字搜不到,视频封面更是盲区。收藏变成了最安静的坟场。

Siftly就是冲着这个坟场来的。

它不是又一个“再存一遍”的云笔记,而是把X书签变成可搜索、可分类、可可视化的本地知识库。项目开源,MIT协议,目前大约3000 Star。仓库在这里:
https://github.com/viperrcrypto/Siftly

它到底解决什么问题

书签失效,不是因为你懒,是因为平台只给了“保存”,没给“理解”。

一条X书签通常同时包含:

  • 推文正文
  • 话题、提及、外链
  • 图片、GIF、视频缩略图里的文字和场景
  • 你收藏时的直觉,而不是后来能想起来的关键词

平台自带搜索基本只认字面。你记得的是“那个很离谱的meme”,系统认得的是发帖人ID和时间戳。错位一开始就存在。

Siftly把每条书签当成知识对象来处理,而不是一串死链。处理完之后,你可以按意思找,而不是按运气翻。

原推里那个例子很准:直接搜「crypto崩盘的搞笑meme」,而不是去回忆作者叫什么、哪天存的。

Siftly是什么,先把边界说清

一句话定义:

自托管的X书签管理器。导入、分析、分类、搜索、探索,全在你自己的电脑上完成。

几个关键边界,写进产品认知里很重要:

  • 不上云做主数据库。 内容存在本地SQLite。
  • 不收订阅费。 软件本身免费开源。
  • 不用装浏览器插件。 用书签小工具或控制台脚本导入。
  • 不是完全离线AI。 除了你配置的AI调用,数据留在本地。也就是说,文本和图片分析仍会发到你选择的模型服务商。

技术栈也很克制:Next.js、TypeScript、SQLite、Tailwind。本地跑起来后,默认地址是 http://localhost:3000。需要 Node.js 18+。

如果你已经在用 Claude Code,原项目宣传可以检测本地登录状态,省掉单独填API Key的步骤。这个“免Key”体验目前主要方便macOS用户;Windows和Linux通常还是要自己配置密钥。

四阶段流水线:它怎么把“收藏”变成“知识”

Siftly最有辨识度的不是界面,是这条流水线。

第一阶段:导入
用内置bookmarklet,或把控制台脚本贴进浏览器。在X书签页滚动导出,再导入本地。支持去重,重复收藏不会把库炸成两份。

第二阶段:实体抽取
从原始推文里挖标签、链接、@用户,以及一百多种常见工具/产品名。这一步免费,不消耗模型额度。它先把“结构”捡出来,再决定要不要动用更贵的视觉和语义能力。

第三阶段:视觉分析
这是它比普通书签工具狠的地方。图片、GIF、视频缩略图都会被读一遍:OCR文字、物体、场景、情绪,甚至梗图模板。一条几乎没配文、全靠图说话的收藏,从此也能被搜到。

第四阶段:语义标签 + 自动分类
每条书签生成大约25到35个可搜索标签,再分进1到3个类目,并带置信度。分类不是装饰,是后面思维导图和筛选浏览的骨架。

跑完之后,你得到的不是更长的书签列表,而是三样能用的能力:

  1. 按意思搜索
    全文、OCR、标签、类目一起参与。适合那种“我记得感觉,不记得原句”的查找。
  2. 交互思维导图
    按类目展开整库,点开节点就能跳回原推。适合回顾自己到底在囤什么,而不是继续无脑往下存。
  3. 筛选浏览
    网格或列表,按分类、媒体类型、时间过滤。导出支持CSV、JSON,以及带媒体文件的ZIP。后续还能往Obsidian等笔记系统搬。

对囤书签的人来说,最大变化不是“又多了一个App”,而是收藏第一次拥有了二次入口:按语义进,按结构看,按文件出。

为什么本地优先这件事,比功能清单更重要

X书签里经常混着:

  • 还没公开的项目想法
  • 行业线索和联系人
  • 付费课程截图
  • 你自己都不好意思让云服务商“学习”的浏览痕迹

所以“再存到某家云收藏App”会让一部分人直接放弃。Siftly把主数据放在本地,逻辑上更接近个人资料库,而不是又一个要你交出时间线的SaaS。

但这里必须讲一句实话:

本地优先,不等于零上传。

实体抽取可以在本地完成;视觉分析和语义标签,通常要调用Claude、OpenAI或MiniMax这类外部模型。你要接受的交易是:

  • 书签库主体留在自己硬盘
  • 为了“能按意思搜”,部分内容会作为提示发给AI服务商
  • 软件不向作者上报遥测,不等于模型厂商看不到你发过去的请求

能接受这层取舍,Siftly才值得装。不能接受,它再好看也不该用。

谁适合立刻试,谁可以先观望

适合:

  • 书签已经破千,翻找全靠运气
  • 收藏里图片和视频很多,纯关键词搜经常落空
  • 想把X当素材源、信息源,而不是滑动消耗场
  • 能接受在本地跑Node应用,并处理一次导入
  • 已经有Claude / OpenAI额度,或想用现成订阅消化分析成本

可以先观望:

  • 书签只有几十条,系统自带搜索就够
  • 完全不想让任何推文或截图离开电脑
  • 期望“打开网页即用”,不愿意装环境和导入
  • 把书签当情绪按钮,并不打算真的回看

工具救不了“收藏强迫症”,它只救“想回看却找不到”。如果你收藏的目的就是获得当下那一下安心,装再强的搜索也没有用。

上手可以很短,真正的工作在“第一次清洗”

官方推荐一条命令走完安装、建库、打开浏览器。概念上就是:克隆仓库,本地启动,导入书签,再跑AI流水线。

但真正决定体验的,不是启动速度,是你怎么做第一次清洗。

一个比较稳的用法:

  1. 先小批量导入,比如最近200条,不要一上来甩进全部历史。
  2. 先看实体抽取结果,确认链接、工具名、话题有没有被正确抓住。
  3. 再开视觉分析。图多的库这一步最耗时间和额度。
  4. 检查自动分类,改掉明显离谱的类目。类目是导图的骨架,骨架歪了,后面都会歪。
  5. 用三句你平时想不起来原词的话去搜,检验语义层有没有生效。
  6. 确认能搜到、能导出,再决定要不要导入全部书签。

有Windows用户和Grok用户的话,社区还有基于原项目的分支,增加了Grok模型支持和更大规模书签处理。原版够用就先用原版,分支当备选,避免一开始就陷入“该用哪份代码”的选择疲劳。

使用前先问自己的5个问题

  1. 我要找回的,是原推链接,还是那张图里的信息?
  2. 我能不能接受把部分书签内容发给AI服务商?
  3. 我有没有稳定的本地环境和备份习惯?SQLite丢了,知识库就丢了。
  4. 我是想建立回看系统,还是只想再收藏一次心理安慰?
  5. 分析几千条图文的模型费用,我有没有心理预期?

这五个问题里,只要第4题答“没有回看意愿”,Siftly对你就是个更精致的收藏夹,不是生产力工具。

书签从来不是记忆,它只是记忆的原材料

我们高估了“保存”的力量,低估了“检索结构”的价值。

一条没有标签、没有视觉理解、没有分类的书签,本质是延期处理的待办。堆到足够多,待办会自己变成噪音。Siftly做的事情很朴素:给噪音补上结构,让以后的你能用自然语言把旧收藏叫回来。

它不会让你变得更有洞察力,也不会自动把收藏变成作品。它只是把那句“以后肯定用得上”从自我安慰,变成一件技术上可行的事。

如果你的X书签已经开始让人焦虑,可以先看仓库,先用小样本验证搜索是否真的打中你的记忆方式:
https://github.com/viperrcrypto/Siftly

收藏很容易。能找回来,才叫知识。

No comments yet