找资料的日常往往是:Obsidian 搜标题,PDF 里 Ctrl+F,Notion 再搜一遍,关键词想不起来就放弃,打开搜索引擎从头来。
Khoj 把这一步收成对话:问一句,从你自己的文档(可选加上互联网)里找,再写成回答。它不是新笔记软件,而是架在已有资料上的检索 + 问答层。
仓库:https://github.com/khoj-ai/khoj
云端试用:https://app.khoj.dev
自托管文档:https://docs.khoj.dev/get-started/setup
官方一句话:Your AI second brain. Self-hostable. 约 3.7 万 Star,AGPL-3.0。
它具体接什么
资料格式
PDF、Markdown、Notion、Word、Org-mode,以及图片等。桌面、Obsidian、Emacs 客户端可以帮你把文件夹同步进索引。库不更新,问答就还在旧世界上。
入口
浏览器、Obsidian 插件、Emacs、桌面端、手机,WhatsApp 也能聊。同一套大脑出现在你已经停留的地方,比再下一个「只在网页里用」的知识库更接近日常。
模型
本地:Llama、Qwen、Gemma、Mistral 等,可经 Ollama、LM Studio、vLLM 这类 OpenAI 兼容接口。
在线:GPT、Claude、Gemini、DeepSeek 等。
不想让正文离开本机,就自托管 + 本地模型;只想先试体验,走云端即可。两者不是同一隐私模型。
再往上
可配 Agent:划定知识范围、角色、模型与工具。可定时做研究,把简报和通知推到邮箱。另有语义搜索、生图、语音相关能力。定位可以从「搜我的笔记」升到「按日程替我跑一轮调研」。
自托管、云端、混合
方式 | 适合 | 代价 |
自托管(Docker / pip) | 文档不能出内网 | 要维护服务、索引和模型 |
官方云 app.khoj.dev | 先验证值不值得迁库 | 数据在对方基础设施上 |
混合 | 本地索引 + 选用云模型 | 正文是否出网取决于你是否把对话发给在线 API |
文档写明:自托管时数据可留在私有网络,本机部署甚至可离线用。第一次启动后建议重启一次服务,好让设置生效。管理后台要设好管理员密码和 Django 密钥;接商用模型再填对应 API Key。
「本地 + 云端混合」很诱人,但隐私边界以实际请求是否出网为准,不以产品口号为准。
第二大脑喊了很多年,这次问得出话吗?
能问出话,和问得准,是两件事。
Khoj 做对的部分是:索引 + 语义检索 + 任意 LLM + 多端,不再强迫你把生活迁进一个新编辑器。Obsidian 用户尤其合适——笔记继续写在原处,问答另开一层。
它做不到的部分,评论里那句已经点破:私有笔记又乱又碎时,它不一定答对人。
常见翻车来源:
- 同一件事写在三份互相矛盾的备忘里,模型会挑最像的一段;
- 扫描版 PDF、双栏论文、表格,解析质量参差;
- 文件没同步、索引没重建,问的是上周还不存在的结论;
- 问题太飘(「我上次怎么说的」),没有时间、项目、文件名等锚点。
第二大脑的质量,上限仍是库的治理:命名、目录、是否过期、是否重复。Khoj 降低的是检索摩擦,不是整理义务。
和 Obsidian 插件、纯 RAG 脚本怎么选
- 已经在用 Obsidian,只想问答当前库:先试 Khoj 的 Obsidian 插件或同类本地 RAG,不必一上来上 WhatsApp 和定时简报。
- 要多源(PDF + Notion + 仓库)且多端入口:Khoj 这类「个人 AI 应用」比单插件完整。
- 只要一条 API 给内部系统用:可能更适合自建检索服务,而不是整套带聊天客户端的产品。
- agpl:改过再提供网络服务,需要遵守 AGPL 的开源义务;闭源商用前先读许可。
建议的试用路径
- 用云端或 Docker 先扔进 一个 主题清晰的文件夹(20–50 个文件),问三个你自己知道答案的问题。
- 看它是否引用对文件;引用飘了就先调同步范围,而不是换更大模型。
- 确认本地模型或 API 的隐私选择,再导入全部笔记。
- Agent 和定时研究放在「问答已经准了」之后——自动化会放大错误索引。
小结
Khoj 把电脑里的文档变成可提问的层:多格式、多端、本地或云模型、可自托管。Star 高,是因为「第二大脑」这个需求真实存在,而且它没有强迫你换笔记软件。
仓库:https://github.com/khoj-ai/khoj
资料仍是你的。工具只决定你是一页页往下拉,还是开口去问。问之前,最好先保证那句话在库里真的写过,并且只写过一种版本。




No comments yet