人歇了活未必在转:10个开源Agent仓库怎么分层用,以及不该通宵无人值守的事

热帖把OpenHands、Hermes Agent、CrewAI、Aider、n8n、LangGraph、Agentic Inbox、browser-use、MCP目录和Task Master收成一张「先收藏、今晚让它跑着」的清单。仓库是真开源、星标也高,但「人歇了活还能转」只在任务边界清楚、密钥隔离、结果可回看时成立。本文按编码、编排、工具、邮箱四层说明每个项目做什么、官方地址、以及无人值守时最常见的翻车:乱改仓库、乱点网页、账单和一份看起来完整的错回复。

清单的杀伤力不在第十个名字,在最后一句:先star一个,今晚睡觉前让它跑着。

这句话击中的是当代开发者的疲劳。需求还在排队,人已经先睡了。开源Agent被写成代班同事——写代码、拆任务、回邮件、打开网页填表。星标够高,仓库也在,于是「收藏」看起来像已经雇到人。

雇到的其实是一套会调用模型的程序。程序可以通宵,判断力不会因此自动上夜班。下面按那10个仓库说清楚:各自在栈的哪一层,官方入口是什么,以及什么活真能丢给夜里,什么活必须早上再看一眼。

先把清单拆成四层,避免十个都装

写代码的Agent
OpenHands、Aider、挂在Claude Code上的Task Master。产出是补丁、提交、功能切片。

编排和分工
CrewAI、LangGraph、Hermes Agent。产出是流程:谁先检索、谁再写、失败了怎么重试。

工具和触发器
n8n、awesome-mcp-servers、browser-use。产出是对接:表格、GitHub、Slack、浏览器里的点击。

收件与起草
Agentic Inbox。产出是读过的信和待你确认的草稿。

一层没稳住,就上十个,得到的不是自动化,是十个会同时说话的半成品。

1. OpenHands:自主写代码,仍要你收diff

https://github.com/OpenHands/OpenHands

原帖写7.6万星,目前公开页已到约8.8万。定位是AI驱动的开发助手:给任务、让它在隔离环境里改代码、跑测试。适合脚手架、修测试、探索陌生仓库。不适合把生产密钥和线上数据库直接喂给会话。人歇之前,应限制它能写的目录,并规定:合并前必须看diff。

2. Hermes Agent:星最多,不等于已经替你长出判断

https://github.com/NousResearch/hermes-agent

Nous Research在2026年2月前后开源,星标后来冲到二十万以上,原帖写的19万已经过时。项目强调跨会话记忆和从经验里沉淀技能,口号是「跟着你长」。这是个人Agent层,不是财报软件。记忆会记住你的偏好,也会记住你随口说的错指令。自我迭代若没有评测集,优化的可能是更会讨好你,不是更少出错。

3. CrewAI:多角色分工,角色说明书比框架名重要

https://github.com/crewAIInc/crewAI

研究员、写作者、审稿人拆开跑,适合「搜集→草稿→检查」这种流水线。角色重叠或目标含糊,会得到三份很勤快的空话。先写清每一步的输入、输出和停手条件,再谈多智能体。

4. Aider:终端里结对,干净提交是它的产品感

https://github.com/Aider-AI/aider

在已有仓库里改文件、给出可审的diff,对独立开发者很实用。它快,是因为上下文就在你的工作区。快的另一面是:错误提交同样快。Git仍然是你的安全网,不是装饰。

5. n8n:开源Zapier,省的是按次费,留下的是运维

https://github.com/n8n-io/n8n

几百种对接,自托管后定时拉数、同步、触发模型。这是清单里最接近「人歇了还在转」的一层——前提是工作流幂等、失败可告警、令牌权限最小。第一条流程建议只做只读:备份、汇总、通知,不要一上来就「自动发邮件、自动改库」。

6. LangGraph:把Agent画成图,便于生产里排错

https://github.com/langchain-ai/langgraph

节点、边、状态、重试,适合已经确定要上线的流程。它不替你决定业务对不对,只让「跑到哪一步炸了」看得见。没有图,只有一个巨大prompt,夜里挂掉时你只能重新跑整场。

7. Agentic Inbox:读信可以自动,发送必须人点

https://github.com/cloudflare/agentic-inbox

Cloudflare的参考实现,邮件经Email Routing进你的Workers账户,Agent起草回复。数据相对留在自己的Cloudflare闭环,不是又一家邮箱品牌。上一篇拆过它的分寸:到信后写草稿,发出去前确认。把「自动回复客户」理解成无人值守,是邮箱Agent里最贵的误会。

8. browser-use:能点网页,也就能点错网页

https://github.com/browser-use/browser-use

让模型操作浏览器:打开页面、填表、抽数据。演示好看。生产里要当高风险工具:独立档案、不用常用密码、不绑定支付。订会议、改后台、点确认支付,都不该在你睡着时默认放行。

9. awesome-mcp-servers:这是目录,不是一个会干活的员工

常见维护仓:https://github.com/punkpeye/awesome-mcp-servers

MCP把GitHub、Slack、Linear、Stripe、Postgres、Notion接到Agent上。目录解决「有什么插件」,不解决「该不该把生产库的写权限交给模型」。每接一个服务器,等于多开一扇门。先读、后写,写操作单独审批。

10. claude-task-master:一句话拆功能,拆完仍要验收

https://github.com/eyaltoledano/claude-task-master

架在Claude Code一类编码环境上,把需求拆成可执行任务队列。对功能开发有节奏感。拆错需求时,一队人会很整齐地把错的做完。它加速的是已知方向,不是替你想产品。

「通宵代班」要过的四道门

真能过夜的,几乎都是边界死、可回滚、失败会响的任务:跑测试、生成周报草稿、同步公开状态、把邮件分类进文件夹。改计费逻辑、对客户承诺、在官网点「发布」,不在此列。


Agent不是单一产品类别。编码Agent产出补丁,编排框架产出状态机,n8n产出触发器,浏览器Agent产出点击。混着吹「全开源就能下班」,是把四层能力说成一种魔法。


星标证明关注度。OpenHands约8.8万、Hermes Agent已到二十万级,说明社区在用,不说明你的仓库被它改对了。权威来自项目文档、隔离环境和你自己的回归测试,不来自收藏夹。


可信的自动化会承认:模型会幻觉、会花掉token、会在网页上走错按钮。可信的部署会把密钥放进最小权限,把发送、支付、强制推送留在人工闸门后。清单末尾那句「睡觉前让它跑着」,只应作用于已经演示过三次成功的同一条任务。

今晚若只做一个,选这条

不要十个一起star完再睡觉。选一个已经重复了三遍的动作:例如「把Issue摘要写进草稿」「把测试跑红的日志整理成三条」「把收件箱里的新闻通讯标成已读并起草回复」。

用n8n或Inbox这类边界清楚的工具先跑通。编码Agent留到明天你盯着diff的时候。浏览器Agent最后接,而且接在一次性环境里。

人可以歇。活要转,先把「转错了能退回」写进流程。否则早上醒来,你得到的不是代班同事,是一份通宵加班、语气完整、方向跑偏的提交记录。

No comments yet