Hermes 对比 OpenClaw:一次实用的比较
TL;DR
OpenClaw 和 Hermes 都是开源 agent,你可以自托管,然后从手机上远程操控。OpenClaw 是更大、覆盖面更广的项目(约 38 万星标,28 个消息渠道,支持语音和手表 App);Hermes(约 21.1 万星标,出自 Nous Research)押注的是一个学习闭环和隔离的 profile 机制,而不是单纯拼渠道数量。我自己跑的是 Hermes,主要是看中它的安全姿态,以及它出自一家独立实验室而非前沿模型厂商。硬化(hardening)配置留到下一篇讲。
这是一个什么样的品类
这两个项目都是自托管的个人 agent:一个跑在你自己硬件上的持久化进程,接入你的消息 App,拥有真正的工具权限(shell、文件、网页、浏览器),记忆能在重启后留存,技能库还会不断增长。你从手机上给它发消息,它就在你的机器上执行动作。
正是最后这一点,让安全成为比较中最重要的维度。一个聊天机器人答错了,顶多浪费你的时间。一个拥有 shell 权限的 agent 一旦被操纵,造成的是实打实的破坏。
OpenClaw
Peter Steinberger 在 2025 年 11 月以 "Clawdbot" 之名发布了 OpenClaw。Anthropic 认为这个名字和 Claude 太像,提出了异议;它一度短暂改名为 "Moltbot",最终在 2026 年 1 月底定名为 OpenClaw。改名后 48 小时内,它的 GitHub 星标数就突破了 10 万。两周后 Steinberger 加入了 OpenAI,项目随之转入一个由 OpenAI 支持的独立基金会,MIT 许可证保持不变。它在 3 月超过了 React 的历史星标总数,目前接近 38 万。
从底层看,它是一个长期运行的 Node.js 网关:一个本地控制平面,管理会话、渠道、工具和事件,内嵌一个 agent 运行时来处理模型调用。人格设定存放在一个叫 SOUL.md 的文件里。它能对接 14 个以上的 LLM 提供商,从 GPT、Claude、Gemini,一直到通过 Ollama 跑的本地模型。
你能得到什么:
- 28 个消息渠道:WhatsApp、Telegram、Slack、Discord、Signal、iMessage、Teams、SMS、WeChat,外加另外 19 个
- 基于 Playwright 的浏览器自动化
- 语音唤醒词和对话模式,搭配 ElevenLabs 语音合成
- macOS、iOS(含 Apple Watch)和 Android 的配套 App
- ClawHub,一个社区技能注册表,技能数已逼近 6.8 万
- 从 Mac mini 到 Kubernetes,各种部署场景都有对应指南
它的设计目标就是"广度":连接一切、随处运行、无所不能。与其说它是一个单一助手,不如说它更像是一套面向 agent 的操作系统。
Hermes
Hermes 出自独立 AI 研究实验室 Nous Research。发布头两个月星标数就突破 9 万,现在超过 20 万。它的设计重心完全不同,Kilo 博客的一篇对比文章里有句话很精准:"Hermes 是把一个网关包装在学习型 agent 外面。OpenClaw 是把一个 agent 包装在消息网关外面。"零件一样,重心相反。
Hermes 的核心是一个循环——让 agent 跑得越久,变得越聪明:
三层记忆架构。 每次会话开始时都会注入两个极小的 Markdown 文件(一个 2200 字符的 MEMORY.md 和一个 1375 字符的 USER.md);再加上对所有历史对话的全文检索,存储在 SQLite 里;如果需要更多,还能接入可插拔的外部记忆提供方。关键事实始终常驻加载,其余内容按需检索。
agent 自己写技能。 当它完成一个复杂任务、把一个错误排查到修复、或者被你纠正之后,它会把这套行得通的流程存成一个 Markdown 技能文件。下次再遇到同类任务,它加载的是已验证过的流程,而不用重新摸索一遍。
一个专门清理这些技能的垃圾回收器。 如果没有东西去修剪,agent 自己写的技能会不断堆积成几十份狭窄、彼此重叠的操作手册。一个叫 Curator 的后台程序会把 30 天未使用的技能标记为过期,90 天后归档,并定期回顾整个技能库,把重叠的合并起来。它从不删除任何东西,每一次改动都可以恢复。
离线的技能进化。 让 agent 给自己的工作打分,结果证明并不靠谱(它们几乎总觉得自己干得很棒)。所以 Hermes 另外配了一条独立的流水线,叫 GEPA,它读取真实的执行轨迹,找出某个技能失败的地方,通过搜索进化出更好的变体。跑一次只需几美元,不需要 GPU,而且它产出的优胜方案是以 pull request 的形式提交给你审核,而不是悄悄替换。
Profile(隔离档案)。 每个 profile 都是一个完全隔离的 agent 实例:各自有独立的配置、记忆、技能、凭证和人格文件。同一台机器上,一个写代码的 agent 和一个做研究的 agent 默认互不共享任何东西。
覆盖面的差距已经在缩小。今年春天以来,Hermes 增加了浏览器自动化、一个原生的 macOS/Linux/Windows 桌面 App,以及自己的 20 多个消息平台支持,包括 Teams、iMessage 和 WhatsApp。它还欠缺的是 OpenClaw 那套原生手机层:没有 iOS 或 Android 配套 App,没有手表 App,没有语音唤醒词。手机端接入,靠的还是一个消息机器人。两者的核心差异在于各自把什么当作重心:OpenClaw 靠连接更多的地方来成长,Hermes 靠让 agent 本身变得更聪明来成长。
二者的共同点
两者都把人格设定放在 SOUL.md 文件里。两者都把技能当作带 frontmatter 的 Markdown 来处理。两者都能从一句大白话的请求里排出定期任务的 cron 计划,也都能通过 Ollama 跑本地模型。从今年春天起,两者都支持浏览器自动化,也都能对接二十多个消息平台。这两个项目正在快速趋同,一张功能对比表可能几周内就过时了——下面这张,权当 2026 年 7 月的一份快照。
并排对比
| OpenClaw | Hermes | |
|---|---|---|
| 维护方 | OpenClaw 基金会(OpenAI 支持) | Nous Research |
| GitHub 星标数(2026 年 7 月) | 约 382,000 | 约 211,000 |
| 消息渠道数 | 28 | 20+ |
| 记忆 | Markdown 文件 + embedding + 全文检索 | 三层:冻结快照、会话检索、外部提供方 |
| 技能 | ClawHub,单一中心化注册表,约 68,000 个技能 | 你自选的 GitHub "taps",加上 agent 自己写的技能 |
| 自我改进 | Cron 任务和心跳 | 学习闭环 + Curator + 离线 GEPA 进化 |
| 隔离性 | 每个渠道独立会话 | Profile:完全隔离的 agent 实例 |
| App | macOS、iOS + Apple Watch、Android | 桌面 App(macOS、Linux、Windows) |
| 安全记录 | 两个 RCE CVE、被投毒的注册表、暴露在外的实例、在中国被国有部门禁用 | 依赖层面的 CVE 修复;目前没有针对它本身的安全事件 |
安全性
这一节是决定我最终选择的部分,所以篇幅也最长。
OpenClaw 在 2026 年的记录。 一条 CVSS 评分 8.8 的一键远程代码执行(RCE)链(CVE-2026-25253,已在 1 月修复);"ClawHavoc" 攻击行动——攻击者向 ClawHub 投放恶意技能,研究人员统计出超过 800 个恶意包,一度约占整个注册表的五分之一;超过 3 万个实例被发现毫无鉴权地暴露在公网上;还有专门搜寻 OpenClaw 配置文件的窃密木马,这些文件里以明文形式存着 API key 和 token。4 月又爆出第二个 RCE(CVE-2026-41295:打开一个包含恶意渠道插件的工作区,插件会在任何信任检查生效之前就执行)。3 月,中国限制政府机构、银行和国有企业运行 OpenClaw。
维护团队的应对相当积极:给未知发送方设置配对码、提供诊断用的 doctor 命令、工具白名单、对 ClawHub 提交内容做 VirusTotal 扫描。但问题是结构性的。28 个入站渠道、一个公开的技能注册表、一个浏览器,加上 shell 权限,叠加起来就是一个巨大的攻击面,打补丁并不能让它变小。每一个渠道都是一扇门。每一个社区技能都是一条供应链。而门后面的那个东西,是会执行命令的。
为什么 Hermes 是更稳妥的选择。 Hermes 的几项安全优势是结构性的,不只是因为用户少、被盯上的机会少:
- Profile 隔离。 每个 profile 都是一个完全隔离的 agent 实例,拥有各自的配置、记忆、技能和凭证。某一个场景被攻破,不会连带交出其余部分。
- 没有可被投毒的中心化技能市场。 技能来自你明确选择信任的 GitHub 仓库(类似 Homebrew 的 tap 机制),或者来自 agent 自己的手笔。这里没有一个攻击者可以投毒的共享注册表,所以 ClawHavoc 那种失败模式在这里根本不存在。
- 可审查的自我改进。 离线技能进化产出的改动是以 pull request 形式交给你审核的,不是悄无声息的修改。
- 每个任务硬性上限 90 轮对话,这样一个被劫持的循环也没法无限跑下去。
诚实地说,也有需要警惕的地方:Hermes 用户更少,意味着攻击者更少、盯着找漏洞的研究人员也更少;而且随着它加了更多渠道和浏览器功能,攻击面也在扩大。它 7 月的发布说明里只列出了依赖层面的 CVE 修复,目前没有针对它本身的安全事件。但上面这些结构性特质,正是我更信任它、愿意把它放在一台必须保持锁定状态的机器上运行的原因。
不管用哪个工具,底线都一样:把它当作拥有 shell 权限的不可信软件对待,因为它本质上就是。最重要的安全工作发生在机器和网络层面,完全在 agent 之下——这正是下一篇要讲的内容。
你该跑哪一个?
OpenClaw——如果你想要的是覆盖面:agent 装在你的手机和手腕上,能语音应答,能控制你的浏览器和音箱,拥有这个领域里最大的社区。但要为硬化配置预留真实的时间——默认设置救不了你。
Hermes——如果你想要一个会不断复利增长的 agent,以及一个更小、更可审计的攻击面:它在第三个月对你环境的了解,远胜第一周;不同项目分别装在独立的 profile 里;它的改进通过一条你可以审查的流水线完成。如果它跑的那台机器必须保持锁定状态,那么这套供应链模型和隔离原语正是重点所在。我也更倾向于它出自一家独立研究实验室(Nous Research),而不是一个现在由 OpenAI 支持的项目——这既是治理层面的考量,也是技术层面的考量。
我自己在跑什么
这里有一台隔离的机器,跑着一个 Hermes 实例,负责推进我一个副业项目的产品开发:查阅现有方案(prior-art research)、做规划、干那些不出彩的中间环节工作。我负责掌舵和审核,它负责执行。
下一篇讲的是让它无人值守也能放心运行的具体配置:网络隔离、隧道化访问、防火墙规则,以及限定 agent 能接触和不能接触的范围。