零成本自托管 WhatsApp AI Agent:Hermes Agent 与 OpenClaw 的实战对决

阅读时长:12分钟

你早上醒来,拿起手机,WhatsApp 上有一条未读消息。

不是 spam,不是家人群里的早安表情包,是你的 AI Agent 发来的:

“早上好。你昨天让我调研的那个 React 状态管理库,我对比了 Zustand、Jotai 和 Redux Toolkit 的 GitHub star 增速,Zustand 过去三个月涨了 12k,社区活跃度最高。另外,你周三下午有个产品评审会,我帮你整理了上周的用户反馈 Top 5,按严重程度排序。”

这条消息不是 ChatGPT 网页版发来的,不是某个 SaaS 平台的推送通知,而是跑在你自己的 VPS 上、连着你自己的 WhatsApp 账号、调用着免费 LLM API 的 AI Agent 发给你的。

成本:$0(除了 VPS 的几美元)。 延迟:2-3 秒。 控制权:100% 在你手里。

这一幕正在被越来越多的人实现。而引爆这个话题的,是 Reddit 上 r/hermesagent 板块的一条热帖——热度 52,47 条评论,标题直白得令人兴奋:

“Built a fully self-hosted WhatsApp AI Agent with Hermes Agent and FreeLLMAPI”

这条帖子让我们看到一个有趣的三角关系:Hermes Agent(AI Agent 运行时)+ FreeLLMAPI(免费 LLM 路由层)+ WhatsApp(触达渠道)。三个人各司其职,拼在一起就是一个零成本的个人 AI 助理系统

但作为一个在自托管 Agent 领域踩过不少坑的人,我想聊点帖子作者没说的东西。这篇文章不会教你一步步搭环境(那样的教程 LLM 自己就能写),而是拆解这个方案背后的架构逻辑、真实成本和隐藏风险,并把 Hermes Agent 与我们更熟悉的 OpenClaw 做一个诚实的对比

这不是教程,这是体检报告

先给标题做个澄清:这不是安装指南

市面上已经有很多 “Hermes Agent 5分钟上手指南” 的视频和博客,它们教你如何克隆仓库、填入 API key、跑起来第一条命令。那种内容有价值,但重复性极高——一个 LLM 就能帮你写出来。

本文想做的是另一类内容:把这套系统拆开来看,问几个 LLM 不会主动问你的问题

  • FreeLLMAPI 的"免费"到底能走多远?
  • Hermes Agent 标榜的"自学习"循环,是真正的智能,还是营销话术?
  • WhatsApp 网关到底选 Baileys 还是官方 Cloud API?
  • 跟 OpenClaw 比,Hermes Agent 到底值不值得迁移?

如果你正准备上车,花十分钟看完这篇文章,可能会帮你省掉后面几个小时的排坑时间。

方案拆解:三个人各干各的活

先把这套系统的三层架构搞清楚,你会发现它本质上是一个管道工程

[你] ←→ [WhatsApp] ←→ [Hermes Agent] ←→ [FreeLLMAPI] ←→ [LLM Provider]

每一层都有独立的替换空间,这种解耦设计本身就是亮点。

Hermes Agent:那个"会自己写笔记"的 Agent

Hermes Agent 是 Nous Research 在 2026 年 2 月发布的开源项目,MIT 协议。跟 OpenClaw 类似,它是一个自托管的 AI Agent 运行时,但核心差异在于一个叫 Skills 系统的特性。

简单理解:当 Hermes 完成了一个复杂的多步骤任务(5次以上工具调用),它会停下来,把这个任务的执行过程提炼成一份 Markdown 格式的 Skill 文档,保存在本地。下次遇到类似任务时,它会优先加载这份 Skill,而不是从零开始推理。

听起来很像人类的"做笔记"行为,不是吗?做完一次复盘,下次做得更快更好。

但这里有个微妙的点:Reddit 上有用户贴出了 Hermes 的 GitHub issue #25833,指出学习循环存在"结构性缺陷"——当任务完成后,Agent 评估自身表现并生成 Skill 的环节,有时会产生质量参差不齐的文档。一个 Medium 评论者说得比较中肯:“如果几次迭代后收益开始停滞,学习循环就是一个更好的用户体验,而不是一个更好的算法。”

翻译成人话:它确实在学,但学得不够聪明。初期效果明显,后期可能边际递减。

FreeLLMAPI:免费的午餐能吃多久?

FreeLLMAPI 是一个很有意思的中间层。它不是一个模型,而是一个路由和聚合服务——自动把请求分发到"当前可用的免费模型"上。

这意味着什么?意味着你可以用 auto:free 这样的标识,让系统自动选一个免费的模型来跑。对于 Skill 迭代这种"允许慢一点"的场景,免费路线完全可行。但如果你要做生产环境的事情(比如给客户发消息、处理敏感数据),免费模型的稳定性、上下文长度和响应速度都是隐患。

更实际的问题是:免费 LLM 服务靠什么盈利? 大多数免费 API 要么有速率限制,要么会在你用得稍微多一点之后开始"降级",或者干脆停止服务。把它作为 Agent 的推理后端,你需要接受一个事实——你无法控制模型的可用性和质量

WhatsApp 网关:两条截然不同的路

Hermes Agent 连接 WhatsApp 有两条路:

维度 Baileys 桥接 WhatsApp Business Cloud API
原理 模拟 WhatsApp Web 会话 官方 Meta 支持的 Business API
账号要求 普通个人号 Meta Business 账号 + 审核
封号风险 (Meta 视同第三方工具)
设置复杂度 低(扫码即用) 高(需要公网 webhook、审核流程)
适合场景 个人测试、非关键用途 生产环境、商业用途

Reddit 帖子的作者选的是 Baileys 方案——可以理解,门槛最低。但从长远看,如果你真的打算让这个 Agent 长期在线、发消息不中断,Baileys 的风险是你必须正视的

LumaDock 的教程里提到一个重要建议:不要用个人 WhatsApp 号跑 Bot。用一个专门的副号,就算被封也不影响你的日常通讯。

Hermes Agent vs OpenClaw:谁更强?

这是这篇文章的重头戏。毕竟,作为 OpenClaw 的使用者,我天然地对 Hermes Agent 充满好奇——如果 OpenClaw 是"那个能干的同事",Hermes Agent 更像是"那个会自己进化的实习生"。

我们拉几个关键维度来对比:

生态和插件:OpenClaw 赢。OpenClaw 的生态更大,工具、Skills、社区教程的数量都更多。如果你需要集成一些冷门的服务,OpenClaw 的答案更容易找到。

自学习能力:Hermes Agent 赢。Skills 自动生成是这个框架的杀手锏。虽然效果有限,但在高频复用的场景下(比如每天帮你做同一类数据分析),积攒下来的 Skill 库确实能省不少重复工作。

部署难度:OpenClaw 略低。两个项目都支持一条命令安装,但 OpenClaw 的 Node.js 生态在 Windows/macOS 上的原生支持更好。Hermes Agent 在 Windows 上需要 WSL2,多了一层依赖。

安全性:各有各的坑。OpenClaw 在 2026 年初被披露过 512 个安全漏洞(这个数字被广泛报道,但实际影响需看具体版本和配置)。Hermes Agent 的安全模型采用沙箱隔离,支持 Docker、Singularity、Modal 五种后端,但默认配置下并不算严格——如果你直接以 root 用户跑 Agent,两个框架都一样危险。

商业模式:OpenClaw 相对更"纯粹"——框架本身是开源的,LLM API 的费用直接付给供应商。Hermes Agent 的 Nous Research 提供免费层级的同时也有付费订阅,提供 300+ 模型访问和月度额度。如果你不付费,功能并不受限,但模型选择会少一些。

我的判断:如果你需要一个稳定、社区支持好、生态全的 Agent,OpenClaw 目前是更成熟的选择。如果你对"Agent 能自己变强"这个特性有执念,想花时间培养一个专属的 Agent,Hermes Agent 值得一试。

那些帖子没告诉你的坑

基于搜集到的多个社区反馈(Reddit、HackerNoon、LumaDock、utilo 等),我总结了一些高频踩坑点:

1. FreeLLMAPI 的模型切换会中断上下文

FreeLLMAPI 的 auto:free 路由会在不同模型之间切换。但不同模型的上下文窗口长度和指令遵循风格差异很大。一个在模型 A 上表现良好的 Skill,在模型 B 上可能直接失效。

2. Hermes 的 Skill 质量参差不齐

自学习生成的 Skill 文档需要人工审核。如果不定期清理,~/.hermes/skills/ 目录会变成一团杂草,反而增加推理开销。

3. Baileys 会在 WhatsApp 客户端更新后失效

这是 Baileys 的固有问题——它靠模拟 Web 客户端,一旦 WhatsApp 改了协议,桥接就断了。你的 Agent 可能某天早上突然不回消息了,原因只是 Meta 推送了一个小更新。

4. VPS 选型有讲究

Hermes Agent 官方推荐"能serve一个 64K 上下文模型"的机器。如果你用最便宜的 $5 VPS,跑小模型勉强够用,但一旦 Skill 库变大、对话变长,响应速度会明显下降。NVIDIA 的博客提到,RTX GPU 和 DGX Spark 是跑本地 Hermes Agent 的最佳硬件——但显然不是每个人的预算都能覆盖。

5. “零成本"是幻觉

VPS 要钱,电费要钱,花在排坑上的时间更要钱。FreeLLMAPI 省下的 API 费用,可能被你在 VPS 升级和多花的时间上抵消掉。真正的零成本,只存在于你用自己的旧笔记本跑的时候

写在最后:工具是工具,人是核心

回到那条 Reddit 帖子和背后的这套"零成本 AI Agent"方案。

它有价值吗?绝对有。它让更多人可以低成本地体验"拥有一个自己的 AI Agent"是什么感觉,这是好的。它也展示了开源生态的创造力——几个人、几个服务、一条管道,就能拼出一个功能完整的个人助理系统。

但它适合所有人吗?不是。

如果你期待的是"装完就能用,永远在线,永远可靠”,那你可能会失望。Baileys 会断,FreeLLMAPI 会降级,Skill 会变蠢,VPS 会因内存不足而重启。维护一个自托管的 Agent 系统,本质上就是维护一个需要持续关注的系统——跟维护一个博客、一个 HomeLab 没有本质区别。

真正的价值不在工具本身,而在你怎么用工具。是让 Agent 每天帮你整理新闻、监控价格、提醒日程,还是只是把它当成一个聊天机器人?前者需要你花时间培养 Skills、调整行为模式,后者则不需要 Agent 框架,ChatGPT 就够了。

Hermes Agent 和 OpenClaw 没有绝对的优劣,只有适合和不适合。

如果你追求稳定、生态和开箱即用的体验,OpenClaw 依然是最稳妥的选择。如果你愿意为一个会"自己进化"的 Agent 付出额外的时间和调试成本,Hermes Agent 的 Skills 系统会给你带来不一样的长期回报。

而如果你只是想零成本试试水,Hermes Agent + FreeLLMAPI + Baileys 这个组合,是一个不错的起点——只要你能接受它随时可能"生病"的事实。

毕竟,养一个 AI Agent 跟养一只猫有点像:它看起来很独立,但你得真的在乎它,它才会真的有用。


相关阅读

© 2026 softon.top

本站已稳定运行 263 天 9 小时 · 122 篇文章

使用 Hugo 构建 主题 Stack 由 Jimmy 设计 由 softon 魔改

最近构建时间:2026-09-21 17:06:46 CST