项目概览
Hermes Agent 是由 Nous Research 开发的开源 AI Agent 框架,定位为自我进化的个人 AI 助手。它整合终端操作、代码编辑、浏览器控制、记忆系统、语音交互于一体,通过 Skill 系统实现无限扩展能力。其核心差异在于内置学习循环,能从经验中创建和改进 Skill,并跨会话构建对用户的深度理解。
该框架采用 CLI 与 GUI 双形态,支持 MCP 协议,不绑定单一 LLM,可灵活切换模型提供商,并支持跨平台部署。其能力分为身份与记忆、感知、表达、效率与成本、生态扩展五大层。记忆系统包含会话内、跨会话和知识图谱三层架构。感知能力涵盖网页抓取、搜索、浏览器自动化等。表达层支持语音合成、语音识别和图片生成。效率层提供 Token 监控、压缩和智能路由工具。生态方面拥有 380+ 社区 Skill。
报告指出其优点包括全能性、丰富的 Skill 生态、强大的记忆系统和零成本可行性,但也存在学习曲线陡、生态碎片化、文档不完善等缺点。
解决什么问题
报告指出,传统 AI 助手存在五大局限:只能聊天不能干活,无法操作本地文件或执行命令;记忆随会话消失,无法跨会话积累对用户的理解;功能封闭无法扩展,用户无法自定义新能力;无法感知互联网,不能实时搜索、抓取网页或操作浏览器;多工具碎片化,搜索、写作、代码等场景没有统一入口。Hermes Agent 旨在解决如何让 AI Agent 从“能对话”进化到“能干活”的核心问题,具体包括感知能力(读懂互联网)、记忆能力(跨会话记住用户偏好和项目上下文)、表达能力(语音合成与图片生成)、执行能力(操作终端、编辑文件、运行命令)以及进化能力(通过遗传算法自动优化自身行为)。
工作方式
报告描述了 Hermes Agent 的实现方式。它采用终端原生的 AI Agent 框架形态,具备 CLI 与 GUI 双形态。其核心架构围绕五大能力层展开:身份与记忆层通过 SOUL.md 定义 Agent 人格,使用 MEMORY.md 记录会话记忆,并可通过 Hindsight 自动提取实体和关系构建知识图谱;感知层使用 Jina Reader 进行单页抓取、Crawl4AI 进行批量抓取、Tavily 与 DuckDuckGo 进行网页搜索、CamoFox 进行反爬绕过;表达层使用 Edge TTS 进行语音合成、Whisper 进行语音识别、FAL.ai 或 OllamaDiffuser 进行图片生成;效率与成本层使用 tokscale 追踪 Token 用量、RTK 压缩 Token、Smart Model Router 进行智能路由;生态扩展层通过 Skill 系统安装和发现新能力。报告还描述了其数据流时序:用户指令经 SOUL.md 加载人格定义,查询历史记忆,调用搜索和抓取工具获取信息,最后由 LLM 综合生成回答,并将关键实体存入记忆。
核心能力
- 内置学习循环,能从经验中创建和改进 Skill
- 跨会话记忆,通过分层记忆系统构建用户深度理解
- 支持 MCP 协议,可接入外部工具
- 多模型路由,不绑定单一 LLM
- CLI 与 GUI 双形态,支持终端和 Web UI
-
- 社区 Skill 即装即用
- 提供从 OpenClaw 的一键迁移工具
- 内置遗传算法实现自我进化
- 提供零成本全栈方案
使用前需要了解
- AI 整理 · 本地测试,未经人工复核;依据历史报告节选,不代表当前产品状态。
- 报告指出,Hermes Agent 存在以下局限:学习曲线较陡,配置项多,新手容易迷失;生态碎片化,工具来源分散,质量参差不齐;文档尚不完善,部分工具缺少详细配置文档;自我进化有风险,遗传算法可能把已调好的配置“优化”得更乱,需要搭配验证 cron;Token 消耗可观,全功能开启后占用大量 token;依赖外部服务,如 Hindsight 需要服务器部署、Tavily 需要注册、FAL.ai 需要付费。报告还列出了不建议使用的场景:只需要简单聊天时,ChatGPT 或微信 AI 更轻量;团队级企业应用缺少权限管理、审计日志等企业特性;对延迟极敏感的场景,多层工具调用会增加响应时间;严格离线环境因依赖云端服务而不适用;不想折腾配置的用户更适合开箱即用的方案。


