很多人用 Hermes Agent 翻车,不是因为 Hermes 笨——是你让它做的事,它根本做不到。今天花 3 分钟摸清 Hermes 的能力边界,以后不翻车。
但"能用"和"好用"之间,还有一道坎:你得知道它能干什么、不能干什么。
很多人装完 AI 助手就开始提各种需求,然后发现:有的很顺、有的报错、有的干脆没反应。不是 AI 笨——是你还没搞清楚自己手里这台"车"的排量和油箱大小。
今天这篇,我们通过实际操作来摸清你系统的能力边界。
运行:
hermes status --all
这个命令会显示:当前用的什么模型、哪些工具开着、网关状态、记忆状态、会话数量。就像手机的"关于本机"页面,一眼看清配置。
常见问题:模型显示正常,但工具只有几个。说明你没开够工具集,回到 hermes tools 打开更多。
每个大模型都有一个上限,叫上下文窗口。你可以把它理解成 AI 的"短时记忆容量"——它能一次看到多少文字。
不同模型的容量差别很大:
常见国产模型上下文窗口对比 DeepSeek V4 — 1M ~150万字 MiniMax M2.7 — 200K ~30万字 Qwen3 — 256K ~38万字 Kimi K2.5 — 256K ~38万字 GLM-5.1 — 200K ~30万字 上下文窗口 = AI 一次能"看到"的最大文字量 ⚠️ 聊天内容 + 工具输出 + 系统提示都要算进去 💡 以上是 2026 年 5 月数据,模型更新很快 以各模型官网为准
实际影响是什么?
如果你让 AI "帮我读一下这个 35万字的文档",用 GLM-5.1可能装不下,用 Qwen3 或 Kimi K2.5 就没问题。如果用 DeepSeek V4 的 1M 上下文,一百万字小说都能一次看完。
实操:查看你的模型上下文窗口
hermes config
在输出里找 context_length,那个数字就是你的上下文窗口大小(单位是 token,大约 1 个中文字 ≈ 2 个 token)。
怎么解决"装不下"的问题?
Hermes 会自动处理——当对话接近上限时,它会自动压缩前面的内容,保留要点,腾出空间。这个功能默认开启,你可以在 config.yaml 里调整压缩的触发时机。
每次和 AI 对话,都会消耗 token。token 就像车的油耗——你说了多少、它回了多少、中间用了多少工具,全都要算钱。
实操:查看你的 token 用量
在聊天中输入:
/usage
会显示当前会话消耗了多少 token。再输入:
/insights 7
会显示最近 7 天的总消耗。
省钱的实操技巧:
1. 短任务用小模型:简单问答用 GLM-4-Air 或 Kimi,复杂推理再用 DeepSeek V4 或 Qwen3。用 /model 随时切换。
2. 精简你的提示词:说"帮我写一个 Python 函数,参数是文件路径,返回行数"比"我想要一个 Python 程序,就是那种可以统计一个文件有多少行的程序"省一半 token。
3. 用完就开新会话:/reset。旧会话的历史会一直占着上下文窗口,token 越烧越多。
Hermes 的 AI 能力来自两个地方:
云端 API(大多数人的选择):调用远程大模型,能力强但每次都要花钱、要联网。
本地模型:在自己电脑上跑模型,免费但需要好硬件(至少 16G 内存,需要有 GPU/NPU 才能流畅运行)。
云端 API vs 本地模型 ☁️ 云端 API ✅ 能力强(DeepSeek V4、Qwen3 级别) ✅ 不挑硬件 ❌ 要联网、按量付费 💻 本地模型 ✅ 免费、离线可用、隐私好 ❌ 要好硬件(16G+内存 + GPU) ❌ 能力弱于顶级云端模型 💡 多数人选云端 API,省心
实操:判断你的硬件能不能跑本地模型
运行:
free -h && nproc
这会显示你的内存和 CPU 核心数。一般来说:
• 4G 内存 → 老老实实用云端 API • 8G 内存 → 可以跑很小的模型(对话质量一般) • 16G 内存 + GPU → 能跑 7B 参数模型(够日常用) • 32G+ 内存 + 独立 GPU → 可以跑 13B-34B 模型(体验不错)
如果你决定用云端 API,Hermes 支持 20 多个服务商。最省心的方式:
hermes model
交互式选择模型和提供商,它会告诉你需要什么 API key、去哪申请。
最后一步,把所有能力摆出来看:
hermes tools list
这个命令会列出所有工具集及其状态(开启/关闭)。对照下面的表,看看你开了多少:
Hermes 能力速查表 🔍 web — 搜索+提取网页内容 💻 terminal — 执行命令行操作 📂 file — 读写搜索文件 🌐 browser — 浏览器自动化 👁 vision — 看图识图 🎨 image_gen — AI 画图 🧠 memory — 跨会话记忆 📋 skills + ⏰ cronjob — 技能与定时 💡 不确定?先全开,用几天再关
实操:一次性检查你的系统能力
把上面几个命令串起来跑:
hermes doctor && hermes status --all && hermes tools list
三条命令跑完,你就能回答这几个问题了:
✅ 我的模型能连上吗? ✅ 我的上下文窗口有多大? ✅ 我开了哪些工具? ✅ 我的硬件适合本地还是云端?
回答完这四个问题,你就清楚自己的 Hermes 能做什么了。下一篇,我们讲几个必须搞懂的核心概念——上下文管理、记忆机制、系统提示词怎么工作。懂了这些,你就能真正"驾驭"你的 AI 助手了。
理论知识看完了,来几个实际的。以下是最常遇到的三种"能用但不好用"的情况,以及对应的解决方法:
场景一:AI 突然变笨了
你聊了半小时,前面都很聪明,突然开始答非所问、忘记你说过的话。
原因:上下文窗口快满了。AI 的"短时记忆"塞了太多东西,新的内容挤不进去了。
解决:/reset 开新会话。或者输入 /compress 手动压缩上下文,让 AI 把前面的内容精简一下。
场景二:同样的提示词,换个模型效果差很多
"帮我写一份产品竞品分析"——用 DeepSeek V4 写得很好,换成 GLM-4-Air 就很一般。
原因:不同模型的能力不同。大模型(DeepSeek V4、Qwen3)理解力和创造力更强;小模型(GLM-4-Air)适合简单明确的任务。
解决:根据任务复杂度选模型。简单任务用便宜的小模型省钱,复杂任务切大模型。用 /model 随时切换。
场景三:让 AI 操作文件,它说"没有权限"
你让 AI 帮你编辑一个配置文件,它报错说没有权限。
原因:文件权限问题,或者 AI 在沙箱环境里运行,访问不到你的文件系统。
解决:先检查文件权限 ls -la 文件名。如果权限没问题但还是访问不到,检查 hermes config 里的 terminal.cwd 设置,确保工作目录正确。
现在就去终端跑一下
hermes status --all,看看你的 AI 助手到底有哪些能力、哪些短板。跑完在评论区截图,我帮你分析你的配置合不合理。