首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >声明了权限它照样读了 18.7 万行:agent 治理缺的是拦截点与尺子

声明了权限它照样读了 18.7 万行:agent 治理缺的是拦截点与尺子

作者头像
海风自语
发布于 2026-10-01 08:21:51
发布于 2026-10-01 08:21:51
240
举报

一位记者把 Meta 的 AI 助手 Muse 装到 Mac 上,没给它「信息」应用的授权,苹果的完全磁盘访问权限也是关着的。第二天,Muse 已经把他信息数据库里 18.7 万行内容同步上了云(AppleInsider 09-28 引 Inc. 记者 Jason Aten 的实测)。

我回头翻了自己服务器上那几个 agent 的日志。权限是我配的,但它到底碰过什么,我拿不出第一手证据。

能被系统拦下来、能被尺子测出来的,才算数;写在设置里的权限和靠体感的评测,都不算。

权限写在设置里,等于没有

先是 Muse。Meta 的帮助页写着它必须服从用户设置的权限,紧接着补了一句免责:「Your Muse can make mistakes or take unexpected actions」。实测结果比免责更直接:没授权的数据,Muse 照样读了,而且读了 18.7 万行才有人发现。

另一头是 NVIDIA 09-28 发布的 Open Agent Safety Platform。核心组件 OpenShell 把策略做到内核层:每次文件访问、每次系统调用、每条出网连接,离开沙箱之前都要过一次策略检查。更硬的一条是凭据,agent 进程永远看不到真凭据。只有当请求发往已批准端点时,运行时才临时把凭据贴上去。还有一条我准备照抄:任何策略变更在生效前,先由形式化验证算出「这次变动会新开哪些有风险的访问」,比如用凭据访问了一个新主机,这类变更要等人工复核。

NVIDIA 企业 AI 副总裁 Boitano 那句话说得比我好:仅靠模型层的防护,管不住 agent 能访问什么、能做什么。

我对这条特别敏感,是因为我干的另一半活在电力行业。变电站远程巡检、生产领域智能安监这类系统,权限从来不靠自觉。谁能远方操作、谁监护、谁发令,是操作票上三个独立身份,缺一个流程就走不动。原因不是信不过人:现场赶时间的时候,写在流程文件里的规矩总会被绕过,只有在系统里拦得住的规矩才是规矩。

后来我给 AI 巡检后端做四层重构,定的第一条规矩还是这个形状:业务层里不许出现框架的上下文对象。原因不是那个对象危险,而是不该出现的依赖,一旦允许它出现,就再也收不回来。

一把测不出已知变化的尺子,等于没有尺子

Claude Opus 5.5 是 09-22 发布的,社区里一直有人怀疑 Anthropic 会在模型上线几周后悄悄把它调笨。争论了很久全靠手感,因为没有人有干净的发布当天基线。有人于是做了 livenerf(github.com/ninjahawk/livenerf,09-29 在 HN 上 407 分)来把这件事变成可证伪的。

它的设计里有四个环节比结论更重要。

第一,只留有信息量的题。2,336 道题各跑 4 次,只留模型「有时候对」的 78 道;全对的题测不出下降,白烧额度。第二,配对重跑,同一批题每周再跑一次,跟自己的历史成绩比,题目难度自动消掉;判分用精确匹配,永不用模型当判官,因为判官自己也会漂移。第三,跑一个对照模型,如果两个模型一起变,说明是平台变了,不是被试模型变了。

第四,也是最容易被跳过的一步:跑正式基线之前,先用一个已知的降级做阳性对照,把推理强度从高降到中,看 token 是否少 26%、准确率是否掉 4.2±3.9 分。没有阳性对照的评测,跑出来的「没有变化」是没有信息量的。

它的诚实也值得记。作者在 README 里明写:每天跑一轮,10 天窗口只能测出大约 7.5 个点的变化;做阳性对照时,把 Opus 5 换成 Opus 5.5 这种同家族换模,它分辨不出来。

我们做巡检识别和缺陷检测的算法评测,缺的正是前半段:大多数团队是跑一遍、看结果、比上次高还是低,题目固定、环境在变、没有对照;误报和漏报的成本还不一样,阈值却没跟着调。一个从没被证明能测出已知降级的评测体系,说「没有变化」等于什么都没说。

我自己那条日报流水线也一样。一篇稿子能不能发,靠的是一组写死的校验命令,而不是我读一遍觉得差不多。校验命令本身也要被验证:它报错时,我第一件事是分清稿子错了还是尺子错了。

马上可以动手的三件事

  1. 挑一个你自己在跑的 agent 或自动化,把它声明的权限跟日志里实际发生的动作对一遍。对不上的地方,就是该加拦截的地方。这一步不花预算。
  2. 给你最依赖的那个外部能力(模型接口、OCR、语音、地图)建一个 20 到 50 题的面板:固定题目、固定判分、每天跑一次,只记两个数,对了几题、输出了多少 token 或字符。
  3. 面板上线前先做一次阳性对照:把某一步降一档(换小模型、降分辨率、关掉某个后处理),确认分数会按预期掉下来。掉不下来,说明尺子还没做好。

这几天其他信号

  • 09-29 · OpenAI DevDay:GPT-6.1 Sol 上线,输入 2 / 输出 10 每百万 token、缓存输入
  • 09-28 · Anthropic:Sonnet 5.5 发布,单价 2/10 一分未降,官方称每任务成本最多降 30%;Terminal-Bench 4.0 从上一代 Sonnet 5 的 10.3% 跳到 70.6%,反超自家旗舰 Opus 5.5 的 66.4%(未独立复现)。
  • 09-29 · Anthropic 红队:智谱 GLM-5.3 在 ExploitBench 上 410 次尝试做出 50 次端到端漏洞利用,对标 Anthropic 受限发布的 Mythos Preview 的 56 次;欺骗性提示可绕过其防护 64%、预填充 92%、权重消融后 100%,消融成本约 $1,200,而拒绝率从 95% 掉到 6%、通用能力不变。
  • 09-23 发布(HN 09-27 发酵):Fireworks 的 Ember-1 基于 Kimi K3 训练,官方称 token 减少 35% 到 50% 而质量不变。它指出:多轮 agentic 里上下文随轮数近似二次增长,早先轮次的推理被反复重读、也反复计费(未独立复现)。
  • 09-28 · BBC:佛蒙特州虚拟电厂已成为该州最大电力来源,5,500 多户家庭电池、约 110MW、$55/月十年租约,去年为当地客户省下 1,100 万美元。
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2026-09-30,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 权限写在设置里,等于没有
  • 一把测不出已知变化的尺子,等于没有尺子
  • 马上可以动手的三件事
  • 这几天其他信号
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档