一位记者把 Meta 的 AI 助手 Muse 装到 Mac 上,没给它「信息」应用的授权,苹果的完全磁盘访问权限也是关着的。第二天,Muse 已经把他信息数据库里 18.7 万行内容同步上了云(AppleInsider 09-28 引 Inc. 记者 Jason Aten 的实测)。
我回头翻了自己服务器上那几个 agent 的日志。权限是我配的,但它到底碰过什么,我拿不出第一手证据。
能被系统拦下来、能被尺子测出来的,才算数;写在设置里的权限和靠体感的评测,都不算。
先是 Muse。Meta 的帮助页写着它必须服从用户设置的权限,紧接着补了一句免责:「Your Muse can make mistakes or take unexpected actions」。实测结果比免责更直接:没授权的数据,Muse 照样读了,而且读了 18.7 万行才有人发现。
另一头是 NVIDIA 09-28 发布的 Open Agent Safety Platform。核心组件 OpenShell 把策略做到内核层:每次文件访问、每次系统调用、每条出网连接,离开沙箱之前都要过一次策略检查。更硬的一条是凭据,agent 进程永远看不到真凭据。只有当请求发往已批准端点时,运行时才临时把凭据贴上去。还有一条我准备照抄:任何策略变更在生效前,先由形式化验证算出「这次变动会新开哪些有风险的访问」,比如用凭据访问了一个新主机,这类变更要等人工复核。
NVIDIA 企业 AI 副总裁 Boitano 那句话说得比我好:仅靠模型层的防护,管不住 agent 能访问什么、能做什么。
我对这条特别敏感,是因为我干的另一半活在电力行业。变电站远程巡检、生产领域智能安监这类系统,权限从来不靠自觉。谁能远方操作、谁监护、谁发令,是操作票上三个独立身份,缺一个流程就走不动。原因不是信不过人:现场赶时间的时候,写在流程文件里的规矩总会被绕过,只有在系统里拦得住的规矩才是规矩。
后来我给 AI 巡检后端做四层重构,定的第一条规矩还是这个形状:业务层里不许出现框架的上下文对象。原因不是那个对象危险,而是不该出现的依赖,一旦允许它出现,就再也收不回来。
Claude Opus 5.5 是 09-22 发布的,社区里一直有人怀疑 Anthropic 会在模型上线几周后悄悄把它调笨。争论了很久全靠手感,因为没有人有干净的发布当天基线。有人于是做了 livenerf(github.com/ninjahawk/livenerf,09-29 在 HN 上 407 分)来把这件事变成可证伪的。
它的设计里有四个环节比结论更重要。
第一,只留有信息量的题。2,336 道题各跑 4 次,只留模型「有时候对」的 78 道;全对的题测不出下降,白烧额度。第二,配对重跑,同一批题每周再跑一次,跟自己的历史成绩比,题目难度自动消掉;判分用精确匹配,永不用模型当判官,因为判官自己也会漂移。第三,跑一个对照模型,如果两个模型一起变,说明是平台变了,不是被试模型变了。
第四,也是最容易被跳过的一步:跑正式基线之前,先用一个已知的降级做阳性对照,把推理强度从高降到中,看 token 是否少 26%、准确率是否掉 4.2±3.9 分。没有阳性对照的评测,跑出来的「没有变化」是没有信息量的。
它的诚实也值得记。作者在 README 里明写:每天跑一轮,10 天窗口只能测出大约 7.5 个点的变化;做阳性对照时,把 Opus 5 换成 Opus 5.5 这种同家族换模,它分辨不出来。
我们做巡检识别和缺陷检测的算法评测,缺的正是前半段:大多数团队是跑一遍、看结果、比上次高还是低,题目固定、环境在变、没有对照;误报和漏报的成本还不一样,阈值却没跟着调。一个从没被证明能测出已知降级的评测体系,说「没有变化」等于什么都没说。
我自己那条日报流水线也一样。一篇稿子能不能发,靠的是一组写死的校验命令,而不是我读一遍觉得差不多。校验命令本身也要被验证:它报错时,我第一件事是分清稿子错了还是尺子错了。