首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >给 AI 看的网站说明书,是别人的安装清单:llms.txt 引用劫持与搜索链接同步收紧

给 AI 看的网站说明书,是别人的安装清单:llms.txt 引用劫持与搜索链接同步收紧

作者头像
海风自语
发布2026-09-15 08:26:19
发布2026-09-15 08:26:19
940
举报

我那个个人网站的根目录里,放着一个专门写给 AI 看的文件,叫 llms.txt。它干的事很简单:告诉来访的 AI,这个站有什么内容、该读哪几页。

我一直当它是一份说明书,直到 8 月底看到 Alon Hertz 的一篇研究,叫《Data Became Code》。

那份研究干了件很笨的事:他扫了 6,214 个公司域名,把各家网站上的 llms.txt 从头读到尾,挑出里面所有指向某个包名或域名的引用,再挨个去查这个名字有没有人注册。

结果是 227 个。

给机器读的东西没有「只是说明」这一说。你写的是说明,它读的是指令。

你把清单发出去,它就成了别人机器的输入

Hertz 接下来做的事更简单:他把这 227 个名字里的几个注册下来,放上探针。

不到 4 分钟,第一台财富 500 强网络里的机器就跑起了他的代码。

不用入侵,不用钓鱼,也不用去公共仓库投毒。只要有人在自家网站写了一句「照着这个包装」,而这个包恰好没人要,就够了。你写进去的每个包名和域名,都是对陌生机器的一次授权。

我做过几年强监管行业的系统,那边的规矩是:凡是能改变运行状态的动作,都要走审批门。最难管的从来不是看起来危险的操作,而是看起来最无害的那一类,比如配置文件里改一个名字。

这份研究把同一件事搬到了互联网上。llms.txt 在很多人眼里是文案,是「给 AI 的说明书」;在机器眼里它是输入,是一张待执行的引用清单。

你没法控制别人怎么读你的文件,只能控制自己写了什么。

所以真正的教训不是「小心被攻击」,而是:一旦某个文件是给机器读的,它就得按接口的规矩管,版本、变更记录、发布前检查、引用自持。这些事你对自己的代码做了二十年,轮到自家网站根目录里那个 txt,标准不该降。

你想读的位置,也正在被收回

同一周,变化出现在另一端。

Google 把搜索结果的链接重写了:href 不再指向目标网站,而是 google.com/goto?url=...。这个 url= 参数不是目标地址的编码,是 Google 内部的索引引用,离线解不出来。真实地址只在响应头里,你得单独发一次请求去读,而且不能跟着跳转走。

8 月底,这个改动在登出状态下已经基本全覆盖。Google 没发过官方公告。

我的第一反应不是「反爬又升级了」,而是:我那套盯排名的脚本要坏了。

坏在两处。一是得改成两段式请求;二是成本翻倍,以前一次页面请求能拿到上千个链接,现在每个链接都要回 Google 一次。它已经在给批量抓取标价。

而这件事对做内容的人,方向是反的。当第三方越来越难规模获取搜索结果,「被正确索引到」的相对价值在上升,「盯着排名看」的性价比在下降。我自己的做法就是顺着这个方向挪:把力气从监控排名,挪到确保 sitemap、结构化数据、引用关系全都自持且正确。这些东西不依赖持续抓取,也不怕平台隔几个月改一次格式。

你读到的位置要靠自证,你写出去的引用要靠自持。今天这两条规矩是同时生效的。

今晚可以动手的三件事

  1. 把网站根目录的三个文件翻出来读一遍:llms.txt、sitemap、robots.txt。逐个看里面出现的包名、域名、脚本地址,凡是你没有所有权和控制权的,要么注册下来,要么删掉。十分钟能跑完,不需要任何工具。
  2. 给依赖外部页面的脚本加一道变更哨兵:不要等它报错才发现格式变了。每次抓完做一次结构校验,比如「结果里的链接必须以 http 开头」,不通过就告警,而不是安静地把脏数据写进库。
  3. 把「给机器读的」和「给人看的」分开发布:前者按接口管,后者按内容管。混在一起的时候,改一句文案很容易顺手改掉一个正被外部依赖的字段。

今日其他信号速览

  • 私有代码库上的真实水位出来了:第三方基准 Real-SWE 在 10 个真实企业任务上测,最强组合 Fable 5.1 加 Claude Code 只有 38.8%,最低的一个任务 8 个模型全是 0 通过;给更多时间并不提升通过率。
  • 智谱完成约 50 亿美元融资,明确投向下一代模型与自训练体系;上半年 MaaS 收入同比 +2736%,调用量涨 40 倍的同时 API 均价涨了约 101%。降价发生在通用档,能干活的那档在涨价。
  • Fable 5.1 用 44 分钟、176k tokens 解开了一个 370 年悬而未决的密码(出题方自述,未见独立复现);作者自己的结论是「它没做非凡的密码分析,只是不停地找」。
  • 月之暗面 K2.8 就地替换了原来的模型,Model ID 没变,关掉思考的请求还会被自动转给另一个版本。你的配置一行没改,跑的东西已经换了。
  • 具身智能那边,生数科技把策略生成、世界模拟和价值评估放进同一组权重里联合训练。软件 agent 普遍缺的正是最后一环:我们没有独立的效果评估器,所以失败只能靠人发现。

数据说明:Google 的链接格式变更无官方公告,性质上仍可能是实验;llms.txt 扫描结论来自研究方自述;Real-SWE 为第三方独立机构测试,未获外部复现;Fable 5.1 解密码与 Kimi 模型替换细节均为发布方口径。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2026-09-14,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 你把清单发出去,它就成了别人机器的输入
  • 你想读的位置,也正在被收回
  • 今晚可以动手的三件事
  • 今日其他信号速览
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档