

最近有一股风气,两个极端。
一边是"国产 AI 已经全面超越 GPT,外国佬完了"。
一边是"国产 AI 不行,用了就是自废武功"。
这两句话,我都不信。
我的做法是:自己实测。
我最近用 Kimi K3 从零跑通了一个自动化脚本项目,整个流程从需求拆解到最终运行。
结论:能力确实已经摸到第一梯队;但如果你全程放任它自己跑,它也会让你结结实实踩三个大坑。

官方公布的 Coding Benchmark 数据里,K3 在 DeepSWE 上拿了 67.5,和 GPT-5.5 的 67.0 基本持平,比 Claude Opus 4.8 的 59.0 高一截。
位置在了,但 benchmark 是位置,真实项目才是落地能力。
下面说说实测里三个差点让我头破血流的真实场景。
项目跑到一半,AI 生成的脚本在我的终端报了个奇怪的错:
FileNotFoundError: [Errno 2] No such file or directory: '/data/config/agents.md'我检查了半天,文件是存在的,路径看着也没问题。
直到我意识到:AI 在 Windows 系统上写了一个 Linux 格式的斜杠路径。
/data/config/agents.md 在 Linux 是合法路径,在 Windows 根本找不到。
更要命的是,有时候它拼接路径用了字符串拼接而不是 os.path.join,在不同系统上跑结果不一样,随机爆炸。

应对方案
在你的项目里加一个 AGENTS.md 规则文件,明确写上:禁止硬编码斜杠路径,必须用 os.path.join 或 pathlib.Path。把约束写进规则,AI 才会遵守。
AI 给我写了这么一行:
result = data.encode_to_custom_format()语法完美,逻辑流畅,注释齐全。
一跑,直接报 AttributeError:str 对象根本没有 encode_to_custom_format 这个方法。
这就是"幻觉"。
AI 凭空虚构了一个不存在的函数,但它写出来的时候完全不会给你任何警告,语气跟真的一模一样。

这就是为什么,永远不能让 AI 写完代码你就直接放进生产环境。
每一段关键逻辑,都需要你自己跑一遍验证。
识别信号
当 AI 给你写了一个你没听说过的方法名,第一反应不是"哇好厉害",而是"这东西真的存在吗",查一下官方文档。
一个 Bug 改了两次,还没修好。
第三次修改时,AI 开始病急乱投医,把旁边一个本来运行正常的模块也给改掉了。
结果新 Bug 和旧 Bug 叠在一起,彻底乱了。
这不是 AI 变笨了,这是上下文窗口"脏了"——前面的对话信息太多,AI 开始顾此失彼。
遇到这种情况,唯一正确的做法是:
立刻停止继续改,回到上一个能正常运行的版本(这就是为什么我强制要求每次改代码前必须 git commit),开一个新的对话窗口,重新描述问题。
不要指望靠继续对话把它"聊回来",上下文已经乱了,只会越来越乱。
不搞复杂的,三句话:
第一:写一个 AGENTS.md 规则文件,把跨平台路径、禁止瞎猜、遇事不决主动问这些约束全写进去,放在项目根目录。
第二:每次改动关键代码前,先 git commit 一次。随时有退路,才敢让 AI 大刀阔斧地改。
第三:同一个 Bug 超过 2 次没解决,立刻换新对话重来,不要死磕。
这三个动作加起来,不超过 10 分钟配置成本。
但它们能帮你避掉 90% 的踩坑场景。
你在用 AI 写代码或者处理任务的时候,遇到过什么奇葩大坑?是幻觉、是路径、还是把好的代码也改乱了?