今早掘金热榜上并排出现了两篇文章,标题放在一起看很有意思:一篇是《AI 给了我 8 个优化方案,全都是对的,但没有一个有用》(作者 东东拿铁,截至今早 8:52 快照 539 阅读、16 赞),另一篇是《我让 AI 当面试官面了我一轮:第 3 个追问我就卡住了》(作者 kyriewen)。 两篇场景完全不同——一个给陌生系统做性能优化,一个拿简历拷问自己——却撞在了同一个点上:AI 让"答案"变得极其便宜,却没有让"该信哪个答案"变得更便宜。 这恰好是 2026 年人机分工那条真正的分界线。 一、一个真事:8 个方案全对,0 个有用 东东拿铁接手了一个陌生项目,用 AI 花一天读懂业务、术语与状态流转。然后他遇上正事:系统要在本地处理一个 1G 左右的大文件再上传到文件服务器,整条链路耗时很长。他把问题交给 AI 分析性能瓶颈,AI 很快给出一批方案——加并行处理、优化图片转换、从打包和磁盘读写下手、甚至重调整体架构,每个方案都有完整理由,从问题分析到技术实现都说得通。 麻烦就在这里:他鉴别不了哪个方案击中了当前瓶颈,哪个只是理论上可以优化。 他的总结很准:以前没有答案时觉得困难,现在困难没消失,只是换了样子——原来不知道有哪些方案,现在不知道该信哪个方案。 二、换更强的模型,并不会让判断变便宜 他起初以为问题出在模型不够强,于是换了更强的模型(文中写的是 GPT6)重试。结果差别不大:问题仍没被准确定位,更强的模型只是生成了更多、论证更充分的答案。 于是他不再追问模型,而是把整条图片处理流程重看一遍,在每一步加日志观测。日志告诉他:耗时最长的是打包环节,差不多用了十分钟;原因不是算法也不是架构,而是一个文件里十几万张图片,系统每读一个文件都要做一次磁盘寻址。 这是文件太碎的问题。 他直接从文件数下手,整个流程耗时缩短约 80%。而他之前问 AI 的那些方案,没有一个碰到这个点。关键在于它们不算错:它们一直在回答他最初提的那个问题。是他自己不知道瓶颈在哪,也就没能力把瓶颈告诉 AI。 他的结论是,AI 解决不了"定义问题",因为定义问题需要的不是知识,而是跟现实的接触面——你得看到真实数据、被事实撞一下脸。 三、另一场拷问:机制推得出,验证没跑过 第二篇换了视角:作者让 AI 扮演十二年经验的前端面试官,一次只问一个问题、同一主题至少连追两层、只认数字和口径。九个问题没有一道聊天题,第一个主题还没面完,第三问他就交出了"这个数据我没有"。两处细节最说明问题: · 数字拆不开:他报出 LCP 从 p75 4.2 秒压到 2 秒上下,被追问"三刀各贡献多少毫秒、用什么数据拆出来的"时答不上——只有总账,没有毫秒级拆分;更麻烦的是 LCP 元素本身从图表 canvas 换成了表格首屏行,真实提速和口径变化混在一起,拆不干净。再被要求换一个与 LCP 无关、且含中低端机与弱网数据的指标时,他只有 lab 口径的 TBT,真机弱网没测过。 · 规模算账:他最顺的那句"选中行 = URL 唯一源",被"3000 条数据 × 60 页"当场推翻——每个 id 加分隔符约 11 字符,3000 个就是约 3.3 万字符的 query,越了浏览器安全线(约 2000 字符)一个数量级。 面试官最高频的一句评价是"机制我推得出、验证我没有",出现了四次;收尾那句最扎心:"你离高一档差的不是认知,是证据。" 四、分界线在哪:三件 AI 替你干不了的事 第一,定义问题。 AI 擅长在给定问题下穷举方案,但"问题到底是什么"要靠你和现实的接触面。东东拿铁加日志前后用的是同一个模型,帮助却完全是两个量级——变的不是模型,是他带进去的东西。 第二,口径与归因。 一个数字的硬度,取决于它被拆开验证的程度和口径无关的程度。只报总账、只报单一环境,等于把故事当数据。 第三,有后果的动作要"同一次求值"。 那场面试逼出的一个真问题很典型:"全选"到底是勾选那一刻的快照,还是导出那一刻的谓词?作者的答案是:谓词管编辑期、快照管提交期,用户看到的、后端算的、实际发生的必须是同一次求值。这类一致性判断,目前还得由人拍板。 同一份热榜里还有一篇用 40MB 离线模型在网页端自动抠图(作者 半刻维度):`@imgly/background-removal` 1.7.0 在浏览器里跑 ISNet ONNX 模型,按 WebGPU → WebGL → WASM 自动降级,作者用 AMD5500 的老机器加 40MB 模型一次抠图 8 秒多,图片不离开本机。把"跟现实接触"挪到本地、挪到你能观测的地方,成本和隐私都会更可控。 五、把分工落成一份可执行清单 1、先问现实,再问模型:手上有没有一份日志、一个真实数字、一次可复现的现象? 2、把问题写成可验证的句子:"提升效率"不是问题,"打包环节因小文件过多耗时十分钟"才是。 3、要求 AI 给可证伪的选项:每个方案附上"如果它成立,应该观测到什么"。 4、数字必须能拆,并能换口径复算:谁贡献了多少、怎么排除口径变化被算成战绩;至少再补一个与主指标无关、含低端机/弱网等差环境的指标。 5、有后果的动作,确认三方同一次求值:用户看到的、后端算的、实际发生的。 6、验收前问一句:我的断言证明的是"没炸",还是"到位"? 结语 2026 年,模型还会继续变强,"答案"只会越来越便宜。真正稀缺的东西反而更贵了:定义问题、设计口径、判断证据、为有后果的动作做一致性决定。 就像东东拿铁在那篇文末写的——当所有方案都看起来合理的时候,先别急着选,关掉对话框,回到现实里分析。要练的不是怎么问得更好,而是在打开对话框之前先想清楚:我准备问的这个问题,是不是问题本身。 参考链接 《AI 给了我 8 个优化方案,全都是对的,但没有一个有用》:https://juejin.cn/post/7686327764182745114 《我让 AI 当面试官面了我一轮:第 3 个追问我就卡住了》:https://juejin.cn/post/7686341072616652838 用 40MB 离线模型在网页端自动抠图:https://juejin.cn/post/7686043275371282466
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。