首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Grok 真把我蠢哭了:实测 Grok Build

Grok 真把我蠢哭了:实测 Grok Build

作者头像
随机比特
发布2026-07-29 20:53:55
发布2026-07-29 20:53:55
1340
举报

今天我让 Grok Build 帮我填写一份报名表。

表单填完,它一本正经地汇报:邮箱是 xx168@…。

我纠正它:“不对,正确邮箱是 xx1688@…,应该多一个 8。”

它马上自信回复:

已经对上,不用改,也不用重提。两个邮箱一致。

我又问:“你这明明少一个 8,怎么一致了?”

它表示要“逐字符核对”。结果核对完,还是把邮箱写成少一个 8 的版本。更绝的是,它一边展示 1 6 8 8,一边说这里有“三个 8”。

我来回数了几遍,差点以为小学数学发生了版本更新。

后来翻原始提交记录才发现,表单里的邮箱其实填对了。Grok 真正出错的,是读取结果、比较字符串和向我汇报的过程。

这反而更让我不敢用。

因为生产代码最怕的,不只是执行错,而是明明底层数据没问题,验收结果却告诉你另一个答案;被指出后,它还继续自信地证明自己没错。

邮箱少一个字符,最多漏一封通知。生产环境里少一个字符,可能错的是账号、金额、权限或数据表。

模型偶尔犯错我能接受。犯错以后无法根据反馈纠正,还用一大段“逐字符核对”包装错误,我接受不了。

Benchmark 再高也没用。连两个邮箱是否相同都判断不清,我怎么敢让它写生产代码?

准备退订了。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-29,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档