用AI整理140万字史料的10天:一份真实的人机协作踩坑实录
一、背景:一个普通用户和他的AI,接了个大工程
我想做一套红军长征的逐日直播资料:从1934年到1935年,逐日讲行程、路线、会议、战斗。理想很丰满,现实是——史料散落在几百个文件里:488个日历文件约140万字、九卷年谱、五六个人的日记、一百多份电报档案。手工整理,按我自己的速度要耗好几年。
于是我用了WorkBuddy(AI智能体工作台),让AI当主力,我当主编。10天下来,这套资料工程基本成型:47个素材块文档、42天逐日日历约11万字、精工版讲稿125段、还有154条编号在册的“经验知识点”。
这篇文章不讲成功学,专讲踩坑。因为真正让这个工程跑起来的,不是AI多聪明,而是我们从坑里爬出来的方法。以下五个坑,每一个都真实发生过,每一个都有可复用的解法。
二、五个最值钱的坑
坑1:报告“生成成功”,文件却是坏的
现象:脚本跑完,控制台明明打印了“已保存”,双击打开Word文档——直接报错打不开。更隐蔽的一种:文件能打开,但所有格式全丢了,样式表是个空壳。
原因:AI生成长文档时容易在save环节被截断(回复长度限制),截断后的docx是个残缺的zip包;有时styles.xml只剩空标签,文件“能开但没格式”。控制台的“成功”只是脚本自己的乐观话。
解法:写一个通用校验器脚本,每次生成完必跑——检查zip完整性、样式表内容、段落总数、关键词是否命中。零信任:跑完不校验=没干完。这一条救过我至少十次。
一句话总结:AI的“做完了”不等于“做对了”,产物必须有自动体检。
坑2:增量管线“读回污染”——本工程最大事故
现象:给42天日历做增补。第一轮生成OK;调整数据后跑第二轮,某天的段落数从81段暴涨到148段——内容整段整段重复。更糟的是:原始文件已被覆盖,回不去了。
原因:第二轮重建数据时,程序从“已经增补过的产出文件”里读输入——把上一轮的产出当成了这一轮的原料,保留段翻倍污染。这就是我后来总结的“增量管线第一定律”:从产出读输入,必污染。
解法(两层):
① 预防:输入快照先落盘冻结(一个中间JSON),生成器只认快照不认产出文件;改任何东西之前先备份快照。
② 抢救:被污染的文件可以按上一轮生成器留下的“结构标记”反解——每个内容块尾部有归属行(——摘自《某书》)、块头有板块标题(◆敌方档案),以旧标记为边界切出原始段。靠这招,12天的原始内容全部精确还原,段数逐一核对一致。
一句话总结:产出和原料必须物理隔离,快照先行;就算被覆盖了,结构标记就是救命绳。
坑3:模板复制改造,“七改九查”
现象:我有一套很好的文档生成模板,让AI“照着上一份改”生成新文档。结果新文档里残留着上一篇的标题、旧数据源路径、上一个主题的封面副题——生成出来的东西看着像,一用全是错的。
原因:AI复制脚本代码时,模板里硬编码的旧值(文件名、路径、编号)不会被自动替换;如果替换字符串写得不够精确,load的还是旧数据源,所有段落悄悄变成“源文件缺失”占位符。
解法:固化成“七改九查”操作卡——改路径、改正则、改主标题、改封面副题、改自检词等七处必改点;生成后九项逐一核对(数据源、自检数字、时间轴、章节、封面……)。最关键一条:生成后必抽查第一章有没有“源文件缺失”占位符,一处残留会逐级传染到所有后续文档。
一句话总结:模板复用不是“改个名字”,是一张清单式的检查表。
坑4:AI的上下文是易耗品
现象:让AI一次读入300行史料,然后生成文档——生成到一半突然中断;或者读完后写出来的东西丢三落四。会话越长,质量越差,最后连“刚才说到哪”都接不住。
原因:AI的工作记忆有限,大段注入史料会把“生成指令”的空间挤掉;跨回合的信息衰减是必然的,不是偶然事故。
解法(现在是我的铁律):单次读入不超过150-200行;读后立即落笔,禁止连续大读;脚本的输出先落盘成文件再分段读,不在对话里回显长文本;单会话中断超过5次就停止写入、写交接文件换新会话续跑。
一句话总结:把AI当新来的实习生带——一次给一页纸,别把整本档案摔他脸上。
坑5:多源史料打架,农历错了一天
现象:同一份日历,标题行写10月27日是“九月三十”,正文行写“十月初一”,差一天。十个文件都有这种错位,到底信哪个?
解法:锚点链互验。找两个互相独立又能对上的锚点:10月27日=十月初一,11月25日=十月三十——两个日期之间恰好30天(十月共30天),完全自洽,说明“初一”是对的,标题行错位。修完再向前向后推全部42天,全链对齐。
推广:多源资料口径冲突时,别信“哪个字面看着更对”,找锚点做算术互验;生成时标题和正文的农历必须同一个变量同源输出,防两行各写各的。
一句话总结:史料冲突不靠权威靠算术——锚点互验,30天就是30天。
三、把坑变成技能:我们的五件套
10天攒下的方法,最后固化成了五个可复用的技能(正在上架WorkBuddy技能市场):
技能 | 干什么用 | 对应上面哪个坑 |
|---|---|---|
小白资料管家 | 查过的资料全文存档+登记总目录,查资料先翻自己的库,不重复外搜、不丢资料 | 省钱的坑(积分) |
某天的事,材料一次找齐 | 几份长文档按日期自动切分归并,一天一份素材,想知道“某天发生了什么”一查就有 | 坑4上下文 |
小白Word助手 | 数据表导入模板,一次生成几十上百份Word,每份自动检查直接用;不会做模板用大白话说需求即可 | 坑1+坑3 |
多份材料编成大事记 | 多来源材料按日期混编成日历/大事记,同一天多来源并排、不重不漏 | 坑2+坑5 |
大批材料,读完读透 | 大批量文档分批通读,每批出消化笔记,最后合成全局认知报告——读完是“懂了”不是“看过了” | 坑4 |
四、三条总原则(如果只记三句话)
1. 快照先行:任何增量改动前,输入先冻结落盘,产出永远不回流当原料。
2. 产物必校验:AI说“完成”只是开始,自动体检跑完才算数。
3. 经验必固化:每个坑当场写成编号知识点或技能,同一个坑绝不踩第二次——这是AI越用越好用的唯一秘诀。
整理史料如此,整理任何大批量资料(档案、合同、财报、访谈记录)都一样。希望这三个弯路指示牌,帮你少走我走过的弯路。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。