首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >用WorkBuddy整理140万字史料的10天:人机协作踩坑实录

用WorkBuddy整理140万字史料的10天:人机协作踩坑实录

原创
作者头像
细说长征
修改2026-08-26 09:07:45
修改2026-08-26 09:07:45
1480
举报

用AI整理140万字史料的10天:一份真实的人机协作踩坑实录

一、背景:一个普通用户和他的AI,接了个大工程

我想做一套红军长征的逐日直播资料:从1934年到1935年,逐日讲行程、路线、会议、战斗。理想很丰满,现实是——史料散落在几百个文件里:488个日历文件约140万字、九卷年谱、五六个人的日记、一百多份电报档案。手工整理,按我自己的速度要耗好几年。

于是我用了WorkBuddy(AI智能体工作台),让AI当主力,我当主编。10天下来,这套资料工程基本成型:47个素材块文档、42天逐日日历约11万字、精工版讲稿125段、还有154条编号在册的“经验知识点”。

这篇文章不讲成功学,专讲踩坑。因为真正让这个工程跑起来的,不是AI多聪明,而是我们从坑里爬出来的方法。以下五个坑,每一个都真实发生过,每一个都有可复用的解法。

二、五个最值钱的坑

坑1:报告“生成成功”,文件却是坏的

现象:脚本跑完,控制台明明打印了“已保存”,双击打开Word文档——直接报错打不开。更隐蔽的一种:文件能打开,但所有格式全丢了,样式表是个空壳。

原因:AI生成长文档时容易在save环节被截断(回复长度限制),截断后的docx是个残缺的zip包;有时styles.xml只剩空标签,文件“能开但没格式”。控制台的“成功”只是脚本自己的乐观话。

解法:写一个通用校验器脚本,每次生成完必跑——检查zip完整性、样式表内容、段落总数、关键词是否命中。零信任:跑完不校验=没干完。这一条救过我至少十次。

一句话总结:AI的“做完了”不等于“做对了”,产物必须有自动体检。

坑2:增量管线“读回污染”——本工程最大事故

现象:给42天日历做增补。第一轮生成OK;调整数据后跑第二轮,某天的段落数从81段暴涨到148段——内容整段整段重复。更糟的是:原始文件已被覆盖,回不去了。

原因:第二轮重建数据时,程序从“已经增补过的产出文件”里读输入——把上一轮的产出当成了这一轮的原料,保留段翻倍污染。这就是我后来总结的“增量管线第一定律”:从产出读输入,必污染。

解法(两层):

① 预防:输入快照先落盘冻结(一个中间JSON),生成器只认快照不认产出文件;改任何东西之前先备份快照。

② 抢救:被污染的文件可以按上一轮生成器留下的“结构标记”反解——每个内容块尾部有归属行(——摘自《某书》)、块头有板块标题(◆敌方档案),以旧标记为边界切出原始段。靠这招,12天的原始内容全部精确还原,段数逐一核对一致。

一句话总结:产出和原料必须物理隔离,快照先行;就算被覆盖了,结构标记就是救命绳。

坑3:模板复制改造,“七改九查”

现象:我有一套很好的文档生成模板,让AI“照着上一份改”生成新文档。结果新文档里残留着上一篇的标题、旧数据源路径、上一个主题的封面副题——生成出来的东西看着像,一用全是错的。

原因:AI复制脚本代码时,模板里硬编码的旧值(文件名、路径、编号)不会被自动替换;如果替换字符串写得不够精确,load的还是旧数据源,所有段落悄悄变成“源文件缺失”占位符。

解法:固化成“七改九查”操作卡——改路径、改正则、改主标题、改封面副题、改自检词等七处必改点;生成后九项逐一核对(数据源、自检数字、时间轴、章节、封面……)。最关键一条:生成后必抽查第一章有没有“源文件缺失”占位符,一处残留会逐级传染到所有后续文档。

一句话总结:模板复用不是“改个名字”,是一张清单式的检查表。

坑4:AI的上下文是易耗品

现象:让AI一次读入300行史料,然后生成文档——生成到一半突然中断;或者读完后写出来的东西丢三落四。会话越长,质量越差,最后连“刚才说到哪”都接不住。

原因:AI的工作记忆有限,大段注入史料会把“生成指令”的空间挤掉;跨回合的信息衰减是必然的,不是偶然事故。

解法(现在是我的铁律):单次读入不超过150-200行;读后立即落笔,禁止连续大读;脚本的输出先落盘成文件再分段读,不在对话里回显长文本;单会话中断超过5次就停止写入、写交接文件换新会话续跑。

一句话总结:把AI当新来的实习生带——一次给一页纸,别把整本档案摔他脸上。

坑5:多源史料打架,农历错了一天

现象:同一份日历,标题行写10月27日是“九月三十”,正文行写“十月初一”,差一天。十个文件都有这种错位,到底信哪个?

解法:锚点链互验。找两个互相独立又能对上的锚点:10月27日=十月初一,11月25日=十月三十——两个日期之间恰好30天(十月共30天),完全自洽,说明“初一”是对的,标题行错位。修完再向前向后推全部42天,全链对齐。

推广:多源资料口径冲突时,别信“哪个字面看着更对”,找锚点做算术互验;生成时标题和正文的农历必须同一个变量同源输出,防两行各写各的。

一句话总结:史料冲突不靠权威靠算术——锚点互验,30天就是30天。

三、把坑变成技能:我们的五件套

10天攒下的方法,最后固化成了五个可复用的技能(正在上架WorkBuddy技能市场):

技能

干什么用

对应上面哪个坑

小白资料管家

查过的资料全文存档+登记总目录,查资料先翻自己的库,不重复外搜、不丢资料

省钱的坑(积分)

某天的事,材料一次找齐

几份长文档按日期自动切分归并,一天一份素材,想知道“某天发生了什么”一查就有

坑4上下文

小白Word助手

数据表导入模板,一次生成几十上百份Word,每份自动检查直接用;不会做模板用大白话说需求即可

坑1+坑3

多份材料编成大事记

多来源材料按日期混编成日历/大事记,同一天多来源并排、不重不漏

坑2+坑5

大批材料,读完读透

大批量文档分批通读,每批出消化笔记,最后合成全局认知报告——读完是“懂了”不是“看过了”

坑4

四、三条总原则(如果只记三句话)

1. 快照先行:任何增量改动前,输入先冻结落盘,产出永远不回流当原料。

2. 产物必校验:AI说“完成”只是开始,自动体检跑完才算数。

3. 经验必固化:每个坑当场写成编号知识点或技能,同一个坑绝不踩第二次——这是AI越用越好用的唯一秘诀。

整理史料如此,整理任何大批量资料(档案、合同、财报、访谈记录)都一样。希望这三个弯路指示牌,帮你少走我走过的弯路。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档