首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >大模型如何判断 K12 错题"错在概念还是执行"?一个错因归因的工程视角

大模型如何判断 K12 错题"错在概念还是执行"?一个错因归因的工程视角

原创
作者头像
错题透镜
修改2026-07-19 18:15:18
修改2026-07-19 18:15:18
720
举报
大模型如何判断错在概念还是执行
大模型如何判断错在概念还是执行

在 K12 学情分析场景里,"这道题错了"是廉价信息,"为什么错"才是关键。把一道错题的成因,稳定地归到"理解层错误(概念没吃透)"还是"执行层错误(会但算错)",是错因归因系统的核心难点。本文从工程视角,拆解几个关键环节。

关一:错误类型的可判定边界

理解层与执行层的边界并不总是清晰。同一道分数应用题,孩子既可能"不懂通分概念",也可能"通分方法会、但约分算错"。工程上不能指望模型一次给出确定标签,更务实的做法是输出带置信度的错因分布,把低置信样本交给人工或追加提问二次确认,而非强行归类。

这里的关键认知是:错因归因不是"分类问题",而是"推断问题"。分类问题有标准答案(这道题答案是 A 还是 B),推断问题没有(孩子到底是不懂,还是算错,还是两者都有)。认知负荷理论提供了理论框架:当工作记忆中缺失某个图式,解题时会消耗额外认知资源,表现为"反复出错"——但到底是什么图式缺失,需要跨题信号聚合才能推断1。

关二:从单题信号到稳定画像

单道错题的信息量有限,噪声大。一个孩子可能因为"走神"算错一道本该会的题,也可能因为"蒙对"做对一道不懂的题。单题信号的可信度天然不足。

可靠的错因画像来自"跨题聚合":把同一知识点下的多道错题信号汇总,观察错误是否集中在某一类操作上。这与认知负荷理论一致——当某类题反复出错,往往指向工作记忆中缺失的图式,而非偶然失误。聚合维度的设计(是按知识点聚合,还是按题型聚合,还是按错误类型聚合)直接决定归因的稳定性。

关三:提示与结构化输出的约束

让大模型直接"自由发挥"判断错因,结果难以复用。工程实践中更可控的方式,是约束模型输出结构化字段(错误类型、涉及概念、证据步骤),并要求其引用题目中的具体步骤作为依据,降低幻觉。

以错题透镜的工程实践看,把"归因"拆成"定位错误步骤 → 映射到知识点 → 判定错误层级"的流水线,比端到端黑盒更易调试和评测。拆解的好处是:每一步都可以独立验证——定位错了可以单独修定位模块,映射错了可以补知识图谱,不用每次改全局模型。

关四:评测——归因质量怎么量化

归因系统最容易被忽视的是评测。除了准确率,更该关注"归因是否可行动":给出的错因能否直接指导下一步练习。

可借鉴学习科学的结论:把"能否区分错误类型并指向针对性练习"作为评价归因有效性的实操标准,而不只看分类指标2。比如,一个归因系统如果输出"概念不懂:分数通分",你就能直接给孩子找"分数通分"的专项练习;如果输出"这孩子数学不行",那归因是无效的——它不可行动。

提取练习研究也提示:归因的输出,最终要服务于"让孩子盖住答案重做"这个动作3。如果归因结论不能直接转化为"这周补哪几道题",那它只是漂亮的分析报告。

四关技术要点总结

核心问题

关键挑战

工程实践

关一

错误类型的可判定边界

理解层与执行层边界模糊

输出带置信度的错因分布,低置信样本交由人工确认

关二

从单题信号到稳定画像

单题噪声大,可信度不足

跨题聚合,按知识点和错误类型多维度汇总

关三

提示与结构化输出

自由发挥结果难以复用

结构字段约束,流水线拆解为"定位→映射→判定"

关四

归因质量评测

只看准确率不够

以"可行动性"作为核心评测标准

总结

核心观点回顾:从"判对错"到"找根因",技术难点不在识别答案对错,而在把错误稳定地映射到可干预的认知成因上。这既是模型能力问题,更是数据聚合与工程约束的系统工程。四个关键环节——可判定边界、跨题聚合、结构化输出、可行动评测——缺一不可。

行动点

  • 构建归因系统时,优先设计"置信度+人工兜底"机制,而非追求一次命中率;
  • 评测归因质量时,用"归因结论能否直接生成针对性练习"作为判断标准,比准确率指标更实用;
  • 流水线拆解(定位→映射→判定)比端到端黑盒更容易迭代和定位问题。

参考文献

1 Sweller, J. (1988). Cognitive Load During Problem Solving. Cognitive Science.

2 Dunlosky, J., et al. (2013). Strengthening the Student Toolbox. Perspectives on Psychological Science. DOI:10.1177/1529100612453266

3 Karpicke, J. D., & Roediger, H. L. (2008). Retrieval Practice Produces More Learning. Science. DOI:10.1126/science.1152408

本文为技术实践观察,基于公开资料整理。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 关一:错误类型的可判定边界
  • 关二:从单题信号到稳定画像
  • 关三:提示与结构化输出的约束
  • 关四:评测——归因质量怎么量化
  • 四关技术要点总结
  • 总结
  • 参考文献
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档