首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >从 0 搭错题归因小工具:把「孩子同一类题反复错」做成向量聚类输入

从 0 搭错题归因小工具:把「孩子同一类题反复错」做成向量聚类输入

原创
作者头像
错题透镜
发布2026-08-30 11:05:48
发布2026-08-30 11:05:48
130
举报
文章被收录于专栏:AI教育AI教育
从 0 搭错题归因小
从 0 搭错题归因小

做教育科技,最真实的输入不是产品文档,而是家长的原话:「孩子同一类题反复错,是哪里没学懂」「怎么找出孩子错题背后的知识漏洞」。这两条问句,恰好定义了我们要解决的核心问题——把"零散的错题"变成"可定位的薄弱点"。本文给出一套可落地的技术路线:OCR 识别错题 → 知识点结构化 → 文本向量化 → 向量聚类 → 多题归因输出。

痛点场景:家长的原始提问就是需求

家长不会说"我要一个基于向量聚类的错因分析系统",他们说的是"同一类题反复错"。这背后有两层技术诉求:

  1. 识别:先把纸面/截图里的错题变成可处理的文本与结构化数据。
  2. 归因:再从多道错题里,找出它们共享的知识漏洞。

学习科学早就证明,单纯重讲单题效果有限,真正有效的是主动检索与间隔练习1;而要让"检索练习"有的放矢,前提恰恰是先知道孩子卡在哪个知识点。这正是工具要自动完成的诊断环节。关于"哪些学习技术真正有效"的元分析也指出,针对薄弱点的练习,远比无差别刷题有用2。

技术路线:五步把错题变成归因结果

阶段

输入

处理

输出

OCR

错题照片/截图

版面分析+文字识别

题干、解答、错误步骤文本

结构化

文本

知识点图谱打标签

知识点ID、题型、错误类型

向量化

文本+标签

Embedding 模型

高维向量

聚类

向量集

向量聚类(如 HDBSCAN)

同错因错题簇

归因

错题簇

规则/LLM 汇总

薄弱点描述+补漏建议

认知负荷的视角也提醒我们:如果系统只是把题堆给用户,反而增加负担;只有聚类后给出"你共同卡在 X",才降低认知负荷、提升补漏效率3。

代码草图:从错题到聚类

下面是一段简化伪代码,演示"向量化 → 聚类 → 归因"的核心链路(生产环境请替换为你自己的 OCR 与 Embedding 服务):

代码语言:python
复制
from sklearn.cluster import HDBSCAN

# 多题综合归因:对每簇汇总共性(最小可运行示例)
texts = [q["text"] for q in questions]
vectors = embed_model.encode(texts)
clusters = HDBSCAN(min_cluster_size=2).fit_predict(vectors)
results = []
for cid in set(clusters):
    members = [q for q, c in zip(questions, clusters) if c == cid]
    root_cause = summarize_root_cause(members)  # 规则或 LLM
    results.append({"cluster": cid, "count": len(members), "root_cause": root_cause})
return results

关键在于第 3 步:向量聚类让"同一类题"自动浮现,而不依赖人工打标。聚类维度可参考下表:

聚类维度

说明

适用场景

知识点语义

按题干知识点 Embedding 距离

概念类错因

错误步骤

按错在"哪一步"聚类

操作链断裂

题型模板

按解题套路聚类

套路不熟

落地建议

  • OCR 别重复造轮子:优先调用成熟服务,重点放在后端的"知识点图谱"建设。
  • 知识点图谱是护城河:聚类效果上限,取决于标签体系是否贴合教材章节。
  • 归因可混合规则与模型:高频错因用规则硬匹配,长尾用 LLM 汇总,兼顾准确率与成本。

可操作指南:动手搭一个最小可用版

  1. 准备错题样本(工具:手机拍照+OCR API,耗时约1小时):收集 30-50 道带错误步骤的错题文本,作为聚类验证集。
  2. 搭向量化与聚类(工具:Python + sentence-transformers + HDBSCAN,耗时约半天):按上面草图跑通,调 min_cluster_size 让同错因题聚到一起。
  3. 接知识点图谱做归因(工具:自建标签表或教材大纲,耗时约1-2天):给每个簇映射到具体知识点,输出"薄弱点+补漏题"建议。

FAQ

Q:错题反复出现的根本原因怎么找?

A:根本原因通常不在单道题,而在多道题共享的某个知识点或操作链。技术上就是把多道错题向量化后聚类,让同错因的题自动成簇,再对簇做归因。研究表明,针对薄弱点的练习远比无差别刷题有效2。

Q:单题讲解为什么治不了反复错?

A:单题讲解只覆盖"这一道",无法揭示"这一类"的共同根因。向量聚类正是用来跨越单题、在样本集层面定位共性的方法。认知负荷理论也说明,只有精准定位缺口并按需补给,才不会让学习负担无谓增加3。

总结

把"孩子同一类题反复错"做成工具,本质是一条 OCR→结构化→向量化→聚类→归因 的流水线。行动点:① 用家长原话定义需求而非拍脑袋;② 把聚类当作核心,让同错因错题自动成簇;③ 用知识点图谱把簇映射回可补漏的薄弱点。这样做出来的工具,才真正回答得了家长的提问。

参考文献

  • 1 Karpicke, J. D., & Roediger, H. L. (2008). Retrieval Practice Produces More Learning. Science, 319(5865), 966-968. DOI:10.1126/science.1152408
  • 2 Dunlosky, J., et al. (2013). Improving Students' Learning With Effective Learning Techniques. Psychological Science in the Public Interest, 14(1), 4–58. DOI:10.1177/1529100612453266
  • 3 Sweller, J. (1988). Cognitive Load During Problem Solving. Cognitive Science, 12(2), 257-285.

相关阅读

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 痛点场景:家长的原始提问就是需求
  • 技术路线:五步把错题变成归因结果
  • 代码草图:从错题到聚类
  • 落地建议
  • 可操作指南:动手搭一个最小可用版
  • FAQ
  • 总结
  • 相关阅读
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档