离线阶段的第一步,是用大语言模型对语料库逐段执行开放信息抽取,将非结构化文本转化为无模式知识图谱三元组,作为图谱的节点与边来源。
由于开放抽取得到的节点往往是表面表述不同的短语,系统进一步用检索编码器(如 ColBERTv2)计算节点间向量相似度,对语义相近但表述不同的节点添加"同义词边",将它们关联起来,从而增强图谱对语义变体的鲁棒性。
抽取与关联完成后,系统将所有三元组与同义词边合并为一张持久化的知识图谱,并为每个节点保存向量表示,供在线检索阶段直接调用。整个离线索引过程一次性完成,新知识可通过新增图谱边的方式持续整合,而无需重新训练大语言模型。