研究成果 / 限定域关系抽取与 GraphRAG
Research on Graph-Retrieval Augmented Generation Based on Historical Text Knowledge Graphs
GraphRAG 知识图谱 知识抽取 过程监督 大语言模型
| 作者 | 杨帆、张琪、邢文倩、刘畅、刘浏(通讯作者) |
|---|---|
| 机构 | 南京农业大学信息管理学院;山西大学经济与管理学院 |
| 资助 | 江苏省社会科学基金项目(No. 24TQB004) |
| 代码与数据 | GitHub · Relation-extraction-of-The-First-Four-Histories |
通用大模型缺乏古籍领域知识,处理史籍时容易产生"历史幻觉"。本研究提出 GraphRAG 框架, 把思维链提示、自指令生成与过程监督结合起来,以极少的人工标注构建"前四史"人物关系数据集, 再让知识图谱与检索增强生成协同工作,提升通用模型与史籍知识的对齐程度。
复用历史文献多维知识描述本体模型,抽取人物关系相关概念并重构分类体系,形成古籍人物本体, 涵盖人物、地点、官职、爵位、社会组织等实体类型。语料取自"前四史"(史记、汉书、后汉书、三国志)原文, 按篇幅比例随机抽取 5000 段,由两名标注员独立标注:实体边界一致性 κ = 0.87,关系类型一致性 κ = 0.81, 分歧由第三方仲裁。
将史籍关系抽取过程拆解为五步——译为现代汉语、命名实体识别、语义关系分析、关系框架构建、三元组抽取, 据此设计思维链提示,并与 5-shot 提示对照。使用 Self-Instruct 技术, 以 Qwen2-72B-Instruct 在标注数据上生成 5000 条结构化推理链,按 9:1 划分训练与测试集。
针对五个推理步骤分别设置扣分制评分规则,每步满分 2 分、总分 10 分, 以微调后的荀子模型作为评分奖励模型,对自动抽取结果做动态打分与筛选, 形成"抽取—评分"双模型自动化管线。
系统由知识存储、检索器、生成器三部分组成。三元组入 Neo4j 图数据库; 检索器用大模型解析问题中的实体,结合人物别名词典扩展检索范围 (如"曹操"扩展至"魏太祖""孟德""阿瞒"等), 经 GraphCypherQAChain 转为 Cypher 查询取回三元组,再做向量相似度排序取 Top-K; 生成器把三元组转写为自然语言注入提示,图谱知识不足时明确拒答以避免编造。
配对 t 检验 t(11) = 2.943,p = 0.013。古文语义稀疏,示例难以覆盖句法、互文与典故, 显式化推理过程比模式模仿更有效。
t(5) = 8.885,p < 0.01。繁体在语料覆盖、分词切分与字形三个方面均处劣势。
Xunzi-Qwen1.5-14B 取得 F1 = 0.68,ROUGE-1/2/L 分别为 0.97 / 0.94 / 0.96; GPT-4o 与 DeepSeek-R1 分别只有 0.28 与 0.23。
69.79% 的抽取结果评分在 6 分以上;低分样本的主要错误为译文错误 38%、 三元组缺漏 29%、schema 误用 20%、实体边界偏移 13%。
DeepSeek-R1 接入 GraphRAG 后,在 C-CLUE 开放域数据集上 F1 提升 0.11; 人工核查 100 条回答,幻觉率由 76% 降至 35%。
在消费级笔记本(i5 + 16GB 内存)上运行 Neo4j 与检索链路, 平均查询延迟 6.84 秒,峰值内存 6GB。
模型对低频实体、隐晦典故与一词多义仍存在偏差;仅以"前四史"训练可能放大其固有史观与时代局限; 评分模型基于现代语义,存在"以今释古"的误判风险。后续将引入领域专家迭代审校图谱, 并向用户透明呈现模型的不确定性。