研究成果 / 开放域关系抽取与强化学习
Reasoning Distillation and Rule-Guided Reinforcement Learning for Open-Domain Knowledge Graph Construction in Low-Resource Domains
开放域知识图谱 低资源文本 推理大模型 关系抽取 强化学习
| 作者 | 刘浏、杨帆、刘畅 |
|---|---|
| 机构 | 南京农业大学信息管理学院 |
| 资助 | 国家社会科学基金一般项目(No. 25BTQ026);江苏省社会科学基金一般项目(No. 24TQB004) |
法律文书、电子病历、古籍文献这类"低资源高歧义"语料缺乏大规模标注、语义歧义又高, 大模型处理时极易出现事实性错误。本研究以中文史籍为试验场,提出一套融合推理蒸馏、 细粒度规则与强化学习的开放域知识图谱自动构建框架。
从二十四史中选取 1000 段语义密集的文本,以 DeepSeek-R1 作为教师模型, 用无约束的思维链提示生成推理轨迹,让模型自然产出推理步骤与 SPO 三元组, 形成冷启动训练集,绕开人工标注的高昂成本。
设计五维度扣分制评分体系——回答格式规范性、实体识别准确度、关系逻辑合理性、 schema 格式校验、三元组完整性,每维 2 分、总分 10 分。 由 DeepSeek-R1 对 200 个样本打分并经人工校准(Kappa = 0.68),得到 250 条高质量评分数据集。 在此数据集上微调后,Qwen2.5-14B-Instruct 的评分准确率最高(82.9%),被选为自建奖励模型。
| 模型 | 评分准确率 |
|---|---|
| Qwen2.5-14B-Instruct | 82.9% |
| DeepSeek-R1-Distill-Qwen-14B | 77.2% |
| QwQ-32B | 63.3% |
先用冷启动数据对五个模型做监督微调,再分别引入 GRPO 与 DPO 做对齐训练: GRPO 把自建奖励模型接入奖励函数并约束推理格式,DPO 则用评分 8–10 分的抽取结果作为正样本、 低分结果作为负样本构造偏好数据。训练使用 Swift 框架, 实验环境为 8×A800(CUDA 12.2),最大序列长度 4096,LoRA 微调。
在 cclue(天津大学)、CHisIEC(北京大学)、qiansishi 与 shiji(南京农业大学)四个测试集上评测, 每集随机抽取 200 条带参考答案的样本。除 F1、ROUGE-1/2/L、BLEU 外, 另定义 Score(单测试集四项指标均值)与 CWS(按各集实体关系类别占比加权的综合得分)。
冷启动阶段出现一个反直觉现象:参数规模与性能并非严格正相关。 DeepSeek-R1-Distill-Qwen-14B 在关键指标上全面超过其 32B 版本, CWS 达 0.65(32B 为 0.62)。样本极度稀缺时,小参数模型收敛更快、领域适配效率更高。
| 训练阶段 | F1 | ROUGE-1 | ROUGE-2 | ROUGE-L | Score | CWS |
|---|---|---|---|---|---|---|
| 冷启动 | 0.61 | 0.73 | 0.60 | 0.70 | 0.66 | 0.65 |
| 冷启动 + DPO | 0.64 | 0.76 | 0.62 | 0.72 | 0.69 | 0.68 |
| 冷启动 + GRPO | 0.72 | 0.84 | 0.73 | 0.80 | 0.77 | 0.77 |
GRPO 的增益始终优于 DPO。史籍关系抽取是格式与逻辑约束都很强的任务, 基于规则扣分的 GRPO 比基于偏好排序的 DPO 更能约束生成空间。 DPO 对奖励信号质量高度敏感——换用自建奖励模型后部分模型出现性能倒退; GRPO 借助组内相对优势机制平滑了评分噪声,在低资源场景下更稳健。
更关键的结论是:自建奖励模型可以替代昂贵的教师模型 API。 对 DeepSeek-R1-Distill-Qwen-14B,自建奖励模型带来 0.31 的 CWS 增益, 略高于 DeepSeek-R1 API 的 0.30。
用最优配置(DeepSeek-R1-Distill-Qwen-14B + GRPO)对前四史全文做抽取, 再用词向量模型对实体与关系指称聚类、由大模型识别主指称并人工校准, 形成同义指称词典完成知识融合,最终入 Neo4j。
八千余种实体类型、近一万六千种关系类型,正是开放域图谱与传统限定域图谱的根本差别: 模型不再受狭窄的预定义 schema 约束,得以捕捉史籍中长尾、细粒度、非标准化的语义关系。 实体类型中"人物"出现 47,966 次占绝对主导,其次为地点(10,179)与官职(7,198), 与纪传体史书"以人系事"的编纂体例高度吻合。
把该图谱接入前期研发的 GraphRAG 对话系统,让模型回答 300 道中学历史题。 引入 GraphRAG 后,判断题 F1 由 0.65 升至 0.68,单选题 F1 由 0.93 升至 0.95, 其中单选题 0.95 的成绩超过了 671B 参数的 DeepSeek-R1。 简答题的 ROUGE/BLEU 基本持平甚至略降——图谱补充了参考答案之外的史料细节, 信息密度提高但与参考文本的字面重合度下降。
案例分析中,基线模型被问及"汉宣帝最宠爱的贵妃"时答成了汉章帝,属典型的长尾知识幻觉; GraphRAG 增强后不仅给出许平君这一正确结论,还同步呈现了各嫔妃的家族关系与宫廷事件时间线。
图谱在实体对齐与关系归一化上仍显粗放,后续将把实体链接与本体约束直接写入强化学习奖励函数, 从源头提升概念一致性;同时将构建更大规模基准数据集,引入 BERT 类小参数模型作对照组, 量化本框架在不同数据量下的边际收益与成本优势。