RESEARCH
围绕"如何让大模型可靠地读史籍"这一问题,团队形成了三项相互衔接的研究: 先在预定义 schema 下做关系抽取并构建 GraphRAG,再突破 schema 限制走向开放域, 同时从人物指称消歧一侧解决实体对齐问题。
限定域 · 基础
在 35 类预定义关系下抽取"前四史"人物关系,构建 Neo4j 知识图谱并接入 GraphRAG 问答。
F1 = 0.68Xunzi-Qwen1.5-14B
开放域 · 进阶
取消预定义 schema,用推理蒸馏冷启动 + 细粒度规则奖励模型 + GRPO 强化学习完成对齐。
F1 = 0.83DS-R1-Distill-Qwen-14B
实体对齐 · 并行方向
三智能体协同将史籍人物指称链接到 CBDB 知识库,融合文本相似度与大模型语义评分。
Recall@5 = 0.908Qwen3-32B
三者关系:研究一确立了"抽取 → 建图 → 检索增强生成"的基本管线; 研究二在此基础上取消 schema 约束、引入强化学习,把知识覆盖度从预定义关系扩展到长尾关系; 研究三处理的是前两者共同面临的遗留问题——同一人物在史籍中以姓名、字号、谥号、官职等多种形式出现, 必须先消歧才能保证图谱节点的唯一性。
王东波、朱丹浩、许乾坤 著,南京大学出版社。 全书 14 章,从古籍信息处理研究综述出发,系统呈现 SikuBERT 预训练模型、荀子生成式基座大模型、 ACHBench 评测基准,以及分词、断句标点、命名实体识别、关系抽取、自动分类、自动摘要、 互文发现等任务的研究成果,末章展望古籍智能体研究。可视作荀子 1.0 与 2.0 时代的成果总集。
本站仅展示各章研究内容摘要,全文以正式出版物为准。