RESEARCH

史籍知识的抽取、链接与生成

围绕"如何让大模型可靠地读史籍"这一问题,团队形成了三项相互衔接的研究: 先在预定义 schema 下做关系抽取并构建 GraphRAG,再突破 schema 限制走向开放域, 同时从人物指称消歧一侧解决实体对齐问题。

研究脉络

三者关系:研究一确立了"抽取 → 建图 → 检索增强生成"的基本管线; 研究二在此基础上取消 schema 约束、引入强化学习,把知识覆盖度从预定义关系扩展到长尾关系; 研究三处理的是前两者共同面临的遗留问题——同一人物在史籍中以姓名、字号、谥号、官职等多种形式出现, 必须先消歧才能保证图谱节点的唯一性。

团队专著

《数字人文下的古籍智能信息处理研究》封面

数字人文下的古籍智能信息处理研究

王东波、朱丹浩、许乾坤 著,南京大学出版社。 全书 14 章,从古籍信息处理研究综述出发,系统呈现 SikuBERT 预训练模型、荀子生成式基座大模型、 ACHBench 评测基准,以及分词、断句标点、命名实体识别、关系抽取、自动分类、自动摘要、 互文发现等任务的研究成果,末章展望古籍智能体研究。可视作荀子 1.0 与 2.0 时代的成果总集。

按时间轴浏览研究成果

本站仅展示各章研究内容摘要,全文以正式出版物为准。