XUNZI 3.0 · 训练中,开放预览

会调用工具的古籍大模型

新荀子 3.0 以 Qwen3.5-9B 为基座,经预训练 → 指令微调 → 强化学习 → Agentic RL 四阶段训练构建,在保持古文理解能力的同时具备工具调用与多步任务执行能力,可适配 Claude Code、OpenClaw 等自演化智能体框架。

体验智能体对话 查看训练过程

正式模型训练进行中。当前演示环境搭载的是基于 Qwen3.5-9B 的阶段性模型, 能力与最终发布版本存在差异。

四阶段训练过程

训练按顺序执行,前一阶段的产物是后一阶段的起点。四个阶段分别解决「读得懂古文」「听得懂指令」「做得准任务」「用得了工具」四类问题。

阶段一

预训练

在大规模古籍语料上继续预训练,让模型建立对古汉语的底层理解。

  • 掌握古汉语的字词、句法与篇章特征
  • 熟悉经史子集各部的文体差异
  • 缓解通用模型在古文上的分词与语义偏差
读得懂古文
阶段二

指令微调(SFT)

用多任务古文指令数据,对齐模型的任务响应格式与推理路径。

  • 覆盖翻译、断句、标引、抽取等古籍处理任务
  • 习得分步推理的作答方式,过程可核验
  • 输出格式稳定,便于接入下游流程
听得懂指令
阶段三

强化学习(GRPO)

以任务评测指标作为奖励信号,按子任务分别对齐,把「答得像」变成「答得准」。

  • 奖励直接来自 F1、ROUGE 等客观指标
  • 分词、断句、实体识别、关系抽取等子任务分别优化
  • 抑制格式漂移与凭空生成
做得准任务
阶段四

Agentic RL

在带工具调用的多步任务轨迹上训练,形成规划—调用—反思的行为模式。

  • 按规范输出工具调用请求与参数
  • 自行拆解复合任务并按序执行
  • 依据工具返回结果调整后续步骤
用得了工具

完整的训练细节、数据构成与评测结果,将随模型发布的技术报告一并公布。

自演化智能体适配

经过 Agentic RL 训练后,新荀子 3.0 输出稳定的工具调用结构,可作为 Claude Code、OpenClaw 等自演化智能体框架的底层模型,把古籍处理能力接入自动化工作流。

工具调用

按 function calling 规范输出调用请求与参数,支持检索、查库、计算等外部工具接入。

多步任务执行

面对"校勘一段文本并抽取人物关系"这类复合任务,可自行拆解步骤、按序执行并汇总结果。

过程可见

思考过程与工具调用分离输出,每一步的依据可回溯,便于人文研究场景下的结果核验。

Claude Code 适配

面向命令行与代码库场景的智能体形态,适配后可用于古籍数据批处理脚本的自动编写与执行。

规划中

OpenClaw 适配

面向开放式任务编排的智能体框架,适配后可承接古籍检索、整理、问答的长链路任务。

规划中

上述适配能力随正式模型一同开放,接入方式将在发布时公布。

从 1.0 到 3.0

荀子 1.0

古籍领域基座模型与 SikuBERT 系列预训练模型,解决古文"读得懂"的问题。

荀子 2.0

面向分词、断句、实体识别、关系抽取等下游任务的指令微调模型与评测基准。

荀子 3.0

引入强化学习与 Agentic RL,从"处理工具"走向"能自主完成任务的智能体"。

查看 1.0/2.0 时代研究成果