新华书店古典小说价格联盟2024年度白话语料整理工作回顾
2024年度白话语料整理:一场与时间赛跑的工程
每年年末,新华书店古典小说价格联盟的技术团队都要面对一个老问题——白话长篇与白话短篇的语料边界越来越模糊。2024年的整理工作启动时,我们盘点库存发现,仅《三言二拍》系统的异文版本就多达47种,其中12种在句读和断句上存在显著分歧。这不是简单的文本比对,而是关乎后续所有价格模型与推荐算法的基础数据质量。
行业现状比想象中更严峻。目前市面流通的古典小说电子资源,大部分仍以影印本或早期OCR文本为主,文言小说与白话文本混排的现象屡见不鲜。尤其公案小说人情世故类目下,“话本”与“拟话本”的文体特征交错,如果语料清洗不彻底,直接会影响我们对情节密度和人物互动频次的统计——而这些恰恰是评估读者阅读粘性的核心指标。
技术路线:从“人工标引”到“半监督聚类”
今年我们放弃了纯人工校对的老路,改为构建一套基于文体特征的半监督分类流水线。首先用规则模板识别白话短篇中常见的“且说”“话分两头”等叙事标记,再结合CRF模型对神怪小说中特定意象词(如“法宝”“洞府”)做权重标注。这套系统让我们在英雄小说语料上节省了约38%的工时,但真正的转折点在于——将清洗后的语料反向注入价格评估模块,使同类书目的价格离散度下降了15.7%。
- 白话长篇:重点修复章回体衔接处的缺字问题
- 文言小说:保留原文注释,但剥离后人批语
- 公案小说人情:建立“判词-供词-旁白”三级标签体系
选型指南:别让语料库成为“数据孤岛”
很多同行问我们,为什么坚持做全品类整理而不只聚焦畅销书目?答案是交叉检索的价值。比如研究神怪小说中的“渡劫”描写,往往需要参考英雄小说里的“比武”场景来理解武力值设定体系。如果语料库各自为政,算法模型就学不到这种隐喻关联。
对于后续想要开展类似工作的团队,我的建议是:优先保证白话短篇的句读准确率,因为它是训练断句模型的最佳语料;同时,文言小说要单独建索引,别和现代汉语词典混用。
2025年,我们计划将这批整理后的语料开放为API接口,重点支持公案小说人情类目的情感谱系分析。毕竟,当算法能分清“惊堂木一拍”是威慑还是调侃时,新华书店古典小说价格联盟的定价体系才算真正摸到了古典文学的脉搏。