中文句子中词语之间没有空格隔开,机器要理解文本,第一步就是把连续的字串切分成有意义的词语,这正是分词要解决的问题。分词结果的好坏直接影响后续的词性标注、搜索引擎、机器翻译等任务的表现。目前主流的分词方案大致有词典匹配、统计模型和深度学习三条技术路线,理解它们各自的原理和适用场景,才能在实际项目中做出合理选择。
词典法的核心是准备一份足够完整的词库,然后通过扫描文本、与词条逐一比对的方式完成切分。这种方法的突出优点是实现简单、运行速度快,非常适合对响应时间敏感或资源受限的场景。按照扫描方向的不同,常见的变体有三种。
正向最大匹配从句子开头选取最长匹配词,例如“研究生命起源”会优先切分为“研究/生命/起源”,从而避免“研究生/命/起源”这类错误。逆向最大匹配则从句子尾部开始处理,在遇到“他说的确实在理”这类顺序歧义时通常表现更稳定。双向最大匹配则同时运行前向和后向算法,再根据词频等规则对差异结果做出取舍,准确率相对更高。
判断标准:如果项目语料规模不大、对延迟要求高、又没有标注数据可供训练,词典法无疑是性价比最高的选择。需要注意,词表必须持续动态更新,随时补充新出现的网络热词、人名地名和行业术语,否则遇到未登录词时准确率会明显下滑。
统计方法不再依赖固定词表,而是从大规模标注语料中挖掘字与字之间的共现规律。隐马尔可夫模型和条件随机场是这条路线最具代表性的两个模型。
HMM将分词视为序列标注问题,给每个汉字标注词首、词中、词尾或单字等位置标签,再利用维特比算法求出概率最高的标注序列。CRF则更进一步,允许相邻特征之间存在相互依赖关系,打破了观察独立性的限制,在处理复杂词边界时展现出更强的稳健性。
这类方法的显著优势在于具备新词发现能力。比如“盲盒经济”如果在一段时间内反复共现,模型便会逐渐学会把它聚合为一个整体词。但是,这要求训练语料规模庞大且与目标领域高度匹配,同时训练和推理的计算成本也远高于词典法,需要做好资源规划。
近年来,深度神经网络逐渐成为分词研究和工程应用的主流方向。其中双向长短期记忆网络(BiLSTM)和基于Transformer的预训练模型应用最为广泛。
BiLSTM能够同时读取上下文信息,具备建模较长距离关联的能力。而BERT、RoBERTa等预训练模型在超大规模无标注文本上经过自监督学习后,已经积累了丰富的语义知识,只需在输出端接入分类层进行微调,就能在大量标准评测中取得领先表现。
以“南京市长江大桥”为例,深度模型能够结合语境理解“南京市”修饰“长江大桥”的语义关系,给出“南京市/长江大桥”的正确切分,而不是陷入“南京/市长/江大桥”的常见错误。这种语义理解能力是词典法和传统统计方法都无法实现的。
不过深度模型的短板主要体现在工程层面:模型体量大、GPU推理耗时长、内存占用高。在移动端或毫秒级响应的应用场景中,通常需要借助知识蒸馏、权重剪枝或模型量化等手段来进行压缩提速。
在实际的生产环境中,单一算法往往难以同时兼顾效果和成本,因此工业界普遍采用多级融合的混合架构来平衡不同需求。
在具体选型时,可以遵循几条基本参考:如果处理的是短文本且要求毫秒级响应,优先考虑词典法;如果语料资源充足且对未知词识别有较高要求,则适合选择统计模型;若追求顶尖的分词准确率且具备GPU资源,优先采用深度模型微调方案。无论选择哪种路线,都要结合数据规模、硬件条件和业务目标综合权衡,必要时通过混合架构取长补短。
可以。二者并不矛盾,反而常常互补。常规做法是用词典法先快速覆盖大多数常见词,再对无法匹配或存在歧义的部分交给统计模型进一步处理,这样能在速度和准确率之间取得很好的平衡。
分词质量不佳的常见原因有三类:一是词典法遇到大量未登录词或领域新词;二是统计或深度模型训练语料与目标文本领域不匹配;三是没有针对特定场景制定专用规则,比如对产品名称、基因序列等特殊文本进行保护。逐项排查这些原因,往往就能找到改进方向。
对于小规模项目,建议优先选择基于词典并附带简单统计扩展的成熟开源工具,如包含核心词表且支持用户自定义词典的通用分词库。这样可以快速上手,同时通过加载业务领域词表来提升准确率,并且无需承担深度模型的算力成本。
中文分词的技术演进经历了从词典匹配到统计建模,再到深度学习的过程,三条路线各有优劣。实际选型时不必追求最先进的技术,而应根据数据储备、计算资源和响应需求做出务实的判断。建议先明确业务场景的约束条件,再用小规模样例做对比评测,最后结合混合架构的思路,让分词模块在准确率、速度和成本之间达到最优平衡。