posseg 的字符级 HMM(256 个 (B/M/E/S × 词性) 状态,6648 字、89290 条发射概率,
gzip+base64 内嵌,DecompressionStream 解压)。分词时先以该模型为热起点,
在你输入的文本上做 MAP-EM(Baum-Welch;M 步把人民日报参数作为 Dirichlet 先验,伪计数 = 先验强度):
文本中高频共现的字串(如反复出现的人名)会把参数拉向自身而被聚成一词并继承词性;
低频内容由先验主导,保持一般切分质量。训练后的模型参数规模与原模型完全相同(同 256 状态转移/发射表),
直接用 Viterbi 切分+标注。非汉字块按规则处理:数字 → m,字母数字串 → eng,其余 → x。