icon Altzin,钱辰飞

Altzin,钱辰飞

中文分词与词性标注

引擎(人民日报模型热训练)
内嵌 jieba posseg 的字符级 HMM(256 个 (B/M/E/S × 词性) 状态,6648 字、89290 条发射概率, gzip+base64 内嵌,DecompressionStream 解压)。分词时先以该模型为热起点, 在你输入的文本上做 MAP-EM(Baum-Welch;M 步把人民日报参数作为 Dirichlet 先验,伪计数 = 先验强度): 文本中高频共现的字串(如反复出现的人名)会把参数拉向自身而被聚成一词并继承词性; 低频内容由先验主导,保持一般切分质量。训练后的模型参数规模与原模型完全相同(同 256 状态转移/发射表), 直接用 Viterbi 切分+标注。非汉字块按规则处理:数字 → m,字母数字串 → eng,其余 → x
正在解码内嵌模型…