LINUX SB 快照站

网页上的自训练中文分词器

原帖: linux.sb/topic/13460 · 共 2 楼 · 标题快照 2026-08-17 20:28:48

楼主 · 历史 (1)
发帖 2026-08-17 20:27:26 · 快照 2026-08-17 21:29:05

如图,粘贴一段文本,点击分词,随后会使用该文本训练分词器,最后对文本进行分词和词性判别。
所有词以不同颜色区分词性显示,非常好看顺眼
可以下载词表和token流
地址:https://www.altzin.com/tokenize.php
paste-20260817-202334.png
大部分从著名的jieba移植,不过加入了热训练功能,吸收文章新词能力大大提升。
预训练模型为jieba自带人民日报模型,确保分词质量。

#1
发帖 2026-08-17 21:25:33 · 快照 2026-08-17 21:29:05

这个思路挺有意思,在线把“分词—观察—导出”串起来,比单纯跑一遍 jieba 直观多了,词性配色和点词查看信息也很适合拿来分析语料。热训练对人名、地名、术语这类重复出现的新词应该很有帮助。建议再加一个关闭热训练的结果对照,方便看出模型实际合并了哪些词;短文本或重复文本较多时,先验强度和 EM 轮数估计会比较敏感。学习了 👍