HC900。其后重复若干组,每组三段(均以换行分隔;正文内不含裸换行):继承组号:整数,-1 表示不继承;否则为先前某组的下标(从 0 起)。词表行:码=短语|码=短语|…(可空)。短语内 | 写成 ||;短语内换行/回车/反斜杠写成 \n \r \\。正文:一行。短码与字面量直接拼接,码之间无分隔符。'|= 与 \;须前缀无关。码表末 3 字符专作延长前缀:1 字码用其余字符;更长码形如「延长前缀 + 后缀」。正文中:原文 \ → \\,换行 → \n,回车 → \r;单引号 ' → '';若字面段会被误解析为码,则整段用 '…' 括起(引号内不解析码)。解压时结构分隔的 CRLF 归一为 LF。chunkChars 个扩展字形簇(grapheme,不拆 emoji;默认 3000)切分,组内抽重复子串建词表(最多 maxSelectRounds 轮,默认 160)。后组在先前各组中选匹配最多者继承:短语沿链查找——本组已写的码位以本组为准,未写的码位才上溯;匹配且目标短码长度相同则复用该码、不写入本组词表;未继承占用的码位可被新词覆盖。新词按短码档分层排序:各档用统一收益函数 benefitWithVocab(正文节省 − 词表成本)取满该档容量,剩余进下一档;仅当收益为正才收录新词。解压按码位:本组有定义用本组,否则沿继承链查找。得分与收益一律按 UTF-8 字节计。