icon Altzin,钱辰飞

Altzin,钱辰飞

可读文本压缩

文件结构(HC900)
首行魔数 HC900。其后重复若干,每组三段(均以换行分隔;正文内不含裸换行):
继承组号:整数,-1 表示不继承;否则为先前某组的下标(从 0 起)。
词表行码=短语|码=短语|…(可空)。短语内 | 写成 ||;短语内换行/回车/反斜杠写成 \n \r \\
正文:一行。短码与字面量直接拼接,码之间无分隔符。

码与字面量
码取打印 ASCII,排除 '|=\;须前缀无关。码表末 3 字符专作延长前缀:1 字码用其余字符;更长码形如「延长前缀 + 后缀」。正文中:原文 \\\,换行 → \n,回车 → \r;单引号 ''';若字面段会被误解析为码,则整段用 '…' 括起(引号内不解析码)。解压时结构分隔的 CRLF 归一为 LF。

压缩语义
原文按每组 chunkChars 个扩展字形簇(grapheme,不拆 emoji;默认 3000)切分,组内抽重复子串建词表(最多 maxSelectRounds 轮,默认 160)。后组在先前各组中选匹配最多者继承:短语沿链查找——本组已写的码位以本组为准,未写的码位才上溯;匹配且目标短码长度相同则复用该码、不写入本组词表;未继承占用的码位可被新词覆盖。新词按短码档分层排序:各档用统一收益函数 benefitWithVocab(正文节省 − 词表成本)取满该档容量,剩余进下一档;仅当收益为正才收录新词。解压按码位:本组有定义用本组,否则沿继承链查找。得分与收益一律按 UTF-8 字节计。
就绪