平时下到的一些 TXT 小说里,经常会夹着下载站广告、网址、水印之类的东西。
少的时候手动删一下就算了,但有些书几百上千章,广告还会混在正文附近。直接正则替换我又不太敢,有些类似广告的文字本身可能就是剧情。
所以最近做了一个专门处理这个问题的 Agent Skill,叫 CML Novel Purifier。
它的思路比较保守。
脚本先把疑似广告找出来,但规则本身没有删除权;之后让 Agent 看前后文逐条判断是删除、保留还是暂时无法判断。真正删除之前还会检查位置和原文有没有变化,全部处理完以后再重新扫描和验证。拿不准的地方宁愿留下,也不会为了把流程跑完直接删掉。
原 TXT 不会覆盖,最后会另外生成清洗后的文件和一个离线复核页面。复核页里可以直接看到前后文,以及为什么判断删除或者保留。
目前主要处理的是中文 TXT 里的站外广告、水印和下载引导。默认不会帮你改标点、排版、剧情或者屏蔽词。TXT 默认保留原排版,最后统一导出 UTF-8;需要的话也可以额外导出 Markdown 或基础 EPUB。
需要 Codex、Claude Code、OpenCode 这类能够读写本地文件、运行终端命令的 Agent。第一次配置好以后,后面基本就是把 TXT 放进输入目录,然后告诉 Agent 清洗哪一本。
这个项目其实最开始只是给自己用的。今年刚毕业,还没找到工作,也想给自己的 GitHub 留一点真正解决过自己问题的东西。制作过程比最开始预想的久很多,codex的plus额度属实不太够用。
现在感觉基本到了可以给别人试的状态,所以发出来看看有没有同样看本地 TXT 小说的人。
如果有人愿意实际拿自己的书试一下,遇到误判、漏掉的广告或者使用流程不顺,都可以提 Issue。
项目地址:
https://github.com/yukino1338/cml-novel-purifier
不求什么大项目,能真的有人用,顺便骗到几十个 Star,我就挺满足了。