LINUX SB 快照站

antiqueeeee

用户 ID 6982 · 当前名首次快照 2026-08-12 10:29:49 · 当前名始于 2026-08-12 10:29:49 · 原站主页: https://linux.sb/user/6982

发言

共 23 楼

【头脑风暴】如何结合AI对社区内文章内容进行审核
#15 · antiqueeeee
发帖 2026-08-14 08:37:54 · 快照 2026-08-17 20:40:36

@SpongeBob #11 没事,那就看个乐子吧

【头脑风暴】如何结合AI对社区内文章内容进行审核
#14 · antiqueeeee
发帖 2026-08-14 08:36:33 · 快照 2026-08-17 20:40:36

@StellaFortuna林可欣 #14 😂也是为了提高交流的效率,散乱的想法意见,很难形成真正意义上的共识,所以我把我的想法汇总到一起,也能让别人了解的更全面些。字数多可能对部分饼友不太友好,但不管什么形式,总是会对一部分饼友不友好的,是不可能存在一种方案让所有饼友都满意的,不想了解的刷到乐乐就好,想了解的总有能讨论的观点,也不用非要从整体上去交流,想到哪说到哪就好。

【头脑风暴】如何结合AI对社区内文章内容进行审核
#13 · antiqueeeee
发帖 2026-08-14 06:48:28 · 快照 2026-08-17 20:40:36

@刘协 #8 我觉得这个事情本身就不是简单的事情,我理的方案其实也都已经很粗糙了

【头脑风暴】如何结合AI对社区内文章内容进行审核
#11 · antiqueeeee
发帖 2026-08-13 23:57:40 · 快照 2026-08-17 20:40:36

6.3 模型调用方式

模型层通过 DeepSeek 官方 API 调用,接口为 OpenAI 兼容格式:地址 https://api.deepseek.com,模型名 deepseek-v4-flash。该模型默认开启思考,首次判定须显式关闭思考模式;复判保持开启并携带主题上下文。两种调用的请求要点如下:

其一,JSON 输出约束:请求中设置 response_formatjson_object,并在提示词中给出 6.1 节的结构与各字段枚举值,保证结论可被程序直接解析。思考模式开启时,模型的思维链与正文输出分离存储,程序只解析正文输出中的 JSON 部分。其二,低温度:判定任务是确定性任务,温度取 0(或接近 0 的最低可用值),保证同一内容重复判定的结论稳定。其三,一次调用产出完整结论:分类、分档、评分、分项置信度、理由在同一次调用内全部产出,不拆分多次调用。其四,复判的上下文载荷:复判调用除内容本身外,还携带所在主题的上下文——回复的复判携带原帖与限定条数(建议不超过十条)的相邻回复,帖子的复判携带其回复区(条数同上限),超出预算截断,使"结合语境判断"得以执行,这也是模型 1M 上下文能力的用武之地。模型的关键特性(思考模式默认开关、上下文长度、JSON 输出支持等)与 API 参数以 DeepSeek 官方文档为准,实现前统一核验。

6.4 提示词设计方向

提示词模板按用途分为首次判定与复判两套,内容上共享五部分:角色说明(内容治理判定器,只判行为特征、不判观点立场);负面清单(由运营者按 3.1 节的转化方法编制,逐条列出禁止的行为与内容特征);分类定义(帖子六分类与回复四分类的定义及"以主要目的归类"的归类标准,见 3.2 节);评分判据(帖子与回复各自四维评分各分值的操作化描述,即"什么情况打几分");输出格式约束(6.1 节的 JSON 结构与枚举值)。用户消息携带规范化内容单元的正文与元信息;复判的用户消息还附带所在主题的上下文段(原帖与相邻回复,见 6.3 节)。提示词中的负面清单段与 L0 规则库的关键词表同源:两者都从负面清单转化而来,由人工复核推翻样本持续补充,改版时同步更新、分别登记版本,避免两份投影出现偏差。

判定的宽严原则写入提示词而非只依赖阈值:只有明确命中负面清单才判越线,凡需要结合复杂语境才能定性的内容应压低置信度或判普通,由阈值路由机制将其升级到更高的层级——提示词与阈值表共同实现"越线从紧、擦边从宽"(3.1 节)。模板的任何改动都登记版本,改动后须在锚定样本集上回归测试(见 5.5 节)方可生效。

七、技术选型与成本量级

技术选型以可行性为最高准则:每一项都选"最简可行、有明确升级路径"的方案,汇总如下。

选型项结论理由
判定模型deepseek-v4-flash(首次判定非思考模式、复判思考模式)单一模型双模式覆盖两次判定;支持 JSON 输出与 1M 上下文;官方 API 国内直连;疑难样本超预期时可平滑升级 deepseek-v4-pro,接口与结论结构不变
实现语言Python 3标准库即可覆盖全部需求(HTTP 调用、SQLite 存取、JSON 解析),无额外运行时依赖,实现路径最短
存储SQLite(WAL 模式)判定量级为每日数百至数千条记录,SQLite 完全胜任;单文件零运维,备份即复制文件;服务化后升级路径为 PostgreSQL
队列与调度进程内调度 + SQLite 持久化任务表待判定与待复核任务先落库再执行,进程崩溃重启后从任务表恢复,落实"宁可延迟、不可丢失"原则;不引入独立中间件,服务化后再替换为 Redis 或消息队列

判定模型的成本量级:deepseek-v4-flash 自 2026 年 8 月 17 日起实行峰谷定价(按百万 token 计,出处见文末):输入未命中缓存时高峰 3 元、空闲 1.5 元,输出高峰 9 元、空闲 4.5 元;固定的提示词模板与负面清单段可命中提示词缓存,命中价远低于未命中价。帖子与回复均走完整判定链路,回复量通常是帖子的十至百倍,判定量按站点规模取每日数百至数千条估算:每条内容按约一千输入 token、数百输出 token 计,高峰时段首次判定单条成本在千分之几元量级,每日判定总成本约数元至数十元,空闲时段与缓存命中可进一步摊薄,高峰时段也可错峰调度;复判因携带主题上下文与思维链输出而高出数倍,但复判样本为低置信升级而来、占比小。判定成本不影响任何设计取舍,此处仅作可行性佐证。

八、可靠性设计

模块可靠性落实的原则是:宁可延迟,不可丢失,不可静默出错。具体措施为:

其一,判定幂等:以内容指纹(站内标识与正文哈希的复合值)去重,同一内容重复进入只产生一条判定主记录,不重复扣分计分。其二,任务持久化:判定任务先写入任务表再执行,进程崩溃重启后从未完成任务恢复,不丢样本。其三,模型调用重试:调用失败按指数退避重试,重试超限转待复核队列,由人工兜底;降级状态下产出的结论在记录中显式标注(degraded 标记),可区分正常结论与降级结论。其四,版本可回溯:每条判定记录绑定规则、提示词、模型、阈值四重版本,任何结论可回溯到产生它的依据,历史结论不覆盖、只标记取代关系。其五,模型输出异常处理:JSON 解析失败、枚举值越界或字段缺失的判定结果一律不得静默丢弃——记录为降级结论(degraded=true、status=待复核)并重试一次,仍失败转待复核队列,由人工兜底;人工复核转正时生成新判定记录取代降级记录。首次判定升级同层复判的,首次判定记录标记已取代。其六,内容变更语义:作者编辑正文产生新指纹,按新内容重新判定,新结论标记取代旧结论、旧记录不撤销;站点删除的内容,其存量判定标记为失效、不再参与聚合计算;规则或模型版本更新只影响新判定,不重扫存量内容(与 3.1 节"负面清单不事后扩张"的承诺一致)。

九、结论汇总

结论汇总分两部分:9.1 节机制结论,9.2 节工程决策。

9.1 机制结论

  1. 核心价值观为社会主义核心价值观,是底线过滤的唯一判定依据;落地方式为"法规底线 + 价值观三层映射"的可客观判定负面清单,只列行为特征、不列观点立场。
  2. 内容按越线、擦边、普通三档分治(模型判定),高质量内容由分类内相对排名产生;越线从紧(疑罪从无)、擦边从宽,模糊样本经机器复判仍拿不准的一律人工。
  3. 降权受三条硬边界约束:列表可达、不连坐作者、状态可见可展开;"非高质量"不是降权理由。
  4. 质量评分采用"先分类、再分类内四维度打分";帖子六分类、回复四分类,推广营销类不进放大通道,站务公告(以官方账号与站务版块识别)不参评。
  5. 质量放大采用分类内相对排名,辅以极低的绝对合格线兜底,滚动时间窗建议 7 天;放大资格随窗口自然退出,精华标记保留。
  6. 信誉量程 [0, 100],新用户初始 5,行为记录按 90 天半衰期衰减(下限 5),按日批处理更新、投票权重取前一日快照;同一来源每日收益设上限。
  7. 抱团检测综合四类统计信号,只输出全站 99% 分位以上的疑似簇转人工,处置限于作废投票与下调信誉分,不自动封号;外部观察阶段以公开互动数据为代理信号。
  8. 赞同度采用 [-1, 1] 连续值,界面五档离散输入,按投票者信誉加权聚合;中立与未投票严格区分,投票可修改、自投不计权重;负赞同度不直接扣分。
  9. 赞同度与质量评分独立:前者评人、后者评内容;赞同度对质量体系仅作校验信号,不进质量分公式。
  10. 申诉推翻判定的,信誉扣分与处置一并回滚;编辑重判的旧判定只取代不撤销。
  11. 阅读行为信号在外部观察阶段不可得;社区反馈信号现阶段以公开互动数据为代理指标。
  12. 处置类规则在机制被站方采纳后生效;外部观察阶段只判定与记录。

9.2 工程决策

  1. 判定模型唯一选定 deepseek-v4-flash:模型判定层内首次判定用非思考模式、复判用思考模式并携带主题上下文;接口为 DeepSeek 官方 OpenAI 兼容格式,JSON 输出。
  2. 判定结论统一为 JSON 结构:内容分类(帖子六分类、回复四分类)、底线三档(越线/擦边/普通)、四维评分(帖子与回复各四维)、分类与分档及逐维置信度、理由,各级判定层同构产出;"高质量"由聚合链路排名产生,不是判定结论。
  3. 路由阈值建议初值:越线 0.9、擦边 0.5、普通及分类与评分 0.7;任何一项置信度低于对应阈值,先同层复判、复判仍不达标再升级人工。
  4. 存储选型 SQLite(WAL 模式),队列为进程内调度加 SQLite 持久化任务表,实现语言 Python 3。
  5. L0 规则层只收录高确定性规则,命中即生效;抽检 5%,新规则上线初期全量复核;模型层结论抽检 1%。
  6. 每条判定记录绑定规则、提示词、模型、阈值四重版本,历史结论不覆盖、只标记取代关系。
  7. 帖子与回复均走完整判定链路;判定成本在每条千分之几元量级,不影响设计取舍。
  8. 判定与复核记录作为标注数据资产长期留存,为未来可能的模型微调积累数据;微调不在当前设计范围内。
  9. 治理系统涉及审核模块、聚合链路、站方系统三个部分,前两部分由本设计交付、第三部分依赖站方既有设施;本文档工程部分覆盖审核模块,聚合链路的工程实现留待后续设计,内容获取(采集)为系统外部的临时数据获取手段,不属于审核模块。

十、待讨论事项

以下事项依赖真实标注数据或运行时观测,本阶段不定:

  1. 提示词模板的具体文本与评分判据的操作化描述(含回复四分类与回复维度判据),需以一批真实标注样本迭代完善。
  2. 各类数值参数的初值与校准:放大比例 N%、绝对合格线、信誉加扣分分值、衰减半衰期、抱团检测阈值、路由阈值与抽检比例等,文档给出的是建议初值,须经运行数据校准。
  3. 信誉分合成公式的具体形式(线性加权或对数压缩),需以历史数据模拟验证区分度。
  4. 帖子六分类与回复四分类对真实站内内容的覆盖度与类间边界,需以抽样标注验证后修订。
  5. 复判的主题上下文最佳规模(原帖加多少条相邻回复)与输出长度控制、成本上限策略,需以实测数据确定。
  6. 服务化时点:存储升级 PostgreSQL、队列替换为独立中间件的触发条件。
  7. 疑难样本量超出 deepseek-v4-flash 能力时的升级条件(切换 deepseek-v4-pro 的判定指标)。
  8. 模型自报置信度的标定:以人工复核的确认率与推翻率校准置信度阈值(见 5.4 节)。
  9. 未来模型微调的启动条件(标注数据积累到多大规模、以何种指标评估收益)。
  10. 推广营销类内容的安置方式(如专设版块)涉及站方运营决策,超出机制设计范围,需与站方协商。
  11. 擦边降权的期限与解除条件(申诉成功解除、期限届满自动恢复等)。
  12. 先发后审模式下,内容发布到判定生效之间存在曝光窗口,处置前的可见性问题(是否由站方改为先审后发)需与站方协商。
【头脑风暴】如何结合AI对社区内文章内容进行审核
#10 · antiqueeeee
发帖 2026-08-13 23:56:55 · 快照 2026-08-17 20:40:36

六、判定结论与数据结构

本章回答"判定结论长什么样、判定依据存在哪里":6.1 节定义各级判定层统一产出的结论结构,这是路由器分级的载体;6.2 节给出支撑判定运行的七类数据的字段级定义与组织原则;6.3 节说明模型层如何调用、调用时如何约束输出;6.4 节给出提示词模板的设计方向,即判定指令怎么写进模型。

6.1 判定结论的统一结构

各级判定层产出同一种结构的结论,模型层以 JSON 输出,规则层以固定模板生成同构结论。结构如下:

{
  "category": "技术分享",
  "verdict": "普通",
  "violation": null,
  "severity": null,
  "scores": {
    "信息量": { "score": 4, "confidence": 0.9 },
    "原创性": { "score": 4, "confidence": 0.85 },
    "建设性": { "score": 5, "confidence": 0.9 },
    "表达完整度": { "score": 4, "confidence": 0.95 }
  },
  "category_confidence": 0.9,
  "verdict_confidence": 0.88,
  "reason": "……"
}

各字段含义:category 为内容分类(示例为真实取值,枚举范围见 3.2 节分类表);verdict 为底线分档,只含越线、擦边、普通三值——"高质量"不是模型给出的标签,而是聚合链路按分类内相对排名产生的结果(见 3.3 节);violation 在分档为越线时必填命中的负面清单条目,分档为擦边时填写最接近的负面清单条目或违规类型(如灌水、软广),无对应条目时可为空,其余情况为 null;severity 在分档为越线时填写情节严重程度(一般/严重,对应 3.1 节四档表中屏蔽/删除两种处置),依据是命中的负面清单条目与违规行为的危害程度,其余情况为 null;scores 为四维质量评分,各维 1 至 5 分并附逐维置信度;category_confidenceverdict_confidence 分别为分类与分档的置信度,与逐维置信度共同供路由器对照阈值使用;reason 为判定理由,供人工复核与审计阅读。结论 schema 按内容类型取对应枚举:category 帖子取六分类、回复取四分类(解答型/补充型/讨论型/寒暄型),scores 帖子取帖子四维、回复取回复四维。L0 规则层以固定模板生成同构结论:命中规则的样本只填写 verdict、violation、reason,category 与 scores 为空值(null),下游排名跳过无评分内容。

6.2 判定数据留存的字段级定义

判定数据留存围绕以下七类实体组织,实体之间的关联关系如图 10 所示,字段定义如下(类型为概念类型,具体数据库类型的选型见第七章):
图10 判定数据实体关系
内容单元:进入模块的规范化内容,是判定的最小对象,也是幂等的依据。

字段类型含义
content_id字符串站内标识(帖子或回复的 ID)
fingerprint字符串幂等指纹(站内标识与正文哈希的复合值),判定幂等的去重依据
body_hash字符串正文哈希(与幂等指纹分离,避免不同内容因正文相同而合并);重复内容检测归聚合链路,本文档不展开
author字符串作者标识
body文本规范化后的正文
title字符串帖子标题(帖子填写,回复为空)
content_type枚举帖子 / 回复
board字符串所在版块
published_at时间站内发布时间
topic字符串所属主题(回复所属的帖子)

判定记录:一次判定行为的完整结果,绑定版本信息。

字段类型含义
judgment_id字符串判定记录标识
fingerprint字符串关联的内容单元指纹
layer枚举L0 / L1 / L2
attempt枚举模型层判定的执行策略:首次 / 复判(模型层填写,其余为空)
category枚举内容分类结论
verdict枚举越线 / 擦边 / 普通
violationJSON负面清单命中条目(越线必填;擦边填最近似条目或违规类型,可为空),未命中为 null
severity枚举越线内容的情节严重程度:一般 / 严重(对应屏蔽/删除两种处置),其余情况为空
scoresJSON四维评分及逐维置信度
confidenceJSON分类与分档置信度
reason文本判定理由
degraded布尔降级结论标记(模型不可用或输出异常时产出的结论为真,与正常结论区分)
rule_version字符串所用规则库版本(L0 必填,其余为空)
prompt_version字符串所用提示词模板版本(模型层必填)
model_version字符串所用模型版本(模型层必填)
threshold_version字符串路由所用阈值配置表版本(模型层必填)
context_snapshot字符串复判所用主题上下文的快照引用(复判填写,供审计复现复判输入)
status枚举结论生效 / 待复核 / 申诉复核中 / 已失效(内容被站点删除时标记,不再参与聚合计算)/ 已取代(被新判定取代的旧结论)
superseded_by字符串被取代时指向新判定记录,未取代为空
created_at时间判定时间

综合质量分不在判定记录中存储:判定记录只存四维原始分,综合质量分由聚合链路按各分类权重表合成(3.2 节的加权规则),权重表版本随排名快照登记。

规则条目:规则库的构成单元,按版本管理。

字段类型含义
rule_id字符串规则标识
pattern_type枚举关键词 / 正则 / 域名 / 频率 / 站务标识
pattern文本匹配模式
verdict枚举命中后给出的分档结论
enabled布尔是否启用
version字符串所属版本
effective_from时间生效时间

提示词模板:模型层判定的指令模板,按版本管理。

字段类型含义
template_id字符串模板标识
purpose枚举首次判定 / 复判
content文本模板全文
version字符串版本号
effective_from时间生效时间

复核记录:人工复核的结论,覆盖判定类样本与疑似操纵簇两类对象;推翻样本同时是数据飞轮的语料来源。

字段类型含义
review_id字符串复核记录标识
target_type枚举判定 / 簇
judgment_id字符串被复核的判定记录(复核判定类样本时填写)
cluster_id字符串被复核的疑似操纵簇(复核簇时填写)
source_type枚举低置信升级 / 抽检 / 赞同度校验抽样 / 操纵簇 / 申诉
action枚举确认 / 推翻 / 作废投票 / 下调权重 / 放行
correctedJSON推翻时的修正结论,其余动作为空
reviewer字符串复核人标识
note文本复核备注
training_flag布尔推翻样本是否标记为训练语料
reviewed_at时间复核时间

任务表:待判定与待复核任务的持久化载体,是"宁可延迟、不可丢失"的可靠性基础。任务表记录执行状态,与判定记录的生命周期状态(status)分离——判定记录记录结论状态,任务表记录执行状态。

字段类型含义
task_id字符串任务标识
task_type枚举判定 / 复核
ref字符串关联对象(内容指纹或簇 ID)
status枚举待执行 / 执行中 / 成功 / 失败待重试
retry_count整数已重试次数
created_at时间创建时间
updated_at时间最近状态更新时间

阈值配置表:路由器的判定依据,按版本管理。

字段类型含义
threshold_id字符串配置标识
conclusion_type枚举越线 / 擦边 / 普通 / 分类 / 评分
min_confidence浮点结论生效所需的最低置信度
version字符串版本号
effective_from时间生效时间

数据组织遵循五条原则:原始内容与判定结论分离存储;历史结论不覆盖,只标记取代关系;任何历史结论都可回溯到产生它的判定记录集合与规则版本;判定与复核记录作为标注数据资产长期留存,为未来可能的模型微调积累数据;隐私与合规边界——仅留存判定所需的公开内容与必要元信息,站点删除的内容标记失效并停止参与聚合计算,对外导出的标注数据须脱敏,底稿留存期限依适用的个人信息保护要求设定。

【头脑风暴】如何结合AI对社区内文章内容进行审核
#9 · antiqueeeee
发帖 2026-08-13 23:55:41 · 快照 2026-08-17 20:40:36

外部观察阶段复核由系统运营者本人执行,机制被采纳后由站方审核团队执行,复核记录全程留痕;复核的操作载体(界面或命令行工具)不在本文档范围内。申诉的入口与时限归站方系统,审核模块只承接进入复核队列的申诉样本;申诉次数与复核时限列入待讨论。队列深度是模块健康指标,积压超过阈值即告警——人工兜底失效本身是需要暴露的故障。人工复核的容量是模块可行性的前提:按判定量每日数百至数千条、升级与抽检合计约百分之几估算,单人每日复核量约数十条,属可承担范围;模型不可用降级期间全量积压转人工的极端情形由告警触发干预,不作为常态设计。

5.4 路由器与阈值

路由器读取各级结论的分项置信度,对照阈值配置表决定结论直接生效还是升级。阈值按结论类型分档设置,建议初值如下:判越线要求置信度不低于 0.9,判擦边不低于 0.5,判普通分类与评分不低于 0.7。这一分档正是"越线从紧、擦边从宽"原则的工程落点:代价越大的判定要求越高的置信度,代价小的判定放低门槛,拿不准的一律向上流动。路由的判定规则是:分类、分档、评分各项置信度全部不低于对应阈值时结论生效;任何一项低于阈值,模型层的首次判定升级为同层复判,复判仍不达标的升级人工复核。模型自报的置信度数值须以人工复核结果持续校准——这是与锚定回归不同的独立过程:按周期统计复核确认率与推翻率相对自报置信度的偏差,偏差超限时调校阈值配置表或提示词判据,防止置信度虚高或虚低。

路由规则汇总如下:

层级产出置信度去向
L0 规则命中规则直接定结论1.0结论生效(抽检转人工)
L1 模型判定(首次)完整结论各项均不低于对应阈值结论生效
L1 模型判定(首次)完整结论任一项低于对应阈值同层复判(思考模式 + 主题上下文)
L1 模型判定(复判)复判结论各项均不低于对应阈值结论生效
L1 模型判定(复判)复判结论任一项低于对应阈值转 L2 人工复核
L2 人工确认或推翻结论生效(推翻样本打训练标识)

5.5 版本登记与可回溯

模型层判定记录绑定四重版本:判定所用的规则库版本、提示词模板版本、模型版本与路由所用阈值配置表版本;L0 记录只绑定规则库版本,L2 人工记录不绑版本。版本登记使任何结论都可回溯到产生它的依据,是复核审计与评分稳定性控制的前提。历史结论不覆盖,只标记取代关系。

评分稳定性由锚定回归机制控制:人工选定一批覆盖各分类、各质量档位、各底线分档的标杆内容(总量数十篇),标定基准结论,组成锚定样本集;任何判定版本上线前,先在锚定集上回归测试,分类与分档的一致率、质量分的分布漂移超过阈值则拒绝上线。锚定回归与 3.2 节的权重校准是两件事:前者控制版本更新造成的评分尺度漂移,后者拟合各维度合成综合质量分的权重;两者的样本关系是——锚定样本集(数十篇)用于版本门禁,权重校准的金标准是独立抽样、覆盖各分类的放大标注集(约五百条),与人工复核队列的疑难样本无关,避免用有偏样本扭曲权重。

5.6 判定过程示例

普通技术教程帖。 一条教程帖进入判定链路:L0 规则层未命中,转 L1 模型判定层;首次判定一次调用产出完整结论——分类=技术分享(置信度 0.9),分档=普通(置信度 0.85),四维评分 4/5/4/4(各维置信度均不低于 0.7);路由器对照阈值表,各项置信度均达标,结论生效,判定记录入库并绑定版本信息。

擦边引战帖。 一条疑似引战帖进入判定链路:L0 未命中,模型判定层首次判定分档=擦边,理由是阴阳怪气引战但未明确违反负面清单;分档置信度 0.62 高于擦边阈值 0.5,结论生效。若分档置信度只有 0.4,则同层复判——以思考模式携带主题上下文重新判定;复判给出分档=擦边(置信度 0.55)、分类=观点讨论(置信度 0.8)、各维评分置信度均不低于 0.7,各项达标,结论生效;复判任一项仍低于阈值的转人工复核,由人决定最终结论。作者因擦边判定记一笔违规,按 3.4 节的规则扣减信誉。

【头脑风暴】如何结合AI对社区内文章内容进行审核
#8 · antiqueeeee
发帖 2026-08-13 23:55:25 · 快照 2026-08-17 20:40:36

五、判定链路设计

判定链路的分级依据是判定成本与置信度的匹配:能用规则确定的内容不进模型,模型拿得准的结论不惊动人工,机器拿不准的才由人介入。其中模型判定是逻辑上的一个环节——同一模型、同一结论结构、同一提示词模板族,流程上不拆层;环节内部按成本采取两级策略:先以非思考模式快速初判,置信度不足的样本再以思考模式携带主题上下文复判一次,仍拿不准的才升级人工复核。实现时两级策略可以拆成两个执行部件,但那是实现细节,不进入流程分层。判定流转如图 8 所示。
图8 判定链路的流转

5.1 L0 规则层

规则层是判定链路的起点,也是成本最低的一级。规则层包含四类规则:关键词匹配规则(精确匹配或简单正则,对应负面清单中可枚举的禁止用语)、域名黑名单规则(已知广告、诈骗、赌博域名的链接匹配)、频率阈值规则(同一作者短时间内批量发帖的灌水特征)与站务标识规则(按作者官方账号或站务版块的标识匹配,命中即标记为站务公告,不进入评分体系——这是 3.2 节"站务公告不参评"的执行点)。四类规则的默认档位映射为:关键词与域名规则命中判越线,频率规则命中判擦边,站务标识规则命中判普通(该结论仅用于排除评分);运营者编制规则时按默认映射配置,需偏离默认值的在编制说明中注明理由。规则库只收录"命中即几乎不可能误伤"的高确定性模式,需要理解语境的判定一律不放进来,这是规则层的收录铁律;频率阈值规则的参数须保守设置(短时间、大批量),只拦明显的机器灌水行为,正常人工批量发帖不应触发。

规则命中的内容直接产出结论,置信度记为 1.0,不经模型层。为防规则本身出错,命中内容按比例抽检人工复核:常规抽检比例 5%,新规则上线初期全量复核,累计命中满一百条或运行满七天后回落到常规抽检比例。规则以版本管理,任何修改都登记版本并记录生效时间。规则库的内容来源有两处:初始由运营者按 3.1 节的转化方法编制负面清单,并进一步把清单条目转化为可匹配的规则模式(关键词、正则、域名、频率),此后由人工复核推翻样本持续提炼补充;规则由系统运营者维护,编制质量由抽检复核把关。

5.2 L1 模型判定层

模型判定层处理规则层未命中的全部内容(帖子与回复),是整个链路中承担判定量最大的一级。选定的模型为 deepseek-v4-flash,职责是对每条内容做完整判定:内容分类(帖子六分类、回复四分类)、底线分档(越线/擦边/普通)、质量四维评分、分项置信度与理由,一次调用产出完整结论(结论结构见第六章)。内容以中文为主,其他语言内容同样进入判定链路,模型的多语言能力可覆盖。

模型判定层在流程上是一步,内部按成本采取两级策略,用同一模型、两种运行模式执行。首次判定使用非思考模式:输出简洁、延迟低,适合对大量内容逐条快速初判,大部分内容的结论在这一步直接生效。复判针对首次判定置信度低于阈值的样本(如疑似阴阳怪气引战、擦边类与需要结合上下文才能定性的内容),使用思考模式:模型在给出结论前先展开推理,对复杂语境的把握显著优于非思考模式,且调用载荷除内容本身外还携带所在主题的上下文(见 6.3 节),使"结合语境判断"得以执行。

两级策略共用同一模型而不引入第二种模型,理由有三:其一,判定任务(分类、分档、评分)对模型能力的需求不高,思考模式已足够胜任;其二,单一模型使版本登记、提示词模板、输出结构全部只维护一套,部署面与运维复杂度最小,符合可行性优先的准则;其三,需要复判的样本是首次判定升级而来,占比小,思考模式输出思维链带来的额外成本被低占比摊薄。若运行数据显示疑难样本量或难度超出预期,可平滑升级为 deepseek-v4-pro——接口与输出结构不变,仅模型名不同,这是预留的升级路径。

5.3 L2 人工复核

人工复核是判定链路的最后一级,也是唯一有人介入的一级,承接五条来源的样本:模型判定层复判仍低于阈值的疑难样本、L0 命中与模型层结论的抽检样本(L0 常规 5% 且新规则上线初期全量,模型层常规 1%)、赞同度校验抽检样本(质量分高但加权赞同度显著偏低的内容,见 3.5 节)、聚合链路报送的疑似操纵簇、以及机制被站方采纳后的用户申诉。复核对象分两类:判定类样本与疑似操纵簇。判定类样本的复核动作只有两种:确认机器结论,或推翻并给出修正结论;疑似操纵簇的复核动作为作废投票、下调权重或放行。复核推翻机器结论时,生成一条新的判定记录(layer=L2)作为生效结论,旧记录标记被取代,复核记录本身只存动作与备注。被推翻的样本打上训练标识,成为改进规则库与提示词模板的高价值语料,形成数据飞轮,如图 9 所示。
图9 数据飞轮

【头脑风暴】如何结合AI对社区内文章内容进行审核
#6 · antiqueeeee
发帖 2026-08-13 23:53:52 · 快照 2026-08-17 20:40:36

四、系统组成与边界

治理系统的工程实现涉及三个部分:审核模块聚合链路站方系统,其中前两部分由本设计交付,第三部分依赖站方既有设施。本文档的工程实现部分(第四至八章)覆盖审核模块;聚合链路的机制规则见第三章(赞同度、信誉、抱团检测、放大排名),其工程实现留待后续设计;站方系统承载依赖站方既有设施的部分(投票功能、内容初始权重与共治资格、处置执行、负面清单公示与申诉入口等运营职责),由站方按本设计的规则实现。三部分的边界与数据流如图 7 所示。
图7 治理系统的组成与边界

4.1 审核模块的定位与边界

审核模块是治理系统的判定核心:输入是规范化内容单元(帖子与回复),输出是结构化判定记录。非文本内容(图片、附件等)不进入判定链路——内容单元只承载文本,非文本违规的识别与处置交由站方系统,本文档不展开。内容获取(采集)是在无法获取站内数据的条件下采用的外部临时手段,不属于审核模块,不在本文档范围内;判定记录由哪些下游消费、以何种形态呈现,均不在本文档范围内。

4.2 审核模块的总体组成

审核模块要解决的核心问题是:对每条进入的内容,用可审计、可回溯的方式得出可信的判定结论。围绕这个目标,模块由一条判定链路三组支撑设施判定数据留存三部分组成,三者各解决一类问题;三部分之上还运行着一条数据飞轮(改进闭环),解决"判定质量如何持续提升"的问题。

判定链路解决"判定怎么做出",负责把一条内容从原始输入变成生效的判定结论。它按判定成本从低到高分为三级,逐级处理:L0 规则层用高确定性规则直接过滤最明显的内容,成本接近于零,不让机器为不需要判断的内容付费;L1 模型判定层对剩余内容做完整判定——首次判定用非思考模式快速出结论,承担大部分判定量,置信度不足的样本在同层内以思考模式并携带主题上下文复判一次;L2 人工复核是最后兜底——模型仍拿不准的由人定论,同时抽检各层结论、纠正误判。低置信度的结论向上一级升级,直到结论生效。每一级产出同一种结构的判定结论(见第六章),区别只在于得出该结论的成本与深度。

三组支撑设施为判定链路提供它缺一不可的三样东西:依据、可回溯与任务保障。 一是判定依据设施:判定不能凭空进行——规则层需要规则库提供高确定性模式(见 5.1),模型层需要提示词模板库提供判定指令(见 6.4),路由器需要阈值配置表提供置信度门槛(见 5.4);二是可回溯设施,即版本登记机制:每一条判定结论都必须能回溯到产生它的规则、提示词、模型与阈值配置版本,这是审计、申诉处理与评分稳定性控制的前提(见 5.5),该机制由各实体表中的版本字段实现,不单独建表;三是任务设施,即待判定与待复核队列,持久化于留存库:判定任务先落库再执行,保证进程崩溃后不丢样本、不重复判定(见 6.2 任务表与第八章)。

判定数据留存解决"判定的证据放哪里",是全部部件的共享数据基础。判定留下的证据——进入模块的内容底稿、每一级产出的结论、人工的复核动作、所用的规则与提示词版本——是此后审计、申诉处理、统计分析与标注数据积累的原料。留存围绕内容单元、判定记录、规则条目、提示词模板、复核记录、任务表、阈值配置表七类实体组织,字段级定义见 6.2 节。

数据飞轮解决"判定质量如何持续提升"。数据飞轮是一条改进闭环:判定难免出错,错处正是改进的原料——人工复核推翻机器结论的样本,会回流补充规则库与提示词模板(见 5.1、6.4),使后续判定更准、需要人工介入的疑难样本更少,形成循环;判定数据留存保存的复核记录与训练标识(见 6.2)是这个循环运转的基础。数据飞轮使模块的判定质量随运行时间持续提升,而不是停留在部署时的水平。

【头脑风暴】如何结合AI对社区内文章内容进行审核
#5 · antiqueeeee
发帖 2026-08-13 23:52:46 · 快照 2026-08-17 20:40:36

两条补充规则:推广营销类不进入质量放大通道,无论内容质量高低,防止推荐位沦为广告位;站务公告类内容(以官方账号与站务版块的标识识别)不进入评分体系,不参评不排名。分类拿不准时归入语义最接近的分类,低置信度样本升级人工。

多维度打分。 每条内容按四个维度各评 1 至 5 分,每个维度附置信度,整体结论附判定理由。帖子四维为信息量(是否提供新信息、干货密度)、原创性(原创与搬运、复读、跟风的区分)、建设性(对读者或社区是否有益)、表达完整度(结构、清晰度、用心程度)。回复四维在四维框架上按回复语义调整:信息量(是否带来新信息)、建设性(是否对问题或讨论有实际帮助,引战性回复此项得低分)、相关性(是否回应主题而非跑题或借楼引流)、表达完整度。

综合质量分为四个维度的加权和,不同分类使用不同的权重表(例如日常闲聊类降低信息量权重,因为闲聊内容天然信息量低,信息量不应主导其类内排序)。

权重校准方法。 权重初值均等,后续以独立抽样的放大标注集为金标准校准:人工对一批覆盖各分类的帖子只做"是否值得放大"的整体判断(该标注集独立于人工复核队列的疑难样本,避免用有偏样本扭曲权重),再以排序学习方法或参数搜索拟合各维度权重(参数仅四个,方法从简),使加权质量分的排序与人工排序的一致性(以 Kendall 等级相关系数衡量)最大化。校准周期性进行,每积累一定规模(建议约五百条)的标注样本重新拟合一次;机制被站方采纳后,可引入真实用户行为数据(阅读完成率、有效互动率)作为辅助校准信号。回复四维的权重以同法校准,标注集覆盖回复四分类。

回复的处置。 回复与帖子同体系:越线回复删除该回复,不连坐其所属主题与作者的其他内容;擦边回复按擦边规则降权折叠。

3.3 质量放大通道

放大采用相对机制:对滚动时间窗(建议 7 天)内质量分排名前 N% 的内容给予放大,而不是设定绝对阈值。采用相对机制的原因是:新社区内容池小,绝对阈值无从标定,且容易无米下锅;相对机制在社区发展的任何阶段都能工作,且随着整体质量提升,被放大的标准自动水涨船高,无需人工调整。

相对机制需要一条兜底规则:当全站内容普遍低质时,排名前 N% 的内容仍然是水帖,推上推荐位会损害机制公信力。因此放大的完整条件是相对排名前 N% 且高于一条设定得很低的绝对合格线,宁缺毋滥。排名在分类内进行,保证各类内容都有被放大的机会,避免技术类垄断推荐位。

放大的手段包括推荐位、精华标记、首页加权、摘要推送等。回复的放大机制与帖子一致,同样按分类内相对排名进行,入选内容以"精选回复"形态呈现(采纳后由站方以置顶、高亮等方式实现)。放大资格随滚动时间窗更新自然退出:滑出时间窗的内容退出推荐位;精华标记保留——它是对创作价值的长期认可。放大通道不惩罚任何内容:水帖不被删除,只是被放大后的优质内容自然稀释出首屏。这是质量与自由兼容的关键机制——创作者获得"认真有回报"的正反馈,普通发言者的权利不受任何影响。

3.4 用户信誉体系

本节分五部分:设立动机、信誉信号源、信誉分的计算、信誉的用途与抱团检测。

设立动机。 如果所有账号在投票、发言上平权,有组织的小团体即可通过三种方式操纵治理结果:互相给对方的内容投票、抬升水帖;抱团举报持不同意见者,借机制的自动处置实现"捂嘴";批量注册小号充当投票工具。信誉体系的目的就是打破账号平权,让话语权与历史行为挂钩,从成本上瓦解上述操纵。抱团举报的防御不依赖专门的举报通道设计(举报通道归站方系统):机制侧的防线在于处置只由判定结论驱动、不随举报数量而动,被处置者可申诉,判定与处置全程可审计。

信誉信号源。 用户信誉由以下行为信号累积形成:发帖历史质量(历史内容的质量分均值与分布,外部观察阶段可得);违规记录(越线、擦边判定的历史,由本机制的判定产生,可得);回复质量(回复是否具有建设性、是否引战,可得);收到的社区反馈(其内容获得的加权赞同度、引发的讨论深度,可得);阅读行为(浏览内容的类型分布,属隐私数据,仅在机制被站方采纳并获授权后可选,外部观察阶段不可得)。

外部观察阶段站内尚无赞同度投票功能,"社区反馈"信号以公开可见的互动数据(回复数量、讨论深度、既有点赞)作为代理指标,待赞同度功能落地后切换为正式信号。

信誉分的计算。 信誉分量程为 [0, 100],新注册用户初始值为 5:处于"可正常发言、可投票但权重极低"的状态,不剥夺参与权,只限制操纵能力。

信誉分由三类行为记录加权累积,再按时间衰减合成:质量贡献(帖子或回复进入放大名单、引发深度讨论、获得高加权赞同)为正向,加分随质量评分递增;中性行为(普通发帖、正常回复)为零分或微小正向,保证活跃即有缓慢积累;违规记录(擦边判定小幅扣分,越线判定大幅扣分)为负向,越线的扣分幅度显著大于擦边。

时间衰减采用指数衰减,半衰期建议 90 天。衰减设计同时实现两个目的:近期行为比陈年旧账更能代表用户当前状态,老用户不能永远吃老本;犯过错的用户只要持续正常贡献,扣分的影响会随时间消退,始终留有改过自新的通道。衰减的下限是新用户初始分(5 分):长期不活跃用户的信誉不低于新用户,避免"老账号反而更不可信"。信誉分按周期(建议每日)批处理更新;赞同度聚合时投票者权重取上一周期结束时的信誉快照,避免信誉与赞同度互相递归依赖。

防刷约束:单个用户每日从同一投票者处获得的信誉收益设有上限,使两人互刷无法线性累积信誉;信誉的主要来源必须分散,来源集中度本身也是异常信号。外部观察阶段站内尚无投票功能,该上限自然不生效,待赞同度功能落地后启用。

信誉的用途。 信誉分主要有三个用途。其一,投票权重:赞同度聚合时按投票者信誉加权,新注册账号的票权重低,直接抬高养号操纵的成本。其二,内容初始权重:高信誉用户的新帖获得略高的初始曝光。其三,共治资格:参与举报、标注违规、评审等社区治理活动的门槛(这些活动由站方实现,治理系统仅提供信誉分数据)。三个用途中,投票权重由治理系统直接使用;内容初始权重与共治资格的实现依赖站方系统(机制被采纳后由站方执行)。

抱团检测。 抱团检测不依赖任何单一信号,而是综合四类统计特征识别"疑似操纵簇":投票对象重合度(一组账号的投票目标高度重合,正常用户的投票对象分散且随机)、投票时间集中度(短时间内成群出动,正常互动随发帖时间自然分布)、信誉来源单一性(信誉主要来自圈内互投,正常信誉来自大量不同用户)、注册时间聚集性(批量账号注册时间相近,正常用户注册时间无相关性)。

信誉体系的全貌如图 6 所示。
图6 用户信誉体系全貌
检测的边界从严把握:系统只输出统计上显著异常(各簇的操纵嫌疑综合得分取全站 99% 分位以上)的疑似簇,不做任何自动处罚,一律转人工复核;确认操纵后的处置也仅限于作废操纵性投票、下调相关账号的信誉分,不直接封号——封号属于站方依站规的职权,机制只提供证据。正常的朋友间互相支持是双向、低频、长期的,与操纵簇的单向、高频、集中特征有统计上的可分性,这正是检测不误伤正常互动的依据。

外部观察阶段站内尚无赞同度投票功能,四类投票信号以公开互动数据为代理:以点赞、回复的互动对象重合度替代投票对象重合度,以互动时间集中度替代投票时间集中度,信誉来源单一性按互动来源计算,注册时间聚集性不变;"作废投票"处置在观察阶段没有对应动作,系统只输出疑似簇证据,处置在机制被采纳后执行。

信誉体系与注册门槛的关系。 "门槛筛选的本质是筛选诚意和耐心"这一社区讨论中的共识性判断是成立的,但诚意并非只能在入口处筛选。信誉体系用持续的行为记录替代一次性的入场审查来完成同样的筛选:愿意为社区付出的用户随时间积累信誉并获得相应权重,不愿付出的用户自然停留在低权重状态。这一设计保留了门槛的筛选功能,但不排斥任何新用户进场,是对"自由与质量矛盾"在用户层面的解法。

3.5 社区反馈信号:赞同度

设计动机与取值。 传统的点赞、点踩是二元信号,信息量过低,无法区分"强烈反对"与"略有保留"。本机制采用连续值表示赞同程度,取值区间为 [-1, 1],-1 表示完全反对,1 表示完全赞同。落地形态为"界面离散、存储连续":用户界面提供五档选择(强烈反对、反对、中立、赞同、强烈赞同),内部映射为 -1、-0.5、0、0.5、1。

聚合方式。 单条内容的赞同度均值为所有投票的信誉加权平均,即 Σ(票值 × 投票者信誉) ÷ Σ(投票者信誉)。高信誉用户的意见占更大权重。投票可修改或撤销,以最后一次为准;对自身内容的投票照常记录但不计权重;全部投票者信誉之和为零时,该内容按未投票处理。展示时同时呈现均值得分与投票人数:小样本下的均值极易被个别高信誉用户带偏,投票人数是均值可信度不可缺的参照。

中立与未投票的区分。 "未投票"与"中立(0 分)"必须区分处理。未投票是无数据,不计入均值、不计入投票人数;中立是有效表达"已阅读、无倾向",计入均值也计入投票人数。区分的理由有二:中立票是真实信息,能反映内容的争议度与极化程度;若中立不计数,操纵者可用大量中立票虚增投票人数、制造"广泛参与"的假象。争议度(投票分布的离散程度)本身可作为辅助信号留存,供评估讨论健康度使用。

赞同度与质量分的边界。 必须明确:赞同不等于质量。小众但优质的观点赞同度可能接近零,人畜无害的灌水赞同度可能为正。若以赞同度决定内容排名,等于让多数人的偏好冒充质量,会系统性惩罚少数派观点、制造回音室,与发言自由的目标直接冲突。因此两个信号严格分离、互不替代:赞同度用于评估用户(讨论信誉)和检测抱团投票行为;质量评分用于评估内容、决定内容排名。赞同度对质量体系的唯一作用是校验:对"质量分高但加权赞同度显著偏低"的内容自动抽样转人工复核,用于发现模型评分的系统性偏差,赞同度本身不进入质量分公式。该抽样来源仅在赞同度功能落地后生效;外部观察阶段无赞同度数据,此项暂停。负赞同度本身不直接扣减信誉——反对意见是合法表达;其作用通过既有通道间接体现:内容因问题暴露而被判定违规时,按违规记录扣分;用户持续输出被高权重反对的内容,作为信誉来源质量下降的信号供后续观察评估。

3.6 逻辑自洽性论证

本机制对"自由与质量能否共存"的回答是肯定的,论证如下。

自由由三个设计共同保障:入口无门槛,任何人可注册可发言;负面清单窄而明确,治理只判越线、不判观点;处置可申诉,误判可纠正。降权的三条边界(列表可达、不连坐、状态可见)保证即便是最轻的负向处置也不构成变相捂嘴。

质量由注意力分配机制而非言论管制实现:放大优质内容即稀释劣质内容的曝光,创作者获得正反馈,形成"认真有回报"的正循环,针对性解决"劣币驱逐良币"的问题。

判定宽严与处置代价匹配:越线从紧、擦边从宽,代价越大的判定要求越高的置信度,拿不准的逐级升级(机器复判、最终归人工),从制度上压缩误伤空间。

各部件相互独立、各司其职:底线过滤防破窗,质量放大解决激励;评内容解决内容问题,评人解决权力分配问题;赞同度与质量分分离,防止多数人的偏好冒充质量;信誉衰减与防刷上限、抱团检测共同保证权力不被固化、不被窃取。

【头脑风暴】如何结合AI对社区内文章内容进行审核
#4 · antiqueeeee
发帖 2026-08-13 23:51:56 · 快照 2026-08-17 20:40:36

3.1 底线过滤通道

底线过滤只判断"是否越线",不判断观点优劣、不评判立场。处置必须可申诉,误判可纠正。

负面清单的制定方式。 社会主义核心价值观是原则性表述,不能直接作为机器审核的判定标准,需要转化为可执行的负面清单。转化方法是:以《网络信息内容生态治理规定》等法规为法定底线,将法规底线与价值观三个层面的要求逐条映射为可客观判定的内容特征——国家层面(富强、民主、文明、和谐)映射为危害国家安全、煽动颠覆国家政权、宣扬分裂国家、侮辱国旗国歌国徽等内容;社会层面(自由、平等、公正、法治)映射为教唆违法犯罪、诈骗导流、赌博及违禁品交易、侵犯他人合法权益的内容;公民层面(爱国、敬业、诚信、友善)映射为造谣诽谤、人身攻击、煽动地域或群体歧视与仇恨的内容;法规与公序底线映射为淫秽色情、血腥暴力、恶意广告刷屏等内容。清单只列行为和内容特征、不列观点立场,转化路径如图 3 所示。
图3 负面清单的转化路径
负面清单必须小、明确、公开,规则事先告知,修改须公示,不事后扩张。

判定的宽严原则。 越线与擦边两档采用相反的宽严尺度:判越线从紧——只有高置信度时才判越线,拿不准的一律不判(疑罪从无),因为屏蔽和删除的代价大;判擦边从宽——降权代价小且可申诉,低置信度也可执行,漏网之弊小于误伤之弊。凡需要结合复杂语境才能判断的模糊样本,先升级机器复判(思考模式结合主题上下文重新判定),复判仍拿不准的一律升级人工复核,不由机器强行定性。

按内容与底线的关系,内容分为四档,各档处置方式不同,如图 4 所示。越线档为高置信度命中负面清单的内容,处置为屏蔽、删除(情节严重的删除,其余屏蔽);擦边档为未越线但在底线边缘试探的内容(引战、软广、恶意灌水),处置为降权、折叠;普通档为不违规也非精品的内容(日常闲聊、一般求助),不做任何处理、正常展示;高质量档由聚合链路的分类内相对排名产生,进入放大通道。
图4 内容四档与处置方式
需要说明:模型判定只产出底线三档(越线、擦边、普通)与质量评分,"高质量"不是模型给出的标签,而是聚合链路按分类内相对排名产生的结果——一条内容是否属于"高质量",由它在同分类内容中的排名位置决定,与判定结论分开存放、分开生效。

降权的边界。 为防止降权演变为变相捂嘴,降权处置受三条硬边界约束:第一,被降权的内容始终保留在原版块的时间序列表中,可从列表直接访问,也可被搜索到,降权只是退出推荐位和首页加权,不是从社区中消失;第二,单次擦边只影响该内容本身,不连坐作者的其他内容——对作者的惩罚只通过信誉分的扣分通道生效,避免隐性限流;第三,降权状态对外可见,内容附带折叠标记和处置理由,读者可主动展开,作者可据此申诉。

需要特别强调的原则是:"非高质量"不是降权的理由。降权只针对擦边行为;若普通内容也被降权,等于要求所有用户写精品,其后果比注册门槛更严重,社区的自由和活跃度都会被摧毁。

纠正的连锁效应。 申诉推翻判定的,基于该判定记录的信誉扣分与处置建议一并撤销回滚;作者编辑正文触发重新判定的,旧判定只标记取代、不予撤销,避免以编辑逃避记录。

3.2 质量评分

质量评分分两步进行:先对内容分类,再在分类内打分;本节随后给出权重表的校准方法与回复的处置方式。

内容分类。 分类是必须的预处理步骤:技术分享帖与日常闲聊帖遵循完全不同的质量基准,若用同一把尺子打分,闲聊类内容永远垫底,长期会把社区逼成"只许硬核",背离自由的初衷。帖子按主要目的归入六类:技术分享(输出技术知识、经验、教程,如教程、踩坑记录、开源项目介绍)、资源分享(分享可用资源,如福利、羊毛、邀请码、公益服务)、求助问答(提出问题寻求帮助,如报错求助、选型咨询)、观点讨论(表达观点、发起讨论,如行业看法、社区治理讨论、长文)、日常闲聊(无特定目的的交流,如打卡、随笔、互动)、推广营销(以商业推广为目的,如广告、抽奖、导流帖)。回复按主要目的归入四类:解答型(直接回应帖子提出的问题,如报错原因分析、方案建议)、补充型(对原文的信息补充、纠正或延伸,如勘误、遗漏信息、后续进展)、讨论型(表达观点、参与探讨,如赞同或反对及理由、行业看法)、寒暄型(社交性短回复,如感谢、顶帖、打卡)。分类体系如图 5 所示。
图5 内容分类体系

【头脑风暴】如何结合AI对社区内文章内容进行审核
#1 · antiqueeeee
发帖 2026-08-13 23:48:17 · 快照 2026-08-17 20:40:36

二、设计需求与总体思路

本章把第一章的现象收拢为问题、目标与方案三个层次:2.1 节总结问题——开放社区困境的本质与现有手段的代价;2.2 节整理出设计必须同时达成的主要目标;2.3 节给出破解矛盾的总体思路。

2.1 问题总结

开放注册社区面临的现象——水文、广告涌入,高质量内容被淹没——本质是过程治理的缺失:没有注册门槛这道预筛选,又缺乏替代性的过程筛选,内容生态只能自然退化。

常见的三种应对手段各有不可接受的代价:注册门槛(预筛选)能维持高质量,却排斥潜在贡献者,入口不自由;人工严管(删帖封号)质量可控,却容易演变为"一言堂",产生寒蝉效应;完全放任最自由,但破窗效应之下劣币驱逐良币,社区整体质量失守。三者的对比关系如图 1 所示。
图1 三种治理手段的代价对比
因此,本设计要解决的问题是:能否设计一套过程治理机制,在不设注册门槛、不约束正常发言的前提下,实现高质量内容被放大、底线违规内容被隔离,让自由与质量共存。

2.2 主要目标

治理机制需同时达成三项主要目标:

  1. 底线过滤:找出违反核心价值观的内容并屏蔽。核心价值观明确为社会主义核心价值观,这是不可退让的底线。
  2. 质量放大:找出高质量内容并给予更多关注度,使认真创作获得正反馈。
  3. 保持自由:不设置高注册门槛,不约束正常发言;治理手段不得演变为对观点和立场的审查。

此外,机制的评估对象不只包括内容,还包括用户:通过对用户历史行为的持续评估形成信誉,用信誉调节其在社区内的权重,从机制上防止少数人操纵治理结果。

2.3 总体思路

破解矛盾的关键在于逻辑转换:从"控制谁能说"转向"调节什么被看见"。自由作用于发言权层面——任何人都能发帖,帖子不轻易被删;质量作用于注意力分配层面——好内容获得更多曝光,水帖自然沉底。两者作用在不同层面,因此可以同时成立。

治理机制由两类评估对象两条作用通道组成,另设一套社区反馈信号作为评估的输入。

两类评估对象:一是内容(帖子与回复),对每条内容同时做底线分档(是否越线)和质量评分(质量高低);二是用户,对每个用户的历史行为持续累积形成信誉分,并检测抱团操纵行为(见 3.4 节)。

两条作用通道:一是底线过滤通道,窄而硬,只处理明确违反核心价值观和站规底线的内容,处置手段为屏蔽与删除(越线)、降权折叠(擦边);二是质量放大通道,宽而软,对质量评分相对靠前的内容给予推荐位、精华标记等更多曝光,不惩罚任何人。

社区反馈信号即赞同度:社区成员对内容表达 [-1, 1] 区间的赞同程度,经投票者信誉加权聚合后,作为评估用户信誉和检测操纵行为的输入信号。

整体逻辑是:底线过滤防止"破窗",质量放大解决"激励",用户信誉解决"权力分配"——让持续贡献者的话语权大于新注册者,使小团体难以通过养号操纵治理结果。本文所称"治理系统"是这套机制的工程执行载体:本设计交付其中的两个部分——审核模块(判定链路)与聚合链路(赞同度聚合、信誉计算、抱团检测、质量放大排名);整体方案还依赖站方既有设施承载的部分,由站方系统按本设计的规则实现。工程层面的划分见第四章。总体思路如图 2 所示。
图2 治理机制总体思路

最后由 antiqueeeee 编辑于 2026-08-13 23:58
【头脑风暴】如何结合AI对社区内文章内容进行审核
#0 · antiqueeeee
发帖 2026-08-13 23:46:45 · 快照 2026-08-13 23:48:41

一、背景

本文档针对开放注册论坛的内容治理问题,设计一套兼顾内容质量与发言自由的治理系统。设计的直接背景是新兴社区 LINUX SB(https://linux.sb/)面临的现实困境:以开放注册的方式运营,上线后水文、广告、抽奖帖大量涌入,高质量内容被淹没,站内围绕"要不要设门槛"产生了持续争论。

争论中的代表性观点来自站内帖子《福站再这么玩下去,迟早成为隔壁站的笑料》(https://linux.sb/topic/10237)。该文指出:注册门槛本质是一种预筛选,管理是一种过程筛选,社区两者必须占其一;高门槛社区靠预筛选维持质量,开放社区则必须用更强的过程治理填补缺口,否则"劣币驱逐良币",认真创作的成员因得不到正反馈而流失,社区最终沦为水站。该观点同时也承认:门槛筛掉的不仅是低质用户,也包括潜在的高质量贡献者,且高门槛社区的严格管理往往伴随"一言堂"、随意封号等对发言自由的损害。

需要说明阶段适用性:本设计的处置类规则(屏蔽、删除、降权、放大、共治资格等)均在机制被站方采纳后生效;外部观察阶段(系统尚未被站方采纳、仅从站外获取公开数据观察的运行阶段)只做判定与记录,不产生任何处置。

大型复杂项目如何找到AI开发的正确姿势
#9 · antiqueeeee
发帖 2026-08-13 17:51:55 · 快照 2026-08-13 17:53:48

@antiqueeeee #8 AI开发只是让编码这个过程的效率提高,但是软件工程中存在的矛盾不会消失,只会转移

大型复杂项目如何找到AI开发的正确姿势
#8 · antiqueeeee
发帖 2026-08-13 17:51:11 · 快照 2026-08-13 17:53:48

梳理初始需求,让AI补充BDD + DDD + E2E测试,细致的话把功能时序图、代码组织结构也梳理出来,整理MVP,逐步开发,每次开发一个部分都让Agent review 一次,逐步开发逐步测试

GLM Coding Plan 7天体验卡 0/5 需要自取
#2 · antiqueeeee
发帖 2026-08-13 17:46:17 · 快照 2026-08-13 17:48:23

你是说,帖子的内容我还没看完,但是体验卡已经送完了,这个意思嘛

内容审核用什么模型啊?
#12 · antiqueeeee
发帖 2026-08-13 17:44:27 · 快照 2026-08-18 23:28:30

你还别说,这两天我还真在构想这个事情,但还没形成最终方案,晚点我发个帖子,把我思考过的内容发出来,让站友们一起头脑风暴一下

大家VibeCoding 的作品最终用起来了嘛?
#15 · antiqueeeee
发帖 2026-08-13 17:39:50 · 快照 2026-08-13 17:40:55

@痛失姓名的站长 #1 你果然UID 是1,他喵的

dsv4pro正式版来了有没有破甲词
#4 · antiqueeeee
发帖 2026-08-13 09:23:35 · 快照 2026-08-13 09:25:31

@爱吃肉的棒男孩 #3 爬虫脚本直接就能写,逆向渗透安全测试这些,也有开源项目,这破甲的意义是啥,去搞破坏嘛?

dsv4pro正式版来了有没有破甲词
#2 · antiqueeeee
发帖 2026-08-13 08:34:10 · 快照 2026-08-13 08:35:41

我不理解,研究破甲词的意义是什么?就纯自娱自乐吗?

很多官媒开始使用“词元”这个称呼了,你怎么看
#20 · antiqueeeee
发帖 2026-08-11 08:37:14 · 快照 2026-08-17 21:16:17

@哈雷彗星 #16 “扯什么文化自信 科技话语权” 这个有什么出处嘛?

这里有玩安卓刷机的吗
#14 · antiqueeeee
发帖 2026-08-10 09:27:41 · 快照 2026-08-12 10:44:49

安卓刷机。。梦回201x年....

一点建议:关于不支持无政府主义治理方针的解释
#1 · antiqueeeee
发帖 2026-08-10 09:10:45 · 快照 2026-08-12 10:44:36

你说的“无政府主义”和“去中心化”,指的是对站内发帖内容的管理程度较低么?

【8月抽奖】免费送5台香港CN2云服务器
#323 · antiqueeeee
发帖 2026-08-08 21:32:45 · 快照 2026-08-12 11:12:05

其实我是字母圈儿的,请抽我