AI 审核非常擅长处理量,非常不擅长做判断,而站长在它身上犯的几乎每一个错误,都源于把这两件事混为一谈。它会在凌晨三点读完每一条帖子。它不会告诉你,一位老成员刚才是在刻薄,还是只是说话直。
按这个分工去搭,它能把审核里最枯燥的那一半拿走。把它当成版主的替代品去搭,它就会成规模地产出自信、格式漂亮、但错误的决定。
它究竟是什么
这个说法背后通常是两套不同的机制,它们失效的方式也不一样。
规则是确定性的:一个关键词、一种模式、一个垃圾信息特征。要么命中要么不命中,逻辑一目了然,但只要对方稍加留意就能轻易绕开。分类则是模型把内容对照骚扰、自伤这类类别打分,给出的是一个概率,而不是一个裁决。
两者都不是版主。它们产出的都是候选项,而候选项不等于决定 —— 这正是整个设计上的难题,也是本文余下篇幅主要在讲「标记之后发生了什么」的原因。
它真正配得上位置的地方
三件事,而且是最枯燥的三件,正因如此,把它们交出去才这么划算。
处理量。垃圾信息、诈骗链接,以及同一条加密货币消息被发到九个空间。这类活儿置信度高、几乎不依赖上下文,偶尔判错也没什么代价,而它恰恰占了绝大部分。
覆盖时段。你的社区不会在夜里或周末停下来,而小团队没法一直盯着。趁没人醒着先做一轮初筛是实打实的价值 —— 内容照样会有人来看,只是晚一点。
在显而易见的事情上保持一致。人累的时候审核尺度会变,私下不喜欢某个人的时候尺度又会变一次。规则不会。对那些没有歧义的情况来说,这种稳定性是优点,这和 社区自动化 里的论点是同一个:把噪音自动化掉。
它不可靠、而且会一直不可靠的地方
这些失效不是下个季度就会修好的缺陷,它们是这个问题本身的性质。
上下文。同一句话,在两位老成员之间是友善的,出自陌生人之口就是敌意。模型只给单条帖子打分,看不到那八个月的往来 —— 而正是这些往来让你一眼就分得清。
圈内用语。被重新占用的贬义词、有共同处境的人之间的黑色幽默、某些职业里直来直去的说话方式,分数都很难看。最容易被标记的那群人所组成的社区,也最容易被错误标记 —— 这首先是个公平问题,其次才是准不准的问题。
求助信号。一位处境艰难的成员,写出来的语气很像违规内容。这种情况必须尽快送到人手里,它也是反对自动移除最有力的一条理由 —— 它所属的那类分拣问题,见 应对难缠的社区成员。
标记、隐藏还是删除 —— 逐条规则去选
大多数平台会让一条自动规则在命中时执行三种处置之一。给所有规则都选同一种,是最常见的错误。
| 处置 | 会发生什么 | 适合 |
|---|---|---|
| 标记 | 内容保持可见,请人来看一眼 | 任何涉及判断的情况 —— 语气、冲突、游走在规则边缘 |
| 隐藏 | 内容先下线等待复审,作者不被封禁 | 存在合理危害风险、且等待的代价比误判更大的情况 |
| 删除 | 内容被自动移除,没有复审环节 | 只用于毫无歧义的情况:已知的垃圾信息模式、诈骗域名、反复刷屏 |
删除只适用于极短的一份清单。判断标准是:你是否能接受自己永远看不到这条内容。加密货币垃圾链接符合这一条,而真实成员写下的东西几乎没有一条符合,包括那些乍看很糟糕的帖子。
在 Mateflow 上,自动规则按关键词、模式或垃圾信息特征匹配,每条规则各自选择标记、隐藏还是删除 —— 这样破坏性最强的那个选项只出现在你确实需要它的地方,而不会被强加给其余规则。
队列才是真正的产品
重要的不是模型打分打得多好,而是从标记到决定之间发生了什么。
安全的默认做法是:被标记的内容在有人处理它之前保持可见。换成别的做法,就意味着一次误判会悄无声息地拿掉一位成员的帖子,而他只能靠发现它不见了才知道 —— 那些什么都没做错、也从不抱怨的人,就是这么流失的。
Mateflow 就是这么做的:被 AI 或规则标为可疑的内容会进入一个复审队列,并且在有人选择保留或撤下之前,对成员始终保持可见,逐条处理或批量处理都可以。标记是一次「请来看看」的请求,不是判决。
由此带来的实际结果是:AI 审核并没有让社区不再需要版主,而是改变了版主的工作内容。少花时间滚动着找问题,多花时间在被推到眼前的那些内容上做决定 —— 这是一份更好的差事,也更好招人,参见 招募志愿版主。
调阈值,但别教会大家压低声音说话
阈值决定了有多少内容会被标记,而两个方向都有代价。
太松,队列里塞满无关紧要的东西,版主开始不看内容就清空队列,整套机制悄无声息地沦为摆设。一个没人信任的队列比没有队列更糟,因为它把敷衍包装成了流程。
太紧,成员会发现连普通帖子都会被卡住。他们开始以你看不见的方式自我审查,社区越来越乏味,却没有任何人来反映问题。在 Mateflow 上,这些类别及其阈值都是可配置的,总开关在「设置」的「内容安全」下 —— 所以这是一个本就该由你去拧的旋钮,而不是一个固定设定。
先放松,读两周队列,再依据证据收紧。合适的阈值,是让清理队列的版主仍然会逐条读完的那一个。
告诉成员它的存在
不加说明的自动化审核,是让别人以最大恶意解读你社区的最快途径。
在你的 社区行为准则 里明说:部分内容会被自动检查,最终决定由人来做,以及如何对一个决定提出申诉。申诉渠道不是一种客气,它是让整套安排具备正当性的东西 —— 而 Mateflow 把申诉放在它们自己独立的队列里,这样它们就不会消失在私信中。
决定明明是人做的,就绝不要说成是系统做的;你自己选择的判断,也绝不要躲在模型背后。成员很容易原谅自动化犯的错,但他们不会原谅被告知没有人需要为此负责 —— 相关标准见 如何做好线上社区审核。
结论
自动化检测,保留判断。把自动移除留给那些你根本不想看到的内容,把所有涉及判断的内容标记出来,并把复审队列当作那个必须跑得通的环节来对待。
对于规模超过几百名成员的社区,AI 审核几乎都值得配起来,而出问题的配置方式,永远是那种放手让它来决定的。关于 AI 在社区里还适合用在哪、又不适合用在哪,见 如何在社区中使用 AI。