KI-Moderation ist sehr gut im Umgang mit Masse und sehr schlecht im Urteilen, und fast jeder Fehler, den Betreiber damit machen, entsteht daraus, dass sie beides verwechseln. Sie liest jeden Beitrag um drei Uhr morgens. Sie sagt Ihnen nicht, ob ein Stammmitglied gerade grausam war oder nur direkt.
Mit dieser Aufteilung im Kopf eingerichtet, nimmt sie Ihnen den größeren Teil der mühsamen Hälfte der Moderation ab. Als Ersatz für einen Moderator eingerichtet, produziert sie selbstbewusste, gut formulierte, falsche Entscheidungen in großem Umfang.
Was sie tatsächlich ist
Hinter diesem Begriff stecken meist zwei verschiedene Mechanismen, und sie versagen auf unterschiedliche Weise.
Regeln sind deterministisch: ein Stichwort, ein Muster, ein Spam-Signal. Sie greifen oder sie greifen nicht, sie sind leicht nachzuvollziehen, und wer aufmerksam ist, umgeht sie mühelos. Klassifizierung ist ein Modell, das Inhalte gegen Kategorien wie Belästigung oder Selbstverletzung bewertet und dabei eine Wahrscheinlichkeit zurückgibt statt eines Urteils.
Keines von beiden ist ein Moderator. Beide erzeugen Kandidaten, und ein Kandidat ist keine Entscheidung — worin das eigentliche Designproblem besteht und weshalb es im weiteren Verlauf dieses Beitrags vor allem darum geht, was nach der Markierung passiert.
Wo sie sich wirklich bezahlt macht
Drei Aufgaben, und es sind die drei langweiligen, was genau der Grund dafür ist, warum es so viel wert ist, sie abzugeben.
Masse. Spam, Betrugslinks und dieselbe Krypto-Nachricht, die in neun Spaces gepostet wird. Das ist Arbeit mit hoher Trefferwahrscheinlichkeit und wenig Kontext, bei der es kaum schadet, gelegentlich danebenzuliegen, und sie macht den Großteil dessen aus, was hereinkommt.
Abdeckung. Ihre Community hört nachts oder am Wochenende nicht auf, und ein kleines Team kann sie nicht durchgehend beobachten. Eine erste Sichtung, während niemand wach ist, hat echten Wert — der Inhalt wird immer noch von einem Menschen gesehen, nur später.
Gleichmäßigkeit beim Offensichtlichen. Menschen moderieren anders, wenn sie müde sind, und noch einmal anders, wenn sie jemanden persönlich nicht mögen. Eine Regel nicht. Bei den eindeutigen Fällen ist diese Gleichmäßigkeit ein Vorteil, und es ist dasselbe Argument wie in Ihre Community automatisieren: Automatisieren Sie das Rauschen.
Wo sie unzuverlässig ist und unzuverlässig bleibt
Die Schwächen sind keine Fehler, die im nächsten Quartal behoben werden. Sie sind Eigenschaften des Problems.
Kontext. Derselbe Satz ist zwischen zwei Stammmitgliedern freundlich und von einem Fremden feindselig. Ein Modell, das einen einzelnen Beitrag bewertet, sieht die acht Monate Vorgeschichte nicht, die den Unterschied für Sie offensichtlich machen.
Sprache innerhalb der Gruppe. Zurückeroberte Schimpfwörter, schwarzer Humor unter Menschen mit derselben Erkrankung und der schroffe Ton mancher Berufsgruppen schneiden allesamt schlecht ab. Communitys aus genau den Menschen, die am ehesten markiert werden, sind auch diejenigen, die am ehesten zu Unrecht markiert werden — das ist ein Fairnessproblem, bevor es ein Problem der Treffsicherheit ist.
Notlagen. Ein Mitglied in Schwierigkeiten schreibt in einem Ton, der einem Regelverstoß ähnelt. Dieser Fall muss schnell einen Menschen erreichen, und er ist das stärkste einzelne Argument gegen automatisches Entfernen — das Sortierproblem, zu dem er gehört, steht in schwierige Community-Mitglieder handhaben.
Markieren, verbergen oder löschen — pro Regel entscheiden
Die meisten Plattformen geben einer automatisierten Regel bei einem Treffer eine von drei Konsequenzen. Für alles dieselbe zu wählen, ist der häufige Fehler.
| Aktion | Was passiert | Richtig für |
|---|---|---|
| Markieren | Der Inhalt bleibt sichtbar, ein Mensch wird gebeten, ihn anzusehen | Alles, was Urteilsvermögen erfordert — Tonfall, Konflikte, Grenzfälle von Regelverstößen |
| Verbergen | Der Inhalt verschwindet bis zur Prüfung, der Autor wird nicht gesperrt | Plausibler Schaden, bei dem Warten schlimmer ist als ein Fehlalarm |
| Löschen | Der Inhalt wird automatisch entfernt, ohne Prüfschritt | Nur das Eindeutige: bekannte Spam-Muster, Betrugsdomains, wiederholte Fluten |
Löschen gehört auf eine sehr kurze Liste. Der Prüfstein ist, ob es Ihnen recht wäre, den Beitrag nie zu Gesicht zu bekommen. Auf einen Krypto-Spamlink trifft das zu, auf fast alles, was ein echtes Mitglied schreibt, nicht — auch nicht auf die Beiträge, die auf den ersten Blick schlecht aussehen.
Bei Mateflow greifen automatisierte Regeln auf Stichwörter, Muster oder Spam-Signale, und jede Regel wählt für sich selbst zwischen Markieren, Verbergen und Löschen — so gibt es die zerstörerische Option dort, wo Sie sie wirklich haben wollen, und sie wird dem Rest nicht aufgezwungen.
Die Warteschlange ist das eigentliche Produkt
Entscheidend ist nicht, wie gut das Modell bewertet. Entscheidend ist, was zwischen der Markierung und der Entscheidung passiert.
Die sichere Grundeinstellung ist, dass markierte Inhalte sichtbar bleiben, bis ein Mensch darüber entscheidet. Alles andere bedeutet, dass ein Fehlalarm stillschweigend den Beitrag eines Mitglieds entfernt und dieses es erst merkt, wenn ihm auffällt, dass der Beitrag weg ist — so verlieren Sie Leute, die nichts falsch gemacht und sich nie beschwert haben.
Mateflow arbeitet genau so: Beiträge, die die KI oder eine Regel als verdächtig kennzeichnet, landen in einer Prüf-Warteschlange und bleiben für Mitglieder sichtbar, bis jemand sie behält oder entfernt, einzeln oder als Sammelaktion. Eine Markierung ist eine Bitte um Aufmerksamkeit, kein Urteilsspruch.
Die praktische Folge ist, dass KI-Moderation den Bedarf an Moderatoren nicht beseitigt, sondern deren Arbeit verändert. Weniger Scrollen auf der Suche nach Problemen, mehr Entscheiden über die, die aufgetaucht sind — was die bessere Aufgabe ist und wofür sich leichter Leute gewinnen lassen, siehe ehrenamtliche Moderatoren gewinnen.
Justieren, ohne den Leuten das Flüstern beizubringen
Schwellenwerte bestimmen, wie viel markiert wird, und beide Richtungen haben ihren Nachteil.
Zu locker, und die Warteschlange füllt sich mit Nichtigkeiten, Ihre Moderatoren beginnen, sie ungelesen abzuarbeiten, und das ganze System wird stillschweigend zur Dekoration. Eine Warteschlange, der niemand vertraut, ist schlimmer als gar keine Warteschlange, weil sie Unaufmerksamkeit als Prozess tarnt.
Zu streng, und die Mitglieder lernen, dass gewöhnliche Beiträge aufgehalten werden. Sie fangen an, sich auf eine Weise selbst zu zensieren, die Sie nicht sehen können, und die Community wird fader, ohne dass jemand ein Problem meldet. Bei Mateflow sind die Kategorien und ihre Schwellenwerte konfigurierbar, mit dem Hauptschalter unter Einstellungen und Inhaltssicherheit; das ist also ein Regler, den Sie anpassen sollen, und keine feste Einstellung.
Beginnen Sie locker, lesen Sie die Warteschlange zwei Wochen lang, und ziehen Sie erst danach anhand der Belege an. Der richtige Schwellenwert ist der, bei dem ein Moderator, der die Warteschlange leert, jeden Eintrag noch liest.
Sagen Sie Ihren Mitgliedern, dass es sie gibt
Nicht offengelegte automatisierte Moderation ist der schnellste Weg zu einer böswilligen Auslegung Ihrer Community.
Sagen Sie in Ihrem Verhaltenskodex klar und deutlich, dass manche Inhalte automatisch geprüft werden, dass ein Mensch die endgültige Entscheidung trifft und wie man eine Entscheidung anfechten kann. Ein Einspruchsweg ist keine Höflichkeit, er ist das, was die ganze Konstruktion legitim macht — und Mateflow führt Einsprüche als eigene Warteschlange, damit sie nicht in Direktnachrichten verschwinden.
Sagen Sie nie, eine Entscheidung sei vom System getroffen worden, wenn ein Mensch sie getroffen hat, und verstecken Sie sich nie hinter dem Modell für eine Entscheidung, die Sie selbst gefällt haben. Mitglieder verzeihen automatisierte Fehler bereitwillig; sie verzeihen es nicht, wenn man ihnen sagt, niemand sei verantwortlich gewesen — die Maßstäbe stehen in eine Online-Community moderieren.
Das Fazit
Automatisieren Sie die Erkennung, behalten Sie die Entscheidung. Reservieren Sie das automatische Entfernen für Inhalte, die Sie ohnehin nie sehen wollen würden, markieren Sie alles, was Urteilsvermögen erfordert, und behandeln Sie die Prüf-Warteschlange als den Teil, der funktionieren muss.
KI-Moderation lohnt sich für fast jede Community jenseits von ein paar hundert Mitgliedern, und die Einrichtung, die schiefgeht, ist immer die, die sie hat entscheiden lassen. Wo KI sonst in einer Community hingehört und wo nicht, steht in wie Sie KI in Ihrer Community einsetzen.