Die KI-Moderation prüft mit einem KI-Modell (OpenAI Moderation) Beiträge und, wenn du möchtest, Antworten, sobald sie erstellt oder bearbeitet werden. Sie bewertet Inhalte in Kategorien wie Belästigung, Hass und Gewalt und kann Inhalte ausblenden oder markieren, die deine Schwellenwerte überschreiten. Sie arbeitet zusätzlich zu deinen Keyword- und Spamfilter-Regeln, nicht an ihrer Stelle.
Wer kann das tun: Inhaber und Administratoren schalten die KI-Moderation ein und konfigurieren sie. Moderatoren können KI-Aktivität ansehen und zurückgehaltene Inhalte prüfen. · Wo: Web, in der Admin-Konsole. · Tarif: In jedem Plattform-Tarif verfügbar. Die KI-Moderation verbraucht nicht das KI-Kontingent deines Tarifs.
KI-Moderation aktivieren
- Gehe zu Admin → Einstellungen → Inhaltssicherheit. Die Seite heißt Inhalts-Moderation.
- Schalte unter KI-Moderation die Option KI-Moderation aktivieren ein.
- Klicke unten auf der Seite auf Save Changes.
Wenn der Schalter aus ist, werden keine Beiträge an OpenAI gesendet. Inhalte werden an einen Drittanbieterdienst gesendet. Prüfe also deine Datenschutzerklärung, bevor du die Funktion einschaltest. Siehe Datenschutz und Grenzen der KI.
KI-Klassifizierung konfigurieren
Die detaillierten Einstellungen findest du unter Admin → Moderation → Automatisierte Moderation im Abschnitt KI-Klassifizierung. Du kannst auch auf der Seite „Inhaltssicherheit“ auf In Automatisierter Moderation konfigurieren klicken. Nur Inhaber und Administratoren sehen diesen Abschnitt.
Klicke auf Konfigurieren und lege fest:
- Modus: Shadow oder Enforce (siehe nächster Abschnitt). Neue Communities beginnen mit Shadow.
- Scannen: Beiträge der obersten Ebene, Antworten und Kommentare oder beides. Wähle mindestens eine Option. Antworten erzeugen das 5- bis 20-Fache des Moderationsaufkommens von Beiträgen der obersten Ebene.
- Schwellenwerte: wann Inhalte blockiert oder markiert werden, pro Kategorie.
Klicke auf Änderungen speichern. Das Speichern hier ändert den Ein/Aus-Schalter unter „Inhaltssicherheit“ nicht.
Modus Shadow und Modus Enforce
| Modus | Was passiert |
|---|---|
| Shadow | Die KI speichert nur Bewertungen. Nichts wird ausgeblendet und nichts kommt in die Warteschlange. Nutze den Modus, um zu sehen, wie die KI die Inhalte deiner Community beurteilt. |
| Enforce | Inhalte über einem Schwellenwert unter Blockieren werden sofort ausgeblendet und zur Prüfung geschickt. Inhalte über einem Schwellenwert unter Markieren bleiben sichtbar und warten auf die Entscheidung eines Moderators. |
Wenn du zu Enforce wechselst, musst du bestätigen, dass markierte Beiträge ab sofort zurückgehalten werden. Prüfe vorher die Ergebnisse des Shadow-Modus unter KI-Aktivität.
Schwellenwerte für die KI-Moderation festlegen
Jede Kategorie hat einen Schwellenwert von 0 bis 1. Eine Kategorie greift, wenn die Bewertung des Inhalts den Schwellenwert erreicht oder überschreitet. Ein niedrigerer Schwellenwert ist also strenger.
- Blockieren (Inhalt ablehnen): schwere Kategorien wie Sexual content involving minors, Graphic violence, Self-harm instructions, Threatening hate speech und Violent wrongdoing.
- Markieren (an Prüf-Warteschlange senden): breitere Kategorien: Hate, Harassment, Sexual content, Violence, Self-harm und Illicit behavior.
Setze bei einer Kategorie ein Häkchen, um sie zu verwenden, und lege ihren Wert fest, oder klicke auf Empfohlene Standardwerte. Jede Stufe wird als Ganzes gespeichert: Kategorien, die du in einer Stufe nicht anhakst, greifen nicht mehr. Erweitert (JSON) zeigt dieselben Einstellungen als JSON.
Von der KI-Moderation zurückgehaltene Inhalte prüfen
Im Modus Enforce warten blockierte und markierte Inhalte unter Admin → Moderation → Ausstehende Inhalte, wo Markiert wegen den Wert KI zeigt. Genehmige sie, um sie zu veröffentlichen, oder lehne sie ab, um sie zu entfernen. Blockierte Inhalte bleiben ausgeblendet, bis du entscheidest; markierte Inhalte bleiben in der Zwischenzeit sichtbar. Wie du sie prüfst und was Autoren sehen, erfährst du unter Zurückgehaltene und ausstehende Inhalte prüfen.
KI-Entscheidungen auf der Seite „KI-Aktivität“ prüfen
Admin → Moderation → KI-Aktivität listet jede Entscheidung der KI-Moderation. Die Seite ist ein Protokoll, keine Arbeitswarteschlange: Aktionen hier ändern den Inhalt nicht.
- Jede Zeile zeigt Inhalt, Autor, Kategorien, Score, Modus, Ergebnis und Datum. Ergebnisse sind Würde blockieren oder Würde markieren (Shadow, nur gespeichert), Blockiert, Markiert, Nicht durchgesetzt oder Durchgelassen.
- Filtere nach Modus, Ergebnis, Kategorie, Inhaltstyp und Zeitraum.
- Klicke auf eine Zeile, um Modell, Schwellenwerte und Kategorie-Scores zu sehen.
- Bewerte die Entscheidungen der KI mit Richtige Entscheidung oder Falsche Entscheidung (aufgehoben). Aufhebungsrate zeigt, wie oft Moderatoren anderer Meinung sind.
- Nach Kategorie zeigt, wie oft jede Kategorie greift und aufgehoben wird. Eine hohe Aufhebungsrate bedeutet, dass dieser Schwellenwert zu locker ist. Klicke auf Schwellenwerte anpassen, um ihn zu ändern.
Gut zu wissen über die KI-Moderation
- Die KI-Moderation prüft Titel und Text von Beiträgen und Antworten, wenn sie erstellt und wenn sie bearbeitet werden. Bilder, Anhänge und Videos prüft sie nicht.
- Beiträge und Antworten von Community-Admins und Space-Moderatoren werden nicht an die KI-Moderation gesendet.
- Keyword-, Regex- und Spamfilter-Regeln werden separat eingerichtet. Siehe Regeln für die automatische Moderation einrichten.
- Die KI-Moderation verbraucht nicht das KI-Kontingent deines Tarifs. Siehe KI-Nutzung und Credits verstehen.
Verwandte Artikel
War dieser Leitfaden hilfreich?