AI モデレーションは、AI モデル(OpenAI Moderation)を使って、投稿と、必要に応じて返信を、作成時や編集時にチェックします。嫌がらせ、ヘイト、暴力などのカテゴリでコンテンツをスコア付けし、しきい値を超えたコンテンツを非表示にしたり、フラグを付けたりできます。キーワードやスパムフィルターのルールに代わるものではなく、それらと併せて機能します。
対象者:AI モデレーションの有効化と設定は、オーナーと管理者が行います。モデレーターは、AIアクティビティの閲覧と保留されたコンテンツの審査ができます。 · 場所:ウェブの管理画面。 · プラン:すべてのプラットフォームプランで利用できます。AI モデレーションは、プランの AI 利用枠を消費しません。
AI モデレーションを有効にする
- 管理画面 → 設定 → コンテンツの安全性に移動します。ページのタイトルはコンテンツモデレーションです。
- AIモデレーションで、AIモデレーションを有効にするをオンにします。
- ページ下部の Save Changes をクリックします。
スイッチがオフの間は、投稿は OpenAI に送信されません。コンテンツは第三者のサービスに送信されるため、有効にする前にプライバシーポリシーを確認してください。AIのデータプライバシーと制限事項を参照してください。
AI分類を設定する
詳細な設定は、管理画面 → モデレーション → 自動モデレーションのAI分類セクションにあります。コンテンツの安全性のページで自動モデレーションで設定をクリックして開くこともできます。このセクションは、オーナーと管理者にだけ表示されます。
設定をクリックして、次の項目を設定します。
- モード:シャドウまたは強制(次のセクションを参照)。新しいコミュニティはシャドウから始まります。
- スキャン対象:トップレベルの投稿、返信とコメント、またはその両方。少なくとも 1 つを選びます。返信は、トップレベルの投稿の 5~20 倍のモデレーション量になります。
- しきい値:コンテンツをブロックまたはフラグ付けする基準を、カテゴリごとに設定します。
変更を保存をクリックします。ここで保存しても、コンテンツの安全性のオン・オフのスイッチは変わりません。
シャドウモードと強制モード
| モード | 動作 |
|---|---|
| シャドウ | AI はスコアを記録するだけです。何も非表示にならず、キューにも入りません。AI がコミュニティのコンテンツをどう判断するかを確認するために使います。 |
| 強制 | ブロックのしきい値を超えたコンテンツは、すぐに非表示になり、審査に回されます。フラグのしきい値を超えたコンテンツは表示されたまま、モデレーターの判断を待ちます。 |
強制に切り替えるときは、今後フラグが付いた投稿は保留されることを確認するチェックを入れる必要があります。先にAIアクティビティでシャドウモードの結果を確認してください。
AI モデレーションのしきい値を設定する
各カテゴリには 0~1 のしきい値があります。コンテンツのスコアがしきい値以上になるとそのカテゴリが発動するため、しきい値が低いほど厳しくなります。
- ブロック(コンテンツを却下):Sexual content involving minors、Graphic violence、Self-harm instructions、Threatening hate speech、Violent wrongdoing などの重大なカテゴリです。
- フラグ(レビューキューに送信):Hate、Harassment、Sexual content、Violence、Self-harm、Illicit behavior といった、より広いカテゴリです。
使うカテゴリにチェックを入れて値を設定するか、推奨デフォルト値をクリックします。各段階は全体として保存されます。段階内でチェックを外したカテゴリは発動しなくなります。詳細設定(JSON) には、同じ設定が JSON で表示されます。
AI モデレーションで保留されたコンテンツを審査する
強制モードでは、ブロックまたはフラグ付けされたコンテンツは管理画面 → モデレーション → 審査待ちコンテンツで待機し、フラグ理由に AI と表示されます。承認すると公開され、却下すると削除されます。ブロックされたコンテンツは判断するまで非表示のままで、フラグ付けされたコンテンツはその間も表示されたままです。審査の方法と投稿者に表示される内容については、保留中・審査待ちのコンテンツを審査するを参照してください。
AIアクティビティのページで AI の判定を確認する
管理画面 → モデレーション → AIアクティビティには、AI モデレーションのすべての判定が一覧表示されます。これは作業キューではなくログです。ここで操作しても、コンテンツは変更されません。
- 各行には、コンテンツ、投稿者、カテゴリ、スコア、モード、結果、日付が表示されます。結果は、ブロック予定またはフラグ予定(シャドウモードで記録のみ)、ブロック済み、フラグ済み、未適用、通過のいずれかです。
- モード、結果、カテゴリ、コンテンツの種類、期間で絞り込めます。
- 行をクリックすると、モデル、しきい値、カテゴリスコアが表示されます。
- 正しい判定または誤った判定(覆し) で、AI の判定を評価します。覆し率は、モデレーターが AI と異なる判断をした頻度を示します。
- カテゴリ別には、各カテゴリが発動した頻度と覆された頻度が表示されます。覆し率が高い場合は、そのしきい値がゆるすぎることを意味します。しきい値を調整をクリックして変更してください。
AI モデレーションについて知っておきたいこと
- AI モデレーションは、投稿と返信のタイトルと本文のテキストを、作成時と編集時にチェックします。画像、添付ファイル、動画はチェックしません。
- コミュニティの管理者とスペースモデレーターによる投稿と返信は、AI モデレーションに送信されません。
- キーワード、正規表現、スパムフィルターのルールは別に設定します。自動モデレーションルールを設定するを参照してください。
- AI モデレーションは、プランの AI 利用枠を消費しません。AIの使用状況とクレジットを理解するを参照してください。
関連記事
このガイドは役に立ちましたか?