AI 모더레이션은 AI 모델(OpenAI Moderation)을 사용해 게시물과, 원하는 경우 답글을 작성하거나 수정할 때 검사합니다. 괴롭힘, 혐오, 폭력 같은 카테고리별로 콘텐츠에 점수를 매기고, 설정한 임계값을 넘는 콘텐츠를 숨기거나 플래그할 수 있습니다. 키워드 및 스팸 필터 규칙을 대체하지 않고 함께 작동합니다.
사용 가능한 사람: 소유자와 관리자가 AI 모더레이션을 켜고 구성합니다. 모더레이터는 AI 활동을 보고 보류된 콘텐츠를 검토할 수 있습니다. · 위치: 웹의 관리 콘솔. · 플랜: 모든 플랫폼 플랜에서 사용할 수 있습니다. AI 모더레이션은 플랜의 AI 사용 한도를 사용하지 않습니다.
AI 모더레이션 켜기
- 관리자 → 설정 → 콘텐츠 안전으로 이동합니다. 페이지 제목은 콘텐츠 모더레이션입니다.
- AI 모더레이션에서 AI 모더레이션 활성화를 켭니다.
- 페이지 하단의 Save Changes를 클릭합니다.
스위치가 꺼져 있으면 게시물이 OpenAI로 전송되지 않습니다. 콘텐츠가 서드파티 서비스로 전송되므로 켜기 전에 개인정보 보호정책을 검토하세요. AI 데이터 개인정보 보호와 제한 사항을 참고하세요.
AI 분류 구성하기
세부 설정은 관리자 → 검토 → 자동 모더레이션의 AI 분류 섹션에 있습니다. 콘텐츠 안전 페이지에서 자동 모더레이션에서 설정을 클릭해도 됩니다. 소유자와 관리자만 이 섹션을 봅니다.
구성을 클릭하고 다음을 설정합니다.
- 모드: 섀도우 또는 강제(다음 섹션 참고). 새 커뮤니티는 섀도우로 시작합니다.
- 검사 대상: 최상위 게시물, 답글 및 댓글, 또는 둘 다. 하나 이상 선택해야 합니다. 답글은 최상위 게시물보다 5~20배 많은 모더레이션 트래픽을 발생시킵니다.
- 임계값: 콘텐츠를 차단하거나 플래그하는 기준을 카테고리별로 설정합니다.
변경사항 저장을 클릭합니다. 여기에서 저장해도 콘텐츠 안전의 켜기/끄기 스위치는 바뀌지 않습니다.
섀도우 모드와 강제 모드
| 모드 | 동작 |
|---|---|
| 섀도우 | AI가 점수만 기록합니다. 아무것도 숨기거나 대기열에 넣지 않습니다. AI가 커뮤니티 콘텐츠를 어떻게 판단하는지 확인할 때 사용합니다. |
| 강제 | 차단 임계값을 넘은 콘텐츠는 즉시 숨겨지고 검토로 보내집니다. 플래그 임계값을 넘은 콘텐츠는 계속 보이는 상태로 모더레이터의 결정을 기다립니다. |
강제로 전환하면 앞으로 플래그된 게시물이 보류된다는 확인란을 체크해야 합니다. 먼저 AI 활동에서 섀도우 모드 결과를 검토하세요.
AI 모더레이션 임계값 설정하기
각 카테고리에는 0에서 1 사이의 임계값이 있습니다. 콘텐츠 점수가 임계값 이상이면 해당 카테고리가 발동하므로, 임계값이 낮을수록 더 엄격합니다.
- 차단(콘텐츠 거부): Sexual content involving minors, Graphic violence, Self-harm instructions, Threatening hate speech, Violent wrongdoing 같은 심각한 카테고리.
- 플래그(검토 대기열로 전송): Hate, Harassment, Sexual content, Violence, Self-harm, Illicit behavior 같은 더 넓은 범위의 카테고리.
카테고리를 체크해 사용하고 값을 설정하거나, 권장 기본값을 클릭합니다. 각 단계는 통째로 저장됩니다. 단계에서 체크하지 않은 카테고리는 더 이상 발동하지 않습니다. 고급(JSON) 섹션에는 같은 설정이 JSON으로 표시됩니다.
AI 모더레이션이 보류한 콘텐츠 검토하기
강제 모드에서는 차단되거나 플래그된 콘텐츠가 관리자 → 검토 → 검토 대기 콘텐츠에서 기다리며, 플래그 사유에 AI가 표시됩니다. 승인하면 게시되고, 거부하면 삭제됩니다. 차단된 콘텐츠는 결정할 때까지 숨겨지고, 플래그된 콘텐츠는 그동안 계속 보입니다. 검토 방법과 작성자에게 보이는 화면은 보류 및 검토 대기 콘텐츠 검토하기를 참고하세요.
AI 활동 페이지에서 AI 결정 확인하기
관리자 → 검토 → AI 활동에는 모든 AI 모더레이션 결정이 나열됩니다. 작업 대기열이 아니라 로그이므로, 여기에서 조치해도 콘텐츠는 바뀌지 않습니다.
- 각 행에는 콘텐츠, 작성자, 카테고리, 점수, 모드, 결과, 날짜가 표시됩니다. 결과는 차단 예정 또는 신고 예정(섀도우, 기록만 함), 차단됨, 신고됨, 적용 안 됨, 통과됨입니다.
- 모드, 결과, 카테고리, 콘텐츠 유형, 날짜 범위로 필터링합니다.
- 행을 클릭하면 모델, 임계값, 카테고리 점수를 볼 수 있습니다.
- 올바른 결정 또는 잘못된 결정 (번복) 버튼으로 AI의 결정을 평가합니다. 번복 비율은 모더레이터가 AI와 얼마나 자주 의견이 다른지 보여 줍니다.
- 카테고리별은 각 카테고리가 얼마나 자주 발동하고 번복되는지 보여 줍니다. 번복 비율이 높으면 해당 임계값이 너무 느슨하다는 뜻입니다. 변경하려면 임계값 조정을 클릭합니다.
AI 모더레이션에 대해 알아 두기
- AI 모더레이션은 게시물과 답글의 제목과 본문 텍스트를 작성할 때와 수정할 때 검사합니다. 이미지, 첨부 파일, 동영상은 검사하지 않습니다.
- 커뮤니티 관리자와 스페이스 모더레이터가 작성한 게시물과 답글은 AI 모더레이션으로 보내지 않습니다.
- 키워드, 정규식, 스팸 필터 규칙은 별도로 설정합니다. 자동 모더레이션 규칙 설정하기를 참고하세요.
- AI 모더레이션은 플랜의 AI 사용 한도를 사용하지 않습니다. AI 사용량과 크레딧 이해하기를 참고하세요.
관련 문서
이 가이드가 도움이 되었나요?