A moderação por IA é ótima com volume e péssima com julgamento, e quase todo erro que donos de comunidade cometem com ela vem de confundir as duas coisas. Ela vai ler cada publicação às três da manhã. Ela não vai dizer se um veterano foi cruel ou apenas direto.
Configurada com essa divisão em mente, ela elimina a maior parte da metade tediosa da moderação. Configurada como substituta de um moderador, ela produz decisões erradas, confiantes e bem formatadas, em escala.
O que ela é de fato
Normalmente há dois mecanismos diferentes por trás dessa expressão, e eles falham de maneiras distintas.
Regras são determinísticas: uma palavra-chave, um padrão, um sinal de spam. Elas correspondem ou não correspondem, são fáceis de entender e são burladas sem esforço por qualquer um que esteja prestando atenção. Classificação é um modelo que pontua o conteúdo em categorias como assédio ou automutilação, devolvendo uma probabilidade em vez de um veredito.
Nenhuma das duas é um moderador. Ambas produzem candidatos, e um candidato não é uma decisão — esse é o problema central de design, e a razão pela qual o resto deste artigo trata sobretudo do que acontece depois da sinalização.
Onde ela realmente vale o que custa
Três tarefas, e são as três mais chatas, que é exatamente por isso que delegá-las vale tanto.
Volume. Spam, links de golpe e a mesma mensagem sobre cripto publicada em nove espaços. É um trabalho de alta confiança e pouco contexto, com quase nenhum prejuízo em errar de vez em quando, e é a maior parte do que chega.
Cobertura. Sua comunidade não para à noite nem no fim de semana, e uma equipe pequena não consegue acompanhá-la sem interrupção. Uma triagem de primeira passada enquanto ninguém está acordado é valor real — o conteúdo continua sendo visto por uma pessoa, só que mais tarde.
Consistência no que é óbvio. Pessoas moderam de um jeito quando estão cansadas, e de outro quando não vão com a cara de alguém. Uma regra não. Nos casos sem ambiguidade, essa uniformidade é uma vantagem, e é o mesmo argumento feito em automatizar sua comunidade: automatize o ruído.
Onde ela não é confiável, e continua não sendo
As falhas não são bugs que serão corrigidos no próximo trimestre. São propriedades do problema.
Contexto. A mesma frase é amigável entre dois veteranos e hostil vinda de um estranho. Um modelo que pontua uma publicação isolada não enxerga os oito meses de histórico que tornam a diferença óbvia para você.
Linguagem de grupo. Termos pejorativos ressignificados, humor ácido entre pessoas que compartilham uma condição e o tom direto de certas profissões pontuam mal. As comunidades das pessoas com maior chance de serem sinalizadas são justamente as com maior chance de serem sinalizadas por engano, o que é um problema de justiça antes de ser um problema de acurácia.
Sofrimento. Um membro em apuros escreve num registro que se parece com uma violação das regras. Esse caso precisa chegar rápido a uma pessoa, e é o argumento isolado mais forte contra a remoção automática — o problema de triagem a que ele pertence está em lidar com membros difíceis da comunidade.
Sinalizar, ocultar ou excluir — escolha regra a regra
A maioria das plataformas dá a uma regra automatizada uma de três consequências quando há correspondência. Escolher a mesma para tudo é o erro mais comum.
| Ação | O que acontece | Indicada para |
|---|---|---|
| Sinalizar | O conteúdo continua no ar, e uma pessoa é chamada para olhar | Tudo que envolva julgamento — tom, conflito, violação limítrofe das regras |
| Ocultar | O conteúdo sai do ar aguardando revisão, e o autor não é banido | Dano plausível em que esperar é pior do que um falso positivo |
| Excluir | O conteúdo é removido automaticamente, sem etapa de revisão | Apenas o inequívoco: padrões conhecidos de spam, domínios de golpe, enxurradas repetidas |
Excluir pertence a uma lista muito curta. O teste é se você ficaria tranquilo em nunca ver aquele item. Isso vale para um link de spam de cripto e não vale para quase tudo que um membro de verdade escreve, inclusive as publicações que parecem ruins à primeira vista.
No Mateflow, as regras automatizadas correspondem a palavras-chave, padrões ou sinais de spam, e cada regra escolhe por si mesma entre sinalizar, ocultar ou excluir — assim a opção destrutiva existe onde você realmente a quer e não é imposta ao resto.
A fila é o produto de verdade
O que importa não é quão bem o modelo pontua. É o que acontece entre a sinalização e a decisão.
O padrão seguro é que o conteúdo sinalizado continue visível até que uma pessoa decida sobre ele. Qualquer outra coisa significa que um falso positivo remove em silêncio a publicação de um membro, e ele só descobre ao notar que ela sumiu — que é como você perde gente que não fez nada de errado e nunca reclamou.
O Mateflow funciona assim: os itens que a IA ou uma regra marca como suspeitos vão para uma fila de revisão e continuam visíveis para os membros até que alguém os mantenha ou os tire do ar, individualmente ou em lote. Sinalizar é um pedido de atenção, não uma sentença.
A consequência prática é que a moderação por IA não elimina a necessidade de moderadores, ela muda o trabalho deles. Menos rolagem à procura de problemas, mais decisão sobre os casos trazidos à tona — o que é um trabalho melhor, e mais fácil de recrutar, conforme recrutar moderadores voluntários.
Ajustar sem ensinar as pessoas a sussurrar
Os limiares decidem quanta coisa é sinalizada, e as duas direções têm um custo.
Frouxo demais e a fila enche de nada, seus moderadores passam a esvaziá-la sem ler, e o sistema inteiro vira enfeite sem que ninguém perceba. Uma fila em que ninguém confia é pior do que fila nenhuma, porque transforma desatenção em processo.
Apertado demais e os membros aprendem que publicações comuns ficam retidas. Eles passam a se autocensurar de formas que você não consegue ver, e a comunidade fica mais sem graça sem que ninguém relate problema algum. No Mateflow, as categorias e seus limiares são configuráveis, com a chave geral em Configurações e Segurança de Conteúdo, então esse é um botão que se espera que você ajuste, e não um valor fixo.
Comece frouxo, leia a fila por duas semanas e aperte com base em evidências. O limiar certo é aquele em que o moderador que esvazia a fila ainda está lendo cada item.
Conte aos seus membros que ela existe
Moderação automatizada não declarada é o caminho mais rápido para uma leitura de má-fé da sua comunidade.
Diga com todas as letras no seu código de conduta que parte do conteúdo é verificada automaticamente, que uma pessoa dá a palavra final e como contestar uma decisão. Um caminho de recurso não é uma cortesia, é o que torna todo o arranjo legítimo — e o Mateflow mantém os recursos numa fila própria, para que não sumam dentro das mensagens diretas.
Nunca diga que uma decisão foi tomada pelo sistema quando quem a tomou foi uma pessoa, e nunca se esconda atrás do modelo por uma escolha que foi sua. Os membros perdoam erros automatizados com facilidade; o que não perdoam é ouvir que ninguém era responsável — os critérios estão em como moderar uma comunidade online.
Em resumo
Automatize a detecção, mantenha a decisão com você. Reserve a remoção automática para conteúdo que você nunca gostaria de ver, sinalize tudo que envolva julgamento e trate a fila de revisão como a parte que precisa funcionar.
Vale a pena configurar moderação por IA em quase qualquer comunidade que passe de algumas centenas de membros, e a configuração que dá errado é sempre aquela que deixou a IA decidir. Para saber onde mais a IA cabe numa comunidade, e onde não cabe, veja como usar IA na sua comunidade.