Moderação de UGC e deteção de conteúdo sensível em texto, foto, vídeo e voz.
O AiST Moderation verifica o conteúdo à entrada e à saída: toxicidade, extremismo, NSFW, deepfake, publicidade de concorrentes, fugas de PII e de cartões. Protege redes sociais, marketplaces, o e-mail corporativo e o call center — automaticamente, de acordo com as suas políticas.
- ⚠ Texto · foto · vídeo · áudio
- ⛨ Mascaramento de PII / PCI-DSS
- ◉ Deteção de conteúdo Ai & deepfake
- ≋ Realtime + batch
- ⌘ 152-FZ · 149-FZ · on-prem
Um comentário tóxico — um escândalo. Uma fuga de cartão — uma coima.
O UGC, o e-mail de saída, o conteúdo do marketplace: é um fluxo de milhares de unidades por dia. A moderação manual é lenta, cara e, mesmo assim, deixa passar conteúdo. Uma única falha custa reputação, uma coima legal ou uma fuga de dados de clientes.
Os moderadores não dão conta, a toxicidade passa
Ao marketplace ou à rede social chegam 50 000 anúncios e comentários por dia. Uma equipa de 15 moderadores cobre 15%. O resto fica ao acaso. Uma publicação escandalosa torna-se a notícia do dia nos canais de Telegram.
As fugas de PII e de cartões custam milhões
Um colaborador anexa a um e-mail para o cliente um ficheiro com dados de passaporte. Um operador do call center dita um número de cartão que fica gravado na chamada. Um gestor envia por Telegram uma lista de preços com segredos comerciais. Cada caso é uma infração à 152-FZ.
Conteúdo no estilo da marca? — não, é Ai e acaso
Os colaboradores publicam em nome da marca qualquer coisa. O marketing satura o feed com imagens do Midjourney «fora do estilo». Os prestadores publicam textos de Ai com alucinações. Controlar tudo à mão é inviável.
O conteúdo chega → é classificado → sai para o público, passa a revisão ou vai para o lixo.
O pipeline aceita qualquer conteúdo (texto, foto, vídeo, áudio, ficheiro), processa-o em paralelo com mais de 20 classificadores e as suas regras personalizadas, emite um veredicto com probabilidades de scoring e encaminha-o: aprovação automática, bloqueio automático ou revisão humana.
-
01
O conteúdo chega de qualquer origem REST/Webhook na fase pre-publish, bus Kafka para o fluxo massivo, gateway de e-mail para DLP, interceção de mensagens nas aplicações de mensagens corporativas, gravação de chamadas do call center.
-
02
Mais de 20 classificadores em paralelo Toxicidade, extremismo, NSFW, deepfake, publicidade de concorrentes, infrações à 149-FZ, rotulagem de agentes estrangeiros, PII, PCI, segredo comercial. Cada um com o seu scoring 0..1, tudo é combinado.
-
03
Veredicto segundo as suas políticas «Se NSFW > 0.85 — bloqueio; se 0.4–0.85 — revisão», «se o e-mail contém um NIF e o destinatário está fora do domínio — bloqueio». Construtor de regras sem código.
-
04
Ação e auditoria — automáticas O conteúdo sai para o público, vai para o lixo ou entra na fila do moderador com prioridade. Cada decisão fica no log de auditoria e no SIEM. O moderador clica em «concordo» — e o modelo é retreinado.
Mais de 20 classificadores — para tudo o que importa ao negócio e à Segurança.
Não um «filtro Ai» universal, mas um conjunto de modelos especializados. Cada um conhece com precisão a sua classe. Todos trabalham em paralelo e oferecem um scoring transparente por categoria.
Toxicidade & insultos
Ódio, ameaças, linguagem obscena, humilhações por características. ru/en, calão, palavrões camuflados.
149-FZ & extremismo
Conteúdo proibido, simbologia, agentes estrangeiros, publicidade do que é proibido pela legislação russa.
NSFW & violência
Erotismo, violência, armas, drogas, sangue. Modelos vision para foto e vídeo.
Deepfake & conteúdo Ai
Vídeos deepfake, rostos gerados por FLUX/SDXL, textos do ChatGPT/Claude.
PII / dados pessoais
Passaporte, SNILS, INN, OGRN, telefone, e-mail, morada. Em texto, foto (OCR) e voz (ASR).
PCI-DSS / números de cartão
Cartões em texto, em gravações de chamadas, em documentos digitalizados. Algoritmo de Luhn + máscara.
Segredo comercial
Listas de preços, contratos, bases de clientes. Pesquisa por modelos e marcadores dos seus documentos.
Spam / phishing / burlas
Padrões de fraude, contactos fora da plataforma, ligações para domínios de phishing.
Publicidade de concorrentes
Logótipos, menções, publicidade encoberta em UGC. A lista negra de marcas é a sua.
Direitos de autor
Perceptual-hash para foto e vídeo, pesquisa na sua base de ativos aprovados.
Conteúdo por idades
Restrições de idade 18+/16+/12+ segundo a UEE, rotulagem de conteúdo, age-gate.
Realtime + batch
API ~150 ms por unidade, processamento batch de milhões de unidades por noite sobre arquivos históricos.
Qualquer conteúdo — qualquer canal. Um único motor — todos os pontos de entrada.
UGC do marketplace, anúncios, avaliações, comentários, e-mail de saída, chats nas aplicações de mensagens corporativas, chamadas do call center, documentos antes da publicação. Em todo o lado — a mesma política, o mesmo scoring, a mesma auditoria.
// tipos de conteúdo
// formatos
// canais de entrada
// legislação russa
// setores & plataformas
// ações segundo o veredicto
Um motor — um único conjunto de políticas. O conteúdo é verificado da mesma forma em todo o lado.
Antes: um moderador para os comentários, antispam para o e-mail, um proxy DLP para os documentos, uma equipa à parte para as chamadas do call center. Cada um com regras próprias que se contradiziam. Agora — uma política, um dicionário, uma auditoria e diferentes pontos de entrada.
O UGC é verificado antes de ser publicado. Invisível para o utilizador — simplesmente a sua «publicação publicada» aparece em 0.2 segundos.
O arquivo de comentários, conversas ou documentos é processado por lotes. As anomalias e as infrações detetadas vão para o moderador.
Interceção de e-mails e anexos antes do envio. Bloqueio de fugas de PII, cartões, contratos e bases de dados. Alerta ao responsável de Segurança.
Da moderação de um marketplace ao DLP corporativo.
O Moderation é a infraestrutura do «filtro». Cada departamento encontra o seu caso: plataformas UGC, Segurança, marketing, suporte, media. Um motor, diferentes políticas e canais.
Moderação pre-publish de anúncios
Antes de ser publicado, cada anúncio é verificado: produtos proibidos, esquemas fraudulentos, contactos fora da plataforma, rostos de pessoas sem consentimento. 96% sai para o público automaticamente em 0.2 s; o resto vai para o moderador com uma explicação.
Moderação de comentários em tempo real
Cada comentário recebe um veredicto em 150 ms: aprovação, ocultação, banimento. Ódio, política, publicidade de concorrentes, spam, ligações de phishing — são bloqueados antes de um único utilizador os ver.
Proteção contra fugas de PII por e-mail
O gateway de e-mail analisa as mensagens de saída. Se o e-mail contém um passaporte, um cartão, NIF de clientes ou uma exportação do CRM — bloqueio antes do envio, alerta ao responsável de Segurança e ticket no Jira. 100% menos fugas segundo a 152-FZ.
Controlo do que dizem os operadores
Gravação da chamada através do AiST ASR → moderação da transcrição: descortesia, promessas de descontos sem autorização, fuga de PII, «dite-me agora o seu cartão». Alerta ao supervisor por cada incidente.
Verificação do conteúdo antes da publicação
Cada artigo passa por uma revisão: agentes estrangeiros sem rotulagem, extremismo, notícias falsas, verificação de factos através de RAG. O editor vê os alertas antes de publicar, não depois de uma queixa do regulador.
KYC e deteção de deepfake
A selfie de onboarding ou a videoverificação é analisada em busca de deepfake, montagem ou máscara. Os documentos, em busca de carimbos e selos falsificados. 80% menos pedidos fraudulentos.
Não é preciso montar o «seu próprio CONTROLO». Está tudo já configurado.
Um classificador «em bruto» é menos de um quarto da tarefa. Além disso, são precisos: mais de 20 modelos para diferentes categorias, um construtor de políticas, gateways (e-mail, Kafka, SIP), uma fila de moderador com prioridades, dashboards, log de auditoria no SIEM e retreino. Nós já temos tudo isto montado.
Ativa-se — não é a equipa de Segurança que o constrói durante um ano.
O AiST Moderation é um serviço dentro da AiST Platform. Não precisa de procurar engenheiros de ML, desenvolver a UI do moderador, implementar infraestrutura GPU nem integrar-se com cada sistema separadamente. Ligue um Webhook a partir da sua plataforma — e numa hora começa a moderação segundo as suas políticas.
«15 moderadores reviam 15% do fluxo e, mesmo assim, tínhamos escândalos. Agora 3 moderadores reveem o duvidoso (4%) e o resto é automático. Há seis meses que não temos escândalos»
O que mais há na AiST Platform→O responsável de Segurança adora este serviço: tudo conforme a lei, tudo auditado.
A moderação controla exatamente aquilo por que há coimas e processos: dados pessoais, extremismo, infrações de direitos de autor, fugas. Por isso o AiST Moderation é on-prem, auditado e com decisões explicáveis.
Perímetro fechado
- On-prem ou AiST BOX no seu centro de dados
- O conteúdo não sai do perímetro
- A inferência GPU — nas suas instalações
- Exportação para o SIEM de cada decisão
- Proteção contra ataques adversariais
- RBAC: os moderadores veem as suas próprias filas
Conformidade regulamentar
- 152-FZ — a PII dentro do seu perímetro
- 149-FZ — conteúdo proibido
- 114-FZ — extremismo
- 436-FZ — rotulagem por idades
- Agentes estrangeiros — rotulagem automática
- Relatórios prontos para o regulador
ROI e operações
- −85% de pessoal de moderação
- 96% das decisões — autónomas
- 0 fugas de PII graças ao DLP
- 0 coimas pela 152-FZ e do regulador
- Fatura transparente em rublos
- Licença por unidades ou por pacote
O que costumam perguntar antes de um piloto do Moderation.
Os modelos detetam realmente o calão russo e os palavrões camuflados?
Sim. Os modelos são treinados com corpora em russo tendo em conta o calão, as distorções (substituições de letras por símbolos ou algarismos) e o mascaramento com emojis. Precisão em toxicidade: 0.92–0.95. São retreinados continuamente com as correções do seu moderador.
O que fazer com os falsos positivos?
Tudo o que é duvidoso (scoring 0.3–0.85, limiares configuráveis) passa para a fila do moderador. O moderador clica em «concordo / não concordo» — e o modelo é retreinado. Após um mês de trabalho, a precisão nos seus tipos de conteúdo cresce de forma notável.
É possível adicionar regras personalizadas próprias?
Sim. Construtor de políticas sem código: «se o scoring X > Y e há um NIF e o destinatário está fora do domínio — bloqueio». As suas próprias listas negras de palavras, rostos e domínios. Os seus próprios perceptual-hash de «imagens proibidas» (logótipos de concorrentes, grafismos aprovados de concorrentes).
O deepfake é mesmo detetado?
Os deepfakes atuais em foto e vídeo — sim, com uma precisão de 0.88–0.94 em ataques típicos. Os deepfakes perfeitos de um atacante avançado podem escapar, pelo que em cenários KYC recomendamos combiná-lo com verificação liveness (pestanejar, rodar a cabeça). Os textos gerados por Ai do GPT/Claude são detetados com maior precisão (0.85–0.92).
Quanto tempo demora a entrada em funcionamento?
Um piloto de «moderação de um canal» (comentários, DLP de e-mail ou anúncios) — 1–2 semanas até produção. A moderação corporativa completa com todos os canais, políticas e dashboards de Segurança — 4–6 semanas.
É um produto independente ou parte da plataforma?
O AiST Moderation é um serviço dentro da AiST Platform. Pode contratá-lo separadamente (como Moderation-API) ou diretamente com OCR (para documentos), ASR (para chamadas), RAG (para fact-check) e Dialog (para moderar chats em tempo real). Um único painel, uma única fatura, uma auditoria unificada.
Envie-nos amostras de conteúdo — o nosso gestor mostrar-lhe-á a moderação com os seus dados.
Peça uma demonstração: envie exemplos do seu UGC, e-mails ou anúncios, e o nosso gestor mostrar-lhe-á a precisão da classificação nas suas categorias diretamente na reunião.