AiST.Ai
aist.moderation / ugc · pii · dlp · brand-safety

Moderação de UGC e deteção de conteúdo sensível em texto, foto, vídeo e voz.

O AiST Moderation verifica o conteúdo à entrada e à saída: toxicidade, extremismo, NSFW, deepfake, publicidade de concorrentes, fugas de PII e de cartões. Protege redes sociais, marketplaces, o e-mail corporativo e o call center — automaticamente, de acordo com as suas políticas.

  • ⚠ Texto · foto · vídeo · áudio
  • ⛨ Mascaramento de PII / PCI-DSS
  • ◉ Deteção de conteúdo Ai & deepfake
  • ≋ Realtime + batch
  • ⌘ 152-FZ · 149-FZ · on-prem
// o problema

Um comentário tóxico — um escândalo. Uma fuga de cartão — uma coima.

O UGC, o e-mail de saída, o conteúdo do marketplace: é um fluxo de milhares de unidades por dia. A moderação manual é lenta, cara e, mesmo assim, deixa passar conteúdo. Uma única falha custa reputação, uma coima legal ou uma fuga de dados de clientes.

// ugc

Os moderadores não dão conta, a toxicidade passa

Ao marketplace ou à rede social chegam 50 000 anúncios e comentários por dia. Uma equipa de 15 moderadores cobre 15%. O resto fica ao acaso. Uma publicação escandalosa torna-se a notícia do dia nos canais de Telegram.

→
A Ai verifica 100% do conteúdo em 0.2 s. O duvidoso (5–10%) vai para o moderador; o evidente resolve-se automaticamente.
// dlp / pii

As fugas de PII e de cartões custam milhões

Um colaborador anexa a um e-mail para o cliente um ficheiro com dados de passaporte. Um operador do call center dita um número de cartão que fica gravado na chamada. Um gestor envia por Telegram uma lista de preços com segredos comerciais. Cada caso é uma infração à 152-FZ.

→
Deteção de PII em texto, foto e áudio. Mascaramento automático, bloqueio de anexos, alerta à Segurança antes do envio.
// marca

Conteúdo no estilo da marca? — não, é Ai e acaso

Os colaboradores publicam em nome da marca qualquer coisa. O marketing satura o feed com imagens do Midjourney «fora do estilo». Os prestadores publicam textos de Ai com alucinações. Controlar tudo à mão é inviável.

→
Filtro brand-safety à saída: conformidade com o tom, deteção de conteúdo Ai, verificação de factos através de RAG.
// como funciona

O conteúdo chega → é classificado → sai para o público, passa a revisão ou vai para o lixo.

O pipeline aceita qualquer conteúdo (texto, foto, vídeo, áudio, ficheiro), processa-o em paralelo com mais de 20 classificadores e as suas regras personalizadas, emite um veredicto com probabilidades de scoring e encaminha-o: aprovação automática, bloqueio automático ou revisão humana.

// L1 · receção
api HTTP / SDK pre-publish · live
queue Kafka / RabbitMQ fluxo massivo
email gateway de e-mail dlp em outbound
chat mensagens & call center chats · chamadas
↓
// L2 · classificação
txt modelos de texto toxicidade · 149-FZ
img modelos vision NSFW · violência · logótipos
av vídeo + áudio deepfake · linguagem obscena
pii PII / PCI / DLP passaporte · cartão · NIF
↓
// L3 · veredicto & ação
policy as suas políticas regras · limiares
route aprovar / bloquear / rever encaminhamento
queue fila do moderador web-UI · prioridade
log auditoria + SIEM cada decisão
  • 01
    O conteúdo chega de qualquer origem REST/Webhook na fase pre-publish, bus Kafka para o fluxo massivo, gateway de e-mail para DLP, interceção de mensagens nas aplicações de mensagens corporativas, gravação de chamadas do call center.
  • 02
    Mais de 20 classificadores em paralelo Toxicidade, extremismo, NSFW, deepfake, publicidade de concorrentes, infrações à 149-FZ, rotulagem de agentes estrangeiros, PII, PCI, segredo comercial. Cada um com o seu scoring 0..1, tudo é combinado.
  • 03
    Veredicto segundo as suas políticas «Se NSFW > 0.85 — bloqueio; se 0.4–0.85 — revisão», «se o e-mail contém um NIF e o destinatário está fora do domínio — bloqueio». Construtor de regras sem código.
  • 04
    Ação e auditoria — automáticas O conteúdo sai para o público, vai para o lixo ou entra na fila do moderador com prioridade. Cada decisão fica no log de auditoria e no SIEM. O moderador clica em «concordo» — e o modelo é retreinado.
// capacidades

Mais de 20 classificadores — para tudo o que importa ao negócio e à Segurança.

Não um «filtro Ai» universal, mas um conjunto de modelos especializados. Cada um conhece com precisão a sua classe. Todos trabalham em paralelo e oferecem um scoring transparente por categoria.

⚠

Toxicidade & insultos

Ódio, ameaças, linguagem obscena, humilhações por características. ru/en, calão, palavrões camuflados.

toxicity
⌘

149-FZ & extremismo

Conteúdo proibido, simbologia, agentes estrangeiros, publicidade do que é proibido pela legislação russa.

ru-compliance
▦

NSFW & violência

Erotismo, violência, armas, drogas, sangue. Modelos vision para foto e vídeo.

nsfw · violence
◉

Deepfake & conteúdo Ai

Vídeos deepfake, rostos gerados por FLUX/SDXL, textos do ChatGPT/Claude.

ai-detect
⛨

PII / dados pessoais

Passaporte, SNILS, INN, OGRN, telefone, e-mail, morada. Em texto, foto (OCR) e voz (ASR).

152-fz
⊟

PCI-DSS / números de cartão

Cartões em texto, em gravações de chamadas, em documentos digitalizados. Algoritmo de Luhn + máscara.

pci-dss
⛯

Segredo comercial

Listas de preços, contratos, bases de clientes. Pesquisa por modelos e marcadores dos seus documentos.

trade-secret
↗

Spam / phishing / burlas

Padrões de fraude, contactos fora da plataforma, ligações para domínios de phishing.

scam · spam
✕

Publicidade de concorrentes

Logótipos, menções, publicidade encoberta em UGC. A lista negra de marcas é a sua.

brand-safety
©

Direitos de autor

Perceptual-hash para foto e vídeo, pesquisa na sua base de ativos aprovados.

copyright · phash
⊕

Conteúdo por idades

Restrições de idade 18+/16+/12+ segundo a UEE, rotulagem de conteúdo, age-gate.

age-rating
⎓

Realtime + batch

API ~150 ms por unidade, processamento batch de milhões de unidades por noite sobre arquivos históricos.

throughput
// o que moderamos e a partir de onde

Qualquer conteúdo — qualquer canal. Um único motor — todos os pontos de entrada.

UGC do marketplace, anúncios, avaliações, comentários, e-mail de saída, chats nas aplicações de mensagens corporativas, chamadas do call center, documentos antes da publicação. Em todo o lado — a mesma política, o mesmo scoring, a mesma auditoria.

// tipos de conteúdo

ComentárioAvaliaçãoAnúncioFicha de produtoPublicaçãoMensagemE-mailChamadaDocumento

// formatos

TextoImagemVídeoÁudioPDFDOCXArquivos (.zip)

// canais de entrada

REST APIWebhookKafka / RabbitMQPostfix / RuPostSIPRECpastas partilhadasS3-bucket

// legislação russa

152-FZ149-FZ436-FZ por idades114-FZ extremismoagentes estrangeirosrotulagem de publicidade

// setores & plataformas

MarketplaceRede socialFórumQuadro de anúnciosWikiPortal corporativoMedia

// ações segundo o veredicto

AprovarBloquearPara revisãoMascararOcultarAlerta à SegurançaTicket Jira

Um motor — um único conjunto de políticas. O conteúdo é verificado da mesma forma em todo o lado.

Antes: um moderador para os comentários, antispam para o e-mail, um proxy DLP para os documentos, uma equipa à parte para as chamadas do call center. Cada um com regras próprias que se contradiziam. Agora — uma política, um dicionário, uma auditoria e diferentes pontos de entrada.

96%autónomo (sem moderador)
~ 0.18 sdecisão média
20+classificadores
⊕
Moderação pre-publish

O UGC é verificado antes de ser publicado. Invisível para o utilizador — simplesmente a sua «publicação publicada» aparece em 0.2 segundos.

⌖
Análise post-publish

O arquivo de comentários, conversas ou documentos é processado por lotes. As anomalias e as infrações detetadas vão para o moderador.

⛨
DLP / outbound

Interceção de e-mails e anexos antes do envio. Bloqueio de fugas de PII, cartões, contratos e bases de dados. Alerta ao responsável de Segurança.

// o que se constrói sobre o AiST Moderation

Da moderação de um marketplace ao DLP corporativo.

O Moderation é a infraestrutura do «filtro». Cada departamento encontra o seu caso: plataformas UGC, Segurança, marketing, suporte, media. Um motor, diferentes políticas e canais.

// marketplace

Moderação pre-publish de anúncios

Antes de ser publicado, cada anúncio é verificado: produtos proibidos, esquemas fraudulentos, contactos fora da plataforma, rostos de pessoas sem consentimento. 96% sai para o público automaticamente em 0.2 s; o resto vai para o moderador com uma explicação.

UGCfraudeOCR em fotos
// rede social / fórum

Moderação de comentários em tempo real

Cada comentário recebe um veredicto em 150 ms: aprovação, ocultação, banimento. Ódio, política, publicidade de concorrentes, spam, ligações de phishing — são bloqueados antes de um único utilizador os ver.

realtime149-FZbrand-safety
// segurança & dlp

Proteção contra fugas de PII por e-mail

O gateway de e-mail analisa as mensagens de saída. Se o e-mail contém um passaporte, um cartão, NIF de clientes ou uma exportação do CRM — bloqueio antes do envio, alerta ao responsável de Segurança e ticket no Jira. 100% menos fugas segundo a 152-FZ.

PostfixRuPost152-FZ
// call center

Controlo do que dizem os operadores

Gravação da chamada através do AiST ASR → moderação da transcrição: descortesia, promessas de descontos sem autorização, fuga de PII, «dite-me agora o seu cartão». Alerta ao supervisor por cada incidente.

+ AiST ASRPCI-DSSguião
// media & conteúdo

Verificação do conteúdo antes da publicação

Cada artigo passa por uma revisão: agentes estrangeiros sem rotulagem, extremismo, notícias falsas, verificação de factos através de RAG. O editor vê os alertas antes de publicar, não depois de uma queixa do regulador.

114-FZagentes estrangeirosfact-check
// banca & serviços financeiros

KYC e deteção de deepfake

A selfie de onboarding ou a videoverificação é analisada em busca de deepfake, montagem ou máscara. Os documentos, em busca de carimbos e selos falsificados. 80% menos pedidos fraudulentos.

KYCdeepfakeliveness
// já na plataforma

Não é preciso montar o «seu próprio CONTROLO». Está tudo já configurado.

Um classificador «em bruto» é menos de um quarto da tarefa. Além disso, são precisos: mais de 20 modelos para diferentes categorias, um construtor de políticas, gateways (e-mail, Kafka, SIP), uma fila de moderador com prioridades, dashboards, log de auditoria no SIEM e retreino. Nós já temos tudo isto montado.

Ativa-se — não é a equipa de Segurança que o constrói durante um ano.

O AiST Moderation é um serviço dentro da AiST Platform. Não precisa de procurar engenheiros de ML, desenvolver a UI do moderador, implementar infraestrutura GPU nem integrar-se com cada sistema separadamente. Ligue um Webhook a partir da sua plataforma — e numa hora começa a moderação segundo as suas políticas.

«15 moderadores reviam 15% do fluxo e, mesmo assim, tínhamos escândalos. Agora 3 moderadores reveem o duvidoso (4%) e o resto é automático. Há seis meses que não temos escândalos»

O que mais há na AiST Platform→
⚠
Mais de 20 classificadorestexto · foto · vídeo · áudio
✓ pronto
⛨
PII / PCI / DLPpassaporte · cartão · NIF · base de dados
✓ pronto
◉
Deteção de deepfake + conteúdo Aifoto · vídeo · texto
✓ pronto
⊕
Construtor de políticasregras · limiares · ações
✓ pronto
▤
UI do moderador + filaprioridades · atalhos · retreino
✓ pronto
⛯
Gateways de entradaAPI · Kafka · email · SIPREC · S3
✓ pronto
⌬
Integrações com RAG / OCR / ASRsobre qualquer conteúdo
✓ pronto
⌘
Auditoria + SIEMcada decisão — no log
✓ pronto
// controlo corporativo

O responsável de Segurança adora este serviço: tudo conforme a lei, tudo auditado.

A moderação controla exatamente aquilo por que há coimas e processos: dados pessoais, extremismo, infrações de direitos de autor, fugas. Por isso o AiST Moderation é on-prem, auditado e com decisões explicáveis.

// para o CISO

Perímetro fechado

  • On-prem ou AiST BOX no seu centro de dados
  • O conteúdo não sai do perímetro
  • A inferência GPU — nas suas instalações
  • Exportação para o SIEM de cada decisão
  • Proteção contra ataques adversariais
  • RBAC: os moderadores veem as suas próprias filas
// para o departamento jurídico

Conformidade regulamentar

  • 152-FZ — a PII dentro do seu perímetro
  • 149-FZ — conteúdo proibido
  • 114-FZ — extremismo
  • 436-FZ — rotulagem por idades
  • Agentes estrangeiros — rotulagem automática
  • Relatórios prontos para o regulador
// para o CFO

ROI e operações

  • −85% de pessoal de moderação
  • 96% das decisões — autónomas
  • 0 fugas de PII graças ao DLP
  • 0 coimas pela 152-FZ e do regulador
  • Fatura transparente em rublos
  • Licença por unidades ou por pacote
// perguntas frequentes

O que costumam perguntar antes de um piloto do Moderation.

Os modelos detetam realmente o calão russo e os palavrões camuflados?

Sim. Os modelos são treinados com corpora em russo tendo em conta o calão, as distorções (substituições de letras por símbolos ou algarismos) e o mascaramento com emojis. Precisão em toxicidade: 0.92–0.95. São retreinados continuamente com as correções do seu moderador.

O que fazer com os falsos positivos?

Tudo o que é duvidoso (scoring 0.3–0.85, limiares configuráveis) passa para a fila do moderador. O moderador clica em «concordo / não concordo» — e o modelo é retreinado. Após um mês de trabalho, a precisão nos seus tipos de conteúdo cresce de forma notável.

É possível adicionar regras personalizadas próprias?

Sim. Construtor de políticas sem código: «se o scoring X > Y e há um NIF e o destinatário está fora do domínio — bloqueio». As suas próprias listas negras de palavras, rostos e domínios. Os seus próprios perceptual-hash de «imagens proibidas» (logótipos de concorrentes, grafismos aprovados de concorrentes).

O deepfake é mesmo detetado?

Os deepfakes atuais em foto e vídeo — sim, com uma precisão de 0.88–0.94 em ataques típicos. Os deepfakes perfeitos de um atacante avançado podem escapar, pelo que em cenários KYC recomendamos combiná-lo com verificação liveness (pestanejar, rodar a cabeça). Os textos gerados por Ai do GPT/Claude são detetados com maior precisão (0.85–0.92).

Quanto tempo demora a entrada em funcionamento?

Um piloto de «moderação de um canal» (comentários, DLP de e-mail ou anúncios) — 1–2 semanas até produção. A moderação corporativa completa com todos os canais, políticas e dashboards de Segurança — 4–6 semanas.

É um produto independente ou parte da plataforma?

O AiST Moderation é um serviço dentro da AiST Platform. Pode contratá-lo separadamente (como Moderation-API) ou diretamente com OCR (para documentos), ASR (para chamadas), RAG (para fact-check) e Dialog (para moderar chats em tempo real). Um único painel, uma única fatura, uma auditoria unificada.

// próximo passo

Envie-nos amostras de conteúdo — o nosso gestor mostrar-lhe-á a moderação com os seus dados.

Peça uma demonstração: envie exemplos do seu UGC, e-mails ou anúncios, e o nosso gestor mostrar-lhe-á a precisão da classificação nas suas categorias diretamente na reunião.

// ao enviar, o senhor aceita o tratamento dos seus dados pessoais