Chamadas, reuniões e vídeos — em texto com separação por interlocutores.
O AiST ASR transforma qualquer voz — chamadas do call center, reuniões, vídeo-formação, entrevistas — numa transcrição de texto precisa com marcas de tempo, interlocutores e temas-chave. Integrado na AiST Platform: ligue a sua central telefónica ou uma pasta — o resto funciona sozinho.
- ◉ Diarização: até 10 interlocutores
- ≋ Realtime & batch
- ⌬ Precisão WER ~ 5–8 %
- ⛯ SIP / telefonia «pronto a usar»
- ⛨ 152-FZ · on-prem · máscaras PII
Milhares de horas de chamadas e reuniões — e zero dados com que trabalhar.
O call center grava 100 % das chamadas — ouve 1 %. As reuniões do Teams «perdem-se no vazio». Os vídeo-cursos estão lá e não é possível pesquisá-los. A voz continua a ser o principal canal de dados perdido da empresa.
Ouve-se 1 % das chamadas, sanciona-se por 1 % dos erros
O supervisor do call center não consegue ouvir tudo — tira uma amostra aleatória. Os problemas reais (mau atendimento, promessas, fugas de informação) passam despercebidos, e os operadores «bons» recebem sanções por uma falha pontual.
Hora e meia de reunião — e ninguém se lembra do que foi decidido
As reuniões no Teams/Zoom passam — e pronto. Alguém tomou notas, alguém não. Uma semana depois surge a pergunta «o que decidimos ali?» — e a resposta reconstrói-se de memória.
200 horas de vídeo corporativo impossíveis de pesquisar
Gravações de palestras internas, vídeo-instruções, cursos de formação — estão no Kinescope e no portal corporativo sem pesquisa. «Por volta do minuto 7 falavam de…» — ninguém o vai encontrar.
Do áudio «em bruto» — à ata etiquetada no CRM. Sem intervenção humana.
O pipeline recolhe o áudio de qualquer fonte, limpa-o, reconhece-o, separa-o por interlocutores, entende emoções e temas — e deposita o resultado onde os seus colaboradores trabalham: no CRM, BI, na base de conhecimento, no painel do contact center.
-
01
A fonte liga-se uma única vez e para sempre Trunk SIP para a central, bot no Teams/Zoom, hot-folder com gravações, bucket S3 com vídeos. Após a configuração, o sistema recolhe o áudio sozinho.
-
02
Reconhecimento + diarização numa única passagem O VAD elimina as pausas, o filtro de ruído — o fundo. O modelo ASR entrega texto com marcas de tempo por palavra. A diarização determina onde fala o cliente e onde fala o operador — mesmo sem separação de canais.
-
03
O NLU acrescenta significado sobre o texto Tom de cada intervenção, temas da conversa, entidades-chave (número de encomenda, nome, valor), cumprimento do guião, promessas e reclamações — automaticamente.
-
04
O resultado — onde os seus colaboradores trabalham A chamada chega à ficha do negócio no CRM, a ata da reunião — ao Confluence e as tarefas ao Jira, a tendência das queixas — ao painel do diretor.
Não é «simplesmente o Whisper». Um ASR industrial para tarefas empresariais.
Modelos prontos para telefonia (8 kHz com ruído), para videoconferências, para gravações de media. Diarização, emoções, temas, checklists, legendas — tudo num motor, tudo através de uma única API.
Precisão WER 0.05–0.08
Telefonia de 8 kHz com ruído, até 100 termos especializados. Vários idiomas e a sua mistura.
Diarização de interlocutores
Até 10 pessoas numa gravação. Funciona mesmo em mono. IDs estáveis durante toda a gravação.
Realtime < 500 ms
Transcrição em streaming para chamadas em direto, ponto para o operador, legendas em tempo real nas reuniões.
Temas e tom
Etiquetas automáticas: «queixa», «devolução», «consulta de preço». Emoção da intervenção — irritado/neutro/simpático.
Checklist do guião
«Cumprimentou?», «Disse o seu nome?», «Comunicou o preço?». Cada chamada etiquetada — o supervisor vê tudo.
Entidades e factos
Número de encomenda, data, valor, nome, morada — são extraídos da voz e preenchem a ficha do cliente.
Dicionário próprio
Nomes de produtos, nomes de colaboradores, abreviaturas. Carregue a lista — o modelo aprende a escrevê-los corretamente.
Mascaramento de PII
Números de cartão, passaporte, identificadores na voz — são distorcidos automaticamente no áudio e mascarados no texto.
Marcas de tempo por palavra
Cada palavra — com o seu próprio tempo. Um clique no texto — salto no áudio para o mesmo segundo.
Legendas SRT/VTT
Ficheiros de legendas prontos para Rutube/Kinescope/o portal corporativo. Faixas multilingues.
Ata automática + tarefas
O AiST LLM sobre a transcrição elabora a ata: decisões, responsáveis, tarefas, prazos.
Stream + batch
WebSocket para a chamada em direto, batch para milhões de horas de arquivo — com os mesmos modelos.
Mais de 20 conectores: telefonia, conferências, plataformas de vídeo, ficheiros.
Não é preciso «migrar antes toda a gente para a nossa central». Ligamo-nos ao que já tem instalado — Asterisk, Mango, MTS Link, Kontur.Talk, o portal corporativo. Os arquivos antigos — através de S3 e pastas partilhadas.
// telefonia / sip
// videoconferências
// plataformas de vídeo
// ficheiros / repositórios
// crm & contact centers
// live & api
Áudio — à entrada. Texto etiquetado no CRM — à saída.
Para cada fonte — um conector pronto que recolhe a gravação após a chamada ou a reunião e entrega o resultado onde os seus colaboradores trabalham. A transcrição aparece na ficha do cliente, na ata da reunião, no painel do supervisor — e não «num motor de pesquisa à parte onde ninguém entra».
A chamada ainda está a decorrer — e o texto já aparece no ecrã do operador. O ponto sugere o guião e respostas da base de conhecimento.
Ao terminar, a gravação é recolhida, transcrita, etiquetada — 30 segundos depois está na ficha do cliente.
«Recupere todas as chamadas dos últimos 3 anos e mostre as tendências de recusas» — milhões de horas numa noite.
Um único motor — controlo de qualidade, atas, legendas, introdução por voz.
O ASR é infraestrutura para uma dezena de cenários ao mesmo tempo. O call center obtém controlo de qualidade, as vendas — a transcrição de chamadas no CRM, os RH — atas de reuniões, os media — a transcrição de entrevistas.
Controlo de qualidade de 100 % das chamadas
Cada chamada etiquetada segundo o guião: tom, temas, promessas ao cliente. As anomalias — para o supervisor. Só é preciso ouvir manualmente as duvidosas. Um contact center de 200 operadores é controlado por uma única pessoa.
Transcrição de chamadas na ficha do negócio
O comercial não perde 20 minutos a «registar no CRM» — a conversa guarda-se sozinha na ficha com etiquetas de tema e o próximo passo. O diretor de vendas vê o panorama real, e não «tudo ok» nos comentários.
Ata automática de reuniões com tarefas
A reunião no Teams/MTS Link termina — 2 minutos depois a ata está no Confluence: decisões, responsáveis, prazos. As tarefas vão automaticamente para o Jira. Ninguém toma notas à mão.
Pesquisa na videoteca e legendas
Gravações de formações internas e vídeo-cursos — com pesquisa por texto e salto por marca de tempo. O colaborador encontra «onde falam de como tratar de uma deslocação em serviço» em 5 segundos, em vez de ver uma hora de gravação.
Transcrição de audiências e depoimentos
A gravação de áudio da audiência — em texto com interlocutores e citações para o processo. Pesquisa nos depoimentos, exportação para a petição. O jurista poupa dias em cada processo.
Transcrição de entrevistas e podcasts
O jornalista grava a entrevista — no editor já está o texto etiquetado. O marketing recebe o texto completo dos webinars para newsletters e artigos. A produção de conteúdo acelera de 5 a 10 vezes.
Não é preciso «acoplar o Whisper». Está tudo já acoplado.
Um modelo ASR «nu» é menos de metade da tarefa. Depois são precisos: recetores SIP, diarização, NLU por cima, etiquetagem do guião, exportação para o CRM, painel para o supervisor, mascaramento PCI-DSS. Nós já temos tudo montado.
Ativa-se — não se integra durante meses.
O AiST ASR é um serviço dentro da AiST Platform. Não precisa de engenheiros de ML, de infraestrutura GPU à parte, de desenvolvimento de integrações com a central e o CRM, nem de painéis de raiz. Ligue o trunk SIP — um dia depois cada chamada está etiquetada e na ficha do cliente.
«O controlo de qualidade do call center era feito por um departamento de 6 pessoas — ficou uma. A cobertura passou de 1 % para 100 %»
O que mais há na AiST Platform→A voz do cliente são dados pessoais. Por isso o ASR vive no seu perímetro.
Uma chamada contém PII (nome, telefone, passaporte), PCI (quando se dita um cartão) e segredo comercial. O AiST ASR funciona on-prem, mascara o sensível à entrada e regista cada pedido.
Perímetro fechado
- On-prem ou AiST BOX no seu centro de dados
- A inferência GPU — nas suas instalações, nada sai para fora
- Mascaramento PII / PCI-DSS em tempo real
- Distorção de números de cartão no áudio
- RBAC: as gravações só são vistas pelo proprietário do grupo
- Auditoria de cada pedido no SIEM
ROI e operação
- −85 % de tempo dos supervisores do CC
- +15 % de conversão de vendas graças à análise de chamadas
- −30 % do tempo dos comerciais a registar no CRM
- Licença por horas ou por pacote
- Cache e deduplicação: menor fatura de inferência
- Custos transparentes
Integrações e gestão
- Mais de 20 conectores: telefonia / reuniões / vídeo
- WebSocket / SIPREC / API HTTP
- Dicionário próprio, regras, checklists
- Testes A/B de modelos e prompts
- SLA de 99,5 %, escalamento horizontal
- Streaming < 500 ms pronto a usar
O que costumam perguntar antes de um piloto de ASR.
Qual é a precisão real em telefonia?
Em telefonia «normal» de 8 kHz com ruído, WER ~ 0.05–0.08; em som de estúdio — 0.03–0.05. A terminologia (produtos, marcas) é incorporada com um dicionário próprio — ensinamos o texto a escrever corretamente os seus nomes. Mostramos-lhe a precisão com as suas próprias chamadas em 3 dias sobre 100 gravações.
A diarização funciona num canal mono?
Sim. Se a gravação for um único ficheiro com canais misturados (caso típico de centrais antigas), o modelo identifica até 10 interlocutores pela voz. Em estéreo (cliente / operador separados), a precisão da diarização é de 99 %.
Como é a integração com a nossa central?
Ligações prontas via SIP / SIPREC / WebSocket com Asterisk, FreePBX, Mango Office, MTS Exolve, Sipuni, UIS, Naumen. Para as restantes — um recetor SIPREC universal. As chamadas são recolhidas em direto ou ao terminar — como o senhor preferir.
Quanto tempo demora a implementação?
Um piloto «chamadas na ficha do CRM» ou «atas de reuniões» — 1–2 semanas até à produção. Um contact center completo com mais de 200 operadores, painéis e checklists — 4–6 semanas. O arquivo de 3 anos — em paralelo, em modo batch.
E quanto ao PCI-DSS quando ditam um número de cartão?
O detetor de números de cartão trabalha ao nível do áudio — os dígitos são distorcidos na gravação ou cortados. No texto — são mascarados com XXXX. Compatível com os requisitos PCI-DSS para gravações de call centers.
É um produto independente ou parte da plataforma?
O AiST ASR é um serviço dentro da AiST Platform. Pode contratar apenas este serviço (como API de ASR), ou diretamente com o construtor de assistentes, RAG sobre as transcrições, papéis e auditoria. Um único painel, uma única fatura.
Envie-nos a gravação de uma chamada — o nosso gestor mostrar-lhe-á a transcrição ao vivo.
Marque uma demonstração: envie o áudio de uma chamada ou reunião, e o nosso gestor mostrar-lhe-á na própria reunião a precisão do reconhecimento com a sua terminologia e os seus interlocutores.