Detecção de caixa postal
AMD: por que o discador confunde caixa postal com gente, e o que isso custa
· atualizado em 27 de setembro de 2026 · 11 min de leitura
O agente atende, cumprimenta e ouve: “…não posso atender agora, deixe seu recado após o sinal.” Na mesma operação, no mesmo minuto, alguém levanta o telefone, diz “alô” e a linha morre antes de ele terminar a palavra.
Os dois casos são o mesmo componente errando em direções opostas: o AMD — answering machine detection — que decide, nos primeiros segundos de cada chamada atendida, se quem está na linha é gente ou máquina.
Quanto do seu tráfego termina em caixa postal varia por base: a faixa que fornecedores estrangeiros publicam na própria documentação foi medida no tráfego deles, não no seu. Mas o volume não muda o essencial — é esse componente que separa gente de máquina, em poucos segundos, sem ninguém olhando, e é o veredito dele que decide quem entra na fila do agente.
O AMD não entende o que foi dito
O AMD clássico não transcreve, não interpreta e não sabe português. Ele mede duas grandezas no áudio — por quanto tempo há voz e por quanto tempo há silêncio — e compara com limiares fixos.
O arquivo de exemplo amd.conf do Asterisk mostra a régua inteira, e todo valor está em
milissegundos:
| Parâmetro | Padrão | O que acontece ao estourar |
|---|---|---|
initial_silence |
2500 | Silêncio antes da saudação. Estourou, é MACHINE |
greeting |
1500 | Duração máxima da saudação. Estourou, é MACHINE |
after_greeting_silence |
800 | Silêncio após a saudação. Estourou, é HUMAN |
maximum_number_of_words |
2 | Palavras na saudação. Estourou, é MACHINE |
min_word_length |
100 | Voz mais curta que isso não conta como palavra |
between_words_silence |
50 | Silêncio mínimo para começar a contar outra palavra |
total_analysis_time |
5000 | Teto para decidir qualquer coisa |
silence_threshold |
256 | Abaixo desse ruído, na escala 0–32767, é silêncio |
Leia a tabela como uma definição operacional de “ser humano”: alguém que começa a falar em menos de 2,5 segundos, fala por menos de 1,5 segundo, em no máximo dois blocos de voz, e depois cala a boca por mais de 0,8 segundo esperando resposta.
A Genesys Cloud escreve a mesma regra com outros números: para identificar uma pessoa viva, o AMD “escuta menos de 2200 ms de fala seguidos de 700 ms ou mais de silêncio”. A documentação dá os exemplos, em inglês: “Hello this is John Smith” passa como voz viva; “Hello this is John Smith. Thank you for calling Widgets Inc, how can I assist you today?” vira secretária eletrônica.
Uma definição de “ser humano” feita só de duração de voz e de silêncio — e a Genesys Cloud escreve a mesma regra com outros números.
Por que a saudação humana derruba a classificação
Agora junte a régua ao jeito como as pessoas atendem telefone. Quatro atendimentos passando por ela:
A saudação longa vira máquina. É o falso positivo, e a documentação da Amazon Connect o descreve sem rodeio: “às vezes uma saudação longa de um cliente vivo é incorretamente detectada como caixa postal”. Quem atende dizendo “alô, boa tarde, aqui é o João, com quem eu falo?” entregou mais voz contínua do que qualquer um dos limiares acima tolera. O comportamento que o algoritmo pune é exatamente o comportamento educado.
O contador de palavras não conta palavras. No Asterisk, “palavra” é um bloco de voz de pelo menos 100 ms separado do seguinte por pelo menos 50 ms de silêncio. Com o padrão de duas, a mesma frase passa ou não dependendo de como foi dita: “alôquemfala” numa tirada só é um bloco; “alô… alô?… quem fala?” é três, e três é MACHINE. Duas pessoas dizem as mesmas palavras e recebem vereditos diferentes por causa da respiração de uma delas.
Demorar a falar condena. initial_silence de 2500 ms: tirar o celular do bolso, olhar a
tela e só então dizer alô é, para o detector, igual a uma gravação que começa muda.
O erro contrário é mais silencioso. A mesma documentação da AWS: “se a saudação da caixa postal for um ‘Alô’ curto ou tiver uma pausa, o AMD a detecta como cliente vivo” — falso negativo. E há um caso que calibragem nenhuma resolve: a AWS declara que números de PBX com vários níveis de menu de voz “não são suportados”.
A Genesys usa ainda um sinal que não é áudio: “se o número de toques antes do atendimento for zero ou maior que quatro, o atendimento tem mais chance de ser caixa postal; entre um e três, a conexão humana é mais provável”. É probabilidade, não prova — e explica por que a mesma base rende classificações diferentes em horários de rede diferentes.
As duas linhas de baixo têm praticamente o mesmo desenho de voz e silêncio, e por isso recebem o mesmo veredito — só uma delas é gente.
O atraso é parte do produto, não um defeito
Enquanto o AMD analisa, a chamada já foi atendida e ninguém está falando com a pessoa. Esse intervalo não é bug: é o tempo de análise, e está publicado.
No Asterisk, total_analysis_time de 5000 ms é o teto. Na Twilio, a documentação diz que “em
média o AMD devolve resultado em cerca de 4 segundos após o atendimento, com os valores padrão”
— e o MachineDetectionTimeout nasce em 30 segundos, faixa de 3 a 59. O limiar de fala padrão é
2400 ms; para celulares e residências a própria Twilio recomenda baixá-lo para 1800–2000 ms, e o
de fim de fala, de 1200 ms para 1400–1500 ms. Quem nunca abriu esses campos está rodando o
padrão de fábrica.
A Genesys deixa o dilema explícito: iniciar o relógio no Line Connect processa mais rápido com menos precisão; no Speech Start, mais lento e mais preciso. Não há ajuste que entregue os dois.
A consequência está na documentação da AWS, em uma frase: “há um pequeno atraso enquanto o sistema conecta a chamada ao agente, o que pode fazer o cliente desligar”. Quem atende e ouve silêncio desliga. O detector registra caixa postal ou desistência para uma pessoa que atendeu, e o relatório não distingue esse caso de quem simplesmente não quis falar.
Quem atende e ouve silêncio desliga. Enquanto o AMD analisa, a chamada já foi atendida e ninguém está falando com a pessoa. Se ela desiste, o detector registra caixa postal ou desistência para alguém que atendeu.
O Asterisk aceita um playback_file, “arquivo de áudio para tocar enquanto o AMD roda, para que
quem chamou não ouça só silêncio”. Não melhora a classificação: muda só o que a pessoa ouve.
O que isso custa, em quatro contas separadas
Contato perdido que some do funil. O falso positivo não vira “perdemos essa pessoa”: vira registro de caixa postal. Se a regra de recontato pula quem caiu em caixa postal, quem atendeu de verdade sai da próxima rodada, marcado como improdutivo.
Tempo de agente queimado no falso negativo. Cada caixa postal entregue como voz viva ocupa o agente pelo tempo de escutar a saudação, entender que é gravação e desligar, e ainda custa a tabulação — exatamente a ocupação que o detector existe para evitar.
Métrica contaminada. Na definição da documentação da Genesys Cloud, taxa de conexão é chamada detectada como voz viva — não chamada atendida. AMD mal calibrado move o indicador para cima ou para baixo sem mover resultado nenhum; a leitura dos três números que importam está no post sobre métricas do discador.
Custo direto por chamada. Onde o AMD é serviço tarifado à parte — a tabela pública da Twilio traz linha própria para ele —, a detecção é cobrada por chamada habilitada e atendida, somada ao minuto falado. Antes de tratar o detector como gratuito, veja no contrato do seu fornecedor se ele é item de linha ou está embutido na chamada. O resto da conta está em quanto custa um discador.
E há uma quinta conta, que não é financeira. O falso positivo derruba a chamada ainda dentro da janela de análise, e chamada derrubada em poucos segundos é matéria-prima do contador de chamada curta que a Anatel usa para bloquear numeração — a régua, o prazo e a saída estão em chamada curta, caixa postal e bloqueio e em as regras da Anatel. Nada aqui é orientação jurídica: a redação vigente de cada despacho precisa ser conferida no texto oficial, no SEI da Anatel. A própria AWS avisa na documentação dela que “o uso de AMD pode não estar em conformidade com as leis de telemarketing”.
O que o AMD custa, em quatro contas separadas — e numa quinta, que não é financeira.
Como medir o seu AMD, não o do fornecedor
Nenhum número de fornecedor vale para a sua base: precisão depende de operadora, aparelho, idioma e saudação. O único teste que vale é sobre a gravação da sua própria operação.
A terceira coluna não aparece em matriz de confusão nenhuma, mas aparece no seu relatório: o balde para onde vai o indeciso é escolha da operação, não do detector.
- Sorteie gravações dos dois vereditos. Cem classificadas como máquina e cem como gente, do mesmo dia. Ouça os cinco primeiros segundos e anote quem realmente atendeu.
- Monte a matriz de confusão. Quatro caixas: acertou gente, acertou máquina, falso positivo, falso negativo. Sem as quatro, “o AMD está bom” é opinião.
- Leia a causa, não só o veredito. O Asterisk publica
AMDSTATUScom quatro valores —MACHINE,HUMAN,NOTSURE,HANGUP— eAMDCAUSEcom a razão, entre elasINITIALSILENCE,LONGGREETING,MAXWORDSeTOOLONG. A distribuição das causas diz qual parâmetro mexer: uma montanha deLONGGREETINGé gente educada sendo cortada. - Decida o que fazer com o “não sei”. O
NOTSUREdo Asterisk e ounknownda Twilio não são erro: são o detector admitindo que não deu. A AWS recomenda tratar o ramo equivalente como chamada atendida e mandar para a fila. Jogar o indeciso no balde de máquina é escolher o falso positivo por omissão. - Quebre por operadora e por hora. Operadora diferente tem saudação diferente; rede congestionada muda o padrão de toques.
Não localizei medição pública de acurácia de AMD sobre tráfego brasileiro, nem estudo de duração da saudação em português. Enquanto não houver, a amostra da sua operação é a única evidência, e custa uma tarde de escuta.
O que está mudando na régua
O limiar de duração continua sendo o padrão de fábrica. O que apareceu depois troca a régua por modelo. Um artigo apresentado no MIPRO 2024 (A Recurrent Neural Network Approach to the Answering Machine Detection Problem, Altwlkany e outros) usa transferência de aprendizado com o YAMNet e relata mais de 96% de acurácia no conjunto de teste, passando de 98% quando somado a detecção de silêncio. A LiveKit publicou benchmark de uma abordagem por transcrição em tempo real com 94,7% de micro F1 e 840 ms de mediana até o veredito, sobre base interna própria.
Duas ressalvas antes de trocar de tecnologia por causa desses números: acurácia em conjunto de teste não é acurácia em tráfego vivo, e nenhum dos dois foi medido em português do Brasil, pelo que consta nas publicações. O ganho plausível é de latência — 840 ms contra os 4 a 5 segundos dos padrões clássicos —, que é a parte do problema que a pessoa do outro lado sente. O que já funciona e o que ainda é promessa em IA de voz está em IA na ligação; o modo de discagem que mais sofre com o atraso está em tipos de discador.
O ganho plausível é de latência, a parte do problema que a pessoa do outro lado sente. Os 840 ms são da LiveKit, sobre base interna própria, e não foram medidos em português do Brasil, pelo que consta na publicação.
Segunda-feira
Três coisas cabem em um dia. Puxe a distribuição de AMDCAUSE (ou o campo equivalente do seu
discador) e veja qual limiar está decidindo o jogo. Ouça cem gravações classificadas como
máquina. Descubra para onde o seu sistema manda o “não sei” e, se for para o balde de máquina,
mude.
- Puxe a distribuição de
AMDCAUSE(ou do campo equivalente do seu discador) e veja qual limiar está decidindo o jogo: uma montanha deLONGGREETINGé gente educada sendo cortada. - Ouça cem gravações classificadas como máquina. Ouça os cinco primeiros segundos de cada uma e anote quem realmente atendeu.
- Descubra para onde vai o “não sei”. Se o seu sistema manda o indeciso para o balde de máquina, mude.
Nenhuma delas exige trocar de fornecedor. Todas exigem que a gravação e o veredito estejam no mesmo lugar.
Perguntas frequentes
O que é AMD no discador?
É a answering machine detection, a detecção de secretária eletrônica: o componente que decide, nos primeiros segundos de cada chamada atendida, se quem está na linha é gente ou máquina. O AMD clássico não transcreve nem interpreta o que foi dito; mede por quanto tempo há voz e por quanto tempo há silêncio, e compara com limiares fixos.
Por que o AMD classifica gente como caixa postal?
Porque ele mede duração, não sentido. Com os padrões do amd.conf de exemplo do Asterisk, quem demora mais de 2,5 segundos para começar a falar, fala por mais de 1,5 segundo ou em mais de dois blocos de voz é classificado como máquina. A documentação da Amazon Connect admite que às vezes uma saudação longa de um cliente vivo é detectada como caixa postal.
Quanto tempo o AMD demora para detectar caixa postal?
Na Twilio, a documentação diz que, com os valores padrão, o resultado sai em média cerca de 4 segundos após o atendimento. No Asterisk, o teto da análise é de 5000 ms. Durante esse intervalo a chamada já foi atendida e ninguém está falando com a pessoa, e quem atende e ouve silêncio desliga.
O AMD pode confundir caixa postal com pessoa?
Pode. A documentação da AWS diz que, se a saudação da caixa postal for um “Alô” curto ou tiver uma pausa, o AMD a detecta como cliente vivo. É o falso negativo: a gravação chega ao agente, que escuta, entende que é gravação, desliga e ainda tabula.
Como medir a precisão do AMD na minha operação?
Sobre a gravação da sua própria operação, não com número de fornecedor. Sorteie cem chamadas classificadas como máquina e cem como gente, do mesmo dia, ouça os cinco primeiros segundos e monte a matriz de confusão com as quatro caixas. Depois leia a causa de cada veredito, como o AMDCAUSE do Asterisk, e quebre o resultado por operadora e por hora.
O que fazer com o resultado NOTSURE do AMD?
O NOTSURE do Asterisk e o unknown da Twilio não são erro: são o detector admitindo que não deu. A AWS recomenda tratar o ramo equivalente como chamada atendida e mandar para a fila. Jogar o indeciso no balde de máquina é escolher o falso positivo por omissão.