O reconhecimento vem antes da verificação
A memória auditiva funciona de modo econômico. O cérebro compara o timbre, o ritmo e as pausas características com um padrão armazenado e responde "é a mamãe" antes que você consiga se fazer essa pergunta. Isso não é ingenuidade, mas o funcionamento normal do reconhecimento: na vida cotidiana, uma voz quase nunca mente, e verificar todas as vezes seria caro demais.
O problema é que, junto com o reconhecimento, um pacote inteiro de expectativas é ativado. Se a voz é conhecida, então as intenções também devem ser conhecidas, o contexto deve estar claro e o pedido deve ser adequado. Você já não responde ao som, mas a toda a história que tem com aquela pessoa. É esse pacote que os golpistas exploram.
Apenas que o som coincide com um padrão da sua memória.
Que é aquela pessoa, que ela está bem, que ligou por vontade própria e que está dizendo a verdade.
Antes, a distância entre essas duas colunas era pequena: falsificar uma voz era difícil. Agora, basta uma gravação curta de um perfil público, e a distância aumentou. A psicologia não mudou; mudou o custo da falsificação.
Depois, o que funciona não é a voz, mas a pressa
Um timbre familiar, por si só, não faz você agir. Ele apenas remove a primeira barreira. Depois, entra em cena uma estrutura quase igual em qualquer situação: a urgência, que não deixa tempo para pensar; o segredo, que não deixa ninguém para quem ligar; e um pedido que precisa ser atendido agora.
Cada elemento atinge uma capacidade: parar e verificar. A urgência consome o tempo. O segredo elimina uma segunda opinião. E uma voz reconhecível faz a própria ideia de verificar parecer constrangedora: quem liga de volta para a mãe só para confirmar que é a mãe?
- Reconhecimento
- Urgência
- Segredo
- Pedido
Se os quatro aparecem juntos em uma conversa, isso já é um sinal, não importa de quem seja a voz que você ouve. Uma pessoa próxima vai lidar bem com uma pausa de 2 minutos. Um roteiro de pressão não lida, e é por isso que não dão essa pausa a você.
O quanto isso é comprovado
Experimentos mediram como as pessoas distinguem mal a fala sintetizada da fala real: as participantes acertaram mais do que por acaso, mas erraram em cerca de 1 a cada 4 casos, e um treinamento curto ajudou apenas um pouco. Isso é o laboratório, não uma ligação em pânico: gravações curtas, alguns idiomas, nenhuma pressão e nenhuma história familiar por trás da voz.
A audição não identifica falsificações de modo confiável: ainda há poucas medições, todas em condições de laboratório
Isso não muda a direção da conclusão, muito pelo contrário: em uma conversa real, com urgência e ansiedade, você não vai escutar com mais atenção do que em um laboratório. Não é prudente transformar a própria audição em especialista em autenticidade.
Termine a leitura no app Miqo
Falta 1 minuto e, no final, vem um quiz. Você encontra em “Psicologia → Engenharia social”
Aponte a câmera do celular para cá para abrir a App Store ou o Google Play.
Fontes
- Mai K. T. et al., "Warning: Humans cannot reliably detect speech deepfakes", PLOS ONE, 2023
- sobre os princípios da influência, R. Cialdini, "Psicologia da influência"