FR
TéléchargerTélécharger

Pourquoi une voix familière ne prouve rien

La rédaction de Miqo · 2 sources

La reconnaissance précède la vérification

La mémoire auditive est conçue pour être économe. Ton cerveau compare le timbre, le rythme et les pauses caractéristiques à un modèle mémorisé et répond «c'est maman» avant même que tu aies eu le temps de te poser la question. Ce n'est pas de la crédulité, c'est le fonctionnement normal de la reconnaissance: dans la vie courante, une voix ne ment presque jamais, et vérifier à chaque fois coûterait trop cher.

Le problème, c'est qu'avec la reconnaissance s'active tout un ensemble d'attentes. Si la voix est familière, alors les intentions le sont aussi, le contexte est forcément clair et la demande paraît appropriée. Tu ne réponds déjà plus à un son, mais à toute ton histoire avec cette personne. C'est cet ensemble que les escrocs exploitent.

Ce que prouve la voix

Seulement que le son correspond à un modèle dans ta mémoire.

Ce que tu déduis

Que c'est bien cette personne, qu'elle va bien, qu'elle appelle de son plein gré et qu'elle dit la vérité.

Autrefois, l'écart entre ces deux colonnes était minime: imiter une voix était difficile. Aujourd'hui, un court enregistrement tiré d'un profil public suffit, et l'écart s'est creusé. La psychologie n'a pas changé, c'est le coût de la falsification qui a changé.

Ensuite, ce n'est plus la voix, mais la précipitation qui agit

À elle seule, une voix familière ne te pousse à rien. Elle ne fait que lever le premier obstacle. Vient ensuite une structure presque identique dans tous les scénarios: l'urgence, qui ne laisse pas le temps de réfléchir; le secret, qui ne laisse personne à appeler; et une demande à exécuter immédiatement.

Chaque élément s'attaque à une seule capacité: s'arrêter et vérifier. L'urgence dévore le temps. Le secret te prive d'un deuxième avis. Et une voix reconnaissable rend l'idée même de vérifier gênante: qui rappelle sa mère pour s'assurer que c'est bien sa mère?

  1. Reconnaissance
  2. Urgence
  3. Secret
  4. Demande

Si les quatre éléments se retrouvent dans une conversation, c'est déjà un signal, quelle que soit la voix que tu entendes. Une personne proche supportera une pause de 2 minutes. Un scénario de pression, non, et c'est pour cela qu'il ne t'en laisse pas le temps.

À quel point est-ce établi?

Des expériences ont mesuré à quel point les gens distinguent mal une parole synthétique d'une parole réelle: les participants devinaient mieux que le hasard, mais se trompaient dans environ 1 cas sur 4, et une courte formation ne les aidait que légèrement. C'est le laboratoire, pas un appel passé dans la panique: de courts enregistrements, quelques langues, aucune pression et aucune histoire familière derrière la voix.

L'ouïe repère mal les falsifications: les mesures restent peu nombreuses et ont toutes été réalisées en laboratoire

Cela ne change pas le sens de la conclusion, bien au contraire: dans une vraie conversation, avec de l'urgence et de l'anxiété, tu ne vas pas écouter plus attentivement qu'en laboratoire. Mieux vaut ne pas faire de ton ouïe l'experte en authenticité.

Termine ta lecture dans l'application Miqo

Encore 1 minute, puis un quiz à la fin. À retrouver dans « Psychologie → Ingénierie sociale »

QR code pour télécharger l'application Miqo

Pointe l'appareil photo de ton téléphone ici pour ouvrir l'App Store ou Google Play.

Sources

  1. Mai K. T. et al., «Warning: Humans cannot reliably detect speech deepfakes», PLOS ONE, 2023
  2. sur les principes d'influence, R. Cialdini, «Influence»