Deepfake et clonage de voix : protéger votre entreprise contre la nouvelle fraude au président
Une voix clonée et trente secondes d'urgence suffisent à faire sortir des centaines de milliers d'euros de votre entreprise. Voici la pile de contrôles qui bloque l'attaque, du protocole de contre-appel aux politiques de paiement sous forme de code.
Par Innovation T Team
La voix de votre directeur financier est une donnée publique. Chaque présentation de résultats, chaque intervention en conférence, chaque extrait de podcast est un matériau d'entraînement pour un clone qui ne coûte presque rien à produire. La fraude au président, les entreprises francophones la connaissent depuis les années 2010, et elle leur a déjà coûté des centaines de millions d'euros. Ce qui a changé, c'est que l'usurpation ne repose plus sur le talent d'un imitateur. La question n'est donc plus de savoir si quelqu'un se fera passer pour vos dirigeants, mais si vos contrôles partent du principe que c'est déjà fait.
Cloner une voix est devenu un produit de grande consommation
Il y a cinq ans, cloner une voix de façon convaincante exigeait plusieurs minutes d'audio propre en qualité studio et de vraies compétences en machine learning. Aujourd'hui, les modèles de synthèse vocale dits zero-shot produisent un clone exploitable à partir de quelques secondes d'audio récupérées sur une vidéo LinkedIn, YouTube ou un message d'accueil vocal. Les modèles à poids ouverts tournent sur un GPU grand public. Les services hébergés font le travail dans un onglet de navigateur.
Deux évolutions techniques ont rendu la menace particulièrement dangereuse pour les entreprises :
- La conversion vocale en temps réel. Les anciennes attaques diffusaient des extraits générés à l'avance, qui s'effondraient dès que la victime posait une question. Les pipelines modernes transforment la parole de l'attaquant, en direct, en la voix de la cible, avec une latence assez faible pour tenir une conversation naturelle. L'attaquant improvise. Le clone suit.
- Le réseau téléphonique est le canal de livraison idéal. La téléphonie classique compresse l'audio dans une bande étroite autour de 8 kHz. Cette compression détruit précisément les artefacts hautes fréquences qui trahissent une voix synthétique. Un clone légèrement suspect sur des enceintes de studio devient parfait dans un haut-parleur de téléphone. L'usurpation du numéro appelant complète l'illusion : en France, l'authentification des numéros imposée par la loi Naegelen progresse, et STIR/SHAKEN se déploie ailleurs, mais les routes internationales restent inégalement couvertes, et c'est justement de là que partent la plupart de ces appels.
Résultat : l'appel vocal est désormais le facteur d'authentification le plus faible de votre entreprise, et la plupart des directions financières le traitent encore comme le plus fort.
La vidéo truquée s'est invitée en visio
La vidéo servait de vérification de secours. "On se fait une visio rapide, que je voie que c'est bien vous." Ce filet de sécurité a disparu.
Les modèles d'échange de visage en temps réel tournent sur un seul GPU grand public et envoient leur sortie vers une caméra virtuelle : la plateforme de visioconférence voit une webcam ordinaire. Les plateformes compressent ensuite le flux de façon agressive, ce qui masque les artefacts de fusion autour des cheveux et des lunettes, exactement comme les codecs téléphoniques masquent les artefacts audio. Dans une affaire largement médiatisée en 2024, un employé de la filiale hongkongaise d'un grand groupe d'ingénierie a rejoint une visioconférence où tous les autres participants étaient synthétiques, y compris le directeur financier, et a validé des virements estimés à environ 25 millions de dollars. L'Europe n'est pas épargnée : dès 2019, la filiale britannique d'un énergéticien allemand avait viré 220 000 euros sur la foi d'une voix clonée.
Deux techniques distinctes méritent d'être connues, parce qu'elles échouent différemment :
- Le face swap remplace le visage de l'attaquant par celui de la cible tout en conservant les expressions de l'attaquant. Il peine sur les angles de tête extrêmes, les occlusions (une main qui passe devant le visage) et les vues de profil.
- La réanimation faciale anime une photo ou une vidéo de la cible, pilotée par les mouvements de l'attaquant. Elle peine sur les changements d'éclairage cohérents et l'interaction avec des objets physiques.
Ces modes de défaillance comptent pour les épreuves de vivacité en direct, nous y reviendrons. Mais ne bâtissez pas votre défense dessus. Les deux faiblesses se réduisent à chaque génération de modèles, et cela s'inscrit dans un mouvement plus large que nous avons analysé dans comment l'IA industrialise les opérations offensives.
Par où l'argent sort réellement
Le média synthétique est l'appât, pas le vol. Dans notre expérience, les pertes se concentrent sur une poignée de scénarios répétables :
- Le faux virement urgent. Un dirigeant cloné appelle un collaborateur de la comptabilité : acquisition confidentielle, délai serré, n'en parlez à personne, virez l'acompte aujourd'hui. Le deepfake achète la crédibilité ; le prétexte (urgence, autorité, secret) fait le reste. C'est la fraude au président classique, dopée à l'IA.
- L'arnaque au changement de RIB. Un attaquant se fait passer pour un fournisseur réel, souvent après avoir compromis la messagerie de ce fournisseur, et demande une "mise à jour des coordonnées bancaires". La prochaine facture légitime paie l'attaquant. Aucune urgence nécessaire, ce qui la rend plus difficile à repérer.
- La réinitialisation via le support informatique. L'attaquant appelle le helpdesk avec la voix clonée d'un salarié et une histoire touchante, et repart avec une réinitialisation MFA. Plusieurs intrusions majeures chez des casinos et des fournisseurs cloud ont commencé exactement ainsi : pas avec un malware, avec un appel téléphonique.
- Le contournement du KYC et de l'onboarding. Les attaques par injection envoient de la vidéo synthétique directement dans les parcours de vérification d'identité, via des caméras virtuelles ou des applications modifiées, et déjouent les contrôles selfie naïfs à l'ouverture de compte.
- La fraude au recrutement. Des candidats synthétiques passent des entretiens vidéo à distance pour décrocher des postes avec accès aux systèmes, ou pour monter des escroqueries à la paie et au matériel.
Confrontez ces scénarios à vos propres processus. Partout où une voix ou un visage autorise une action, vous portez un passif non provisionné.
Pourquoi la détection seule perd la partie
Le réflexe instinctif est d'acheter un détecteur de deepfakes. Résistez-y, ou au moins comprenez ce que vous achetez.
Les classifieurs de détection sont entraînés sur les artefacts de générateurs connus. Chaque nouvelle génération de modèles produit des artefacts différents, si bien que la précision du détecteur se dégrade entre le banc d'essai du laboratoire et l'appel que recevra votre comptable fournisseurs huit mois plus tard. Compression, transcodage et bruit de fond (garantis dans tout appel réel) dégradent encore la détection. Et le problème du taux de base est implacable : si les appels frauduleux représentent un cas sur cent mille, même un bon classifieur noie votre équipe sous les faux positifs ou l'endort avec des faux négatifs.
Le pire scénario n'est pas une détection manquée. C'est un salarié qui exécute le virement parce que "le détecteur n'a rien signalé". Un détecteur médiocre plus une confiance mal placée, c'est pire que pas de détecteur du tout.
La détection a sa place : comme signal faible parmi des contrôles en couches, dans les centres de contact, et dans les pipelines KYC où vous maîtrisez la chaîne de capture et pouvez imposer une vivacité par défi-réponse. Ce n'est pas un point d'ancrage pour votre défense.
La pile de contrôles qui fonctionne
La stratégie gagnante consiste à rendre le média synthétique sans valeur. Concevez vos processus pour qu'un clone parfait, audio et vidéo, ne rapporte rien à l'attaquant.
La vérification hors bande, formalisée
Le contrôle au meilleur rapport valeur-effort : toute demande sensible reçue sur un canal doit être vérifiée sur un canal différent, établi de manière indépendante.
- Les numéros de contre-appel viennent de votre annuaire interne ou de votre référentiel fournisseurs, jamais de la demande elle-même, jamais d'une signature d'e-mail, jamais du numéro affiché.
- La vérification part en sortant. Un "appel de confirmation" entrant ne vérifie rien.
- Les phrases codées verbales peuvent aider pour un comité de direction, mais traitez-les comme des fils de détente, pas comme des authentifiants. Les secrets partagés fuient, et un attaquant qui pêche la phrase est en soi un signal de détection.
Rédigez le protocole, donnez-lui un nom, et faites de son invocation un acte protégé. Un salarié qui dit "je dois appliquer la procédure de contre-appel" à une voix qui ressemble exactement à celle du PDG doit savoir, avec certitude, qu'il ne peut pas être sanctionné pour cela. Le vrai PDG doit être le premier à s'y soumettre publiquement.
Des contrôles de paiement sous forme de code
Une politique qui vit dans un PDF saute sous la pression. Encodez-la dans votre ERP, votre plateforme bancaire ou votre circuit d'approbation, pour que le chemin risqué soit techniquement bloqué, pas seulement déconseillé :
# politique de paiement : changement de coordonnées bancaires fournisseur
trigger: vendor_bank_details_change
controls:
- out_of_band_callback:
target: contact_number_on_file # jamais celui fourni dans la demande
performed_by: someone_other_than_requester
- dual_approval:
roles: [ap_manager, finance_controller]
- cooling_off_hours: 24 # aucun paiement sur un nouveau RIB le jour même
- first_payment_cap: low_value_test_transaction
notify: security_team
Le même étagement s'applique aux virements au-dessus d'un seuil : double autorisation avec un second approbateur contacté hors bande, et une règle dure selon laquelle l'urgence ne court-circuite jamais le circuit. Les opérations confidentielles disposent d'un chemin d'exception convenu à l'avance qui implique toujours deux humains, car "le dossier est secret" est exactement le prétexte que les fraudeurs utiliseront.
Tuez la voix comme authentifiant
La reconnaissance d'une voix par un humain ne vaut plus rien comme preuve d'identité. Supprimez-la partout où elle est porteuse :
- Les réinitialisations au helpdesk exigent une vérification via votre fournisseur d'identité (une notification push vers un appareil déjà enrôlé, une confirmation du manager dans le SIRH), jamais "j'ai reconnu sa voix" ni des questions de sécurité dont les réponses traînent dans les fuites de données.
- Migrez l'authentification des collaborateurs vers des facteurs résistants au phishing. Les passkeys et les clés matérielles FIDO2 ne se dictent pas au téléphone, voix clonée ou pas. Nous détaillons la trajectoire de migration dans notre guide des passkeys et de l'authentification sans mot de passe.
- Bannissez l'approbation par simple réponse pour les actions financières. "Je confirme, comme convenu lors de notre appel" dans un fil d'e-mails n'est pas un contrôle.
Verrouillez le flanc e-mail
Un appel deepfake voyage rarement seul. L'appel crée l'urgence ; un e-mail usurpé ou un domaine sosie livre les instructions de virement. Fermez le volet usurpation avec une authentification e-mail stricte :
_dmarc.yourcompany.com. IN TXT "v=DMARC1; p=reject; rua=mailto:dmarc-reports@yourcompany.com; adkim=s; aspf=s"
DMARC en p=reject avec alignement strict, plus l'enregistrement ou la surveillance des domaines sosies, force les attaquants à se rabattre sur des adresses de webmail gratuites que votre passerelle de messagerie peut signaler via des règles d'expéditeur externe et d'incohérence du nom affiché.
Provenance et vivacité là où vous maîtrisez le pipeline
Pour les parcours d'identité côté clients, mettez votre prestataire KYC face à des exigences précises : vivacité par défi-réponse aléatoire (pas de simple contrôle selfie passif), détection des attaques par injection qui repère caméras virtuelles et émulateurs, et attestation d'appareil sur les SDK mobiles. N'oubliez pas le cadre juridique : les données biométriques relèvent de l'article 9 du RGPD, exigez donc aussi minimisation, durées de conservation courtes et base légale documentée. Pour vos propres communications, les content credentials C2PA permettent de signer les prises de parole officielles de vos dirigeants, si bien que l'absence de signature valide devient elle-même un signal. Le règlement européen sur l'IA impose par ailleurs le marquage des contenus générés, mais ne comptez pas sur les fraudeurs pour s'y conformer. La provenance n'arrêtera pas la fraude cette année, mais elle coûte peu à adopter tôt et son effet se cumule.
Un cadre de vérification par paliers
Déployez dans cet ordre. La plupart des organisations bouclent les étapes 1 à 4 en quelques semaines.
- Inventoriez les actions à haut risque. Tout ce qui déplace de l'argent, modifie des coordonnées bancaires, réinitialise des identifiants, accorde des accès ou libère des données sensibles. Si une demande vocale ou vidéo peut le déclencher, c'est dans le périmètre.
- Attribuez un palier à chaque action. Palier 1 (irréversible et à forte valeur) : contre-appel hors bande, double approbation, délai de latence. Palier 2 (réversible ou valeur modérée) : contre-appel hors bande par une personne. Palier 3 : circuit authentifié standard, aucun canal improvisé accepté.
- Définissez le canal de confiance par palier. Numéros issus de l'annuaire, confirmation en personne, ou circuit de tickets authentifié. Documentez où vivent les données de contact de confiance et qui les maintient.
- Rendez le chemin sécurisé rapide. Si la vérification prend deux jours, les gens la contourneront. Un contre-appel doit prendre cinq minutes. La vitesse est une fonctionnalité de sécurité.
- Entraînez-vous. Organisez un exercice sur table où "le PDG" appelle la comptabilité un vendredi après-midi. Puis, avec le consentement des intéressés et une validation juridique (le clonage de la voix d'un salarié touche au RGPD, faites cadrer l'exercice par votre DPO), lancez un red team avec une vraie voix clonée. Le premier exercice grandeur nature est toujours une leçon d'humilité, et il convertit les sceptiques plus vite que n'importe quelle note de service.
C'est le zero trust appliqué aux processus humains : ne jamais déduire la confiance de ce à quoi une demande ressemble ou de ce qu'elle donne à entendre, toujours d'un canal vérifié de manière indépendante. La version architecturale de ce principe est traitée dans l'architecture zero trust expliquée.
Formez au prétexte, pas à l'artefact
N'apprenez pas à vos équipes à repérer une synchronisation labiale douteuse. Cette compétence expire tous les mois et nourrit une fausse confiance. Apprenez-leur à repérer le prétexte, qui n'a pas changé depuis bien avant les deepfakes :
- L'urgence : cela doit se faire aujourd'hui, tout de suite, avant la clôture.
- L'autorité : la demande vient d'une personne haut placée, ou s'en réclame.
- Le secret : n'en parlez à personne, c'est confidentiel, cela reste entre nous.
- Le glissement de canal : on quitte les systèmes officiels pour les téléphones personnels et les messageries privées.
Deux de ces signaux réunis doivent déclencher le protocole de vérification automatiquement, quelle que soit l'apparence de la personne. Récompensez le déclenchement. Félicitez publiquement le salarié qui a lancé la vérification sur une demande légitime, car c'est le système qui fonctionne.
Quand cela arrive malgré tout
La vitesse décide de ce que vous récupérez. Préparez ces étapes à l'avance pour que personne n'improvise un vendredi à 18 h :
- Appelez immédiatement la cellule fraude de votre banque et demandez le rappel du virement (recall SEPA). Les chances de récupération chutent brutalement après les premières 24 à 48 heures, le temps que les fonds sautent de compte mule en compte mule.
- Gelez les campagnes de paiement liées et verrouillez tous les comptes que le prétexte a touchés, y compris les cibles de réinitialisation au helpdesk.
- Préservez les preuves : enregistrements d'appels, métadonnées de réunion, en-têtes d'e-mails, numéro appelant. Ne laissez pas l'enregistrement expirer automatiquement.
- Déposez plainte auprès des forces de l'ordre et déclarez le sinistre à votre assureur cyber dans les délais de la police. Beaucoup de contrats imposent des fenêtres de notification strictes pour la fraude aux virements.
- Menez la rétrospective sur le processus, pas sur la personne. Le salarié trompé par un clone dernier cri n'est pas la défaillance. Le processus qui a laissé un seul appel téléphonique déplacer de l'argent, si.
Intégrez ces étapes à votre dispositif global et répétez-les avec vos autres scénarios. Notre playbook de réponse à incident en donne la structure.
La fraude synthétique n'est pas un risque futur. C'est une attaque au présent, banalisée, qui cible précisément la confiance informelle sur laquelle tourne votre entreprise. Le remède n'est pas une détection magique. C'est de l'ingénierie de processus, rigoureuse et sans glamour : vérification hors bande, paiements gouvernés par du code, identité résistante au phishing, et des équipes qui traitent l'urgence elle-même comme le signal d'alerte.
Comment Innovation T peut vous aider
Innovation T construit et durcit les systèmes dont ce playbook dépend : circuits d'approbation imposés dans votre ERP et vos intégrations bancaires, déploiements d'authentification résistante au phishing, pipelines de vérification d'identité avec de vrais contrôles de vivacité, et exercices d'ingénierie sociale incluant des scénarios de clonage vocal. Nous sommes d'abord des ingénieurs : les contrôles sont livrés en logiciel qui tourne, pas en diapositives. Découvrez nos services de sécurité et d'ingénierie.
Si, aujourd'hui, une voix ou un visage peut faire sortir de l'argent de votre organisation, c'est un constat d'audit. Parlez-en avec nous et nous vous aiderons à fermer la brèche avant que quelqu'un d'autre ne la trouve.
Prêt à construire avec Innovation T ?
Qu'il s'agisse de sécurité, de croissance ou d'ingénierie, notre équipe peut vous aider à livrer dans les meilleures conditions.