Deepfakes y clonación de voz: cómo proteger su empresa del fraude sintético
Una voz clonada y treinta segundos de urgencia bastan para sacar seis cifras de su empresa. Esta es la pila de controles que lo impide, desde protocolos de rellamada hasta políticas de pago como código.
Por Innovation T Team
La voz de su director financiero es un dato público. Cada presentación de resultados, cada ponencia en un congreso, cada aparición en un pódcast es material de entrenamiento para un clon que cuesta casi nada producir. La pregunta ya no es si alguien suplantará a sus directivos. Es si sus controles asumen que ya lo han hecho.
La clonación de voz ya es un producto de consumo
Hace cinco años, clonar una voz de forma convincente exigía minutos de audio limpio de estudio y conocimientos reales de aprendizaje automático. Hoy, los modelos de texto a voz zero-shot generan un clon utilizable a partir de unos segundos de audio de referencia extraídos de vídeos de LinkedIn, de YouTube o del saludo de un buzón de voz. Los modelos de pesos abiertos corren en una GPU doméstica. Los servicios alojados lo hacen en una pestaña del navegador.
Dos avances técnicos convirtieron esto en un peligro específico para las empresas:
- Conversión de voz en tiempo real. Los ataques antiguos reproducían clips pregrabados, que se desmoronaban en cuanto la víctima hacía una pregunta. Las cadenas modernas de conversión en tiempo real transforman el habla en vivo del atacante en la voz del objetivo con una latencia lo bastante baja para sostener una conversación natural. El atacante improvisa. El clon le sigue el ritmo.
- La red telefónica es el canal de entrega perfecto. La telefonía tradicional comprime el audio a una banda estrecha en torno a los 8 kHz. Esa compresión destruye justo los artefactos de alta frecuencia que delatan la voz sintética. Un clon que suena raro en monitores de estudio suena perfecto por el altavoz de un teléfono. La falsificación del identificador de llamadas completa la ilusión, y la atestación STIR/SHAKEN sigue aplicándose de forma irregular en las rutas internacionales, que es precisamente por donde entran la mayoría de estas llamadas a España y América Latina.
El resultado: una llamada de voz es hoy el factor de autenticación más débil que usa su empresa, y la mayoría de los equipos financieros la siguen tratando como el más fuerte.
El deepfake de vídeo se sumó a la llamada
El vídeo era la verificación de reserva. "Hacemos una videollamada rápida y así veo que es usted de verdad." Esa red de seguridad ya no existe.
Los modelos de intercambio de rostro en tiempo real corren en una sola GPU de consumo y envían la salida a través de una cámara virtual, de modo que la plataforma de videollamadas ve una webcam normal. Las plataformas de reuniones comprimen después el flujo de forma agresiva, ocultando los artefactos de fusión en el nacimiento del pelo y las gafas igual que los códecs telefónicos ocultan los artefactos de audio. En un caso muy difundido de 2024, un empleado de finanzas en Hong Kong se conectó a una videoconferencia en la que todos los demás participantes eran sintéticos, incluido el director financiero, y aprobó transferencias que la prensa cifró en unos 25 millones de dólares.
Conviene distinguir dos técnicas, porque fallan de manera diferente:
- El intercambio de rostro (face swap) sustituye la cara del atacante por la del objetivo conservando las expresiones del atacante. Sufre con los ángulos extremos de cabeza, la oclusión (una mano que pasa por delante de la cara) y las vistas de perfil.
- La reanimación facial (face reenactment) anima una foto o un vídeo del objetivo a partir de los movimientos del atacante. Sufre con los cambios de iluminación coherentes y con la interacción con objetos físicos.
Esos modos de fallo importan para los desafíos de prueba de vida en directo, a los que llegaremos. Pero no construya su defensa sobre ellos. Ambas debilidades se reducen con cada generación de modelos, y forman parte de un cambio más amplio que analizamos en cómo la IA está industrializando las operaciones ofensivas.
Por dónde sale realmente el dinero
El contenido sintético es el cebo, no el robo. En nuestra experiencia, las pérdidas se concentran en un puñado de escenarios repetibles:
- Transferencia urgente. La versión sintética del clásico fraude del CEO: un directivo clonado llama a un empleado de finanzas. Adquisición confidencial, plazo cerrado, no se lo cuente a nadie, envíe el depósito hoy. El deepfake aporta la credibilidad; el pretexto (urgencia, autoridad, secreto) hace el trabajo.
- Cambio de datos bancarios de un proveedor. El atacante suplanta a un proveedor real, a menudo tras comprometer su correo, y solicita una "actualización de cuenta bancaria". La siguiente factura legítima se paga al atacante. No requiere urgencia, y por eso es más difícil de detectar.
- Restablecimientos en el helpdesk. El atacante llama a soporte con la voz clonada de un empleado y una historia lastimera, y sale con un restablecimiento de MFA. Así empezaron varias brechas graves en casinos y proveedores cloud: no con malware, con una llamada.
- Evasión de KYC y onboarding. Los ataques de inyección introducen vídeo sintético directamente en los flujos de verificación de identidad mediante cámaras virtuales o aplicaciones modificadas, burlando los selfies de verificación ingenuos en la apertura de cuentas. Las fintech de la región que crecen con onboarding cien por cien remoto son el blanco natural.
- Fraude en selección de personal. Candidatos sintéticos superan entrevistas remotas por vídeo para conseguir puestos con acceso a sistemas, o para montar estafas de nóminas y de envío de portátiles.
Contraste estos escenarios con sus propios procesos. Allí donde una voz o una cara autoriza una acción, tiene un pasivo sin tarifar.
Por qué la detección sola pierde
La reacción instintiva es "compremos un detector de deepfakes". Resístase, o al menos entienda qué está comprando.
Los clasificadores de detección se entrenan con los artefactos de los generadores conocidos. Cada nueva generación de modelos produce artefactos distintos, así que la precisión del detector se degrada entre el benchmark de laboratorio y la llamada que recibe su administrativo de cuentas por pagar ocho meses después. La compresión, la transcodificación y el ruido de fondo (garantizados en cualquier llamada real) la degradan aún más. Y el problema de la tasa base es brutal: si las llamadas fraudulentas son una entre cien mil, incluso un clasificador sólido ahoga a su equipo en falsos positivos o lo adormece con falsos negativos.
El peor desenlace no es una detección fallida. Es un empleado que envía la transferencia porque "el detector no marcó nada". Un detector mediocre más una confianza mal puesta es peor que ningún detector.
La detección tiene su sitio: como una señal débil dentro de controles en capas, en centros de contacto y en pipelines de KYC donde usted controla la ruta de captura y puede imponer pruebas de vida de tipo desafío-respuesta. No es un lugar donde anclar su defensa.
La pila de controles que funciona
La estrategia ganadora es volver irrelevante el contenido sintético. Diseñe sus procesos de modo que un clon perfecto, de audio y de vídeo, no le sirva de nada al atacante.
Verificación fuera de banda, formalizada
El control de mayor valor con diferencia: toda solicitud sensible recibida por un canal debe verificarse por otro canal distinto y establecido de forma independiente.
- Los números de rellamada salen de su directorio corporativo o del maestro de proveedores, nunca de la propia solicitud, nunca de la firma de un correo, nunca del identificador de llamadas.
- La verificación se inicia en sentido saliente. Las "llamadas de confirmación" entrantes no verifican nada.
- Las frases clave verbales pueden ayudar en comités de dirección, pero trátelas como cables trampa, no como autenticadores. Los secretos compartidos se filtran, y un atacante que tantea buscando la frase es, en sí mismo, una señal de detección.
Ponga el protocolo por escrito, déle nombre y convierta su invocación en un acto protegido. El empleado que le dice "tengo que ejecutar el procedimiento de rellamada" a una voz idéntica a la del director general debe saber, con total certeza, que no puede ser sancionado por ello. El primero en dar ejemplo cumpliéndolo debe ser el director general de verdad.
Controles de pago como código
La política que vive en un PDF se salta bajo presión. Codifíquela en su ERP, su plataforma bancaria o su flujo de aprobaciones, de forma que la ruta peligrosa quede bloqueada técnicamente, no solo desaconsejada:
# política de pagos: cambio de datos bancarios de proveedor
trigger: vendor_bank_details_change
controls:
- out_of_band_callback:
target: contact_number_on_file # nunca el que figura en la solicitud
performed_by: someone_other_than_requester
- dual_approval:
roles: [ap_manager, finance_controller]
- cooling_off_hours: 24 # sin pagos a la cuenta nueva el mismo día
- first_payment_cap: low_value_test_transaction
notify: security_team
El mismo escalado aplica a las transferencias por encima de un umbral: doble autorización con el segundo aprobador contactado fuera de banda, y una regla dura según la cual la urgencia jamás se salta el flujo. Tenga en cuenta los rieles de pago locales: una transferencia inmediata SEPA en España o un SPEI en México liquidan en segundos y son, en la práctica, irrevocables, lo que convierte el periodo de enfriamiento en su única ventana real. Las operaciones confidenciales tienen una vía de excepción pactada de antemano que sigue implicando a dos personas, porque "la operación es secreta" es exactamente el pretexto que usarán los atacantes.
Elimine la voz como autenticador
El reconocimiento de una voz por un humano ya no vale nada como prueba de identidad. Retírelo de todos los puntos donde soporta carga:
- Los restablecimientos del helpdesk exigen verificación a través de su proveedor de identidad (una notificación push a un dispositivo ya enrolado, una confirmación del responsable en el sistema de RR. HH.), nunca "le reconocí la voz" ni preguntas de conocimiento sacadas de filtraciones de datos.
- Migre la autenticación de la plantilla a factores resistentes al phishing. Las passkeys y las llaves físicas FIDO2 no se pueden dictar por teléfono, con voz clonada o sin ella. Explicamos la ruta de migración en nuestra guía de passkeys y autenticación sin contraseñas.
- Prohíba la aprobación por respuesta para acciones financieras. Un "confirmo lo hablado en nuestra llamada" en un hilo de correo no es un control.
Blinde el flanco del correo
Las llamadas con deepfake rara vez viajan solas. La llamada crea la urgencia; un correo falsificado o de dominio parecido entrega las instrucciones de la transferencia. Cierre la mitad de la suplantación con autenticación estricta del correo:
_dmarc.yourcompany.com. IN TXT "v=DMARC1; p=reject; rua=mailto:dmarc-reports@yourcompany.com; adkim=s; aspf=s"
DMARC en p=reject con alineación estricta, más el registro o la vigilancia de dominios parecidos, obliga a los atacantes a usar direcciones de webmail gratuito que su pasarela de correo seguro puede marcar con reglas de remitente externo y de discrepancia en el nombre mostrado.
Procedencia y prueba de vida donde usted controla el pipeline
En los flujos de identidad de cara al cliente, exija concreción a su proveedor de KYC: prueba de vida con desafío-respuesta aleatorizado (no comprobaciones pasivas de selfie), detección de ataques de inyección que marque cámaras virtuales y emuladores, y atestación de dispositivo en los SDK móviles. Si opera en España o trata datos de residentes europeos, recuerde que estos flujos biométricos caen de lleno bajo el RGPD y la LOPDGDD: documente la base jurídica y la evaluación de impacto antes de desplegarlos. Para sus propios contenidos publicados, las credenciales de contenido C2PA le permiten firmar las comunicaciones oficiales de sus directivos, de modo que la ausencia de una firma válida se convierta en señal. La procedencia no detendrá el fraude este año, pero adoptarla pronto es barato y su valor se acumula.
Un marco de verificación por niveles
Despliéguelo en este orden. La mayoría de las organizaciones pueden completar los pasos 1 a 4 en unas semanas.
- Inventaríe las acciones de alto riesgo. Todo lo que mueve dinero, cambia datos bancarios, restablece credenciales, concede accesos o libera información sensible. Si una solicitud por voz o por vídeo puede dispararlo, está dentro del alcance.
- Asigne un nivel a cada acción. Nivel 1 (irreversible y de alto importe): rellamada fuera de banda, doble aprobación, periodo de enfriamiento. Nivel 2 (reversible o de importe moderado): rellamada fuera de banda por una persona. Nivel 3: flujo autenticado estándar, sin aceptar ningún canal improvisado.
- Defina el canal de confianza de cada nivel. Números de teléfono del directorio corporativo, confirmación presencial o un flujo de tickets autenticado. Documente dónde viven los datos de contacto de confianza y quién los mantiene.
- Haga rápida la vía segura. Si la verificación tarda dos días, la gente la esquivará. Una rellamada debe tomar cinco minutos. La velocidad es una característica de seguridad.
- Ensáyelo. Organice un ejercicio de mesa en el que "el director general" llama a finanzas un viernes por la tarde. Después, con consentimiento y visto bueno del área jurídica (y, en España, revisando las implicaciones de RGPD de clonar la voz de un empleado), hágale red team con una voz clonada de verdad. El primer simulacro en vivo siempre es una cura de humildad, y convierte a los escépticos más rápido que cualquier circular.
Esto es zero trust aplicado a los procesos humanos: la confianza nunca se deriva de cómo suena o cómo se ve una solicitud, siempre de un canal verificado de forma independiente. La versión arquitectónica de ese principio la tratamos en arquitectura zero trust explicada.
Entrene para el pretexto, no para el artefacto
No enseñe a sus empleados a cazar fallos de sincronización labial. Esa habilidad caduca cada mes y genera una falsa confianza. Enséñeles a reconocer el pretexto, que no ha cambiado desde mucho antes de que existieran los deepfakes:
- Urgencia: tiene que ser hoy, ahora mismo, antes del cierre de la jornada.
- Autoridad: la solicitud viene de alguien de arriba, o lo invoca.
- Secreto: no se lo diga a nadie, es confidencial, que quede entre nosotros.
- Cambio de canal: un desplazamiento desde los sistemas oficiales hacia teléfonos personales y chats privados.
Dos cualesquiera de esas señales juntas deben disparar el protocolo de verificación de forma automática, por muy real que parezca la persona. Premie el disparo. Celebre en público al empleado que verificó una solicitud que resultó ser legítima, porque eso es el sistema funcionando.
Cuando ocurre de todos modos
La velocidad decide cuánto recupera. Deje estos pasos preparados para que nadie improvise un viernes a las seis de la tarde:
- Llame de inmediato a la línea de fraude de su banco y solicite la retrocesión de la transferencia. Las probabilidades de recuperación caen en picado pasadas las primeras 24 a 48 horas, a medida que los fondos saltan entre cuentas mula, y con los rieles de pago instantáneo la ventana es aún menor.
- Congele las remesas de pago relacionadas y bloquee cualquier cuenta que el pretexto haya tocado, incluidos los objetivos de restablecimiento en el helpdesk.
- Preserve las evidencias: grabaciones de llamadas, metadatos de reuniones, cabeceras de correo, el número desde el que llamaron. No deje que la grabación caduque automáticamente, y consérvela con una base jurídica documentada si le aplica el RGPD.
- Denuncie ante las fuerzas de seguridad (en España, la Policía Nacional o la Guardia Civil, con el apoyo de INCIBE; en América Latina, las fiscalías y unidades de ciberdelito de cada país) y notifique a su aseguradora de ciberriesgo dentro de los plazos de la póliza. Muchas pólizas tienen ventanas de notificación estrictas para el fraude en transferencias de fondos.
- Haga la retrospectiva sobre el proceso, no sobre la persona. El empleado engañado por un clon de última generación no es el fallo. El fallo es el proceso que permitió que una llamada moviera dinero.
Integre estos pasos en su manual general y ensáyelos junto con el resto de escenarios. Nuestro manual de respuesta a incidentes cubre la estructura.
El fraude sintético no es un riesgo futuro. Es un ataque presente, ya convertido en commodity, que apunta específicamente a la confianza informal con la que funciona su empresa. La solución no es una detección mágica. Es ingeniería de procesos aburrida y rigurosa: verificación fuera de banda, pagos gobernados por código, identidad resistente al phishing y personas que tratan la propia urgencia como la bandera roja.
Cómo puede ayudar Innovation T
Innovation T construye y endurece los sistemas de los que depende este manual: flujos de aprobación aplicados en su ERP y sus integraciones bancarias, despliegues de autenticación resistente al phishing, pipelines de verificación de identidad con controles reales de prueba de vida, y simulacros de ingeniería social que incluyen escenarios de clonación de voz. Somos ingenieros antes que nada, así que los controles se entregan como software funcionando, no como diapositivas. Consulte nuestros servicios de seguridad e ingeniería.
Si hoy una voz o una cara puede mover dinero en su organización, eso es un hallazgo. Hable con nosotros y le ayudaremos a cerrarlo antes de que otro lo encuentre primero.
¿Listo para construir con Innovation T?
Ya se trate de seguridad, crecimiento o ingeniería, nuestro equipo puede ayudarte a lograrlo con calidad.