Qué son los ataques por inyección en KYC#
Un ataque por inyección, en el contexto de la verificación de identidad, se produce cuando un atacante intercepta la canalización de captura normal y sustituye la entrada real de la cámara por datos fraudulentos. En lugar de presentar a la cámara un documento de identidad real y su propio rostro, el atacante inyecta imágenes o vídeos preparados de antemano en el flujo de verificación. Estos ataques eluden la realidad física que la verificación KYC está diseñada para confirmar.
Los ataques por inyección se han convertido en la categoría de fraude de identidad de más rápido crecimiento. A medida que la detección de vida y la verificación documental mejoran frente a los ataques de presentación físicos (mostrar una foto impresa), los atacantes se desplazan hacia métodos de inyección digital que operan en la capa de software. La barrera de entrada es baja: el software de cámara virtual está disponible libremente y las herramientas de generación de deepfakes se han vuelto accesibles para usuarios no técnicos.
Vectores de ataque#
Suplantación de cámara virtual
El software de cámara virtual como OBS Virtual Camera, ManyCam o controladores personalizados se presenta ante el sistema operativo como un dispositivo de cámara legítimo. Cualquier aplicación que solicite acceso a la cámara, incluido un SDK de verificación KYC, recibe el flujo de la cámara virtual en lugar de la entrada de la cámara física. El atacante puede reproducir un vídeo pregrabado, compartir la pantalla de otra aplicación o introducir contenido sintético a través de la cámara virtual.
Ataques de reproducción de documentos
En un ataque de reproducción de documentos, el atacante utiliza una imagen de alta resolución de un documento de identidad robado u obtenido de forma fraudulenta y la presenta a la cámara. Las variantes avanzadas muestran la imagen del documento en una pantalla de alta densidad de puntos, lo que puede engañar a los sistemas básicos de captura documental que no comprueban los artefactos de recaptura de pantalla.
Selfis deepfake
La tecnología de deepfakes permite a los atacantes generar vídeos faciales realistas de otra persona. A partir de una foto de referencia del documento de identidad, un atacante puede crear un vídeo sintético que coincida con la foto del documento y luego inyectarlo a través de una cámara virtual. Los deepfakes avanzados pueden responder a los desafíos de detección de vida en tiempo real, ejecutando giros de cabeza y parpadeos a demanda.
Recaptura de pantalla
El atacante muestra un documento o un selfi en una pantalla y lo captura con la cámara del dispositivo apuntada hacia esa pantalla. Se trata de un ataque híbrido físico-digital que puede burlar la detección de cámara virtual mientras sigue utilizando contenido fraudulento.
Los ataques por inyección pueden combinarse en sofisticados ataques de varias etapas. Un atacante podría usar una réplica física de documento para el paso de captura documental y un deepfake inyectado a través de una cámara virtual para el paso del selfi, exigiendo que sus defensas detecten distintos tipos de ataque en distintas etapas del flujo.
Capas de defensa#
Una defensa eficaz frente a los ataques por inyección requiere varias capas de detección independientes. Ninguna técnica aislada es suficiente, porque los atacantes encontrarán y explotarán las debilidades de cualquier defensa individual. Se aplica el principio de defensa en profundidad: cada capa está diseñada para captar los ataques que atraviesan la capa anterior.
Verificación de la integridad del dispositivo
La primera capa de defensa verifica que el entorno de captura sea de confianza. En las plataformas móviles, esto incluye comprobar el rooting o el jailbreak (que permite el secuestro de las API de la cámara), verificar la integridad del código de la aplicación frente a la manipulación, detectar marcos de instrumentación como Frida o Xposed que pueden interceptar las llamadas a funciones del SDK, y confirmar que la API de la cámara devuelve datos de un sensor de hardware físico en lugar de una fuente virtual.
Detección de vida del documento
La verificación de la vida del documento confirma que el documento de identidad es un objeto físico presente ante la cámara, y no una visualización en pantalla o una copia impresa de una imagen digital. Las técnicas incluyen: analizar la interferencia de patrones de muaré que se produce cuando una cámara captura una pantalla; detectar la cuadrícula de píxeles característica de las pantallas LCD/OLED; analizar los patrones de reflexión de la luz que difieren entre los documentos de plástico/policarbonato y las pantallas planas; y pedir al usuario que incline el documento, lo que produce respuestas distintas de los hologramas y elementos de seguridad en los documentos auténticos.
Vida facial y antisuplantación
La detección de vida facial, como se vio en nuestro artículo sobre verificación biométrica, debe ser robusta frente a los ataques de presentación tanto físicos como digitales. Los desafíos basados en iluminación, en los que la pantalla del dispositivo proyecta patrones de luz de colores sobre el rostro, ofrecen una defensa sólida porque el patrón de luz reflejada es extremadamente difícil de reproducir en un deepfake sin conocer la secuencia de desafío específica. Una evaluación de vida en el lado del servidor evita la elusión de las comprobaciones de vida en el lado del cliente.
Cadenas de hash de fotogramas
Una cadena de hash de fotogramas enlaza cada fotograma de vídeo capturado con su predecesor mediante hash criptográfico, creando una secuencia a prueba de manipulaciones. Si un atacante inyecta fotogramas de otra fuente a mitad del flujo, la cadena de hash se rompe. La cadena de hash se inicializa con un nonce proporcionado por el servidor, lo que vincula la sesión de captura a una solicitud de verificación específica y evita la reproducción de sesiones capturadas previamente.
Verificación de la integridad del flujo#
Más allá de la integridad de los fotogramas individuales, debe verificarse la coherencia de todo el flujo de captura. Esto incluye analizar características temporales como la estabilidad de la velocidad de fotogramas, la coherencia de la exposición y los patrones de ruido del sensor que difieren entre las cámaras físicas y las fuentes sintéticas. El análisis del paralaje de movimiento puede detectar superficies planas (pantallas) comprobando si los elementos de primer plano y de fondo se desplazan de forma adecuada con el movimiento del dispositivo.
El análisis de metadatos proporciona señales adicionales: las cámaras físicas incorporan datos EXIF, incluidos la distancia focal, la apertura y el modelo de sensor, que pueden contrastarse con perfiles de dispositivos conocidos. Las cámaras virtuales y los flujos inyectados pueden omitir o falsificar estos metadatos de maneras detectables.
Validación en el lado del servidor#
Nunca confíe únicamente en la validación del lado del cliente. Cualquier comprobación realizada en el dispositivo del usuario puede ser eludida por un atacante suficientemente motivado que controle el dispositivo. Todas las decisiones críticas de integridad y de vida deben validarse en el lado del servidor a partir de los datos capturados en bruto.
La validación en el lado del servidor es el árbitro final de la integridad de la verificación. El servidor recibe los fotogramas capturados, los metadatos, la cadena de hash y las respuestas a los desafíos de vida, y luego valida de forma independiente: la integridad de la cadena de hash, la corrección de las respuestas a los desafíos de vida, los resultados de la comparación biométrica, las señales de autenticidad del documento y la coherencia cruzada entre las sesiones de captura del documento y del selfi.
Arquitectura de defensa en profundidad#
Una arquitectura completa de defensa en profundidad para la verificación KYC superpone estas defensas de modo que un atacante deba burlar simultáneamente todas las capas para tener éxito:
- Capa 1 (Dispositivo): detección de root/jailbreak, verificación de la integridad de la aplicación, detección de cámara virtual.
- Capa 2 (Captura): vida del documento, vida facial con desafío de iluminación, inicialización de la cadena de hash de fotogramas.
- Capa 3 (Transporte): canal cifrado, con fijación de certificado, con vinculación de sesión y prevención de reproducción.
- Capa 4 (Servidor): evaluación independiente de vida, comparación biométrica, análisis de autenticidad del documento, verificación de la cadena de hash.
- Capa 5 (Analítica): detección de anomalías entre sesiones, agrupación de huellas de dispositivos, comprobaciones de velocidad en intentos de envío repetidos.
Cada capa funciona de forma independiente e informa de su propia señal de confianza. La decisión final de verificación tiene en cuenta todas las capas, y un fallo en una sola capa basta para señalar un envío para revisión o rechazo. Esta arquitectura garantiza que, incluso cuando los atacantes encuentren formas de eludir defensas individuales, el sistema global conserve su integridad.