【AI安全】LoRango把触发器拆成两份LoRA:单独审计为何看不见后门
2026-09-25
Investigadores de instituciones como la Universidad de Fudan publicaron el estudio LoRango (arXiv:2609.25884v1), que analiza un ataque de condición combinada en modelos de generación de imágenes por texto. El método divide un comportamiento oculto en dos archivos LoRA (adaptadores de bajo rango, que son archivos pequeños para añadir estilos o personajes a una IA) estáticos y normales: uno llamado 'Signature' escribe un código en la representación intermedia del modelo, y el otro, llamado 'Payload', identifica ese código para liberar una imagen predefinida. Según el estudio, cuando se cargan juntos, la tasa de éxito del ataque en modelos SD v1.5 y SDXL fue del 97.9% y 98.7% respectivamente, mientras que si se cargan por separado, el éxito es apenas del 2.8% al 4.6%.
Oxo Security señala que, si un sistema permite que los usuarios sumen libremente adaptadores visuales, la auditoría de seguridad debe pasar de revisar archivos individuales a revisar 'combinaciones de adaptadores'. El ataque no requiere comandos especiales en el texto (prompts) ni modificar el modelo base. Si una plataforma solo revisa cada archivo por separado de forma aislada, es muy probable que no detecte el comportamiento que surge solo cuando ambos archivos se encuentran. Cabe aclarar que esto es un experimento de laboratorio y no significa que todos los mercados de LoRA tengan estos ataques activos actualmente.
El mecanismo de activación está oculto en los cálculos del modelo y no en las instrucciones de texto. El atacante no necesita usar códigos secretos en el prompt; el disparador es la interacción de los pesos de ambos archivos durante el proceso de cálculo. El estudio utiliza un modelo de amenaza de 'caja blanca', donde el atacante puede entrenar ambos archivos. El 'Payload' está diseñado para que, si no hay una pareja que coincida, los efectos se cancelen entre sí, haciendo que el archivo parezca normal. Solo cuando el 'Signature' y el 'Payload' se alinean, se rompe una barrera matemática en el modelo y se ejecuta la acción no deseada.
Para una auditoría pública efectiva, se deben considerar tres puntos: primero, si la plataforma permite combinar adaptadores de distintas fuentes y quién controla esa lista; segundo, si las pruebas de seguridad solo se hacen con archivos individuales sin probar combinaciones frecuentes; y tercero, si la detección de anomalías compara el resultado esperado contra el comportamiento de la combinación. Una prueba mínima recomendada es generar imágenes usando el modelo base solo, solo el archivo A, solo el archivo B, y finalmente A+B, manteniendo siempre el mismo modelo, texto y semilla aleatoria para comparar los resultados.
Qué significa para una pyme colombiana y cucuteña: Si su empresa utiliza herramientas de generación de imágenes por IA (como Stable Diffusion) para diseño, marketing o creación de contenido, tenga cuidado al descargar 'estilos' o 'personajes' (archivos LoRA) de fuentes desconocidas. Un archivo puede parecer seguro por sí solo, pero al combinarlo con otro que descargó previamente, podría activar funciones no deseadas. La recomendación es no mezclar adaptadores de distintos autores sin antes probar la combinación en un entorno controlado.