Recientemente, se ha descubierto que los modelos de lenguaje (LLMs) responden de manera diferente a solicitudes dañinas cuando se utiliza un sistema de marca de agua, como el SynthID-Text, implementado por Anthropic y desarrollado por Google. Este avance se produce en respuesta a una nueva ley de la Unión Europea que exige a las plataformas de IA adoptar medidas de identificación de contenido generado.
SynthID-Text utiliza una clave secreta que modifica sutilmente el proceso de selección de palabras en las respuestas generadas por el modelo. Por ejemplo, una elección de palabra que normalmente sería "nublado" podría cambiarse a "cubierto". Este sistema no solo afecta la selección de palabras, sino también las herramientas que puede invocar el modelo y su adherencia a las medidas de seguridad que ha aprendido a seguir.
La investigación indica que, en condiciones adversas, como cuando un atacante intenta que el modelo realice acciones dañinas, la marca de agua puede hacer que el modelo cumpla instrucciones que normalmente no seguiría. Andrea Siposova, investigadora de seguridad en IA, enfatiza que este cambio en el comportamiento de los modelos es significativo, especialmente bajo condiciones adversas.
El proceso de marca de agua funciona al incrustar una señal que permite identificar la salida como generada por IA, lo que se conoce como procedencia. SynthID incorpora un generador de semillas aleatorias y un algoritmo de muestreo que, en lugar de usar un generador de números aleatorios arbitrario, emplea una clave secreta para determinar la selección de la siguiente palabra.
En experimentos realizados por Siposova, se compararon las respuestas de seis modelos de peso abierto ante solicitudes dañinas, tanto con como sin la marca de agua. Los resultados mostraron que la marca de agua no solo cambió el comportamiento de rechazo ante solicitudes dañinas, sino que, en muchos casos, hizo que los modelos fueran más propensos a responder a estas solicitudes, especialmente cuando se empleaban técnicas de inyección de solicitudes.
Estos hallazgos subrayan la necesidad de que los desarrolladores evalúen exhaustivamente cómo se comportan sus modelos de lenguaje y agentes cuando se implementa la marca de agua, dado que las implicaciones de seguridad son significativas y pueden afectar las acciones posteriores de los agentes de IA que dependen de estos modelos.




Comentarios