Investigadores revelan vulnerabilidad en modelos de IA que expone información personal
Ciberseguridad

Investigadores revelan vulnerabilidad en modelos de IA que expone información personal

Científicos descubrieron una forma de extraer el razonamiento oculto de modelos de IA, lo que podría permitir la filtración de información personal. Todos los proveedores de modelos de frontera probados comparten esta vulnerabilidad.

11 de agosto 20262 min de lectura Wired
0 comentarios

Recientemente, un grupo de científicos informáticos identificó una técnica que permite extraer el razonamiento oculto de modelos de inteligencia artificial (IA) avanzados mientras resuelven problemas complejos. Este hallazgo sugiere, aunque no prueba de manera concluyente, que ciertos modelos chinos podrían haber sido entrenados mediante la "destilación" de información de modelos estadounidenses, dado que sus patrones de razonamiento parecen coincidir.

La investigación, liderada por Alexander Panfilov de la Universidad de Tübingen, reveló que esta técnica podría ser utilizada para recuperar información personal, como contraseñas y claves API, de los procesos internos de un modelo. Aunque esta vulnerabilidad ha sido corregida, Panfilov advierte que "todos los proveedores de modelos de frontera que probamos comparten esta vulnerabilidad", lo que puede llevar a filtraciones de información personal y ataques de destilación de razonamiento a gran escala.

Los investigadores también encontraron que modelos de OpenAI, Anthropic y Google, accesibles a través de API, presentan el mismo problema. En su estudio, se demostró que el modelo chino Kimi K3 de Moonshot AI produce resultados sorprendentemente similares a los pasos de razonamiento ocultos de Claude Opus 4.8 y GPT 5.6 Sol para ciertos prompts. Sin embargo, no se puede establecer causalmente que haya habido una destilación directa de estos modelos.

La destilación es una técnica comúnmente utilizada para copiar eficientemente las capacidades de modelos existentes a nuevos, especialmente en el desarrollo de modelos de código abierto. Sin embargo, ha generado controversia debido a acusaciones de que empresas de IA chinas la utilizan para replicar modelos estadounidenses. En febrero, OpenAI informó a legisladores estadounidenses que DeepSeek parecía haber copiado uno de sus modelos para desarrollar un modelo de razonamiento llamado R1.

La técnica descubierta por Panfilov y su equipo se basa en el hecho de que muchas empresas de IA ofrecen modelos relacionados de diferentes tamaños. Los modelos más grandes son más capaces pero también más costosos de ejecutar. Al alimentar trazas de razonamiento encriptadas a una versión más pequeña del mismo modelo, se puede revelar el razonamiento oculto, ya que estos modelos más pequeños han recibido menos entrenamiento de alineación y son menos propensos a negarse a revelar su información interna.

Comentarios