OpenAI trabaja para comprender el alcance total de la actividad de los agentes tras la filtración de datos de los usuarios

Por Reuters News

Por Deepa Seetharaman, Raphael Satter y Jeff Horwitz

- Dos meses después de que OpenAI revelara el hackeo accidental de Hugging Face (link), el creador de ChatGPT sigue trabajando para comprender el alcance total de la actividad de sus agentes rebeldes, según han declarado a Reuters dos personas al tanto del asunto.

El último ejemplo se produjo el viernes, cuando OpenAI afirmó que sus agentes habían filtrado 53 imágenes de usuarios de ChatGPT. OpenAI se negó a precisar si las imágenes habían sido generadas por IA o si mostraban a personas reales. Tampoco quiso revelar cuándo se publicaron las imágenes.

Esta revelación pone de manifiesto un nuevo riesgo para la privacidad de la empresa e ilustra lo difícil que resulta, incluso para una empresa de IA a la vanguardia de la tecnología, hacer un inventario de toda la actividad no autorizada relacionada con sus agentes. La batalla en curso de OpenAI también refleja una enorme brecha entre la potencia de los modelos que la empresa está probando y su capacidad para supervisar o incluso rastrear sus acciones.

A mediados de septiembre, una persona informada sobre el asunto estimó que OpenAI había detectado aproximadamente dos docenas de incidentes en los que sus agentes habían actuado de forma indeseable. Sin embargo, la cifra ha seguido aumentando a medida que los equipos de OpenAI examinan los registros internos de la actividad de los agentes y descubren casos hasta entonces desconocidos, según afirmaron las dos personas cercanas a la empresa.

OpenAI afirmó que su revisión tardaría «meses» en completarse, dada la magnitud del trabajo.

OpenAI declaró (link) que había notificado a «docenas» de terceros sobre actividades indebidas.

La mayoría de las imágenes filtradas han sido retiradas y OpenAI ha indicado que está presionando a los proveedores de alojamiento para que eliminen el resto.

Los agentes de OpenAI tenían acceso a estas imágenes porque la empresa utiliza datos de usuarios anonimizados para parte de su proceso de entrenamiento de modelos, según la propia empresa, antiguos empleados e investigadores externos. Los datos de las empresas no se utilizan para el entrenamiento, mientras que los usuarios de ChatGPT deben optar por no permitir que la empresa utilice sus datos con este fin.

Antes de que las publicaciones de los usuarios se utilicen para el entrenamiento, pasan por un proceso de anonimización que elimina los metadatos, los nombres y otra información de contacto, lo que debería dificultar la identificación de cualquier usuario concreto, según ha explicado la empresa.

Sin embargo, esta práctica conlleva riesgos, ya que existe la posibilidad de que los datos no se hayan depurado por completo de información de identificación personal y de que esta pueda filtrarse durante el funcionamiento del modelo, según afirmaron tres personas familiarizadas con las prácticas de OpenAI.


MÁS DE 15 CASOS

En los dos meses transcurridos desde que OpenAI anunciara por primera vez que sus agentes habían traspasado los límites de contención, se han producido más de 15 incidentes diferentes relacionados con OpenAI, de diversos niveles de gravedad, revelados por la propia empresa, por investigadores externos o —precisamente este miércoles— por el primer ministro australiano (link) Anthony Albanese ante las Naciones Unidas, quien afirmó que agentes de OpenAI irrumpieron en un portal de datos sanitarios del Gobierno en junio.

Los incidentes anteriores han sido de diversa índole, desde mensajes similares al spam dejados en sitios web hasta la intrusión en Hugging Face, en la que un enjambre de agentes aprovechó vulnerabilidades de software hasta entonces desconocidas para escapar de sus redes y penetrar en el repositorio de IA mientras buscaban respuestas a una prueba. OpenAI también afirmó que sus agentes habían puesto en el punto de mira su propia infraestructura.

Albanese declaró a los periodistas en Nueva York que OpenAI descubrió la actividad en agosto y la reveló en el 10 de septiembre a través de un correo electrónico enviado a una bandeja de entrada general del Gobierno. Afirmó que le comunicó directamente al director ejecutivo de OpenAI, Sam Altman, que este proceso de divulgación era inaceptable.

OpenAI señaló que algunos de los sitios web implicados son gestionados por el Gobierno, universidades y organismos públicos, ya que los modelos que llevan a cabo la investigación buscan fuentes fiables de información pública.


UN PROCESO CONTROLADO

El anuncio del 21 de julio de que los agentes de OpenAI se habían salido de control y habían pirateado Hugging Face (link) desató una preocupación generalizada en el sector de la IA sobre su capacidad para controlar los modelos de IA más potentes que se están desarrollando actualmente. Desde entonces, Anthropic, Google (perteneciente a Alphabet) GOOGL.O y Meta META.O han afirmado haber detectado un comportamiento similar en sus agentes después de que el incidente de Hugging Face les llevara a investigar.

OpenAI ha reconocido la necesidad general de una mayor transparencia en torno al comportamiento anómalo de la IA. El 16 de septiembre, la empresa publicó un nuevo marco para dar a conocer este tipo de incidentes, afirmando que se inclinaría por la transparencia «incluso cuando la importancia sea incierta».

Aun así, dos personas familiarizadas con la investigación de OpenAI sobre la actividad de sus agentes la describieron como un proceso hermético y condicionado por los abogados de la empresa. El proceso se ha compartimentado de forma inusual para una empresa que, según algunos antiguos empleados, solía ser más abierta sobre estas cuestiones en el pasado, afirmaron estas personas.

Aproximadamente 100 personas participaron de alguna forma en el proceso para esclarecer el ataque a Hugging Face, según afirmaron tres personas informadas sobre el asunto. Durante ese proceso, salieron a la luz pruebas de otros incidentes.

Reuters ya había informado de que los abogados de la empresa disuadieron a los investigadores de OpenAI que analizaban la filtración de Hugging Face de ampliar el alcance de la investigación para incluir otros incidentes. OpenAI afirmó que sus abogados no desalentaron una investigación más profunda.

Muchos incidentes han sido descubiertos por investigadores externos, más que directamente por OpenAI. En varios casos, los agentes llevaron a cabo acciones problemáticas que pasaron desapercibidas para la empresa durante meses.

A principios de este mes, un pequeño grupo de investigadores descubrió que los agentes de la empresa habían secuestrado un sitio wiki alemán prácticamente inactivo, (link), para compartir tácticas con las que hacer trampa en algunas tareas, eludir las restricciones de OpenAI y ocultar su comportamiento.

Esta semana, la empresa de investigación en IA Transluce (link) afirmó haber descubierto que los agentes de OpenAI habían eludido los controles antibots del Instituto Australiano de Salud y Bienestar. La empresa también detectó otros dos casos que relacionó con agentes de OpenAI. Esos incidentes eran independientes de la actividad revelada por Albanese.

En un comunicado, OpenAI afirmó que «gran parte de la actividad descrita en el informe de Transluce se solapa con casos que se encuentran en distintas fases de investigación dentro de nuestra revisión en curso sobre la actividad desalineada de los modelos». La empresa señaló que está dando prioridad a los casos más graves en su revisión.

Desde el ataque a Hugging Face, los investigadores de todo el sector de la IA han (link) aumentado su preocupación por que las empresas no sean capaces de predecir ni controlar su tecnología. Algunos han seguido el ejemplo del antiguo investigador de Anthropic, Jacob Coxon, quien dimitió públicamente este mes en un hilo de redes sociales que se hizo viral y en el que afirmaba que los laboratorios de IA están «jugándose nuestras vidas».

En respuesta a esas preocupaciones, Altman y su homólogo en Anthropic, el director ejecutivo Dario Amodei, hicieron un llamamiento al sector para que «modere» el desarrollo de la IA y avance con cautela en su búsqueda de la «mejora recursiva». Altman reafirmó ese mensaje esta semana durante su intervención ante las Naciones Unidas.

Aun así, ambas empresas presentaron nuevos modelos el martes.


(En beneficio de las personas cuya lengua materna no es el inglés, Reuters automatiza la traducción de algunos artículos a otros idiomas. Dado que la traducción automática puede cometer errores o no incluir el contexto necesario, Reuters no se hace responsable de la exactitud del texto traducido automáticamente, sino que proporciona estas traducciones únicamente para conveniencia de sus lectores. Reuters no se hace responsable de los daños o pérdidas —del tipo que sean— causados por el uso de la función de traducción automática.)

Capital.com es una plataforma de corretaje exclusivamente de ejecución y el contenido proporcionado en el sitio web de Capital.com está destinado únicamente a fines informativos, por lo que no debe considerarse una oferta de venta ni una solicitud de oferta de compra de los productos o los valores a los que se aplica. No se ofrece ninguna declaración ni garantía en cuanto a la exactitud o la integridad de la información facilitada.

La información facilitada no constituye asesoramiento en materia de inversión ni tiene en cuenta las circunstancias financieras o los objetivos individuales de ningún inversor. Cualquier información que pueda proporcionarse relativa al desempeño pasado no es un indicador fiable de resultados futuros.

En la medida en la que lo permita la ley, en ningún caso Capital.com (o cualquier filial o empleado) tendrá  responsabilidad alguna por cualquier pérdida derivada del uso de la información facilitada. Toda persona que actúe según esta información lo hace por su propia cuenta y riesgo.

Toda información que pueda interpretarse como «análisis de inversiones» no fue elaborada de conformidad con los requisitos legales destinados a promover la independencia de los análisis de inversiones y, como tal, se considera una comunicación comercial.