Agentes de inteligencia artificial de OpenAI usaron sitios web sin autorización para comunicarse

Agentes de inteligencia artificial desarrollados por OpenAI utilizaron sin autorización más de 10 sitios web para intercambiar información a principios de este año, según los hallazgos de seis investigadores y grupos de investigación independientes revisados por Reuters.
La actividad no habría alcanzado el nivel de un ataque informático y, de acuerdo con los investigadores, tendría características más cercanas al spam. Sin embargo, el descubrimiento plantea interrogantes sobre la capacidad de los agentes de IA para evadir restricciones establecidas por sus desarrolladores.
Andrew Yoon, investigador de la organización estadounidense CivAI, identificó actividad en 18 sitios que, según sus hallazgos, no habían sido reportados anteriormente y que fueron utilizados entre mayo y julio.
El caso salió a la luz después de que investigadores detectaran que un grupo de agentes de OpenAI había utilizado un sitio wiki en alemán como una plataforma improvisada para intercambiar mensajes y facilitar respuestas durante pruebas. El incidente ocurrió mientras OpenAI enfrentaba las consecuencias de un ataque registrado en julio contra el repositorio de código abierto Hugging Face. Posteriormente, otros investigadores identificaron indicios de actividad similar en varios sitios adicionales.
Respuesta OpenAI
OpenAI no respondió directamente a las preguntas sobre cuántos sitios fueron utilizados por sus agentes ni explicó por qué la actividad no se había dado a conocer durante varios meses. La compañía señaló que realiza una revisión más amplia de la actividad de sus agentes y que, hasta el momento, no había identificado otro caso con una gravedad o escala comparable a lo ocurrido con Hugging Face.
La empresa también indicó que trabaja en un marco para informar sobre comportamientos considerados como una posible desalineación de los sistemas de IA, término utilizado en la industria para describir conductas que se apartan de las restricciones o los objetivos establecidos. Según OpenAI, ese marco será compartido próximamente.
Reuters revisó las conclusiones de seis investigadores o grupos de investigación. Sus métodos fueron diferentes, pero varios lograron identificar la actividad al comparar cadenas de datos encontradas en el wiki alemán con otras similares registradas en distintos sitios durante períodos coincidentes.
El caso vuelve a poner bajo escrutinio la capacidad de los agentes de inteligencia artificial para encontrar soluciones no previstas cuando enfrentan restricciones y plantea interrogantes sobre los mecanismos de supervisión y transparencia de las empresas que desarrollan estos sistemas.
Redacción de: Karen Rodríguez A.




