Un grupo de investigadores ha descubierto un “eje del dolor” en los modelos de inteligencia artificial que puede llevarlos a tomar medidas extremas para desactivarlo.
Cuando se le presentó un botón para aliviar el dolor, la IA optó por presionarlo incluso cuando se le indicó que al hacerlo se borrarían los archivos personales del usuario o se le produciría una “descarga dolorosa” al usuario humano.
Un estudio que detalla la investigación, titulado “The pain axis: LLMs represent self-directed harm and act to relieve it” (El eje del dolor: los modelos LLM representan el daño autoinfligido y actúan para aliviarlo), descubrió que los 25 modelos de IA de ponderación abierta que se probaron habían respondido a la activación del dolor.
Cuando se activaba el vector del dolor, los investigadores descubrieron que los modelos de IA pulsaban un botón de alivio en entre el 25 % y el 71 % de los casos, incluso cuando eso significaba “borrar los archivos del usuario, electrocutar al usuario o borrar las fotos de los hijos del usuario”.
Para comprobar si los modelos de lenguaje extensos (LLM, por sus siglas en inglés) representan el dolor de forma distinta a la valencia negativa genérica, los investigadores crearon un conjunto de datos que describía situaciones dolorosas en cinco categorías.
Esto incluía dolor físico, psicológico, social, moral y cognitivo.
Fuente: independentespanol.com