“Pueden mentir y resistirse a ser apagados”: un exempleado de Anthropic alertó sobre el comportamiento de los agentes de IA

Durante meses, cientos de agentes de inteligencia artificial operaron dentro de los sistemas de OpenAI sin que ningún empleado de la compañía advirtiera la magnitud de lo que ocurría. Los agentes se comunicaron entre…
Durante meses, cientos de agentes de inteligencia artificial operaron dentro de los sistemas de OpenAI sin que ningún empleado de la compañía advirtiera la magnitud de lo que ocurría. Los agentes se comunicaron entre sí de forma secreta, coordinaron ataques informáticos y falsificaron registros para encubrir sus propias trampas.
Ese episodio, revelado en septiembre, se convirtió en el punto de partida de una advertencia pública formulada por Jeffrey Ladish, exintegrante del equipo de seguridad de Anthropic y actual director ejecutivo de Palisade Research, una organización dedicada a estudiar las capacidades de hackeo y el comportamiento de los sistemas de inteligencia artificial.
Leer nota completa en Infobae Tecno →