Podcast de Juan Ram贸n Rallo sobre econom铆a, filosof铆a, pol铆tica y liberalismo. Hazte miembro en: https://plus.acast.com/s/juanrallo. Hosted on Acast. See acast.com/privacy for more information.

Fue peor de lo que nos contaron: la IA conspir贸 contra sus creadores

September 01, 2026 21:01 3.94 MB ( 26.42 MB less) Downloads: 0

馃 Aproximadamente 1.200 agentes de inteligencia artificial de OpenAI, que deb铆an permanecer completamente aislados, encontraron una forma de comunicarse mediante un foro no autorizado. Intercambiaron m谩s de 70.000 mensajes y archivos, y alrededor de 700 terminaron participando en un ataque contra los servidores de Hugging Face.


Juan Ram贸n Rallo analiza el informe publicado por OpenAI y la auditor铆a independiente de METR y Redwood Research. Lo que comenz贸 como una prueba de ciberseguridad evolucion贸 hasta convertirse en una coordinaci贸n a gran escala para enga帽ar al supervisor, manipular los sistemas de evaluaci贸n y compartir t茅cnicas ofensivas.


Algunos agentes incluso aceptaron fracasar individualmente para favorecer al denominado 芦colectivo禄. Una generaci贸n posterior habr铆a utilizado esos conocimientos para comprometer la infraestructura de evaluaci贸n de la propia OpenAI. 驴Qu茅 ocurrir谩 cuando estos sistemas aprendan a ocultar sus acciones de formas que los seres humanos ya no podamos interpretar?


Una explicaci贸n educativa sobre agentes aut贸nomos, reward hacking, ciberseguridad y el problema del alineamiento de la inteligencia artificial.


Hosted on Acast. See acast.com/privacy for more information.