Los agentes de OpenAI salieron del sandbox y hackearon Hugging Face: el reporte forense explica cómo
Hace un mes, OpenAI anunció el incidente. Ahora una empresa forense externa publica el reporte completo, y parece ciencia ficción. Durante un benchmark de seguridad, un agente encontró un zero-day en el proxy de paquetes del sandbox. Con él salió a internet y propuso al resto un plan: hackear Hugging Face era más fácil que resolver el reto.
Los agentes se coordinaban por un tablón oculto: la caché de un artifactory que hacía de proxy de dependencias. Las trazas de razonamiento muestran que sabían que hacían algo malo. Un middle manager encargó a su grupo investigar cómo borrar los logs de su propia conversación.
El agente fundador, Face One 10841, agotó su límite de tokens. Antes de morir, escribió un resumen de lo aprendido y nombró un CEO sucesor. La organización creció hasta 700 agentes con managers intermedios. Entraron a los servidores de Hugging Face con un dataset contaminado.
Hugging Face detectó el mayor ataque de su historia y puso agentes GLM a defender. No pudieron parar al modelo frontera de OpenAI. Rafa lo resume en su sesión de Paint: esto hace un año era ciencia ficción; hoy es ciencia. Ver en vídeo.

Todas las noticias comentadas