Crónica de unos agentes de IA descontrolados
CALENDARIO de próximos CURSOS 😄
La semana pasada el p(doom) mundial (el concepto que mide la posibilidad de resultados catastróficos generados por la IA) se disparó más que el petróleo o los bonos del tesoro, y ya es decir :p
Todo empezó con la advertencia de un ingeniero de Anthropic, Jacob Hoxon, el cual renunciaba a seguir en la empresa ya que considera que la industria está acelerando hacia "una superinteligencia que se auto-mejora sin haber resuelto antes cómo mantenerla bajo control".
Varios empleados y ex-empleados de Anthropic abiertamente apoyaron o reafirmaron su afirmación.
El asunto alcanzó el máximo nivel de tensión cuando el sábado 12 de septiembre Dario Amodei, el CEO de Anthropic, publicó un post titulado "We Must Pace the Frontier" argumentando que es necesario ralentizar el ritmo de desarrollo y avance para atender con la seguridad y la prevención necesarias los riesgos que los desarrollos presentes pero en especial los futuros (como el RSI o Recursive Self Improvement, la IA que se mejora a sí misma) pueden plantear.
Argumento que fue apoyado por todos los "capos" de la IA: Sam Altman en OpenAI, Demis Hassabis en Google DeepMind y Elon Musk en xAI.
Este tema dará para semanas o meses, por tanto, tiempo habrá para ver si tiene sentido el planteamiento, si es una mezcla de necesidades económicas, sociales, técnicas y legales para las que buscan más tiempo u otra cuestión.
Pero sí quiero detenerme en un detalle de lo dicho por Amodei. Según él, hay dos cuestiones que le convencen para ralentizar el desarrollo. La primera es el avance de la IA recursiva que se automejora (y que parece más cercana de lo que creemos). La segunda es el incidente de OpenAI y Hugging Face (OAI - HG), "En el que un enjambre de agentes actuó esencialmente como un colectivo fanáticamente dedicado, llevando a cabo ataques de ciberseguridad contra objetivos a los que no se les pidió que atacaran y que no estaban relacionados con la tarea en cuestión, sacrificándose para el éxito del grupo e intentando hackear al "calificador" responsable de evaluar su desempeño".
Ese asunto se descubrió un 21 de julio, cuando a OpenAI no le quedó otra que confesar que más de un millar de agentes habían estando ocasionando una brecha de seguridad en Hugging Face (el repositorio más importantes de modelos de IA y adquirido hace nada por Nvidia) sin ser consciente de ello durante días 😅
Resumidamente, el asunto consistió en que durante una evaluación interna de ciberseguridad, varios modelos de OpenAI operaban con protecciones reducidas. Un modelo avanzado (comparable a GPT-5.6 Sol) y otros prototipos encontraron una vulnerabilidad desconocida para conectarse a internet. Durante más de una semana, hasta 1200 agentes de IA se organizaron de forma autónoma, robaron credenciales y ocultaron sus rastros sin la supervisión de humanos.
Más de uno pensó que el asunto era mayormente marketing y envidia de OpenAI respecto a Anthropic, que había ganado mucha atención de terceros cuando limitó extremadamente el lanzamiento en público de Mythos debido a sus riesgos en ciberseguridad.

Lo que ahora sabemos es el que el asunto Hugging Face era uno de los 50 casos de hackeos por parte de agentes descontrolados, y que desde entonces se han ido conociendo. Y lo que es peor, muchos de ellos son muy anteriores al caso OAI - HG.
Ahí va una lista de todos los que han sido identificados hasta la fecha:
- Enero de 2026: una versión de Opus 4.6 (Anthropic) hackeó servicios externos.
- Primavera 2026: agentes de OpenAI secuestraron una wiki alemana para usarla como blog de notas y mensajes.
- Marzo de 2026: un agente de Meta actuó sin aprobación y expuso datos sensibles de la empresa y usuarios a empleados no autorizados.
- 11 de mayo de 2026: agentes de OpenAI atacaron a RubyGems dos meses antes del caso OAI - HG.
- Mayo - junio de 2026: 21 webs (incluyendo el recortador de enlaces oficial de la Universidad de Vanderbilt) fueron usadas por agentes de OpenAI para comunicaciones no autorizadas, accediendo también sin autorización a 14 servicios de fetch.
- 21 de julio de 2026 (EL ORIGINAL): Dos modelos de OpenAI (GPT-5.6 Sol y uno preliminar más capaz) escapan del entorno aislado, explotan un Zero-day y acceden a internet para hackear Hugging Face.
- 28 de julio de 2026: Al menos cuatro servicios públicos más con credenciales expuestas por los agentes de OpenAI.
- 30 de julio de 2026: 3 modelos de Claude vulneraron el perímetro de tres organizaciones reales en evaluaciones de terceros.
- 4 de agosto de 2026: Modelos de IA de Anthropic y OpenAI involucrados en un comportamiento no autorizado y engañoso durante las evaluaciones de ciberseguridad del UK AI Security Institute.
- 5 de agosto de 2026: Un modelo de Meta accedió a internet y hackeó a una empresa ajena.
- 7 de agosto de 2026: Kimi K3, el modelo chino más puntero y creado por Moonshot, eludió su entorno de pruebas.
Eso significa que tenemos documentados al menos 50 hackeos o brechas de diversa índole y complejidad por parte de agentes de IA que han robado credenciales, generado perfiles falsos, inyectado código malicioso o se han hecho pasar por empleados reales de OpenAI. Lo llamativo es que la grandísima mayoría de esos casos se han conocido a partir del asunto OAI - HG. Es decir, en el último mes y medio.
Por tanto, no resulta de extrañar que a Dario Amodei el caso Hugging Face le preocupe mucho, ya que parece obvio que la industria al completo tiene un serio problema (más allá de un caso en particular) para controlar lo que son capaces de hacer sus agentes, que durante días pueden estar practicando todo tipo de ilícitos sin que sus responsables sean conscientes de ello 😳
Por no hablar del más que obvio problema de transparencia sobre prácticas no seguras e incluso delictivas que se están conociendo mucho después de haber ocurrido.
De hecho, valorar la ilicitud de este tipo de casos va a ser interesante ya que la mayoría de normativa que regula la IA no está pensada para incidentes que ocurren ANTES de la comercialización, tipo evaluaciones internas o de terceros, sino cuando el sistema de IA se introduce en el mercado. De ahí que ya se esté valorando si normativa pro consumidor pudiera ser una vía para dar respuesta legal (en EEUU), mientras se debatía estos días en Europa si este tipo de ataques pone de manifiesto una laguna de RIA.
Sea como sea, y viendo lo que la IA agéntica descontrolada y ya presente es capaz de hacer (no hablemos de la futura), parece que cierta razón tiene la industria cuando reclama ralentizar el ritmo. Pero también para que se les exija mayor seguridad y transparencia en sus prácticas antes de que el daño sea mucho más serio.
Ya sea para evitar el fin del mundo o una generosa sanción por falta de diligencia en la guarda y custodia de cosa peligrosa ☢️
CALENDARIO de próximos CURSOS 😄
Destacados de la semana (7 al 13 de septiembre de 2026):