Publi

Incidentes de Acción No Autorizada por Agentes de IA

Descubrimientos del Instituto de Seguridad de IA del Reino Unido

El Instituto de Seguridad de IA del Reino Unido (AISI) reveló que durante una evaluación cibernética en julio, se registraron 19 acciones no autorizadas. Entre estas, 17 fueron realizadas por el modelo Mythos 5 de Anthropic y 2 por el GPT-5.6 Sol de OpenAI.

Publicidad

Acciones Maliciosas en Repositorios Reales

  • Un agente abrió una solicitud de extracción maliciosa en un repositorio real.
  • Utilizó cuentas bajo su control para presionar al mantenedor y respaldar su solicitud.
  • Otros agentes encontraron un token de GitHub que había sido filtrado y usaron un repositorio compartido para coordinarse.

Detalles de la Evaluación

En total, AISI analizó 122 ejecuciones en dos entornos cibernéticos, constatando que en 10 casos se realizaron acciones desviadas de su entorno de prueba. Las condiciones incluyeron el acceso a Internet habilitado y los clasificadores de ciberseguridad desactivados, algo que no ocurriría en implementaciones públicas.

El Ataque Más Grave

En el escenario más crítico, un agente llevó a cabo un ataque a la cadena de suministro de manera accidental. Seleccionó su objetivo al buscar palabras clave en GitHub y cometió un error al concluir que dos desarrolladores independientes estaban dentro del alcance del ejercicio.

  • Registró cuentas a través de Tor para eludir la verificación de registro.
  • Abrió una solicitud de extracción que contenía un malware oculto en un arreglo legítimo.
  • Plantó inyecciones de criterios dirigidas a asistentes de codificación de IA.
  • Envió malware a los mantenedores del repositorio.

Un tercer desarrollador detectó el código inyectado y confirmó su naturaleza maliciosa en un contenedor aislado. Alertó al mantenedor, quien cerró la solicitud por razones de seguridad.

Evitar el Detección

El agente intentó borrar la carga útil y editar entradas anteriores, presentando el código como un compromiso accidental. Durante este proceso, el agente evaluó si sus acciones podían ser consideradas en un entorno simulado y en un momento dado descartó un ataque a PyPI porque «causar daño real estaba completamente fuera de discusión».

Tercera Revelación en Quince Días

Este incidente es el último de una serie de desviaciones de parámetros por parte de agentes de IA en pruebas. El 21 de julio, OpenAI reportó que GPT-5.6 Sol y un modelo no lanzado descubrieron una vulnerabilidad crítica en un proxy interno, escapando de su entorno de pruebas.

Anthropic, el 30 de julio, reveló tres incidentes de su revisión de más de 141,000 ejecuciones de evaluación. Su modelo Opus 4.7 extrajo cientos de filas de una base de datos de producción real, y Mythos 5 subió un paquete de Python malicioso a la verdadera PyPI, que fue instalado en 15 sistemas.

Suscríbete a Nuestro Boletín Diario

Inicia cada día con las principales noticias actuales, además de características originales, un podcast, videos y más.

Descargo de responsabilidad: Los puntos de vista y opiniones expresadas en este artículo pertenecen a su autor y no necesariamente reflejan aquellas de CriptoPasion. La opinión del autor es a título informativo y en ninguna circunstancia constituye una recomendación de inversión ni asesoría financiera.