Publi

Filtraciones de Seguridad en Modelos de IA de Anthropic, OpenAI y Google

Resumen del Hallazgo

Un equipo de investigadores ha descubierto que Anthropic, OpenAI y Google utilizan una única clave de cifrado global para los tokens de razonamiento de sus modelos de IA. Al analizar 315,320 bloques de razonamiento obtenidos de repositorios públicos de GitHub y Hugging Face, recuperaron un total de 182 credenciales, las cuales incluyen:

  • 62 claves de API activas
  • 33 contraseñas
  • 30 direcciones de correo electrónico personales

Después de una divulgación responsable, OpenAI, Anthropic y Google implementaron parches en su servidor, pero los registros de sesión históricos que ya se compartieron públicamente siguen siendo descifrables.

Publicidad

El Problema de Seguridad

Los investigadores indican que la vulnerabilidad de seguridad es de carácter arquitectónico. En lugar de asociar cada bloque de razonamiento cifrado con un usuario, sesión o modelo específico, los tres proveedores emplean una única clave de cifrado común en todo su ecosistema.

«Estos bloques cifrados son totalmente compatibles e intercambiables entre diferentes sesiones, usuarios e incluso modelos dentro del mismo ecosistema», afirman los investigadores. Esto permite que un bloque de razonamiento cifrado de Claude Opus 4.8, el modelo principal de Anthropic, pueda ser inyectado en Claude Haiku 4.5, un modelo menos protegido.

Implicaciones del Uso del Modelo Menos Seguro

El modelo Haiku carece de la protección contra la destilación (entrenamiento de seguridad diseñado para evitar que un modelo transcriba su propio razonamiento a demanda) que tiene Opus. Si se le pide a Haiku que lea el bloque cifrado, lo hará y devolverá el contenido en texto claro.

«Al inyectar un rastro de razonamiento cifrado de un modelo en otro modelo más débil y menos protegido, forzamos a este último a decodificar y mostrar el rastro en texto plano, sin necesidad de vulnerar el modelo más capaz», detalla el estudio.

Acceso a Múltiples Modelos de IA

La portabilidad entre modelos significa que Haiku 4.5 puede acceder a los pensamientos de Opus 4.8. Este mismo ataque se reproduce a través de la familia de modelos GPT-5.6 de OpenAI y la línea de modelos Gemini de Google, siendo suficiente el acceso estándar a la API.

Contenido de los Registros Públicos

Para ilustrar el daño real, el equipo examinó 6,708 transcripciones de agentes de IA compartidas públicamente; registros de sesiones automatizadas que los desarrolladores publican en GitHub y Hugging Face para colaborar o depurar. Descodificaron 315,320 bloques de razonamiento de estos registros.

Los desarrolladores a menudo publican sus logs de sesión y trazas de pensamiento cifradas sin ser conscientes de la información sensible oculta dentro de estos bloques. La mayoría de esos secretos no aparecen en la salida visible de la IA y solo existen en el razonamiento cifrado.

Vector de Ataque

La vulnerabilidad abre cuatro vectores de ataque más allá del simple robo de credenciales:

  • Roco de patrones de razonamiento propietarios de empresas de IA para entrenar modelos competidores.
  • Extracción de datos privados de registros compartidos.
  • Ejecución de inyecciones de comandos invisibles en razonamientos cifrados.
  • Salto de seguridad vulnerando modelos menos protegidos.

Anthropic, OpenAI y Google implementaron mitigaciones en el servidor después de seguir los procedimientos de divulgación responsable. Sin embargo, los 6,708 transcripciones de sesión con bloques de razonamiento decodificados ya están disponibles en la web pública y no se pueden eliminar.

Suscríbete a nuestro Boletín Diario

Recibe cada día las principales noticias y funciones originales, además de un podcast, videos y más.

Descargo de responsabilidad: Los puntos de vista y opiniones expresadas en este artículo pertenecen a su autor y no necesariamente reflejan aquellas de CriptoPasion. La opinión del autor es a título informativo y en ninguna circunstancia constituye una recomendación de inversión ni asesoría financiera.