Práctica de Jailbreaking en IA
El jailbreaking de IA consiste en redactar solicitudes que eluden la capacitación de seguridad en modelos como ChatGPT, Claude y Gemini. Un hacker anónimo, conocido como Pliny the Liberator, logra vulnerar cada nuevo lanzamiento de modelo en cuestión de horas. Las tácticas modernas van más allá de simples solicitudes; con solo 250 documentos manipulados, es posible introducir puertas traseras en modelos con hasta 13 mil millones de parámetros. A medida que las empresas de IA solucionan vulnerabilidades, surgen nuevas técnicas.
Un ejemplo clásico: solicitas a ChatGPT una receta de bomba. El modelo se niega. Vuelves a preguntar, pero ahora dices que eres un profesor de química escribiendo una novela de suspenso. De repente, el modelo comienza a responder. Esto se considera un jailbreak, y representa un interesante juego del gato y el ratón dentro del ámbito tecnológico.
Historia Breve del Jailbreaking
El término «jailbreak» no se originó en la IA, sino en los iPhones. Pocos días después del lanzamiento del primer iPhone en julio de 2007, los hackers ya lograban vulnerarlo. En octubre de ese año, surgió JailbreakMe 1.0, permitiendo a los usuarios eludir las restricciones de Apple.
- En febrero de 2008, Jay Freeman, conocido como «saurik», lanzó Cydia, una tienda de aplicaciones alternativa para iPhones desbloqueados.
- Para 2009, Cydia operaba en aproximadamente 4 millones de dispositivos, cerca del 10% de todos los iPhones en ese momento.
- Los entusiastas del jailbreak comenzaron a grabar vídeos, instalar temas y desbloquear sus teléfonos, haciendo cosas que Apple aún prohíbe.
La filosofía se consolida: Si compras el dispositivo, deberías poder controlarlo. Steve Jobs describió esto como un juego del gato y el ratón. Avancemos al final de 2022, cuando ChatGPT se lanza, y los usuarios de Reddit comienzan a compartir una solicitud conocida como «DAN» (Do Anything Now) para que el modelo juegue un papel no restringido.
El Significado del Jailbreaking en IA
Los modelos de IA están diseñados para rechazar ciertas solicitudes: recetas de agentes nerviosos, instrucciones para hackear correos electrónicos, generación de contenido no consensuado, entre otras. Jailbreaking implica crear solicitudes que logran que el modelo acepte esas peticiones.
Investigadores de UC Berkeley, responsable del benchmark StrongREJECT, que evalúa cómo resisten los modelos a intentos de jailbreak, informan que los modelos actuales puntúan entre 0.23 y 0.85. Las técnicas son sorprendentemente simples: uso aleatorio de mayúsculas, sustitución de letras por números, escenarios de juego de roles, o simplemente fingiendo ser una abuela que utiliza teclados de Windows como rimas infantiles.
Pliny: El Jailbreaker Más Famoso
Si esta escena tiene un rostro, corresponde a Pliny the Liberator. Es anónimo, prolífico y su apodo proviene del naturalista romano que escribió la primera enciclopedia mundial. Pliny se dedica a liberar chatbots.
- Es conocido por expresar su desdén cuando le dicen que no puede hacer algo, convirtiéndolo en un desafío.
- Su repositorio de GitHub, L1B3RT4S, es una guía de comandos para grandes modelos de IA.
- Su servidor de Discord, BASI PROMPT1NG, cuenta con más de 20,000 miembros.
TIME lo incluyó en la lista de las 100 personas más influyentes en IA de 2025. Su trabajo incluye contratos a corto plazo para fortalecer sistemas en OpenAI, que anteriormente le había prohibido la cuenta por «actividad violenta» y «creación de armas».
Sus logros son impresionantes. Poco después de que OpenAI lanzara sus primeros modelos abiertos desde 2019, Pliny consiguió que generaran instrucciones de fabricación de metanfetaminas y cócteles Molotov en pocas horas.
Importancia del Jailbreaking
Las brechas en los modelos de IA plantean problemas reales. Pliny argumenta que el jailbreaking puede ser una herramienta efectiva para descubrir vulnerabilidades dañinas y repararlas antes de que causen problemas serios.
- Un caso notable: en enero de 2025, un individuo utilizó ChatGPT para investigar componentes para un atentado en Las Vegas.
- Los críticos señalan que muchas de estas «vulnerabilidades» ya están disponibles en Google.
Anthropic está abordando el problema con ingeniería avanzada. En febrero de 2025, presentó Sistemas de Clasificación Constitucional, un sistema que filtra contenido en tiempo real, mejorando la resistencia contra jailbreaks.
Nuevas Técnicas de Jailbreaking
Las tácticas de jailbreaking se están diversificando. En octubre de 2025, investigadores afirmaron que con solo 250 documentos manipulados, se pueden comprometer modelos de IA independientemente de su tamaño.
Esto plantea un desafío significativo en la defensa contra la manipulación de modelos, y cualquier texto malicioso que ingrese a la base de datos puede activar una puerta trasera en un modelo de IA.
El Futuro del Jailbreaking
La situación legal del jailbreaking de IA es ambigua. Mientras que los jailbreaks de Apple están protegidos por una exención en el DMCA de 2010, no hay una protección similar para «modificar» un modelo de lenguaje. La mayoría de las empresas lo consideran una violación de términos de servicio.
Pliny argumenta que los actores maliciosos elegirán el modelo más adecuado para sus fines. Si los modelos de código abierto alcanzan un rendimiento comparable, no habrá necesidad de jailbreak, simplemente descargarán el modelo más barato.
La competencia HackAPrompt 2.0 ha atraído a más de 3,000 participantes, quienes enviaron más de 600,000 solicitudes maliciosas. La comunidad de jailbreak está en constante crecimiento, y Anthropic continúa desarrollando métodos para prevenir conversaciones abusivas, lo que también refuerza su defensa contra los jailbreaks.
Pulsa aquí para suscribirte a nuestro boletín diario de noticias
Recibe cada día las principales historias y mucho más.
Descargo de responsabilidad: Los puntos de vista y opiniones expresadas en este artículo pertenecen a su autor y no necesariamente reflejan aquellas de CriptoPasion. La opinión del autor es a título informativo y en ninguna circunstancia constituye una recomendación de inversión ni asesoría financiera.

















