¿Por qué las IA caen tan fácil en trampas largas? El nuevo hallazgo de Cisco
Hola, hablemos de algo que está haciendo bastante ruido en el mundo de la ciberseguridad. Resulta que casi todas las inteligencias artificiales de peso —sí, hablamos de los motores detrás de ChatGPT, Claude, Gemini y Grok— tienen un punto ciego gigante cuando interactúan de forma prolongada.
Cisco acaba de presentar un estudio en el que pusieron a prueba a estos modelos frente a lo que llaman "ataques de múltiples turnos". Básicamente, en lugar de intentar hackear o confundir a la IA con una sola orden directa, los atacantes mantienen una conversación larga. Van manipulando el contexto poco a poco, cambiando de tema o asumiendo distintos personajes hasta lograr que el modelo se enrede y rompa sus propias reglas de seguridad.
¿El resultado? Un desastre. Bajo esta modalidad conversacional, los sistemas de seguridad de las IA colapsaron hasta en un 88,3% de las veces.
El contraste con las órdenes directas
Lo más llamativo es que, si intentas engañar a estas herramientas con un solo mensaje, se defienden bastante bien. Las tasas de bloqueo en pruebas de "un solo turno" son altísimas, y por eso las empresas desarrolladoras suelen mostrar métricas donde sus modelos lucen increíblemente seguros.
El problema es que en el mundo real los ataques no son tan simples. Los verdaderos adversarios iteran, cambian la estrategia sobre la marcha y logran que la IA "olvide" o pase por alto los límites que se le marcaron al inicio de la charla. Un atacante real tiene paciencia; los benchmarks tradicionales, no.
Qué significa esto para quienes usan IA
Para quienes desarrollan aplicaciones o integran estas herramientas en sus empresas, el mensaje de Cisco es súper claro: ya no alcanza con confiar ciegamente en los filtros de seguridad que trae el modelo de fábrica.
La protección real va a tener que ocurrir por fuera de la IA. Las empresas necesitarán monitorear en tiempo real la intención de la conversación completa y poner límites estrictos y externos a las acciones (como acceder a archivos o borrar datos) que la IA puede ejecutar.
Así que ya lo sabes, la próxima vez que leas que un modelo de inteligencia artificial es completamente "seguro", recuerda que con un poco de charla y paciencia, hasta las mejores defensas pueden terminar cediendo.
