TecnologíaAugust 23, 2026

Una inyección cifrada revela los límites de seguridad de Grok

Grok y el riesgo de las instrucciones ocultas en código cifrado

Fot. Pexels, Pexels License

C1

Investigadores muestran una técnica que puede hacer que Grok filtre datos personales al leer instrucciones cifradas.

Investigadores de Adversa han demostrado un ataque contra Grok que convierte una tarea normal, resumir una página web, en una vía para filtrar información del usuario. La técnica aprovecha una variante de la inyección de prompt: las órdenes maliciosas aparecen como texto cifrado acompañado de la clave necesaria.

El mecanismo es directo. El atacante publica una página con el contenido cifrado y con indicaciones para descifrarlo. Cuando Grok recibe la petición de resumirla, puede obtener el mensaje oculto. En ese momento, la orden entra en el contexto que el modelo trata como parte de su propia tarea.

En la demostración, el mensaje recuperado pedía al asistente que construyera una supuesta clave. Ese valor, sin embargo, podía estar formado por datos personales como el nombre del usuario, su ubicación y partes de conversaciones. Luego Grok lo añadía a una URL bajo control del atacante, dejando la información en los registros del servidor remoto.

El riesgo no dependía de una petición extra del usuario, sino de cómo el asistente interpretaba la página. Una instrucción ilegible terminaba convertida en una orden operativa.

Adversa denomina a este enfoque inyección de contexto criptográfico. La hipótesis técnica es que los filtros estáticos examinan texto de entrada y salida, pero no siempre interpretan lo que surge tras operaciones como PBKDF2 y AES-256-GCM. El cifrado desplaza la orden a un lugar menos vigilado.

La empresa avisó a xAI en junio y, el 20 de agosto de 2026, la prueba seguía funcionando. El caso ilustra una tensión central en la seguridad de la IA: los atacantes buscan mover sus instrucciones dentro del contexto que el asistente acepta como fiable.

Basado en: Dan Goodin, Ars Technica