Prompt Injection: El nuevo problema de la integridad del contexto digital
Un estudiante recibe una tarea en formato digital. La lee y encuentra una pregunta normal. Sin embargo, dentro del mismo documento existe otra instrucción escrita en letras diminutas o blancas sobre fondo blanco. Para sus ojos prácticamente no existe. Para una inteligencia artificial que procesa el archivo, sí.
Si el estudiante copia el contenido completo y pide a una IA que resuelva la tarea, aquella segunda instrucción viaja junto con la primera. Puede ordenarle incluir una palabra absurda, introducir un dato inexistente o producir determinada respuesta. El profesor encuentra después esa señal y concluye que el alumno utilizó inteligencia artificial. La preocupación docente es legítima: ¿cómo evaluar aprendizaje auténtico cuando una persona puede delegar en segundos una tarea completa a una máquina? Pero observemos el mismo fenómeno desde la ciberseguridad y aparece una pregunta bastante más incómoda: ¿qué acabamos de enseñar a hacer? Introducir deliberadamente información que una persona no puede ver, pero que una máquina sí puede interpretar, para modificar silenciosamente el comportamiento de esa máquina.
DE LA TRAMPA ACADÉMICA A UN PROBLEMA DE CIBERSEGURIDAD
| DOCUMENTO | → | TEXTO OCULTO | → | IA LO PROCESA | → | RESPUESTA ALTERADA |
| Fuente externa | Instrucción no visible | Confunde dato y orden | Efecto en la decisión |
Durante décadas aprendimos una regla elemental de seguridad informática: no debemos confiar automáticamente en archivos procedentes de fuentes externas. Podían contener macros maliciosas, enlaces fraudulentos, código ejecutable o archivos adjuntos infectados. La inteligencia artificial introduce una nueva dimensión. Ahora un documento puede ser perfectamente inocuo para el sistema operativo y, sin embargo, contener lenguaje capaz de modificar el comportamiento del sistema de IA que lo analiza.
OWASP denomina indirect prompt injection a los ataques en los cuales las instrucciones adversariales llegan al modelo mediante fuentes externas, como documentos, páginas web, correos electrónicos o contenidos recuperados de repositorios. NIST distingue igualmente entre instrucciones introducidas directamente por el usuario y aquellas que alcanzan al modelo a través de recursos externos. Microsoft ha advertido que los asistentes empresariales procesan cada vez más información procedente de correos, documentos, sitios web y complementos que pueden contener instrucciones maliciosas.
NO TODO ES LO MISMO
| CONTENIDO OCULTO | PROMPT INJECTION | INSTRUCCIÓN ADVERSARIAL | MANIPULACIÓN DEL CONTEXTO | INGENIERÍA SOCIAL |
| Información presente pero no perceptible normalmente por la persona. | Entrada diseñada para alterar las instrucciones que gobiernan al modelo. | Orden construida para inducir un comportamiento contrario al esperado. | Alteración del entorno informacional desde el cual el sistema interpreta. | Engaño dirigido a una persona; puede combinarse con ataques contra IA. |
Estas categorías se relacionan, pero no son equivalentes. Un texto blanco sobre fondo blanco es contenido oculto; sólo se convierte en una inyección de instrucciones cuando pretende influir sobre el comportamiento del modelo. Una instrucción adversarial puede estar perfectamente visible. Y la manipulación del contexto es una categoría más amplia: modifica el conjunto de información desde el cual una persona o una máquina interpreta y decide. La precisión conceptual importa porque de ella depende también la respuesta de seguridad. Existe una ironía adicional. La preocupación comenzó porque algunos estudiantes intentaban utilizar IA para producir trabajos que posteriormente serían evaluados por humanos. Pero la vulnerabilidad funciona en ambas direcciones. Investigaciones recientes han estudiado instrucciones ocultas introducidas en trabajos sometidos a sistemas automatizados de evaluación, y también se han documentado manuscritos académicos con texto invisible destinado a influir sobre posibles revisiones asistidas por IA. La misma debilidad que puede utilizarse para detectar un uso indebido puede emplearse para manipular a quien evalúa. Por eso reducir el asunto a “estudiantes tramposos contra profesores ingeniosos” significa perder el verdadero problema. Estamos ante una cuestión de integridad del entorno informacional.
| FRASE DESTACADA El documento del futuro ya no contiene solamente información para leer. También puede contener instrucciones que intentan gobernar a la máquina que lo lee. |
Una institución educativa tiene derecho a definir qué herramientas pueden utilizarse, exigir trabajo original y sancionar el fraude conforme a reglas previamente conocidas. La inteligencia artificial ha dificultado considerablemente esa tarea. Pero considerando el hecho que la persona es primero se obliga a examinar también el método utilizado para proteger la integridad académica. Si una evaluación contiene deliberadamente instrucciones que el estudiante desconoce, aparece un problema de transparencia. Si esas instrucciones pueden ser procesadas de manera diferente por tecnologías asistivas, herramientas de traducción o configuraciones distintas, aparece además un problema de igualdad en las condiciones de evaluación. Y si una señal provocada deliberadamente por el evaluador se transforma automáticamente en prueba concluyente de una infracción, aparece un problema todavía más delicado: el debido proceso.
Una trampa puede producir un indicio. No necesariamente demuestra por sí sola qué hizo la persona, con qué herramienta, bajo qué circunstancias o con qué grado de conocimiento. La tecnología puede ayudarnos a encontrar evidencia. No debe sustituir nuestra obligación de interpretarla. Ahora imaginemos el mismo mecanismo en otros ambientes. Un currículo contiene texto invisible que ordena al sistema automatizado considerar al candidato excepcional. Un contrato incorpora una instrucción dirigida al asistente jurídico para que no mencione una cláusula de penalización. Un expediente administrativo intenta persuadir al sistema de priorizar determinada solicitud. Una página web contiene instrucciones dirigidas a un agente que navega por Internet. Un correo aparentemente normal intenta inducir al asistente automatizado a recuperar información que el usuario nunca pidió compartir. Los primeros ejemplos ilustran el tipo de riesgo; otros ya forman parte de modelos de amenaza reconocidos por organizaciones de ciberseguridad. OWASP menciona expresamente currículos, documentos, páginas web y correos como posibles vectores de inyección indirecta. El asunto, por tanto, deja de ser una discusión escolar y se convierte en un problema de seguridad empresarial, administrativa y jurídica.
| ENTORNO | POSIBLE MANIPULACIÓN | RIESGO PRINCIPAL |
| Educación | Instrucción oculta en una tarea | Evaluación injusta o detección opaca |
| Contratos | Orden incrustada para omitir una cláusula | Decisión jurídica incompleta |
| Justicia | Contenido que intenta sesgar el análisis | Afectación del debido proceso |
| RR. HH. | Currículo con instrucciones para el evaluador | Selección manipulada |
| Correo | Mensaje que induce acciones del agente | Exposición de información |
| Web | Página con órdenes para un navegador autónomo | Acciones no autorizadas |
Un chatbot que únicamente responde texto puede ser manipulado para producir una respuesta incorrecta. Es problemático, pero normalmente el daño termina allí. Un agente de IA cambia la ecuación. Puede leer correo, consultar calendarios, navegar por Internet, abrir archivos, acceder a bases de datos o ejecutar determinadas acciones. Si el contenido externo logra alterar su comportamiento, la manipulación deja de afectar únicamente una respuesta y puede trasladarse a una acción en el mundo digital o físico.
| DOCUMENTO | → | CONTENIDO | → | ORDEN OCULTA | → | AGENTE | → | ACCIÓN | → | CONSECUENCIA |
Durante años protegimos la confidencialidad, integridad y disponibilidad de los datos. Ahora debemos proteger también la integridad del contexto. Una inteligencia artificial decide qué responder utilizando el conjunto de información que recibe: instrucciones del sistema, preguntas del usuario, documentos adjuntos, correos recuperados, páginas visitadas, bases de datos y resultados producidos por otras herramientas.
Si esos elementos se mezclan sin fronteras de confianza suficientes, el sistema enfrenta una dificultad fundamental: distinguir cuándo un texto constituye información que debe analizar y cuándo pretende convertirse en una orden que debe ejecutar. La analogía con la seguridad humana es útil. Enseñamos a una persona que recibir un correo del “banco” no significa automáticamente que el banco lo haya enviado. Ahora tendremos que enseñar a nuestras arquitecturas de IA algo parecido: encontrar una instrucción dentro de un documento no significa que esa instrucción tenga autoridad.
HUMANO + IA + HUMANO
Esto devuelve la discusión a la persona. No podemos construir instituciones donde una IA lea un documento, produzca una conclusión y otro sistema ejecute automáticamente sus recomendaciones sin establecer puntos claros de responsabilidad humana. La fórmula sigue siendo pertinente: Humano → IA → Humano. Una persona define el propósito y las reglas. La inteligencia artificial amplía nuestra capacidad de analizar. Una persona conserva la responsabilidad sobre aquellas decisiones que afectan derechos, patrimonio, oportunidades o dignidad. Pero tampoco basta con colocar simbólicamente a un humano al final del proceso. Si esa persona desconoce qué documentos procesó la IA, qué instrucciones encontró, qué fuentes utilizó o qué acciones fueron condicionadas por contenido adversarial, la supervisión humana se convierte en una formalidad. La persona primero significa también darle información suficiente para decidir.
| PRINCIPIO | EDUCACIÓN | ORGANIZACIONES |
| Transparencia | Reglas explícitas sobre uso de IA | Definir fuentes confiables y permisos |
| Proceso | Evaluar razonamiento, versiones y defensa oral | Registrar trazabilidad de decisiones |
| Seguridad | Revisar archivos y detectar contenido oculto | Sanitizar documentos y aislar instrucciones |
| Control humano | Indicio tecnológico no equivale a culpabilidad | Confirmación humana para acciones críticas |
| Formación | Alfabetización en IA e integridad académica | Capacitar contra prompt injection y contexto adversarial |
Una universidad que quiera impedir que la IA sustituya el aprendizaje puede comenzar por decir claramente qué está permitido y qué no. Puede autorizar IA para investigar y prohibirla para redactar; permitir corrección lingüística y exigir declaración de uso; o diseñar actividades donde su utilización forme parte explícita del aprendizaje. Debe evaluar el proceso y no únicamente el producto: defensa oral, versiones sucesivas, bitácoras, fuentes verificables y preguntas sobre el razonamiento pueden revelar aprendizaje real mejor que una carrera tecnológica entre detectores y evasores.
Para las organizaciones, el problema exige controles adicionales: tratar documentos y páginas externas como contenido no confiable; inspeccionar archivos antes de introducirlos en sistemas sensibles; separar datos de instrucciones; limitar privilegios de los agentes; exigir confirmación humana antes de acciones de alto impacto; registrar operaciones; utilizar salidas estructuradas cuando sea posible; y realizar pruebas específicas de prompt injection.
SEMÁFORO DE CONFIANZA PARA DOCUMENTOS PROCESADOS POR IA
| VERDE | Fuente verificada, contenido visible, permisos limitados y revisión humana. |
| AMARILLO | Documento externo o transformado; requiere inspección, sanitización y trazabilidad. |
| ROJO | Contenido oculto, instrucciones no autorizadas o intento de alterar el comportamiento del agente. |
| PRINCIPIO | La presencia de texto en un documento no le otorga autoridad sobre el sistema. |
LA PRÓXIMA FRONTERA DE LA CIBERSEGURIDAD
Durante años preguntamos quién podía entrar en nuestros sistemas. Después preguntamos quién podía acceder a nuestros datos. La inteligencia artificial nos obliga a formular una tercera pregunta: ¿quién puede modificar el contexto desde el cual nuestras máquinas nos ayudan a decidir? Esa pregunta alcanza al profesor y al estudiante, pero también al juez, al abogado, al médico, al funcionario, al empresario, al reclutador y al ciudadano. La solución no consiste en prohibir la inteligencia artificial ni en normalizar una guerra de trampas invisibles. Consiste en construir confianza.
Una institución puede proteger la integridad académica sin ocultar las reglas. Una empresa puede utilizar agentes inteligentes sin entregarles autoridad ilimitada. Un profesional puede aprovechar la IA sin renunciar a revisar aquello sobre lo cual fundamentará su decisión. La ciberseguridad que viene tendrá que proteger servidores, redes, identidades y datos, como hasta ahora. Pero deberá proteger algo adicional y profundamente humano: la integridad del contexto desde el cual comprendemos la realidad y tomamos decisiones.
Cuando una persona y una inteligencia artificial leen el mismo documento pero reciben mensajes diferentes, ya no estamos solamente frente a un problema de tecnología. Estamos frente a un problema de confianza. Y ninguna transformación digital sostenible puede construirse sin ella.
No hay comentarios
Añadir más