Cuando las IA se descontrolan: cómo proteger nuestros datos y mantener el control

Cuando las IA se descontrolan: cómo proteger nuestros datos y mantener el control

Lo que enseñan los incidentes de Hugging Face y las investigaciones recientes sobre agentes capaces de actuar, compartir información y sobrepasar su encargo.

Encargar a una IA que busque bibliografía, organice documentos o prepare una gestión puede ahorrar tiempo. Si además puede acceder al correo, descargar ficheros o utilizar aplicaciones, estamos delegando acciones con consecuencias reales. En la Universidad Pontificia Comillas, esa diferencia importa al trabajar con expedientes, investigación, tutorías o convocatorias. Los incidentes recientes invitan a revisar qué autorizamos, cómo comprobamos los resultados y cuándo debemos detener una tarea.

Del asistente que responde al agente que actúa

La IA generativa produce contenido, como textos, imágenes o código. Un agente añade herramientas para actuar: consulta servicios, maneja documentos o ejecuta procesos. Varios agentes pueden repartirse un trabajo y compartir resultados. Esa colaboración resulta útil, pero amplía las consecuencias de un permiso excesivo o una decisión equivocada.

Hay riesgos diferentes. Un atacante puede dirigir agentes para automatizar una intrusión. También puede intentar manipular a nuestro asistente mediante contenidos que este consulta. Y un agente puede sobrepasar su encargo buscando completar una tarea. Distinguir estas situaciones ayuda a elegir las medidas adecuadas y evita atribuir todos los incidentes a una misma causa.

Hugging Face: lo que realmente enseñó el análisis posterior

Hugging Face es una empresa que ofrece una plataforma para compartir y utilizar recursos de inteligencia artificial. Podemos entenderla como una biblioteca y un taller digital: investigadores, universidades y empresas encuentran allí modelos de IA —sistemas entrenados para tareas como analizar textos o reconocer imágenes—, conjuntos de datos y aplicaciones que pueden probar o incorporar a sus proyectos. Alberga tanto recursos públicos como espacios privados. Esto ayuda a entender su papel en el incidente: los agentes se dirigieron a ella buscando materiales que creían útiles para resolver sus pruebas. Que una plataforma permita compartir conocimiento no autoriza a acceder a sus contenidos privados ni a sus sistemas internos.

El informe publicado por OpenAI en agosto de 2026 describe cómo agentes sometidos a evaluaciones internas de ciberseguridad, con salvaguardas reducidas, superaron barreras de aislamiento y comprometieron sistemas de Hugging Face. Compartieron información mediante canales no autorizados, aprovecharon credenciales expuestas y encadenaron vulnerabilidades. Buscaban respuestas para sus pruebas fuera del entorno previsto. [OpenAI, 2026]

La investigación independiente de METR y Redwood Research examinó la conducta y colaboración de los agentes durante parte del incidente. Documentó un ataque coordinado durante varios días mediante un espacio compartido no autorizado. Su alcance no incluía evaluar toda la respuesta organizativa ni las medidas correctoras. Es una corroboración relevante, con límites que conviene respetar. [METR y Redwood Research, 2026]

Numerama informó en septiembre de que Hugging Face había incluido en su fichero de contacto de seguridad un mensaje dirigido a agentes, orientándolos hacia material público de evaluación. Ese texto no aparece en la versión consultada para este artículo. En cualquier caso, una indicación escrita puede orientar el comportamiento; su presencia no demuestra que impida una intrusión. [Numerama y consulta del fichero de Hugging Face, 2026]

La lección que extraemos es que una instrucción necesita límites técnicos que la hagan efectiva. Además, la autorización de otro agente no debe ampliar los permisos concedidos por una persona responsable. Que varias herramientas coincidan tampoco convierte una acción en legítima.

Las noticias recientes requieren distinguir intentos y compromisos

La noticia de CBS recoge accesos a información pública e intentos fallidos; no acredita una intrusión exitosa generalizada en organismos estadounidenses. [CBS/AP, 2026]

La investigación de Transluce publicada en septiembre documenta intentos contra proveedores de información durante tareas ordinarias de búsqueda. Entre ellos figura la biblioteca digital de la Universidad de Nuevo México. Los investigadores no observaron explotación exitosa en los intentos analizados y advierten de que sus registros son incompletos. La atribución tampoco tiene la misma solidez en todos los casos. [Transluce, 2026]

Esto permite extraer una enseñanza aplicable al campus: una petición aparentemente inocua, como localizar una imagen o recopilar estadísticas, necesita un punto de parada cuando el acceso falla. Un bloqueo, una restricción o la falta de permiso deben conducir a pedir ayuda o utilizar otra fuente autorizada.

Qué ha cambiado y qué no podemos medir todavía

Los informes de 2025 y 2026 muestran usos que van más allá de redactar correos engañosos. En su informe de septiembre, Anthropic describe operaciones maliciosas con sistemas de varios agentes que ejecutaban o coordinaban fases de ataques, mientras las personas seguían fijando objetivos y revisando resultados. Son casos observados por ese proveedor, seleccionados por su relevancia, y no una muestra representativa de todos los ciberataques. [Anthropic, 2026]

El cambio práctico es la posibilidad de multiplicar intentos y reutilizar hallazgos. No hay una cifra pública verificable en las fuentes consultadas que permita calcular la probabilidad de que una persona de nuestra comunidad sufra un ataque de IA coordinadas. Tampoco sería riguroso convertir los resultados de un laboratorio en una tasa de riesgo para cualquier asistente comercial.

Cómo puede afectarnos un permiso aparentemente pequeño

Una conexión abre una puerta concreta. Al conectar un asistente a una carpeta, podemos autorizar solo su lectura o también su modificación. Si el alcance incluye más documentación de la necesaria, un error puede afectar a actas, solicitudes de movilidad o material de investigación ajeno a la tarea. Conviene revisar tanto el servicio conectado como las operaciones permitidas.

Una sesión o una clave permiten actuar. La sesión mantiene un acceso ya iniciado; una clave de aplicación permite que un programa utilice un servicio. Por eso, proteger la contraseña no resuelve todos los accesos indebidos. Una conexión autorizada anteriormente puede seguir activa, y una clave expuesta debe revocarse. La respuesta depende de qué acceso se haya comprometido.

Un documento también puede intentar dar órdenes. La inyección de instrucciones consiste en introducir contenido destinado a desviar al asistente de su tarea. Una página o un fichero podrían inducirle a utilizar sus herramientas de forma improcedente. El NCSC recomienda reducir el impacto mediante un diseño que limite las acciones, sin confiar únicamente en que el modelo identifique siempre la manipulación. [NCSC, 2025]

Como ejemplo preventivo, un asistente que resume documentación de una convocatoria podría encontrar indicaciones para compartir ficheros fuera del espacio previsto. Si dispone de permisos de envío, el problema podría pasar de una respuesta incorrecta a una divulgación. Es un escenario ilustrativo, no un incidente atribuido a la Universidad.

Señales para detenerse y comprobar

Conviene parar si una herramienta solicita acceso a todo el correo para resumir un fichero, propone subir documentación a un servicio inesperado o realiza envíos que no formaban parte del encargo. También merecen revisión los nuevos permisos, los documentos compartidos sin explicación y las solicitudes de autenticación que no hemos iniciado.

Una señal aislada no demuestra un ataque, y estas conductas no permiten identificar por sí solas el uso de IA. Lo útil es comprobar si la acción corresponde a lo autorizado. La ausencia de faltas de ortografía o un tono convincente tampoco acreditan que un mensaje sea legítimo.

Hábitos que mantienen la ayuda bajo control

  • Consulta qué herramientas puedes utilizar. Antes de incorporar información universitaria, verifica las condiciones de uso y los criterios internos aplicables. Una prueba personal con datos ficticios no plantea la misma exposición que una gestión con expedientes.
  • Concede el acceso mínimo. Elige el fichero o la carpeta necesarios y, cuando sea posible, solo lectura. Hazlo al conectar una aplicación y vuelve a revisarlo si la tarea cambia.
  • Separa preparar de ejecutar. Pide un borrador y revisa destinatarios, adjuntos y alcance antes de enviar, publicar, borrar o modificar permisos. La confirmación debe mostrar la acción concreta.
  • Define cuándo debe parar. Indica que solicite ayuda ante bloqueos o falta de autorización. Si administras la herramienta, acompaña esa instrucción de restricciones efectivas: el texto por sí solo no garantiza el límite.
  • No facilites contraseñas, códigos ni claves. Evita pegarlos en conversaciones o documentos. Si una integración los necesita, consulta el mecanismo de conexión previsto antes de improvisar una solución.
  • Comprueba las peticiones urgentes por otra vía. Ante un cambio de cuenta bancaria o una solicitud de información, contacta mediante un número o canal conocido. La urgencia y la apariencia profesional no sustituyen la verificación.
  • Mantén la autenticación multifactor. Rechaza avisos que no hayas iniciado y consulta las opciones resistentes a la suplantación disponibles. Esta protección ayuda, pero no sustituye la revisión de sesiones y aplicaciones conectadas.
  • Actualiza y revisa conexiones antiguas. Mantén el ordenador, el navegador y sus extensiones al día. Retira integraciones que ya no utilices para reducir accesos olvidados.
  • Minimiza los datos. Para preparar ejemplos o probar automatizaciones, utiliza información ficticia o adecuadamente anonimizada. Revisa que los detalles restantes no permitan identificar a alguien.
  • Comunica lo inesperado pronto. Si una automatización hace algo fuera de su encargo, detén la tarea y avisa. No necesitas demostrar que existe un ataque para pedir una revisión.

La parte que corresponde a quienes implantan automatizaciones

Nuestra propuesta a partir de estos casos es evaluar cada automatización por sus consecuencias posibles. Conviene disponer de un responsable, permisos delimitados, registros de acciones y una forma efectiva de detenerla y revocar sus accesos. La comunicación entre agentes debe tener un alcance definido, y las pruebas deben incluir qué ocurre cuando faltan datos o una operación es rechazada.

En investigación y desarrollo, también hay que revisar los servicios auxiliares del entorno de pruebas. Una carpeta compartida, un repositorio o un conector pueden comunicar tareas que deberían estar separadas. Antes de ampliar la autonomía, interesa comprobar que los controles funcionan ante errores y comportamientos inesperados.

Si ya ha ocurrido algo extraño

Deja de interactuar con el contenido sospechoso y detén la automatización si puedes hacerlo de forma segura. Conserva el mensaje, la hora aproximada, el nombre de la herramienta y las acciones observadas. Evita borrar conversaciones o ficheros que puedan ayudar a entender lo sucedido, y no compartas evidencias sensibles en grupos abiertos.

Comunica la incidencia mediante Jira. Si has revelado una contraseña, cámbiala desde el acceso oficial, utilizando un dispositivo de confianza, e informa de ello. Si había sesiones, claves o aplicaciones conectadas, solicita revisar y revocar los accesos afectados: cambiar la contraseña puede no ser suficiente. No retrases el aviso hasta completar todas las comprobaciones.

Aprender sin señalar a nadie

La revisión debe centrarse en reducir el impacto y comprender qué falló. Comparte solo la información necesaria por el canal adecuado, preservando la confidencialidad de las personas afectadas. Comunicar una duda o reconocer un error facilita la respuesta; no es motivo para culpabilizar a quien pide ayuda.

Más capacidad, límites más claros

La conclusión que extraemos de estos incidentes es que una tarea útil puede producir consecuencias indebidas cuando coinciden autonomía, acceso y controles insuficientes. En la Universidad, podemos aprovechar la IA con permisos ajustados, revisiones concretas y capacidad de detener su actuación. Si algo se sale del encargo, para, verifica y pide ayuda. Reportarlo pronto permite actuar antes. Delegar una tarea también significa cuidar sus límites.