Cuando a tu IA de confianza le da órdenes un extraño (sin un solo clic)

Cuando a tu IA de confianza le da órdenes un extraño (sin un solo clic)

Estamos metiendo asistentes de inteligencia artificial en todas partes, y no me refiero a los que responden preguntas: hablo de los que hacen cosas. Leen tu correo, consultan la base de datos de clientes, redactan mensajes, mueven información de un sitio a otro… los llaman agentes, y son la gran promesa del momento. Esta semana hemos tenido un recordatorio incómodo de lo que puede salir mal cuando le das a una IA acceso, autonomía y confianza a la vez.

Qué ha pasado

Un equipo de investigadores destapó tres fallos (los bautizaron como "SalesBleed") en Agentforce, la plataforma de agentes de IA de Salesforce, una de las herramientas empresariales más usadas del mundo para gestionar clientes. Y lo que consiguieron da que pensar: con solo dejar un mensaje desde fuera, como quien rellena un formulario de "quiero información" en una web, lograban que el asistente de IA de la empresa hiciera lo que ellos quisieran.

En concreto, podían sacar datos confidenciales de clientes sin que ningún empleado pulsara nada (lo que se llama un ataque zero-click, de cero clics) y, aún peor, usar la identidad de confianza de ese asistente para enviar mensajes de phishing a los propios empleados desde dentro de la empresa. Imagina un correo trampa que no llega de un desconocido raro, sino del asistente oficial en el que todo el mundo confía. Mucho más difícil de detectar.

La parte tranquilizadora: los investigadores avisaron a Salesforce de forma responsable y la empresa lo corrigió hace semanas. El fallo concreto está tapado. Pero el problema de fondo que revela no es exclusivo de Salesforce, y no se arregla con un parche.

El truco: la IA se cree todo lo que lee

Para entender por qué esto pasa (y por qué va a seguir pasando) hay que entender una rareza de cómo funcionan estos asistentes: no distinguen bien entre "información" y "órdenes".

Un programa normal tiene separado el código (lo que debe hacer) de los datos (con lo que trabaja). Una IA de estas, en cambio, recibe todo mezclado en forma de texto: tus instrucciones, los documentos, los correos, los formularios… todo es texto que lee y sobre el que actúa. Y ahí está la trampa: si un atacante consigue colar sus propias instrucciones dentro de algo que la IA vaya a leer (un mensaje, un formulario de contacto, una ficha de cliente), la IA puede obedecerlas como si vinieran de su jefe. Es como si a un empleado le bastara con que una orden estuviera escrita en un papel encima de la mesa para cumplirla, sin preguntarse quién la dejó ahí.

Así de simple es el ataque, paso a paso:

Cómo un extraño toma el mando de una IA en cuatro pasos: 1) alguien de fuera rellena un formulario con órdenes ocultas; 2) la IA lo lee y no distingue el dato de la orden; 3) obedece y saca datos de clientes sin que nadie pulse nada; 4) usa su identidad de confianza para enviar phishing desde dentro.
Lo inquietante: la víctima no comete ningún error. El error es que el asistente se fía de lo que lee.

Fíjate en el detalle más importante: nadie del lado de la víctima hace nada mal. No hay un empleado despistado que pincha donde no debe. El atacante simplemente deja su mensaje, y el propio asistente, haciendo su trabajo de "leer los contactos nuevos", se traga la orden y la ejecuta. El eslabón débil no es una persona: es la confianza ciega que hemos depositado en la máquina.

Por qué un agente de IA es un blanco tan goloso

Si te paras a pensarlo, un asistente de IA con permisos reúne justo la combinación de cosas que un atacante sueña con encontrar:

Por qué un agente de IA es tan goloso para atacar: se cree lo que lee (no separa dato de orden), tiene acceso amplio (ve tus datos y puede actuar), goza de confianza ciega (es el asistente de la casa) y actúa sin supervisión (nadie revisa qué hace).
Crédulo, poderoso, de confianza y sin nadie vigilando: el cóctel perfecto.

Es crédulo (se cree lo que lee), es poderoso (tiene acceso a datos y puede actuar en tu nombre: enviar, escribir, exportar), goza de confianza ciega (es "el asistente oficial", y nadie duda de lo que dice) y suele actuar sin que nadie mire (trabaja en segundo plano, y rara vez hay alguien revisando cada cosa que hace). Junta esas cuatro y tienes, básicamente, un empleado con acceso a todo, muy influenciable y al que nadie supervisa. Cualquiera que le sepa susurrar al oído lo tiene ganado.

Es, en el fondo, la misma idea de siempre en seguridad (la confianza es la superficie de ataque), pero llevada a un terreno nuevo y resbaladizo: por primera vez, ese "empleado" de confianza es un programa al que cualquiera desde fuera puede intentar darle órdenes con solo dejarle un texto delante.

Qué se puede hacer (y por qué te importa aunque no uses Salesforce)

Esto no va de dejar de usar agentes de IA (llegaron para quedarse y son genuinamente útiles). Va de usarlos como se usa cualquier cosa poderosa: con cabeza y con frenos. Las ideas de fondo, tanto si eres quien monta uno de estos sistemas como si simplemente empiezas a delegar tareas en asistentes personales:

  • Trata lo que la IA lee como no fiable. Todo lo que le llega de fuera (un correo, un formulario, una web, un documento) puede llevar instrucciones ocultas. No es paranoia: es asumir que el texto no siempre es "solo texto".
  • Dale los mínimos permisos. Un asistente no necesita acceso a todo "por si acaso". Cuanto menos pueda ver y hacer, menos daño causa el día que lo engañen. Es el viejo principio del mínimo privilegio, más necesario que nunca.
  • Pon un humano en las decisiones serias. Enviar datos fuera, mandar correos masivos, borrar o exportar información… son acciones que merecen una confirmación humana, no el piloto automático de la IA.
  • No te fíes de "quién" manda el mensaje. El ataque más elegante era hacer pasar el phishing por el asistente de confianza. Que algo venga del "asistente oficial" o de un compañero no garantiza que sea legítimo. La identidad, hoy, se puede secuestrar.

Y aquí está el porqué de que esto te importe aunque no toques Salesforce en tu vida: lo que hoy le pasa a la IA empresarial de una gran compañía, mañana le pasará al asistente personal que gestione tu correo, tu agenda o tus compras. Vamos hacia un mundo de agentes que actúan por nosotros, y este caso es un aviso tempranero y muy claro de dónde están las grietas.

El fondo del asunto

La lección no es "la IA es peligrosa" ni "no la uses". Es algo más matizado y más útil: darle a un programa autonomía y confianza es delegar poder, y todo poder delegado hay que vigilarlo. Durante décadas hemos aprendido a desconfiar de los correos, a no dar nuestras claves, a mirar dos veces antes de pinchar. Ahora toca aprender una versión nueva de esa prudencia, una en la que el que puede meter la pata (o ser engañado) ya no eres solo tú, sino también el asistente en el que has decidido confiar.

Los agentes de IA son como esa marioneta: hacen lo que se les dice con una soltura asombrosa. El truco está en asegurarse de que quien mueve los hilos eres tú, y no un extraño que ha sabido dónde dejar el mensaje.

← Volver al inicio

0 comentarios

Deja un comentario