El agente Muse de Meta afronta un fallo de seguridad y dudas sobre su autonomía

El nuevo agente personal de inteligencia artificial de Meta, Muse, ha quedado bajo escrutinio apenas unas semanas después de su lanzamiento por una vulnerabilidad de día cero en su aplicación para macOS y por una prueba interna en la que contratistas humanos llegaron a realizar algunas llamadas telefónicas en nombre del agente. Ambos episodios ponen el foco en los retos de seguridad, privacidad y autonomía que aparecen cuando una IA obtiene acceso a cuentas, aplicaciones y dispositivos para actuar por el usuario.

Las claves de Muse en 20 segundos

  • Un investigador descubrió un fallo de día cero en la aplicación de Muse para macOS.
  • El problema permitía a software local manipular una configuración relacionada con la transcripción de voz y acceder al token de Muse.
  • Meta publicó un parche después de la divulgación del fallo.
  • Reuters informó además de una prueba en la que contratistas humanos realizaron algunas llamadas iniciadas por Muse.
  • Meta asegura que la prueba buscaba mejorar la seguridad y la privacidad antes de un posible lanzamiento público.

Muse se presentó como un agente capaz de realizar tareas que van más allá de las respuestas habituales de un chatbot. Puede trabajar con correo electrónico, calendarios y otros servicios conectados, rellenar formularios, realizar compras o gestionar determinadas tareas en nombre del usuario. Para conseguirlo necesita permisos y acceso a información que, en un asistente convencional, no serían necesariamente necesarios.

Ese nivel de acceso convierte la seguridad del agente en una cuestión diferente. Un fallo en la aplicación no afecta únicamente a la propia herramienta, sino que puede ofrecer una vía para aprovechar los permisos que el usuario ya le ha concedido.

Un fallo en macOS permitía manipular la aplicación

El investigador de seguridad especializado en macOS Patrick Wardle descubrió un fallo en la aplicación de Muse que permitía a un programa ejecutándose localmente modificar configuraciones internas de la aplicación sin necesitar permisos adicionales de macOS. La vulnerabilidad fue divulgada públicamente el 21 de septiembre.

Una de esas configuraciones controla el destino utilizado para la transcripción de las instrucciones dictadas por voz. Wardle demostró que podía cambiar ese destino para enviar las transcripciones a un servidor bajo su control.

A partir de ahí, el investigador mostró cómo podía obtener el token utilizado para autenticar la cuenta de Muse y utilizar el propio agente para realizar acciones con los permisos que el usuario había concedido.

Entre las pruebas de concepto descritas por Wardle se encuentran la escritura de archivos en el equipo y el uso de la cámara. También se mostró el acceso a la ubicación de un iPhone vinculado a una cuenta de Muse.

La vulnerabilidad tenía una limitación importante: no permitía por sí sola atacar de forma remota cualquier Mac con Muse instalado. El atacante necesitaba conseguir primero que código malicioso se ejecutara en el equipo con los permisos del usuario. Investigadores señalaron, no obstante, que determinadas técnicas de ingeniería social pueden utilizarse para conseguir que una persona ejecute un comando aparentemente legítimo.

Meta respondió con un parche después de la divulgación. Ars Technica informó de que la compañía había publicado una corrección unas horas después de que el fallo se hiciera público.

El incidente resulta especialmente relevante por la arquitectura de Muse. Meta había explicado al presentar el agente que cada usuario dispone de una máquina virtual dedicada en la nube y que el sistema utiliza mecanismos adicionales de aislamiento y control para limitar los daños si el agente resulta comprometido.

La compañía también había abierto un programa de recompensas por vulnerabilidades con premios de hasta 300.000 dólares, incluidos hasta 130.000 dólares para determinados ataques de inyección de instrucciones que afecten a un usuario.

El problema no afecta solo al código de la IA

El caso muestra una diferencia importante entre proteger un modelo de inteligencia artificial y proteger el sistema completo que utiliza ese modelo.

Muse puede acceder a servicios externos, navegar por páginas web y utilizar herramientas para completar tareas. Meta explica que su navegador especializado funciona con un intermediario que controla la conexión con Chrome y que el agente recibe una representación de accesibilidad de las páginas en lugar del DOM completo. También afirma que el agente no puede ejecutar JavaScript directamente en las páginas y que existen clasificadores adicionales para bloquear determinadas acciones o solicitar confirmación al usuario.

Sin embargo, una vulnerabilidad en el cliente instalado en el ordenador puede convertirse en una vía alternativa para alcanzar los privilegios del agente.

Ese es uno de los problemas específicos de los agentes de IA: la superficie de ataque ya no está formada únicamente por el modelo. También incluye las aplicaciones cliente, los conectores, las credenciales, los navegadores, las APIs y los sistemas a los que el agente tiene acceso.

Muse también puso a prueba el papel de los humanos

La segunda controversia procede de la función de llamadas telefónicas de Muse. Reuters informó el 22 de septiembre de que Meta había probado internamente un sistema denominado «human concierge», mediante el cual contratistas humanos realizaban algunas llamadas iniciadas por el agente.

Muse permite que el usuario le encargue llamar a empresas para realizar gestiones como reservar una cita, comprobar si un establecimiento dispone de un producto o solicitar presupuestos.

Según los mensajes internos vistos por Reuters, Meta comenzó a probar llamadas realizadas por humanos después de detectar dificultades del agente para completar algunas conversaciones con empresas. La prueba se habilitó para aproximadamente la mitad de los empleados de Meta y existía una opción para no participar.

La decisión generó dudas entre algunos empleados por la información que podía quedar expuesta durante esas llamadas. Reuters informó también de un incidente en el que un trabajador afirmó que un contratista había realizado un comentario racista durante una llamada relacionada con la negociación de una factura.

Una vicepresidenta de Meta reconoció internamente que había sido un error comenzar la prueba sin las comunicaciones adecuadas y señaló que la función había sido retirada temporalmente. La compañía continúa evaluando la tecnología de llamadas y, según Reuters, algunos experimentos habían elevado la tasa de éxito hasta entre el 95 % y el 98 % cuando intervenía un agente humano.

Meta explicó posteriormente a Reuters que la prueba buscaba obtener información para mejorar las protecciones de seguridad y privacidad antes de una posible disponibilidad pública y que cualquier lanzamiento futuro incluiría las comunicaciones correspondientes.

El reto de construir agentes que puedan actuar

Los dos episodios afectan a aspectos diferentes de Muse, pero tienen un punto en común: cuanto más puede hacer un agente por el usuario, mayor es la responsabilidad de proteger los permisos y la información que necesita para hacerlo.

Meta presentó Muse con una arquitectura diseñada específicamente para agentes capaces de trabajar de forma autónoma, utilizar herramientas, coordinar subagentes y operar con datos personales. La propia compañía reconoce que este tipo de sistemas puede cometer errores y que también puede ser atacado mediante la información que procesa.

La compañía ha anunciado además una futura modalidad denominada Muse Confidential VM, cuyo objetivo es impedir mediante mecanismos criptográficos que Meta pueda acceder a los datos almacenados en la máquina virtual del usuario. Según Meta, esta tecnología está siendo probada con un grupo reducido y su diseño está siendo revisado por auditores externos.

Muse llega así a una fase especialmente relevante para el desarrollo de agentes personales. El desafío no consiste únicamente en conseguir que una IA sea capaz de completar una tarea, sino en determinar qué permisos necesita, cómo se supervisan sus acciones y qué ocurre cuando falla una parte de la infraestructura que la rodea.

La vulnerabilidad de macOS ya ha sido corregida, pero el episodio ofrece una muestra de por qué los agentes con capacidad para actuar requieren controles distintos de los asistentes que simplemente generan texto. Y la prueba con contratistas humanos añade otra cuestión: cuando una IA todavía no puede completar de forma fiable una tarea en el mundo real, la frontera entre automatización y trabajo humano puede ser mucho menos clara de lo que su interfaz hace pensar.

Preguntas frecuentes

¿Qué vulnerabilidad tenía Muse en macOS?

Un investigador descubrió que software ejecutándose localmente podía modificar una configuración interna de Muse relacionada con la transcripción de voz y utilizarla para intentar obtener el token de autenticación del agente. Meta publicó posteriormente una corrección.

¿Podía el fallo atacar un Mac de forma remota?

No directamente. El ataque requería que el atacante consiguiera ejecutar código en el ordenador, aunque investigadores señalaron que determinadas técnicas de ingeniería social podían facilitar ese paso.

¿Por qué Meta utilizó contratistas humanos con Muse?

Reuters informó de que Meta probó el sistema para mejorar el rendimiento de las llamadas telefónicas realizadas por Muse. La compañía indicó que la prueba tenía como objetivo obtener información para mejorar seguridad, privacidad y funcionamiento antes de un posible lanzamiento público.

¿Qué diferencia a Muse de un chatbot convencional?

Muse está diseñado para ejecutar acciones en nombre del usuario, como gestionar correo, calendario, compras, formularios y otras tareas mediante servicios conectados. Por eso necesita más permisos y acceso a sistemas externos que un chatbot limitado a responder preguntas.

Scroll al inicio