VASA-1 de Microsoft anima retratos: así hace rapear a la Mona Lisa

Microsoft Research Asia ha presentado VASA-1, un modelo de inteligencia artificial capaz de generar caras humanas realistas que hablan y gesticulan a partir de una sola imagen y un archivo de audio. La demostración que ha dado la vuelta a la red muestra a la Mona Lisa de Leonardo da Vinci rapeando «Paparazzi», de Lady Gaga, con movimientos de labios y expresiones faciales sincronizados con la canción.

Cómo funciona VASA-1

El nombre viene de «Visual Affective Skills». El sistema toma una imagen estática de una persona, la combina con un clip de audio y genera un vídeo en el que el rostro imita expresiones y movimientos de cabeza mientras sincroniza los labios con lo que se está diciendo o cantando. Para conseguirlo, Microsoft ha combinado modelos de generación de movimiento de cabeza entrenados con muestras de vídeo junto con modelos de texto a imagen como DALL-E 3 de OpenAI.

Qué diferencia a VASA-1 de otros generadores de vídeo

La mayoría de herramientas de «talking head» necesitan varios segundos de vídeo de referencia o múltiples fotografías del sujeto. VASA-1 parte de una única imagen fija, lo que reduce mucho la barrera de entrada, pero también multiplica el riesgo de uso indebido: cualquier foto pública de una persona podría convertirse en material de partida.

Para qué quiere usarlo Microsoft

Los investigadores plantean VASA-1 como base para «interacciones en tiempo real con avatares que emulan comportamientos conversacionales humanos», con aplicaciones en enseñanza, compañía o apoyo terapéutico, donde ofrecer a alguien un interlocutor virtual con el que hablar puede tener valor práctico.

Por qué no hay demo pública

Microsoft ha decidido no publicar una demo online, API ni producto derivado de VASA-1 hasta tener garantías de que la tecnología «se utilizará de manera responsable y acorde con las regulaciones apropiadas», en clara referencia al riesgo de deepfakes engañosos. La cautela llega poco después de que la compañía retirase su modelo WizardLM-2 nada más lanzarlo, porque los equipos de desarrollo no habían completado las pruebas de toxicidad antes de publicarlo.

Limitaciones actuales

Al tratarse de una investigación sin producto ni API pública, nadie fuera de Microsoft puede probar VASA-1 hoy. Tampoco hay fecha anunciada para un lanzamiento comercial, ni detalles técnicos sobre la duración máxima del vídeo generado o la resolución de salida.

Preguntas frecuentes

¿Qué es VASA-1?

Un modelo de Microsoft Research Asia que genera vídeos de caras hablando a partir de una imagen estática y un archivo de audio.

¿Puedo probar VASA-1?

No. Microsoft no ha publicado demo, API ni producto, precisamente por el riesgo de uso indebido para crear deepfakes.

¿Qué necesita VASA-1 para generar un vídeo?

Solo una imagen estática de una persona y un clip de audio con la voz que se quiere sincronizar.

¿Para qué quiere usarlo Microsoft?

Como base para avatares conversacionales aplicados a enseñanza, compañía o apoyo terapéutico.

¿Ha tenido Microsoft otros problemas de seguridad con sus modelos de IA?

Sí. Retiró el modelo WizardLM-2 poco después de lanzarlo porque no había completado las pruebas de toxicidad correspondientes.

Este tipo de tecnología es justo lo que persigue regular la nueva normativa europea sobre etiquetado de contenido generado con IA, que entra en vigor en 2026. Y no es el único terreno donde los rostros virtuales avanzan: TikTok ya prueba influencers virtuales generados con IA para vender productos dentro de la app.

Más información en la página oficial del proyecto VASA-1.

Scroll al inicio