V-JEPA (Video Joint Embedding Predictive Architecture) es el modelo con el que Meta AI dio en febrero de 2024 un paso hacia la visión de Yann LeCun de una inteligencia de máquina más parecida a la humana. Su objetivo no era generar vídeo, sino algo más difícil: detectar y entender cómo interactúan los objetos entre sí en el mundo físico, a partir de simple observación.
Meta lo publicó bajo licencia Creative Commons no comercial, dentro de su política de ciencia abierta, para que otros equipos de investigación pudieran construir sobre él. La idea de fondo está inspirada en cómo aprenden las personas y los animales: observando el entorno, sin que nadie les explique con palabras qué va a pasar después.
Cómo aprende V-JEPA
A diferencia de los modelos generativos, que intentan reconstruir píxel a píxel lo que falta en una imagen o vídeo, V-JEPA aprende a predecir las partes que faltan o están tapadas en un espacio de representación abstracto, no en el espacio visual directo. Esa diferencia, que parece técnica, tiene consecuencias prácticas: entrena más rápido, necesita menos ejemplos y aprende a descartar el detalle que no se puede predecir (como el ruido de fondo) para centrarse en lo que sí importa.
El modelo se entrena por autoaprendizaje con datos sin etiquetar, y solo usa etiquetas después, para ajustarlo a una tarea concreta. Eso lo hace mucho más eficiente que los modelos anteriores en cuanto a la cantidad de datos etiquetados que necesita.
La técnica clave es el enmascaramiento: se bloquean regiones grandes del vídeo, tanto en espacio como en tiempo, y se obliga al modelo a rellenar ese hueco a partir del contexto. Para conseguirlo bien, el modelo tiene que desarrollar algo parecido a una comprensión de la escena, no solo memorizar patrones visuales.
Limitaciones y siguientes pasos en 2024
En su versión original, V-JEPA solo trabajaba con contenido visual, sin audio, y se centraba en la percepción: entender lo que pasa en un vídeo, no todavía planificar o tomar decisiones a partir de esa comprensión. El equipo de Meta ya apuntaba entonces a dos direcciones: sumar audio para hacerlo multimodal, y extender sus predicciones a horizontes de tiempo más largos, un paso necesario para que un modelo del mundo sirva de verdad para planificar acciones.
Ese salto llegó poco más de un año después. Meta presentó V-JEPA 2, la evolución directa de este modelo, con mejor capacidad de predicción física y más cerca de aplicarse a robots reales. El proyecto encaja además con la apuesta más amplia de la compañía por la inteligencia artificial general, donde este tipo de «modelos del mundo» ocupan un lugar central en la visión de LeCun.
Preguntas frecuentes
¿Qué es V-JEPA?
Es un modelo de Meta AI que aprende a entender y predecir interacciones físicas entre objetos observando vídeo, en lugar de generar imágenes o texto.
¿En qué se diferencia de un modelo generativo de vídeo?
No reconstruye píxel a píxel lo que falta en un vídeo. Predice en un espacio de representación abstracto, lo que le permite entrenar con menos datos y centrarse en la información conceptual relevante.
¿Quién está detrás de V-JEPA?
Meta AI, bajo la dirección científica de Yann LeCun, dentro de su línea de investigación hacia una inteligencia de máquina avanzada (AMI).
¿Existe una versión más reciente de V-JEPA?
Sí, Meta presentó V-JEPA 2 en 2025, con mejor capacidad de predicción física y orientado también a aplicaciones de robótica.
Más información: paper original y código en GitHub.













