
LLaVA, el modelo que une visión y lenguaje con CLIP y Vicuna
Un equipo de investigadores de la Universidad de Wisconsin-Madison, Microsoft Research y Columbia University ha presentado LLaVA (Large Language and Vision Assistant, o Asistente de Gran Lenguaje y Visión), un modelo que conecta un codificador visual con un LLM para responder preguntas sobre imágenes con un nivel de precisión que hasta ahora solo alcanzaban sistemas propietarios como GPT-4. El trabajo,














