Machine Learning

LLaVA, el modelo que une visión y lenguaje con CLIP y Vicuna

Un equipo de investigadores de la Universidad de Wisconsin-Madison, Microsoft Research y Columbia University ha presentado LLaVA (Large Language and Vision Assistant, o Asistente de Gran Lenguaje y Visión), un modelo que conecta un codificador visual con un LLM para responder preguntas sobre imágenes con un nivel de precisión que hasta ahora solo alcanzaban sistemas propietarios como GPT-4. El trabajo,

Meta lanza Llama 2 Long con contexto de 32.768 tokens

Meta publicó en septiembre de 2023 un artículo técnico en arXiv presentando Llama 2 Long, una variante del modelo de lenguaje grande (LLM) de código abierto LLaMA 2 con ventana de contexto ampliada hasta 32.768 tokens. La variante de 70.000 millones de parámetros supera a GPT-3.5 Turbo 16k de OpenAI en un conjunto de tareas de contexto largo, según los

Mistral 7B: código abierto y sin moderación de contenido

El 27 de septiembre de 2023, Mistral AI, la startup francesa fundada cinco meses antes, publicó su primer modelo de lenguaje (LLM): Mistral 7B. El método de distribución era inusual: un enlace de torrent en un tweet, sin página de producto, sin formulario de registro y sin cola de espera. El modelo estaba disponible en minutos para cualquier persona con

Claude 2 de Anthropic: ventana de 100K tokens y mejor código para competir con GPT-4

Anthropic lanzó Claude 2 en julio de 2023 con un cambio de registro frente a su primera versión: una ventana de contexto de 100.000 tokens, mejoras medibles en código y razonamiento matemático, y un sistema de planes que incluye acceso prioritario en horas punta. El modelo compite directamente con GPT-4 de OpenAI, que a esa fecha manejaba hasta 32.000 tokens

Falcon 180B, el LLM abierto del TII supera a Llama 2 en benchmarks

El Instituto de Innovación Tecnológica de los Emiratos Árabes Unidos (TII) publicó en septiembre de 2023 Falcon 180B, un modelo de lenguaje de 180.000 millones de parámetros entrenado con 3,5 billones de tokens. Al publicarse, encabezaba el Hugging Face Open LLM Leaderboard para modelos de acceso abierto, superando a Llama 2 de Meta en tareas de razonamiento, codificación y evaluación

Llama 2 de Meta no es open source: la licencia incumple la OSI

Meta presentó en julio de 2023 su modelo de lenguaje Llama 2 con la etiqueta de «open source» y disponibilidad para uso comercial, como argumento diferenciador frente a los modelos GPT-3.5 y GPT-4 de OpenAI. El problema es que la licencia de uso no cumple con los criterios que define la Open Source Initiative (OSI), y eso hace que el

A dark-themed developer workstation screen showing SQL code and database query results alongside a terminal with Python co...

Code Llama de Meta y el texto a SQL: resultados de Snowflake

Meta publicó Code Llama el 24 de agosto de 2023, una familia de modelos derivados de Llama 2 y ajustados específicamente para generar código. Snowflake evaluó el rendimiento de estos modelos en tareas de texto a SQL y encontró resultados que reducen la ventaja de GPT-4 a menos de un punto porcentual en algunos supuestos. Code Llama frente a Llama

WizardCoder-34B: 73,2% en HumanEval, por delante de GPT-4

WizardCoder-34B es un modelo de lenguaje especializado en código (LLM, large language model) que el equipo WizardLM publicó en agosto de 2023, basado en Code Llama 34B de Meta. Los resultados que presentó en el benchmark HumanEval generaron debate en la comunidad: un 73,2% en la métrica pass@1, por encima del 67,0% de GPT-4 y del 48,1% de GPT-3.5, según

Microsoft lanza Azure ChatGPT: chat privado para empresas con datos propios

Microsoft ha publicado una versión de referencia de código abierto que permite a las empresas desplegar su propio ChatGPT corporativo, aislado de OpenAI y conectado a sus propias fuentes de datos. La solución combina el servicio Azure OpenAI con la Búsqueda Cognitiva de Azure (Azure Cognitive Search) para implementar el patrón RAG (Retrieval Augmented Generation, o Generación Aumentada por Recuperación),

Perfusion de NVIDIA: personalización texto-imagen en 100 KB

Perfusion es un método de personalización de texto a imagen desarrollado por investigadores de NVIDIA que ocupa apenas 100 KB de almacenamiento y se entrena en unos 4 minutos. Para situar la cifra: una fotografía de teléfono moderno ocupa entre 3 y 10 MB, entre cien y mil veces más. El trabajo se presentó en agosto de 2023 y está

Scroll al inicio