Machine Learning

Perfusion de NVIDIA: personalización texto-imagen en 100 KB

Perfusion es un método de personalización de texto a imagen desarrollado por investigadores de NVIDIA que ocupa apenas 100 KB de almacenamiento y se entrena en unos 4 minutos. Para situar la cifra: una fotografía de teléfono moderno ocupa entre 3 y 10 MB, entre cien y mil veces más. El trabajo se presentó en agosto de 2023 y está

Danswer AI: búsquedas con IA sobre documentos internos

Danswer AI es una herramienta de código abierto que permite hacer preguntas en lenguaje natural a los documentos internos de una empresa y obtener respuestas con citas a las fuentes originales. El sistema usa RAG (retrieval-augmented generation, o generación aumentada por recuperación): antes de generar una respuesta, recupera los fragmentos de texto más relevantes de los documentos indexados, lo que

Llama 2 en Hugging Face: cómo acceder y qué versiones hay

Tras el lanzamiento oficial de Llama 2 por parte de Meta, el modelo quedó disponible en Hugging Face para descarga directa y para pruebas a través de la interfaz Spaces. Lo que sigue son las especificaciones técnicas principales, los modelos disponibles y los pasos para acceder. Modelos disponibles Llama 2 tiene tres tamaños de modelo: 7B, 13B y 70B parámetros.

Meta lanza Llama 2: LLM open source con licencia comercial

Meta ha publicado Llama 2, la segunda versión de su modelo de lenguaje de gran escala, con acceso abierto y licencia comercial. El lanzamiento se hizo en un evento conjunto con Microsoft, que distribuye el modelo en Azure desde el primer día. Hugging Face y AWS también tienen previsto incorporarlo a sus plataformas. Llama 2 está disponible en tres tamaños:

LLMs: qué son, cómo funcionan y para qué sirven

Un gran modelo de lenguaje (LLM, del inglés Large Language Model) es una red neuronal entrenada sobre cantidades masivas de texto para aprender cómo funciona el lenguaje: qué palabras van juntas, cómo se construyen los argumentos y cómo se razona en texto. GPT-4, Llama 3, Mistral, Gemini y Claude son LLMs. ChatGPT los popularizó a finales de 2022, pero el

LAION: la red open source que construye datos para la IA

LAION (Large-scale Artificial Intelligence Open Network) es una organización sin ánimo de lucro con sede en Alemania cuya actividad se centra en construir la mayor base de datos pública disponible para entrenar sistemas de IA. No desarrolla modelos para usuarios finales: trabaja en los cimientos, en conjuntos de datos masivos, herramientas de procesamiento y modelos base que investigadores y empresas

Mistral AI capta 105 millones de euros en semilla para construir LLMs de código abierto

Mistral AI, la empresa de inteligencia artificial fundada en París en mayo de 2023, cerró una ronda de financiación semilla de 105 millones de euros liderada por Lightspeed Venture Partners. La operación, que dejó la valoración de la compañía en 240 millones de euros, fue en ese momento el cierre de semilla más cuantioso registrado en Europa. La empresa llevaba

GitHub Copilot: el asistente de código con IA de OpenAI

GitHub Copilot es un asistente de programación integrado en el editor de texto que sugiere líneas de código y funciones completas en tiempo real. Desarrollado por GitHub en colaboración con OpenAI, el sistema se basa en Codex, un modelo entrenado con miles de millones de líneas de código públicas. El desarrollador escribe un comentario o el inicio de una función

Japón declara que entrenar LLMs no viola el copyright

El gobierno japonés ha fijado su posición sobre una de las disputas más activas en torno a la inteligencia artificial: el entrenamiento de modelos de lenguaje a gran escala (LLM, por sus siglas en inglés) con datos protegidos por derechos de autor no constituye infracción. Keiko Nagaoka, ministra de Educación, Cultura, Deportes, Ciencia y Tecnología, lo resumió con una frase

StyleDrop, el modelo de Google que replica estilos visuales con una sola imagen

Google ha publicado un paper sobre StyleDrop, un método de generación de imágenes a partir de texto capaz de capturar el estilo visual de una imagen de referencia con alta precisión. La tecnología está construida sobre Muse, el modelo texto-imagen de Google, y mejora con cada ciclo de retroalimentación, ya sea humana o automatizada. Cómo funciona StyleDrop StyleDrop aborda uno

Scroll al inicio