Convertir documentos empresariales a un formato que pueda consumir una inteligencia artificial parece una tarea sencilla hasta que aparecen hojas de cálculo, presentaciones antiguas, archivos ODT, tablas complejas o documentos creados hace veinte años. Firecrawl ha lanzado anydoc, una nueva librería open source escrita en Rust que convierte documentos de oficina a Markdown y que destaca por combinar ejecución local, soporte para formatos antiguos y modernos y bindings para Node.js, Python, Rust y navegadores mediante WebAssembly.
Las claves de anydoc en 20 segundos
- anydoc convierte Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV y PDF a Markdown.
- Está escrito en Rust y dispone de interfaces para Node.js, Python, Rust y WebAssembly.
- Detecta muchos formatos leyendo el contenido del archivo, no únicamente su extensión.
- Firecrawl publica una mediana de 4,4 ms en su benchmark de 100 documentos.
- No incorpora OCR: los PDF formados únicamente por imágenes necesitan otra solución.
El proyecto resulta especialmente interesante por el momento en el que aparece. Los grandes modelos de lenguaje pueden procesar texto con facilidad, pero una buena parte de la información de las empresas sigue almacenada en DOCX, XLSX, PPTX, PDF, RTF o formatos OpenDocument. Antes de utilizar esos contenidos en un sistema RAG (Retrieval-Augmented Generation), un buscador semántico o un agente, normalmente hay que extraer y normalizar su estructura.
Markdown se ha convertido en uno de los formatos habituales para esa etapa. Mantiene títulos, listas, enlaces y tablas con poco marcado adicional, algo útil tanto para conservar cierta estructura como para evitar introducir demasiado contenido innecesario en el contexto de un modelo.
Microsoft desarrolla MarkItDown con ese mismo objetivo y lo define expresamente como una herramienta para transformar distintos archivos a Markdown destinado a LLM y análisis de texto. Docling, por su parte, ofrece una arquitectura mucho más orientada a la comprensión avanzada de documentos, particularmente PDF, mientras Pandoc continúa siendo un conversor general entre una enorme cantidad de formatos.
anydoc entra ahora en ese espacio con una prioridad distinta: convertir rápidamente documentos ofimáticos mediante una librería ligera y sin recurrir a modelos de machine learning o servicios externos.
De un DOC de 2003 a Markdown con el mismo modelo interno
La arquitectura de anydoc tiene una característica especialmente interesante para desarrolladores.
Los diferentes parsers no generan Markdown directamente de forma independiente. Los documentos pasan primero a un modelo común formado por bloques, elementos inline, tablas, notas al pie y recursos. Después un único serializador genera GitHub-Flavored Markdown (GFM).
El flujo simplificado es:
Documento
│
├── detección de formato
│
├── parser DOC / DOCX / PPT / XLS / ODT...
│
▼
Modelo común de documento
│
▼
Serializador GFM
│
▼
Markdown
La ventaja de este enfoque es la consistencia. Si se corrige, por ejemplo, el tratamiento de caracteres dentro de una tabla, esa modificación puede beneficiar a Word, RTF u OpenDocument sin tener que implementar el mismo comportamiento en cada conversor.
Firecrawl asegura que esta arquitectura conserva elementos como títulos y anclas, negrita, cursiva, tachado, bloques de código, enlaces, referencias internas, listas anidadas, tablas con celdas combinadas, citas, notas al pie e incluso notas del presentador. Los recursos incrustados también permanecen disponibles dentro del modelo de documento aunque su representación textual en Markdown sea más limitada.
El soporte anunciado actualmente incluye:
| Tipo | Extensiones soportadas |
|---|---|
| Word | .doc, .docx, .docm |
| PowerPoint | .ppt, .pps, .pot, .pptx, .pptm, .ppsx, .ppsm |
| Excel | .xls, .xlsx, .xlsm, .xlsb |
| OpenDocument | .odt, .ods, .odp |
| RTF | .rtf |
| EPUB | .epub |
| CSV | .csv |
.pdf |
Esto incluye formatos binarios antiguos como .doc, .xls o .ppt, algo relevante para organizaciones con repositorios documentales que llevan años acumulando archivos.
No confía únicamente en la extensión del archivo
Otra particularidad de anydoc es la detección de formato.
En vez de dar por hecho que un archivo denominado informe.docx realmente es un DOCX, la biblioteca intenta analizar sus bytes utilizando las señales definidas por los propios formatos: cabeceras PDF, estructuras OLE, grupos RTF o información contenida en paquetes ZIP, entre otras.
Esto puede resultar útil en pipelines que reciben documentos desde múltiples fuentes y donde las extensiones no siempre son fiables.
CSV constituye una excepción porque no dispone de una firma binaria equivalente, por lo que necesita una extensión o una indicación explícita del formato.
En Node.js puede utilizarse directamente desde bytes:
import {
toMarkdownBytes
} from '@firecrawl/anydoc';
const markdown = await toMarkdownBytes(bytes);
Y desde Python:
import anydoc
markdown = anydoc.to_markdown("report.docx")
También existe una versión WebAssembly:
import init, {
toMarkdownBytes
} from '@firecrawl/anydoc-wasm';
await init();
const markdown = toMarkdownBytes(bytes);
Esto permite ejecutar la conversión dentro del navegador, sin enviar necesariamente el documento a un servidor. La demostración publicada por Firecrawl utiliza precisamente esta modalidad y realiza el procesamiento local.
Firecrawl asegura una mediana de 4,4 milisegundos
El rendimiento es uno de los principales argumentos utilizados por sus desarrolladores.
Firecrawl ha publicado un benchmark realizado con 100 documentos reales repartidos entre 14 formatos. En esa prueba, anydoc registró una mediana de 4,4 milisegundos por documento.
Los resultados publicados son:
| Herramienta | Formatos cubiertos en la prueba | Tiempo mediano | Puntuación |
|---|---|---|---|
| anydoc | 14/14 | 4,4 ms | 81 |
| Pandoc | 5/14 | 102,1 ms | 56 |
| MarkItDown | 6/14 | 134,8 ms | 65 |
| Docling | 4/14 | 513,6 ms | 57 |
| Unstructured | 8/14 | 572,9 ms | 63 |
| LibreOffice | 12/14 | 1.129,5 ms | 40 |
Las cifras deben interpretarse con bastante cuidado.
El benchmark ha sido diseñado y publicado por el propio proyecto, no por un laboratorio independiente. Además, cada herramienta cubrió un número distinto de formatos y no todas persiguen exactamente el mismo objetivo.
Firecrawl lo reconoce en su propia metodología: la puntuación general de cada solución se calcula únicamente sobre los formatos que consigue procesar, por lo que la comparación más justa es observar los resultados formato a formato. La calidad fue evaluada utilizando un LLM como juez y comparando los resultados con imágenes de las seis primeras páginas de cada documento.
El hardware utilizado fue un Ryzen 9 9950X3D con Windows 11 y 64 GB DDR5. Para anydoc y las librerías Python se excluyó del cronometraje el arranque del proceso, mientras que algunas herramientas CLI sí incorporaron ese coste.
Por tanto, afirmar simplemente que anydoc es «100 veces más rápido que todas las alternativas» sería demasiado simplista.
Lo que sí puede afirmarse con los datos disponibles es que el benchmark del propio proyecto muestra una ventaja importante en su escenario concreto de conversión de documentos ofimáticos sin modelos de IA.
anydoc frente a MarkItDown, Docling, Pandoc y Unstructured
Aunque aparecen enfrentados en el benchmark, estas herramientas no son completamente intercambiables.
| Herramienta | Enfoque principal | Punto fuerte |
|---|---|---|
| anydoc | documentos → Markdown para IA | velocidad, Rust, ejecución local y múltiples bindings |
| MarkItDown | documentos y multimedia → Markdown | sencillez e integración Python/LLM |
| Docling | comprensión avanzada de documentos | layout, tablas, fórmulas, imágenes y PDF complejo |
| Pandoc | conversión universal entre formatos | enorme variedad de formatos de entrada y salida |
| Unstructured | preparación de datos para GenAI | particionado, limpieza, chunking y pipelines |
| LibreOffice | suite ofimática/conversión | compatibilidad documental general |
MarkItDown, desarrollado por Microsoft, soporta PDF, PowerPoint, Word, Excel, imágenes con OCR, audio con transcripción, HTML, CSV, JSON, XML, ZIP, EPUB e incluso determinados contenidos remotos. Además dispone de arquitectura de plugins y soporte MCP.
Docling tiene otro perfil. Su parser de PDF intenta reconstruir layout, orden de lectura, estructura de tablas, código, fórmulas e incluso contenido gráfico, y puede trabajar también con imágenes y audio. Es una solución mucho más próxima a una plataforma completa de procesamiento documental para GenAI que a un simple conversor rápido.
Unstructured tampoco se limita a generar Markdown. Su librería se utiliza para particionar, limpiar y realizar chunking sobre más de 25 tipos de documentos antes de enviarlos a sistemas de IA.
Pandoc juega incluso en otra categoría. Sigue siendo en 2026 uno de los conversores universales más completos y su versión 3.10.1 fue publicada el 21 de julio de 2026. Puede convertir entre numerosos lenguajes de marcado, formatos ofimáticos y publicaciones, tanto de entrada como de salida.
Por eso la elección depende del problema.
Para transformar miles de DOCX, XLSX o PPTX en Markdown dentro de una aplicación Node.js, anydoc puede resultar especialmente atractivo. Para interpretar documentos PDF con diagramas y estructuras complejas, Docling puede ofrecer capacidades que anydoc deliberadamente no incluye. Y si el objetivo es convertir Markdown a EPUB, LaTeX, DOCX o decenas de formatos diferentes, Pandoc continúa ofreciendo una amplitud mucho mayor.
El gran límite de anydoc está en los PDF escaneados
La velocidad tiene una explicación importante: anydoc no incorpora modelos de machine learning ni OCR.
Los PDF basados en texto pueden procesarse localmente mediante pdf-inspector, pero un PDF compuesto únicamente por imágenes devolverá actualmente un error Unsupported.
Eso significa que este documento:
PDF
├── texto embebido → anydoc puede procesarlo
└── páginas escaneadas → necesita OCR
requiere otra fase cuando el contenido procede de un escáner.
Firecrawl utiliza esta separación también comercialmente: su API Parse combina la conversión documental con sus propios modelos OCR para los casos que la librería local no puede resolver.
Para una empresa puede incluso ser una arquitectura razonable: ejecutar localmente el camino rápido para documentos digitales y enviar únicamente aquellos que necesitan reconocimiento visual a un pipeline específico de OCR.
Un conversor pensado también para agentes de IA
anydoc incluye además un Agent Skill, lo que permite instalar instrucciones para que herramientas compatibles puedan utilizar automáticamente el conversor.
La instalación indicada por el proyecto es:
npx skills add firecrawl/anydoc
Firecrawl menciona compatibilidad con Claude Code, Codex, Cursor y OpenCode, además de otras herramientas que implementen ese formato de habilidades.
Esta parte apunta hacia un cambio interesante.
Hasta ahora el flujo típico era que una aplicación preparase los documentos antes de entregarlos a la IA. Con los agentes, la propia herramienta puede encontrar un .docx, .xlsx o .pptx, invocar el conversor y continuar trabajando con su contenido en Markdown.
El pipeline podría ser tan sencillo como:
Agente
│
├── encuentra report.xlsx
│
▼
anydoc
│
▼
Markdown
│
▼
contexto del LLM
Esto puede aplicarse a análisis de contratos, incorporación de documentación a un RAG, migraciones documentales, extracción de información corporativa o asistentes capaces de trabajar con archivos locales.
Markdown se está convirtiendo en la capa intermedia de la IA documental
La aparición de anydoc también refleja una tendencia más amplia.
Durante décadas, convertir documentos significaba preservar al máximo su presentación visual. En los sistemas de IA el objetivo suele ser distinto: conservar suficiente estructura semántica para que otro sistema pueda entender el contenido.
Un modelo normalmente necesita saber que una frase es un encabezado, que cinco elementos forman una lista o que determinadas cifras pertenecen a columnas de una tabla. No necesita necesariamente reproducir cada tipografía, margen o sombra de la aplicación original.
Markdown encaja bien en ese espacio intermedio.
anydoc apuesta por conseguirlo con parsers convencionales y Rust, evitando modelos pesados cuando el documento ya contiene toda la información estructural necesaria. Docling y otras herramientas pueden entrar después cuando el problema exige comprensión visual u OCR.
No existe por tanto un único «mejor conversor para IA». Hay diferentes niveles de complejidad.
La aportación interesante de anydoc es demostrar que una parte considerable de la preparación documental para LLM puede hacerse localmente, en milisegundos y sin ejecutar ningún modelo de inteligencia artificial.
Preguntas frecuentes
¿Qué es anydoc?
anydoc es una librería open source desarrollada por Firecrawl para convertir documentos Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV y PDF a GitHub-Flavored Markdown. Está escrita en Rust y tiene bindings para Node.js, Python, Rust y WebAssembly.
¿anydoc puede procesar PDF escaneados?
No directamente. Su soporte PDF está orientado a documentos que contienen texto. Los archivos formados únicamente por imágenes necesitan un sistema OCR adicional.
¿Es anydoc más rápido que MarkItDown y Docling?
El benchmark publicado por Firecrawl obtiene una mediana de 4,4 ms para anydoc y tiempos superiores para las herramientas comparadas. Sin embargo, es una prueba realizada por los propios desarrolladores, con diferente cobertura de formatos entre herramientas, por lo que no debería interpretarse como una comparación universal.
¿Para qué sirve convertir documentos a Markdown antes de enviarlos a una IA?
Markdown conserva estructuras como encabezados, listas, enlaces y tablas utilizando relativamente poco marcado. Esto facilita utilizar documentos como contexto para LLM, sistemas RAG, buscadores semánticos y agentes.













