Una empresa baja de 5.600 a 13 euros su factura de traducción con IA local

Una empresa pasó de pagar hasta 5.600 euros al mes por una API de traducción a desembolsar 13 euros por el mismo servicio tras trasladar los modelos a infraestructura propia. El caso, compartido por Nando Theessen, fundador de DevWire, muestra cómo el coste de inferencia puede cambiar cuando una compañía con un volumen elevado de uso deja de pagar por cada petición y ejecuta sus propios modelos en servidores con GPU.

Las claves de la IA local para traducción en 30 segundos

  • La factura de la API llegó a alcanzar los 5.600 euros mensuales.
  • La empresa trasladó la traducción a tres servidores dedicados de Hetzner con GPU RTX PRO 6000.
  • El sistema utiliza vLLM y Triton, con MADLAD para las traducciones.
  • El coste de la API cayó hasta 13 euros al mes, mientras el alojamiento ronda los 2.650 euros.
  • La infraestructura procesa unas 500.000 peticiones diarias y también ejecuta modelos de lenguaje, visión y análisis de sentimiento.

El caso resulta especialmente interesante porque el ahorro no procede de utilizar menos traducción. Según explica Theessen, el problema original era precisamente el contrario: añadir nuevas fuentes y más material mejoraba el negocio del cliente, pero cada incremento de uso elevaba también la factura de la API.

La alternativa fue ejecutar los modelos internamente. La infraestructura terminó formada por tres servidores dedicados contratados a Hetzner y equipados con GPU RTX PRO 6000. Sobre ellos se desplegaron vLLM y Triton para servir los modelos, mientras que MADLAD se utiliza específicamente para las tareas de traducción.

Los modelos no se eligieron únicamente por su rendimiento. Theessen explica que tuvieron en cuenta la calidad, la compatibilidad y si los distintos casos de uso podían ejecutarse de forma adecuada sobre el hardware disponible. El objetivo era encontrar el mejor resultado dentro de esas limitaciones.

El coste cambia cuando la inferencia deja de cobrarse por petición

La diferencia entre ambos escenarios es considerable. La API de traducción llegó a costar 5.600 euros mensuales, mientras que después del cambio el consumo de la propia API se redujo a 13 euros. El alojamiento de los servidores supone alrededor de 2.650 euros al mes.

Eso sitúa el coste directo de la infraestructura descrita en unos 2.663 euros mensuales, frente a los 5.600 euros que llegó a alcanzar la factura anterior. Theessen cifra el ahorro total en unos 3.000 euros al mes.

La comparación, sin embargo, no consiste únicamente en sustituir una factura por otra. La nueva infraestructura permite utilizar los servidores para más tareas que la traducción. Según el relato, el cliente dispone ahora también de modelos de lenguaje internos para trabajos con agentes de IA, además de modelos destinados a visión y análisis de sentimiento.

El mismo gateway de inferencia sirve alrededor de 500.000 peticiones al día. Eso equivale a un volumen aproximado de 15 millones de solicitudes en un mes de 30 días, aunque el número real puede variar según el periodo.

La diferencia económica se explica en parte por ese cambio de modelo. Con una API externa, el crecimiento del consumo suele traducirse directamente en un aumento de la factura. Con infraestructura propia o dedicada, una parte importante del coste queda vinculada a los servidores contratados, por lo que utilizar más capacidad disponible no necesariamente genera el mismo incremento proporcional en el coste de cada petición.

En este caso, además, la empresa no utiliza las GPU exclusivamente para traducir. El mismo equipamiento sirve para varios modelos y tareas, lo que aumenta el aprovechamiento de la infraestructura.

El ejemplo también marca los límites de la IA autoalojada

Theessen no plantea este escenario como una sustitución general de los grandes modelos comerciales. De hecho, reconoce que los modelos autoalojados no pueden reemplazar a los modelos de frontera en todos los usos.

La propuesta es más concreta: identificar tareas relativamente sencillas y con un volumen de uso suficiente para que ejecutar los modelos por cuenta propia tenga sentido económico.

La traducción aparece en su experiencia como uno de los casos más fáciles para plantear este cambio. Cuando una empresa mantiene un gasto recurrente elevado en una API y necesita realizar grandes cantidades de solicitudes, el coste fijo de una infraestructura con GPU puede resultar más previsible.

El punto a partir del cual compensa no es universal. Depende del modelo utilizado, el volumen de solicitudes, los requisitos de latencia, el hardware, el coste de alojamiento y la capacidad necesaria. También hay que tener en cuenta la gestión de los servidores y del software de inferencia, aspectos que no desaparecen por dejar de utilizar una API externa.

En el caso descrito, la empresa ya disponía de un volumen suficientemente elevado como para que tres servidores con GPU pudieran asumir no solo la traducción, sino también otras cargas de IA. Eso permite repartir el coste de la infraestructura entre varios usos.

Theessen apunta que, para empresas que gastan entre 2.500 y 3.000 euros mensuales en traducción u otros servicios similares, el autoalojamiento debería al menos entrar en la comparación. También menciona como alternativas tanto alquilar servidores con GPU como utilizar equipos de Apple, aunque su publicación no aporta un cálculo detallado de coste y rendimiento para cada opción.

La conclusión que se desprende de este caso es más limitada que una simple defensa de la IA local. El autoalojamiento puede tener sentido cuando existe un volumen de inferencia alto, los modelos disponibles cubren las necesidades del negocio y la infraestructura puede reutilizarse para varias tareas.

Para cargas pequeñas o necesidades que dependen de modelos de frontera, una API externa puede seguir siendo una opción más adecuada. El atractivo de ejecutar los modelos localmente aumenta cuando el uso es constante y la compañía puede mantener ocupadas las GPU con diferentes aplicaciones.

El caso compartido por Theessen no aporta una auditoría independiente de los costes ni detalla otros gastos asociados al funcionamiento de la infraestructura. Las cifras corresponden a la experiencia concreta que describe y no deben interpretarse como un ahorro garantizado para cualquier empresa.

Lo que sí deja claro es la diferencia que puede producir el volumen. Una factura de 5.600 euros mensuales por traducción puede justificar estudiar una arquitectura propia cuando esa misma infraestructura permite atender cientos de miles de peticiones diarias y reutilizar las GPU para otras aplicaciones de IA.

Preguntas frecuentes

¿Cuánto pagaba la empresa por su API de traducción?

La factura llegó a alcanzar los 5.600 euros al mes. Después del cambio, el coste de la API de traducción quedó en unos 13 euros mensuales.

¿Qué hardware utiliza para ejecutar los modelos?

La empresa utiliza tres servidores dedicados de Hetzner equipados con GPU RTX PRO 6000.

¿Qué modelos y software utiliza?

El sistema emplea vLLM y Triton para la infraestructura de inferencia y utiliza MADLAD para las tareas de traducción. También ejecuta modelos de lenguaje, visión y análisis de sentimiento.

¿Cuántas peticiones procesa la infraestructura?

El gateway de inferencia atiende alrededor de 500.000 peticiones al día, según la experiencia compartida por Nando Theessen.

Scroll al inicio