Ingeniería
29% del gasto en la nube se desperdicia y por primera vez en cinco años vuelve a subir: la IA es la causa
El reporte Flexera State of the Cloud 2026 registra el primer repunte del desperdicio en la nube en cinco años. La causa nueva son las cargas de IA sin gobierno de costo: qué revisar antes de meter más presupuesto.
El 29% del gasto en infraestructura de nube (IaaS y PaaS) se desperdicia, según el reporte State of the Cloud 2026 de Flexera, publicado el 18 de marzo de 2026 con 753 responsables de decisiones de nube encuestados. Es la primera vez en cinco años que esa cifra sube en lugar de bajar: venía de 30% en 2021 y había ido cediendo terreno año con año. Lo que rompió la racha, según el propio reporte, son las cargas de trabajo de inteligencia artificial.
Si tu empresa ya metió IA a producción (agentes, generación aumentada por recuperación, ajuste fino de modelos) y no metió junto con eso un proceso para vigilar el costo, hay una probabilidad real de que una parte de ese gasto ya esté en la categoría de desperdicio sin que nadie en tu operación lo sepa todavía.
Qué encontró el reporte
Flexera encuestó a 753 tomadores de decisiones de nube para su decimoquinta edición anual. Los hallazgos centrales:
- El desperdicio estimado en IaaS/PaaS llegó a 29%, revirtiendo una tendencia a la baja de cinco años.
- 81% de los encuestados ya usa IA generativa, frente a 72% el año anterior y 47% en 2024.
- El uso de GenAI como servicio de nube pública subió de 50% a 58% entre un año y el siguiente.
- 85% sigue señalando la gestión del gasto en la nube como uno de sus principales retos, pese a que 63% ya tiene un equipo de FinOps establecido y 71% opera un centro de excelencia en la nube.
Brian Shannon, CTO de Flexera, lo resume así en el comunicado de la compañía: la nube está madurando y la visibilidad está mejorando, pero la IA está reconfigurando tanto la economía como el riesgo del gasto en la nube, según el comunicado de prensa de Flexera.
Por qué la IA rompe un patrón que venía mejorando
El desperdicio tradicional en la nube (instancias sobredimensionadas, recursos huérfanos, reservas que nadie usa) es un problema conocido desde hace más de una década y las empresas habían aprendido a contenerlo. Las cargas de IA introducen un tipo de gasto distinto, más difícil de prever y de auditar con las mismas herramientas.
Tres razones técnicas explican por qué:
El optimizador de cómputo tradicional no sirve igual para GPU. Ajustar el tamaño de una instancia de cómputo general es una disciplina madura. Hacerlo con GPU es otra cosa: implica decidir entre acelerador dedicado, servicio administrado de machine learning o inferencia serverless, y el punto de equilibrio entre esas opciones suele estar entre 30% y 50% de utilización de GPU, según estimaciones de la industria citadas por CloudMagazin sobre el costo de GPU en inferencia de IA. Para empresas con cargas intensivas de IA, el gasto en GPU ya representa entre 40% y 60% de la factura total de nube, de acuerdo con la misma fuente. Un acelerador reservado que se usa a una fracción de su capacidad cuesta lo mismo que uno saturado.
Los entornos de prueba de modelos no se apagan solos. Entrenar o evaluar un modelo suele requerir levantar un entorno temporal con GPU. Si ese entorno no tiene fecha de caducidad ni dueño asignado, sigue corriendo y facturando después de que el experimento terminó. A diferencia de un servidor web olvidado, cuyo costo es marginal, una instancia GPU olvidada cuesta órdenes de magnitud más por hora.
No hay visibilidad de costo por experimento. La factura de nube tradicional se desglosa por servicio y por etiqueta. La factura de un pipeline de entrenamiento o de un agente en producción mezcla cómputo, almacenamiento de vectores, llamadas a modelos y transferencia de datos en una sola carga de trabajo, y pocas herramientas de FinOps separan ese gasto por proyecto o por experimento con la granularidad que se necesita para decidir qué vale la pena seguir pagando.
FinOps dejó de ser un tema de finanzas
El otro dato que cambió en 2026 es quién es dueño del problema. Según el reporte State of FinOps 2026 de la FinOps Foundation, basado en 1,192 encuestados que representan más de 83,000 millones de dólares en gasto anual de nube, 78% de las prácticas de FinOps ya reportan al CTO o al CIO, no al área de finanzas. Es la sexta encuesta anual de la fundación desde 2020 y confirma algo que ya se veía venir: el control del gasto en la nube se volvió una decisión de ingeniería, no sólo de contabilidad.
Ese mismo reporte encontró que 98% de los equipos de FinOps ya gestionan gasto de IA o de agentes dentro de su alcance, y que la capacidad más solicitada que todavía no existe de forma madura en el mercado es el monitoreo granular por token, por solicitud a un modelo de lenguaje y por utilización de GPU. En otras palabras: las herramientas de FinOps apenas están poniéndose al día con el tipo de gasto que la IA generó.
La consecuencia comercial de esa brecha también quedó registrada: el mercado de software y servicios de FinOps vale 16,790 millones de dólares en 2026 y se proyecta en 39,040 millones de dólares para 2034, un crecimiento anual compuesto de 11.12%, según el reporte de mercado de Fortune Business Insights consultado el 1 de octubre de 2026. Ese crecimiento no es casualidad: es la respuesta a un problema de visibilidad que las empresas ya identificaron pero todavía no resuelven con sus procesos actuales.
Este problema de medición no es exclusivo del gasto en infraestructura. Es el mismo vacío que ya describimos en 48% de las empresas mexicanas ya usan IA, pero 46% no puede probar si les rinde: sin medición, no hay forma de saber si el gasto se traduce en valor.
Qué revisar en tu operación
Si tu empresa ya tiene IA corriendo en producción, en este orden:
- Pide el desglose de gasto en cómputo por proyecto de IA, no por servicio. Si tu proveedor de nube o tu equipo de ingeniería no puede separar cuánto cuesta cada agente, cada pipeline de entrenamiento o cada experimento de forma individual, no tienes visibilidad real, tienes un total.
- Pon fecha de caducidad a todo entorno de prueba con GPU. Un entorno de evaluación de modelos debería apagarse solo si nadie lo usa en un plazo definido (24 o 48 horas es razonable para la mayoría de los casos). Pregunta a tu equipo si esa regla existe hoy.
- Define presupuesto por proyecto, no sólo tope global de la cuenta de nube. Una alerta que dispara cuando toda la cuenta se pasa de presupuesto llega demasiado tarde. Una alerta por proyecto o por equipo detiene el problema antes de que crezca.
- Revisa la utilización real de GPU reservada cada mes, no cada trimestre. El ritmo al que cambian las cargas de IA es más rápido que el de las cargas tradicionales; una revisión trimestral llega con el gasto ya hecho.
- Pregunta quién es dueño del costo de cada agente o modelo en producción. Si la respuesta es "el equipo de IA" en general y no una persona o un equipo específico, ese gasto no tiene dueño y por lo tanto no tiene quien lo cuestione.
Ese inventario y esa disciplina de revisión son justo lo que resuelve una operación de soporte y hosting que da seguimiento continuo a la infraestructura en vez de dejar que el sistema corra sin que nadie vuelva a mirarlo después de la entrega.
Dónde este diagnóstico no aplica
Si tu uso de IA se limita a consumir una API de un proveedor (OpenAI, Anthropic, Google) sin levantar infraestructura propia de cómputo, el 29% de desperdicio de Flexera no te aplica directamente: ese dato mide IaaS y PaaS, no gasto en API de modelos por token. Tu problema de costo ahí es otro, y ya lo cubrimos en El precio por token no decide si tu agente de IA es rentable.
Tampoco aplica si tu empresa todavía no tiene ninguna carga de IA en producción, sólo pilotos pequeños y acotados en tiempo. Montar un proceso completo de gobierno de costo (alertas, presupuestos por proyecto, revisión mensual) para un piloto de tres semanas es más esfuerzo del que el piloto justifica. La disciplina importa cuando el gasto se vuelve recurrente, no antes.
Y si tu empresa gasta menos de lo que cuesta construir el proceso de gobierno, el cálculo tampoco sale. Automatizar alertas y reportes de costo por proyecto tiene un costo de implementación; si tu factura mensual de cómputo de IA es de unos cuantos miles de pesos, probablemente te sale más barato revisarla a mano una vez al mes que construir un sistema para hacerlo.
El origen del desperdicio ya no es sólo una instancia olvidada: es un proceso de IA sin nadie que vigile su costo mientras crece. Construir ese sistema de alertas y presupuesto por proyecto es exactamente el tipo de trabajo que evita que el gasto en IA se vuelva un problema que se descubre hasta el estado de cuenta.
Fuentes
- Flexera 2026 State of the Cloud Report: The convergence of cloud and value
- Comunicado de prensa: Flexera Finds Cloud Value is Rising While AI Waste Grows
- What 5 years of Flexera's State of the Cloud data reveals
- State of FinOps 2026 Report, FinOps Foundation
- 3 FinOps trends to look out for in 2026, TechTarget
- Cloud FinOps Market Share, Size, Trends, Forecast 2034, Fortune Business Insights
- AI inference in the cloud: why GPU costs will dominate your cloud bill in 2026, CloudMagazin
Comentarios