Saltar al contenido
hivek blog
Cuéntanos tu proyecto

IA aplicada

El token baja de precio, la factura de IA sube: cómo presupuestar un proyecto agéntico en 2026

El costo por token empresarial cayó 67% en un año, pero 73% de las empresas gastó más de lo presupuestado en IA. La razón está en cuántas veces llama el agente al modelo, no en el precio de lista.

El token baja de precio, la factura de IA sube: cómo presupuestar un proyecto agéntico en 2026

El precio por token de los modelos de lenguaje bajó 67% entre el primer trimestre de 2025 y el primero de 2026, de 18.40 a 6.07 dólares por millón de tokens en costo mixto empresarial, según un análisis de 2.4 mil millones de llamadas API empresariales citado por Optimum Partners. En el mismo periodo, 73% de las empresas reportó que su gasto real en IA superó lo presupuestado, de acuerdo con datos de la FinOps Foundation recogidos en ese mismo análisis. Si tu equipo está por meterle presupuesto a un asistente o a un sistema agéntico, ese es el problema que vas a enfrentar: no el precio del token, sino cuántas veces tu sistema lo compra sin que nadie lo esté contando.

El caso más citado de esta paradoja es el de Uber. La empresa desplegó Claude Code entre sus ingenieros en diciembre de 2025; la adopción llegó a 84% de los aproximadamente 5,000 ingenieros de la compañía en marzo de 2026, habiendo comenzado en 32% en diciembre 2025 y alcanzado 63% en febrero 2026, y para abril ya se había agotado todo el presupuesto de IA planeado para el año, según reportó Fortune. El CTO Praveen Neppalli Naga reconoció haber gastado 1,200 dólares en tokens durante una sola sesión de demo personal de dos horas. El gasto promedio por ingeniero rondaba entre 150 y 250 dólares mensuales, con usuarios intensivos llegando a 2,000 dólares al mes.

Por qué un agente cuesta 30 veces más que un chatbot

La diferencia no está en el modelo, está en cuántas veces se le llama. Un chatbot simple resuelve una consulta con una sola llamada al modelo. Un flujo agéntico (uno que llama herramientas, verifica el resultado y se corrige si falla) puede requerir entre 5 y 30 veces más tokens que esa consulta simple, según un análisis de Gartner de marzo de 2026 citado por EY. EY documenta el mismo salto en dólares: un flujo de atención a cliente que costaba 0.04 dólares por interacción en 2023, con el esquema de entrada, búsqueda y respuesta, cuesta 1.20 dólares por orquestación en 2026 cuando se le agregan herramientas, razonamiento e iteraciones. Treinta veces más caro, aunque el precio por token haya bajado.

A esto se suma que buena parte del gasto real no aparece en la factura del proveedor del modelo. Según un reporte de NavyaAI de febrero de 2026, entre 20% y 40% del costo total de un sistema de producción es la factura de inferencia; el resto, entre 60% y 80%, vive en orquestación, bases de datos vectoriales, observabilidad, reintentos y capacidad reservada que queda ociosa. El mismo reporte estima que el uso de tokens por tarea puede multiplicarse entre 50 y 500 veces frente a una consulta directa, dependiendo de cuántos ciclos de corrección ejecute el agente.

El número exacto de llamadas por tarea varía según el proveedor y el diseño del flujo, y no hay un estudio único que lo fije con precisión: estimaciones de la industria lo sitúan entre 10 y 20 llamadas al modelo por cada solicitud de usuario en un sistema agéntico de producción. Es una cifra de referencia, no un estándar verificado, así que conviene medirla en tu propio flujo antes de presupuestar sobre ella.

Los precios que sí puedes anotar hoy

Dos referencias verificables al 11 de septiembre de 2026:

ReferenciaCifraFuente
Costo mixto empresarial por tokenDe 18.40 a 6.07 USD por millón de tokens (Q1 2025 a Q1 2026)Optimum Partners
Gemini 3.8 Flash, entrada0.75 USD por millón de tokens (precio introductorio, vigente hasta el 31 de diciembre de 2026)Página oficial de precios de Google AI
Gemini 3.8 Flash, salida3.75 USD por millón de tokens (mismo periodo introductorio)Página oficial de precios de Google AI

Ese mismo precio de Gemini 3.8 Flash se duplica a partir del 1 de enero de 2027, a 1.50 y 7.50 dólares por millón de tokens de entrada y salida respectivamente, según la misma página. No es un caso aislado: la tabla de precios de cualquier proveedor cambia de forma seguida, y un precio introductorio de lanzamiento no es el precio con el que vas a operar en doce meses. Por eso ningún precio de este artículo debe leerse como definitivo, sino como el punto de referencia del día en que se escribió.

También hay presión del lado de los proveedores. Un análisis de mercado de julio de 2026 señala que modelos más económicos, varios de origen chino como DeepSeek, Qwen, GLM, Kimi y MiniMax, alcanzaron 46% de participación de mercado a mediados de 2026 conforme las empresas migran tareas rutinarias hacia opciones más baratas. Al mismo tiempo, el gasto total en modelos de IA se proyecta que duplique de 15,500 a 32,600 millones de dólares entre 2025 y 2026. Los dos movimientos ocurren a la vez: el precio por token baja y el gasto agregado sube, porque el volumen de llamadas crece más rápido de lo que baja el precio.

Qué preguntar antes de fijar el presupuesto

Antes de poner un número en la propuesta de un asistente o de un flujo agéntico, pide que tu equipo o tu proveedor conteste esto con datos, no con estimaciones optimistas:

  1. Cuántas llamadas al modelo hace una sola tarea completada, no una sola consulta. Un flujo que "responde una pregunta" en la demo puede ejecutar quince pasos internos en producción.
  2. Qué porcentaje del costo vive fuera del modelo: orquestación, base de datos vectorial, logs, reintentos, infraestructura reservada. Si nadie te puede dar ese número, es que no lo están midiendo.
  3. Qué pasa con el costo si el volumen de uso se cuadruplica, no si se duplica. La adopción de herramientas agénticas dentro de una empresa no crece de forma lineal: crece por oleadas, como en el caso de Uber.
  4. Si el flujo usa un solo modelo para todo o si enruta tareas simples a modelos más baratos. La diferencia entre una arquitectura escalonada y depender de un solo modelo de punta puede representar una brecha de varias veces en el costo por millón de tokens, de acuerdo con el mismo análisis de Optimum Partners.
  5. Con qué frecuencia se revisa el precio de lista del modelo contratado. Como muestra el caso de Gemini 3.8 Flash, un precio introductorio puede duplicarse en menos de un año.

Dónde esta lógica no aplica

No todo lo que toca un modelo de lenguaje necesita este nivel de vigilancia de costos. Si el caso de uso es una consulta puntual, sin herramientas externas ni pasos de verificación (clasificar un correo, resumir un documento, generar una respuesta de plantilla), el costo por token sigue siendo la variable dominante y la caída de precios sí te beneficia de forma directa. El riesgo de sobrecosto aparece cuando el sistema empieza a razonar en varios pasos, llamar herramientas y corregirse solo: ahí es donde el número de llamadas, no el precio unitario, decide la factura. Tampoco tiene sentido optimizar el costo por token antes de tener el flujo funcionando: primero se valida que el agente resuelve el proceso, después se afina cuánto cuesta sostenerlo en producción.

Medir cuántas llamadas hace realmente un flujo agéntico, y no solo el precio de lista del modelo, es el trabajo que suele faltar antes de aprobar un proyecto de este tipo; en hivek aplicamos IA a procesos concretos con ese cálculo hecho desde el diagnóstico.

La pregunta que vale la pena dejar sobre la mesa no es qué modelo es el más barato esta semana, sino si tu equipo ya sabe cuántas veces al día su propio sistema está llamando al modelo sin que nadie lo esté sumando.

Fuentes

Comentarios

→ Suscripción

Te avisamos cuando publicamos

Un correo por artículo, con los datos y las fuentes de cada caso. Automatización de procesos, IA aplicada y plataformas a la medida.

Un correo por artículo. Baja cuando quieras.