IA aplicada
El precio por token no decide si tu agente de IA es rentable: el acierto de caché bajó hasta 75%
DeepSeek y Anthropic recortaron el precio de reusar contexto mucho más que el de los tokens nuevos. Para un agente que revisa el mismo documento o recuerda una conversación larga, ese es el número que importa, no el precio de entrada que anuncia el proveedor.
DeepSeek puso en producción DeepSeek-V4.1-Flash el 10 de septiembre de 2026 con el precio de los tokens de entrada que ya pasaron por caché 57% más barato que la versión de agosto. Anthropic hizo algo parecido: en Claude Fable 5.1 el mismo tipo de token bajó 75% frente a Claude Fable 5. Ninguno de los dos recortó tanto el precio de un token nuevo. Si tu agente atiende clientes o revisa el mismo documento varias veces, ese es el número que decide cuánto pagas, no el precio de entrada que aparece primero en la página de tarifas.
Por qué el precio de entrada no es el precio real
Un modelo de lenguaje procesa cada solicitud como si fuera nueva, a menos que el proveedor guarde en memoria lo que ya calculó. Ese cálculo guardado se llama caché de contexto. Cuando una solicitud reutiliza esa memoria, es un acierto de caché (cache hit); cuando no la encuentra y tiene que procesar todo desde cero, es un fallo (cache miss) y se cobra el precio de entrada completo.
Para un agente conversacional, la diferencia es enorme. Cada turno de una conversación larga vuelve a enviar el historial completo: el system prompt, las instrucciones, los turnos anteriores. Si el proveedor no reutiliza ese contexto, el agente paga el precio de entrada completo en cada turno, aunque el 95% del texto sea idéntico al de la llamada anterior. En la documentación de precios de Anthropic hay un ejemplo de una sesión de una hora con 50,000 tokens de entrada: sin caché cuesta 0.705 dólares; con 40,000 de esos tokens leídos desde caché, baja a 0.525 dólares. Es la misma tarea, el mismo modelo, y una diferencia de 25% sólo por cómo se diseñó el reuso de contexto.
Esto ya lo tratamos con otro ángulo en cuánto cuesta realmente ponerle IA a los documentos de tu empresa: ahí el punto era el volumen de documentos. Aquí el punto es la repetición: un agente de atención a clientes o de búsqueda sobre políticas internas revisa una y otra vez el mismo contexto base, y el precio de esa repetición no es el que anuncia el proveedor en la portada.
Los números de septiembre de 2026
DeepSeek-V4.1-Flash reemplazó a DeepSeek-V4-Flash el 10 de septiembre de 2026. Según el análisis técnico de OrcaRouter, el ahorro viene de una caché KV (key-value) más pequeña: el nuevo modelo usa una caché de aproximadamente 890 bytes por token, alrededor de una cuarta parte de la que necesitaba la versión anterior. Menos memoria por token cacheado significa que el proveedor puede cobrar menos por leerlo.
En dólares, según el desglose de precios de OrcaRouter, DeepSeek cobra tarifas distintas en horario pico (lunes a viernes, 01:00 a 04:00 UTC y 06:00 a 10:00 UTC) y fuera de pico:
| Concepto | Fuera de pico | Pico |
|---|---|---|
| Entrada (fallo de caché) | $0.15 / MTok | $0.30 / MTok |
| Entrada (acierto de caché) | $0.003 / MTok | $0.006 / MTok |
| Salida | $0.60 / MTok | $1.20 / MTok |
El precio de acierto de caché en horario pico bajó de $0.014 a $0.006 por millón de tokens frente a la versión de agosto, una reducción de 57%. El precio de entrada normal bajó 32% en el mismo periodo. La caché no tiene costo de escritura ni TTL fijo: DeepSeek limpia los cachés no usados "en horas o días", según la misma fuente.
Anthropic sigue un modelo distinto: cobra por escribir en caché (1.25x el precio de entrada para caché de 5 minutos, 2x para una hora) y una fracción del precio de entrada por cada lectura. Según la tabla de precios oficial de Anthropic, la mayoría de los modelos Claude cobra 10% del precio de entrada por lectura de caché. Claude Fable 5.1 y Claude Mythos 5.1 son la excepción: ahí una lectura cuesta 2.5% del precio de entrada, es decir $0.25 por millón de tokens, contra $1.00 por millón que costaba en Claude Fable 5. Claude Opus 5.5 también bajó su multiplicador, de 10% a 5%: de $0.50 a $0.20 por millón de tokens leídos desde caché, 60% menos. El precio de entrada base de estos modelos bajó mucho menos: 0% en Fable 5.1 (se quedó en $10 por millón) y 20% en Opus 5.5 (de $5 a $4 por millón), según el resumen de lanzamientos de septiembre de 2026 de Capital and Compute.
El patrón se repite en los dos proveedores: el precio que bajó más no fue el de entrada ni el de salida. Fue el de reusar lo que ya se procesó.
Qué preguntarle a tu proveedor antes de aprobar el presupuesto
Si estás evaluando o pagando por un agente que mantiene conversación (atención a clientes, un asistente que agenda o califica por WhatsApp, como el que describimos en nuestro trabajo con agentes conversacionales) o que revisa el mismo cuerpo de documentos varias veces (búsqueda sobre políticas internas, soporte técnico con la misma base de conocimiento), el precio de entrada anunciado no te dice cuánto vas a pagar. Antes de aprobar el desarrollo o firmar con un proveedor, pregunta:
- ¿El sistema reutiliza el contexto entre turnos, o reenvía todo el historial en cada llamada? Si la respuesta es "reenvía todo", cada turno se cobra al precio de entrada completo, sin importar cuánto haya bajado el precio de caché.
- ¿Qué porcentaje de los tokens de entrada llegan como acierto de caché en un mes típico? Es una métrica que se puede pedir en el reporte de uso; si nadie la tiene, nadie está optimizando por ella.
- ¿El modelo elegido tiene descuento de caché competitivo, o el multiplicador es el estándar de 10%? Como viste arriba, no todos los modelos del mismo proveedor tienen el mismo descuento.
- ¿Cuánto dura la caché antes de expirar? Una conversación que se pausa 20 minutos y vuelve a arrancar puede perder el acierto de caché si el proveedor sólo garantiza 5 minutos.
Esto conecta con algo que ya escribimos sobre medición: 48% de las empresas mexicanas ya usan IA, pero 46% no puede probar si les rinde. El costo por acierto de caché es exactamente el tipo de número que debería estar en ese reporte y casi nunca está.
Dónde este ahorro no te toca
Si tu caso de uso procesa cada solicitud de forma independiente (clasificar correos uno por uno, generar una descripción de producto distinta cada vez, resumir documentos que no se repiten), el contexto casi nunca se reutiliza y el acierto de caché no va a mover tu factura de forma relevante. En ese escenario, lo que importa sigue siendo el precio de entrada y salida por token, y comparar proveedores por su tarifa de caché sería mirar el número equivocado.
Tampoco ayuda si tu volumen es bajo: la mecánica de caché premia el reuso frecuente y constante. Un agente que atiende cinco conversaciones al día no genera suficiente repetición para que el descuento se note en la cuenta mensual, y en el caso de Anthropic, el costo de escritura (1.25x o 2x el precio de entrada) puede incluso salir más caro que no cachear si la conversación no vuelve a consultarse.
Y hay un caso donde el precio bajo de caché puede ocultar un problema real: un proveedor puede anunciar tarifas de caché competitivas y aun así construir un agente que no las aprovecha, porque el diseño del prompt cambia en cada llamada (por ejemplo, mete la fecha y hora exactas al inicio del system prompt) y eso invalida el acierto de caché en cada turno. El precio bajo en la tarjeta de tarifas no garantiza nada si la arquitectura no está armada para aprovecharlo.
Ese es justo el criterio que aplicamos al diseñar una arquitectura de agentes de IA dentro de la operación: no basta con elegir el modelo más barato en el papel, hay que revisar si el flujo de conversación o de consulta documental está armado para que el contexto repetido se cobre como lectura de caché y no como una llamada nueva cada vez.
Los modelos van a seguir cambiando de precio cada pocas semanas (ya escribimos sobre esa cadencia en fatiga de modelos: cómo decidir cuándo cambiar de IA cuando sale una nueva cada 11 días), y cada recorte de tarifa va a venir con su propio comunicado destacando el número más favorable. La pregunta que vale la pena hacerle a cualquier proveedor, antes de firmar, es si su sistema fue diseñado para cobrarte ese número favorable o si sigue pagando el precio completo por costumbre. Si quieres que revisemos cómo está diseñado el reuso de contexto en tu agente antes de aprobar el presupuesto, ahí puedes contarnos qué proceso quieres meter en un agente.
Fuentes
- AI Weekly: DeepSeek cuts prices as... (amdatalakehouse, consultado el 29 de septiembre de 2026)
- DeepSeek V4.1 Flash pricing (OrcaRouter, consultado el 29 de septiembre de 2026)
- Pricing - Claude Platform Docs (Anthropic, consultado el 29 de septiembre de 2026)
- New AI models, September 2026 (Capital and Compute, consultado el 29 de septiembre de 2026)
Comentarios