Anthropic bajó 75% el precio del prompt caching

El 1° de septiembre de 2026, Anthropic bajó 75% el precio de que un agente recuerde lo que ya le dijiste.

Ese día lanzó tres cosas a la vez: Claude Fable 5.1, Mythos 5.1 y un paquete de controles para empresas llamado Enterprise Frontier Safeguards. Los titulares se los llevó el modelo nuevo. El cambio que más pesa para quien corre agentes seguido está en otro lado, más aburrido y menos fotogénico: el precio de la caché.

Tres lanzamientos, un solo cambio que mueve la aguja

Fable 5.1 es la actualización general del modelo — la que está disponible para cualquiera que use la API, Claude Code o Claude Enterprise. Mythos 5.1, en cambio, quedó restringido a dos programas de verificación específicos (ciberseguridad y ciencias biológicas): no es un modelo de uso abierto. Enterprise Frontier Safeguards es un paquete de controles de datos y cumplimiento pensado para empresas grandes.

De los tres, el que cambia el cálculo económico de correr agentes con frecuencia no es ninguno de los modelos nuevos. Es un ajuste de precio que Anthropic metió en el mismo anuncio: la lectura de caché bajó 75%.

Qué es, en criollo, una “lectura de caché”

Cuando un agente trabaja, no arranca de cero en cada paso. Vuelve a mandarle al modelo casi el mismo contexto una y otra vez: las instrucciones del sistema, las definiciones de las herramientas que puede usar, el historial completo de la conversación hasta ese punto.

Ese contexto repetido se puede cachear — el modelo no tiene que reprocesarlo entero cada vez — y se factura aparte, con un precio distinto al de leer contexto genuinamente nuevo. A esa línea de la factura se la conoce como “lectura de caché” (cache read).

Es, básicamente, el costo de que el agente “se acuerde” de todo lo anterior en cada uno de sus pasos.

Los números

Hasta el 31 de agosto, la lectura de caché costaba USD 1,00 por millón de tokens. Desde el 1° de septiembre cuesta USD 0,25 — una baja de 75%.

El resto de la estructura de precios de Fable 5.1 no cambió respecto a la versión anterior: USD 10 por millón de tokens de input nuevo y USD 50 por millón de tokens de output, igual que antes.

Anthropic midió el impacto sobre cuatro semanas de uso real en agosto de 2026, combinando tráfico de Claude Enterprise, Claude Code y la API. Para uso típico, el costo total baja alrededor de 25%. Para tareas de programación compleja o de trabajo muy agéntico — donde la lectura de caché llega a representar la mayor parte de la factura —, el ahorro reportado sube hasta 45%.

La diferencia entre ambos números no es casualidad: cuanto más largo y repetitivo es el trabajo de un agente, más pesa la caché sobre el costo total. Un chat corto de pregunta y respuesta apenas la nota. Un agente que corre veinte, treinta, cien pasos releyendo el mismo contexto en cada uno, la nota mucho.

Lo que cambia para quien corre agentes seguido

Nada de esto sale en los benchmarks de capacidad ni en las comparaciones de qué modelo “razona mejor”. Pero es la variable que decide si automatizar cierto flujo de trabajo sale a cuenta o no.

Un agente que hace una tarea larga y agéntica no gasta principalmente en pensar la respuesta final. Gasta en cargar, paso a paso, todo lo que ya sabía. Cuando ese costo baja 75%, cambia qué workflows cierran los números — no porque el modelo mejoró, sino porque la memoria del agente dejó de ser tan cara.

Corro agentes todos los días en Quantik, y esta es justo la variable que no aparece en las demos: no tanto qué modelo se usa, sino cuánto cuesta que se acuerde de lo que ya le dijiste.

La factura de un agente no se mueve tanto por lo que responde. Se mueve por lo que tiene que recordar en cada paso.

¿Alguien más está revisando ahora qué parte del costo de sus agentes es memoria, y no modelo?


Fuentes:

Comentarios