Cómo leer el precio de cualquier API de IA (y no quemar dinero sin darte cuenta)
Tu factura de IA llegó tres veces más alta de lo normal y no sabes por qué. Aprende a leer cualquier tabla de precios de API y a bajar el gasto real.
kamerrezz
30 de julio de 2026

Cómo leer el precio de cualquier API de IA (y no quemar dinero sin darte cuenta)
Terminas el mes y la factura de tu app con IA llegó tres veces más alta de lo que esperabas. Abres el dashboard de uso y ves una tabla con columnas que nunca leíste con atención: input, output, cache write, cache read, batch. Sabes que ahí está la respuesta, pero se siente como leer el estado de cuenta de un banco en otro idioma.
La buena noticia: son solo cuatro o cinco ideas, y se repiten casi igual en OpenAI, Google y Anthropic — cambian los números, no el concepto. Una vez que entiendes esa tabla una vez, la entiendes para siempre, sin importar qué proveedor uses.
Cómo se cobra, en una frase
Cualquier API de IA te cobra por separado lo que le mandas (input) y lo que te devuelve (output), medido en tokens — un token es, más o menos, tres cuartos de una palabra. Y en los tres proveedores grandes, el output cuesta entre 5 y 6 veces más que el input.
Sí, leíste bien: no es un error de la tabla. Es la primera cosa que hay que entender antes de optimizar nada.
El chisme: el caso del bot que gastaba $720 al mes por accidente
Un desarrollador documentó públicamente cómo su bot de analítica de videos de YouTube estaba costándole $720 al mes. El bot mandaba, en cada consulta, un bloque de metadatos de más de 80,000 tokens — siempre el mismo bloque, una y otra vez, en cada una de las cien consultas diarias. Nunca cambiaba. Y aun así, la API lo procesaba desde cero cada vez, como si fuera nuevo.
Activó una sola función — sin cambiar nada más del código, sin cambiar de modelo — y el gasto bajó a $72 al mes. Noventa por ciento menos. La función se llama prompt caching, y vas a entender exactamente por qué funcionó en un momento.
Por qué el output cuesta más: la física, no el marketing
Esto no es una decisión arbitraria de precios. Tiene que ver con cómo procesa la información un modelo:
- Leer tu input es paralelo. El modelo procesa todo lo que le mandaste — mil, diez mil, cien mil tokens — en una sola pasada. Es como leer un correo largo: tus ojos recorren el texto completo en segundos, sin importar cuánto mida.
- Escribir el output es secuencial. El modelo genera una palabra, y solo después de terminarla puede empezar a pensar la siguiente. No puede "adelantarse". Es como escribir un ensayo: cada oración depende de haber terminado la anterior.
Por eso generar 500 palabras de respuesta cuesta mucho más que leer 500 palabras de pregunta. No es que el proveedor quiera cobrarte más por "generosidad" — es que generar texto es, literalmente, un trabajo distinto y más pesado que leerlo.
Cómo leer cualquier tabla de precios (aunque cambien los nombres de las columnas)
Cada proveedor le pone un nombre distinto a las mismas cinco columnas. Esta es la traducción:
| Lo que ves en la tabla | Qué significa en realidad |
|---|---|
| Input / Base Input | Lo que pagas por cada token que le mandas al modelo |
| Output | Lo que pagas por cada token que el modelo te devuelve — siempre 5-6x más caro que el input |
| Cache Write | El sobreprecio único que pagas la primera vez que guardas un bloque de contenido repetido |
| Cache Read / Cache Hit | El descuento —casi siempre ~90%— que pagas cuando reutilizas ese bloque ya guardado |
| Batch | El descuento —casi siempre 50%— por procesar algo que no necesita respuesta inmediata |
Con esa tabla en la cabeza, ya puedes leer la de cualquier proveedor sin que te confunda el nombre exacto que le pusieron.
Los tres proveedores grandes, lado a lado
Los números cambian cada pocos meses — no los memorices, memoriza el patrón. Esta es la foto de julio de 2026, con un modelo económico y uno de alto rendimiento de cada uno:
| Proveedor | Modelo | Input $/M | Output $/M | Ratio | Descuento de caché |
|---|---|---|---|---|---|
| Anthropic | Modelo económico | $1.00 | $5.00 | 5x | ~90% |
| Anthropic | Modelo de alto rendimiento | $5.00 | $25.00 | 5x | ~90% |
| OpenAI | Modelo económico | $0.20 | $1.20 | 6x | ~90% |
| OpenAI | Modelo de alto rendimiento | $5.00 | $30.00 | 6x | ~90% |
| Modelo económico | $0.25 | $1.50 | 6x | ~90% | |
| Modelo de alto rendimiento | $2.00 | $12.00 | 6x | ~90% |
Nota el patrón que se repite en las seis filas: el ratio nunca baja de 5x. Da igual el proveedor que elijas — esa regla no cambia.
Prompt caching: la misma idea, tres formas distintas de facturarla
Aquí es donde sí conviene prestar atención al proveedor específico, porque el modelo mental cambia:
- Anthropic y OpenAI: caché "de alquiler corto". Pagas un sobreprecio (alrededor de 1.25x el precio normal) la primera vez que guardas un bloque, y después cada lectura te cuesta solo ~10% del precio normal. Se paga sola desde la segunda vez que la reutilizas.
- Google: dos modos distintos. Tiene una caché automática y gratuita que activa sola, sin que hagas nada — pero no garantiza que se use. Y tiene una caché explícita que sí garantiza el descuento, pero te cobra renta por hora mientras el contenido esté guardado ahí, la uses o no.
Esa diferencia de Google es la que más sorprende a quien viene de Anthropic u OpenAI: no es "pagar por escribir", es "pagar por tener guardado", como alquilar un casillero en vez de pagar cada vez que metes algo adentro. Si vas a usar caché explícita ahí, hay que acordarse de vaciar el casillero cuando ya no lo necesitas — si no, sigue cobrando aunque nadie lo use.
Cuándo SÍ conviene cachear, y cuándo te sale más caro
Este es el error más común, y es contraintuitivo: cachear algo que solo vas a usar una vez te cuesta más, no menos.
# Antes de activar caching, pregúntate:
- [ ] ¿Este bloque de contenido se va a repetir en más de una llamada?
Si la respuesta es no, no lo caches — el sobreprecio de escritura
no se va a pagar solo.
- [ ] ¿El bloque es lo suficientemente grande? (normalmente hace falta
un mínimo de ~1,000 tokens para que valga la pena)
- [ ] ¿El contenido cacheado va PRIMERO en el prompt, y lo que cambia
cada vez va al final? Un solo carácter distinto en el bloque
cacheado invalida todo el ahorro.
Batch: la palanca que casi nadie usa y debería
Si tu app no necesita responder en el momento — un reporte que se genera de noche, una clasificación masiva de miles de tickets, una evaluación que corre una vez por semana — casi todos los proveedores ofrecen un modo de procesamiento por lotes con 50% de descuento, tanto en input como en output, a cambio de esperar unas horas por el resultado en vez de segundos.
Es la palanca de ahorro más fácil de activar y la que más se queda sin usar, simplemente porque nadie revisa qué parte de su tráfico en realidad no necesitaba ser instantánea.
La estrategia que más ahorra: no uses el modelo caro para todo
Volviendo a la tabla de arriba — la diferencia entre el modelo económico y el de alto rendimiento de cualquier proveedor es de 5 a 25 veces en precio. La estrategia más simple y con más impacto es esta:
- Modelo económico para tareas simples y de alto volumen: clasificar, extraer datos, formatear, resumir cosas cortas.
- Modelo de alto rendimiento solo para lo que de verdad lo necesita: razonamiento complejo, decisiones con consecuencias, tareas donde equivocarse sale más caro que el ahorro en tokens.
El error típico es usar el modelo más caro por default para todo, "por si acaso" — cuando la mayoría de las tareas de una app real ni siquiera necesitan esa potencia.
Una palanca que ya conoces: gastar menos tokens desde el diseño
Si ya leíste el blog de Context Engineering, esto te va a sonar familiar: la forma más directa de bajar el gasto no es un truco de facturación, es simplemente mandarle al modelo menos información irrelevante. Cada token que no necesitabas mandar es un token que pagaste por nada — y si era parte del output, lo pagaste hasta 6 veces más caro.
Antes de revisar tu próxima factura
# Checklist para auditar el gasto de tu app de IA
- [ ] ¿Sabes qué porcentaje de tu costo es input vs output?
- [ ] ¿Hay contenido que se repite en cada llamada y no está cacheado?
- [ ] ¿Hay tráfico que no necesita respuesta inmediata y no está en batch?
- [ ] ¿Estás usando el modelo más caro para tareas que un modelo
económico resolvería igual de bien?
- [ ] ¿Tienes un límite de longitud de respuesta, o el modelo puede
generar output tan largo como quiera?
La próxima vez que abras el dashboard de facturación de cualquier proveedor, ya no vas a ver una tabla confusa — vas a ver exactamente las mismas cinco piezas, con nombres distintos, esperando a que las muevas a tu favor.
No te pierdas los próximos artículos
Suscríbete al newsletter y te avisamos cuando publiquemos contenido nuevo.