English Version at the end

Los modelos de lenguaje o mejor llamados LLMs ( GPT’s ) están en todas partes. Hoy en día, los agentes de IA son tan populares que muchos asumen que integrarlos en una solución empresarial es tan simple como hacer preguntas en ChatGPT. La verdad, es un poco más interesante que eso, por lo tanto hoy explicaré unos de los temas que pocas veces ponemos atención en su diseño:  Algunos de los costos variables más importantes de estas soluciones de AI por su uso.

Nada en tecnología es gratis, y menos cuando se trata de modelos de IA en entornos de negocio. No es lo mismo un LLM para responder dudas cotidianas para hacer mi trabajo personal, que uno integrado en una solución empresarial, donde la velocidad, seguridad, consistencia y la precisión son fundamentales. Además, no basta con que el modelo «suene natural», sino que debe ser capaz de trabajar con los datos específicos de la empresa, entendiendo los procesos operativos correctos, procesándolos de forma eficiente y a un costo razonable.
Aquí es donde entran en juego los costos operativos y la infraestructura. El problema es que muchos subestiman estos costos hasta que ven su primera factura.

Lo que muchos no sabemos es que no todo caso de uso requiere una solución es IA, y no siempre el modelo más nuevo es la mejor opción. Pero claro, nos encanta usar la última tecnología disponible en el mercado… aunque eso no siempre sea lo mejor, más rentable y eficiente.

Por eso, en este artículo me voy a centrar en cómo calcular correctamente, algunos de los costos de los modelos de IA. En un próximo paper, hablaremos sobre cómo elegir el modelo adecuado para cada caso de uso, porque el LLM más avanzado no siempre es el que más conviene.

El ABC de los costos en los modelos de IA:

Para entender por qué los costos pueden salirse de control, primero hay que conocer el concepto de tokens y la estructura de costos de los modelos..

Los modelos de IA no procesan palabras completas, sino fragmentos de ellas, llamados tokens. Un token puede ser una palabra, parte de una palabra, un signo de puntuación o incluso un espacio en blanco ( ver el gráfico 01, como una palabra se descomponen en tokens -colores -, y cada modelo lo hace de diferente manera y eso es la forma de monetizar de un modelo). Los tokens se traducen a Tokens IDs, que son códigos numéricos únicos que permiten a los modelos de IA identificarlos y procesarlos en cada idioma de una manera matemática predictiva por decirlo de laguna menara ( cada token tiene un ID único).

A partir de estos IDs, el modelo, basado en su entrenamiento previo, predice la siguiente palabra o fragmento con la mayor precisión posible, optimizando la respuesta según su experiencia y datos aprendidos.

gráfico 01

Dependiendo del idioma, el número de tokens utilizados varía:
🔹 En inglés, una palabra suele representar 0.75 tokens en promedio.
🔹 En español, el número es mayor: entre 1.3 y 1.5 tokens por palabra más o menos.

Si revisas las calculadoras de costos de proveedores como OpenAI, Azure o Helicone, notarás varios términos técnicos. Aquí te explico los términos más importantes para que podamos usar estas herramientas de la mejor manera (OpenAI, 2024; Helicone, 2024; Azure, 2024):

Provider (Proveedor): La empresa que ofrece el modelo de IA (ej. OpenAI, Google, Anthropic, Cohere, Mistral).

Model (Modelo): Nombre o versión del modelo de IA (ej. GPT-4.0, Claude 3, Mistral 7B). Cada modelo tiene distintos costos y capacidades.

Context (Ventana de Contexto): Tamaño máximo de tokens que el modelo puede procesar en una sola llamada. Un mayor contexto permite respuestas más detalladas, pero aumenta el costo.

Input/1M: Costo por cada millón de tokens de entrada (tokens que el usuario envía en la consulta).

Output/1M: Costo por cada millón de tokens de salida (tokens generados por la IA en la respuesta).

Per Call: Costo fijo por cada llamada a la API, sin importar la cantidad de tokens usados.

Total (Per Call): Estimación del costo total de una interacción basada en el número de tokens utilizados.

Calculadoras de costos, Fuentes:

OpenAI & other LLM API Pricing Calculator;

Azure OpenAI Token Calculator, 2024;

Helicone LLM API Pricing, 2024.

Ejemplo de costos de una interacción con un LLM

Pasemos a un caso real de como debemos interpretar estas herramientas, Tomemos como referencia el modelo GPT-4o, que tiene los siguientes costos aproximados (OpenAI, 2024):

Para que nos quede más claro usaremos esta fórmula que nos dará una mejor idea de cómo estas herramientas calcular estos costos y podremos introducir en una para posterior en nuestro Business Cases de la solución completa.

Formula de costos de tokens
Formula de costos de tokens

Helicone LLM API Pricing, 2024.

Ahora, supongamos la siguiente conversación con un chatbot:
Escenario de conversación
Primera llamada:
🔹 Input: «Hola» (≈1 token)
🔹 Output: «¡Hola! ¿Cómo puedo ayudarte hoy?» (≈6 tokens)
Segunda llamada:
🔹 Input: «Hola, me puedes decir cómo se tramita una licencia de manejo en la Ciudad de México en 2025.» (≈18 tokens)
🔹 Output: «Para tramitar tu licencia… (respuesta completa)» (≈192 tokens)

Cálculo total de tokens
🔸 Tokens de entrada: 1 (call 1) + 18 (call 2) = 19 tokens
🔸 Tokens de salida: 6 (call 1) + 192 (call 2) = 198 tokens
🔸 Número total de llamadas: 2
Cálculo de costos
1. Costo por tokens de entrada:
19/1,000,000×2.50=0.0000475USD19 / 1,000,000 \times 2.50 = 0.0000475 USD19/1,000,000×2.50=0.0000475USD
2. Costo por tokens de salida:
198/1,000,000×10.00=0.00198USD198 / 1,000,000 \times 10.00 = 0.00198 USD198/1,000,000×10.00=0.00198USD
3. Costo fijo por llamadas:
2×0.0075=0.015USD2 \times 0.0075 = 0.015 USD2×0.0075=0.015USD
4. Costo total de la interacción:
0.015+0.0000475+0.00198≈0.01703USD0.015 + 0.0000475 + 0.00198 \approx 0.01703 USD0.015+0.0000475+0.00198≈0.01703USD

Ahora bien, en esta pequeña interacción el costo fue de 0.017 USD mas o menos 0.33 pesos Mexicanos… y si esto lo multiplicas por ciento de miles de conversaciones al dia por mes puede llegar a ser un problema y más si compartes respuesta largas y confusas y tienes procesos repetitivos que generan interacciones del modelo innecesaria.

Estos solo es el costo del uso de LLM de AI, a esto hay que agregarle la licencia del Agente y en caso dado los costos asociación del App para interactuar WhatsApp y algunos elementos mas que veremos en el Business Case a detalle mas adelante.

Este ejercicio demuestra que cada interacción tiene un costo medible. Para reducir gastos, es fundamental:
🔹 Optimizar los flujos de interacción para reducir tokens innecesarios.
🔹 Estructurar bien la data para minimizar la cantidad de llamadas.
🔹 Usar prompts bien diseñados para evitar respuestas largas y costosas.

Si no controlas estos factores, la IA se vuelve un pozo sin fondo. En el próximo artículo, exploraremos cómo elegir el modelo adecuado para cada caso de uso, para que no termines pagando cantidades innecesarias por el uso del modelo.
Porque innovar está bien, pero innovar con estrategia y rentabilidad es mucho mejor.

Referencias
Brown, P. F., et al. (1992). «Class-Based n-gram Models of Natural Language». Computational Linguistics.
OpenAI. (2024). Pricing & API Cost Calculator. Retrieved from OpenAI.
Helicone LLM API Pricing Calculator. (2024). Retrieved from Helicone.
Azure OpenAI Token Calculator. (2024). Retrieved from Azure.

_____________________________________________________________________

English Version

Understanding AI Model Costs
To understand why costs can get out of control, you first need to know about tokens and how AI models charge for usage.

What Are Tokens?
AI models don’t process whole words. Instead, they break text into small pieces called tokens. A token can be a whole word, part of a word, a punctuation mark, or even a space. (See Figure 01 for an example of how words break down into tokens—each color represents a different token, and every model does this differently. This is how AI models monetize their services.)

Each token is converted into a Token ID, a unique numeric code that helps the AI model recognize and process it in any language.

Using these Token IDs, the model predicts the next word or fragment based on previous training, aiming for the most accurate response possible.

Token Usage by Language
The number of tokens used depends on the language:

In English, words average 0.75 tokens each.
In Spanish, words average 1.3 to 1.5 tokens each.

Key Pricing Terms
If you check pricing calculators from providers like OpenAI, Azure, or Helicone, you’ll see several technical terms. Here are the most important ones:

Provider: The company that offers the AI model (e.g., OpenAI, Google, Anthropic, Cohere, Mistral).
Model: The specific AI model being used (e.g., GPT-4.0, Claude 3, Mistral 7B). Different models have different costs and capabilities.
Context Window: The maximum number of tokens a model can process in a single request. A larger window allows for more detailed responses but increases costs.
Input/1M: Cost per one million input tokens (tokens in the user’s request).
Output/1M: Cost per one million output tokens (tokens generated by the AI’s response).
Per Call: A fixed cost per API call, regardless of the number of tokens used.
Total (Per Call): The estimated total cost of an interaction based on the number of tokens processed.

A Real Example: AI Model Cost Calculation

Let’s analyze a real-world example using GPT-4o, which has the following approximate costs (OpenAI, 2024):

Input cost: $2.50 per million tokens
Output cost: $10.00 per million tokens
Fixed API call cost: $0.0075 per request
Now, imagine this conversation with an AI chatbot:

Chatbot Conversation Example

First request:

Second request:

*Some variation may occur in the token calculation in English.

Token Usage Calculation

Cost Breakdown

  1. Input token cost: 19/1,000,000×2.50=0.0000475USD19 / 1,000,000 \times 2.50 = 0.0000475 USD
  2. Output token cost: 198/1,000,000×10.00=0.00198USD198 / 1,000,000 \times 10.00 = 0.00198 USD
  3. Fixed API call cost: 2×0.0075=0.015USD2 \times 0.0075 = 0.015 USD
  4. Total interaction cost: 0.015+0.0000475+0.00198≈0.01703USD0.015 + 0.0000475 + 0.00198 ≈ 0.01703 USD

In this small interaction, the total cost is approximately $0.017 USD (about 0.33 Mexican pesos). Now, imagine multiplying this by hundreds of thousands of interactions per day. Costs can quickly spiral out of control—especially if responses are long and repetitive processes trigger unnecessary AI interactions.

This is only the cost of using an AI LLM. In addition, you need to factor in the agent’s license and, if applicable, the costs associated with the app for interacting via WhatsApp, along with other elements that we will explore in detail in the Business Case later on

How to Reduce AI Costs

This example shows that every AI interaction has a measurable cost. To minimize expenses, businesses should:

If these factors aren’t controlled, AI can become a money pit. In the next article, we’ll explore how to choose the right AI model for each use case so you don’t end up overpaying for model usage.

Because innovation is great—but innovating with strategy and cost efficiency is even better.

References