Tu texto se codifica con el mismo byte-pair encoding que usa el modelo, así que el reparto que ves es el real y no una estimación basada en caracteres. Si la entrada se analiza como array de mensajes, cada mensaje se cuenta por separado y se muestra su porción del total. La vista previa de truncado recorre los mensajes en orden y descarta hasta que el resto quepa en tu límite, motivo por el cual el resultado suele quedarse corto en lugar de ajustarse al límite.
Para decidir cuántas reglas más caben en un system prompt. Para calcular cuántos turnos de historial conservar antes de que los más antiguos desaparezcan en silencio. Para explicar por qué una petición que ayer funcionaba hoy devuelve un error de longitud de contexto. Para comprobar si un resultado de herramienta muy largo merece la porción de ventana que ocupa.
Todo se codifica localmente en tu navegador, dentro de un Web Worker. Nada de lo que pegas se sube, se registra ni se envía a ningún proveedor de modelos. Los prompts suelen contener credenciales, datos de clientes y detalles de producto sin publicar, así que esto no es una opción configurable: no existe un servidor al que enviarlos.
Preguntas y respuestas frecuentes sobre este tema.
Aquí se cuenta el contenido que pegas. Una llamada real a la API también gasta tokens en el propio formato de chat, unos pocos por mensaje para marcadores de rol y separadores, además de los esquemas de herramientas que adjuntes y la respuesta del modelo. Toma esta cifra como el mínimo de tu entrada, no como la factura final.
Sí, y a menudo por mucho. Los modelos de la era GPT-4o usan o200k_base mientras que GPT-4 y GPT-3.5 usan cl100k_base; el vocabulario más reciente es bastante más eficiente con texto CJK. Anthropic y Llama usan tokenizadores completamente distintos, y por eso esta herramienta no los ofrece en lugar de mostrar una cifra equivocada.
Depende de quién gestione la conversación. Una llamada directa a la API falla con un error de longitud de contexto. Los frameworks y clientes de chat suelen recortar primero: lo más habitual es descartar los mensajes más antiguos, a veces fijando el system prompt y a veces resumiendo. El selector de estrategia te permite ver cada resultado sobre tu propia conversación.
No hay una proporción fija, y por eso estimarlo a ojo falla. Las palabras frecuentes suelen fundirse en un solo token mientras que los caracteres raros pueden costar varios, y o200k_base es bastante más eficiente aquí que cl100k_base. Pega una muestra representativa y cambia de codificación para ver la diferencia en tu propio texto.
Sí. En términos de presupuesto es un mensaje más, y uno largo compite por el mismo espacio que el historial. Lo único especial es que la mayoría de los clientes se niegan a descartarlo, que es justo lo que modela la estrategia de conservar system: el precio de fijarlo es que hay que sacrificar más historial.
No. El vocabulario de codificación se descarga a tu navegador y el recuento ocurre en un Web Worker de tu equipo. No hay ninguna petición que transporte tu texto, ni registros, ni proveedor de modelos implicado, algo importante porque los prompts suelen llevar credenciales y datos de clientes.