Tu texto se codifica con el mismo byte-pair encoding que usa el modelo, asi que el reparto que ves es el real y no una estimacion basada en caracteres. Si la entrada se analiza como array de mensajes, cada mensaje se cuenta por separado y se muestra su porcion del total. La vista previa de truncado recorre los mensajes en orden y descarta hasta que el resto quepa en tu limite, motivo por el cual el resultado suele quedarse corto en lugar de ajustarse al limite.
Para decidir cuantas reglas mas cabe en un system prompt. Para calcular cuantos turnos de historial conservar antes de que los mas antiguos desaparezcan en silencio. Para explicar por que una peticion que ayer funcionaba hoy devuelve un error de longitud de contexto. Para comprobar si un resultado de herramienta muy largo merece la porcion de ventana que ocupa.
Todo se codifica localmente en tu navegador, dentro de un Web Worker. Nada de lo que pegas se sube, se registra ni se envia a ningun proveedor de modelos. Los prompts suelen contener credenciales, datos de clientes y detalles de producto sin publicar, asi que esto no es una opcion configurable: no existe un servidor al que enviarlos.
Preguntas y respuestas frecuentes sobre este tema.
Aqui se cuenta el contenido que pegas. Una llamada real a la API tambien gasta tokens en el propio formato de chat, unos pocos por mensaje para marcadores de rol y separadores, ademas de los esquemas de herramientas que adjuntes y la respuesta del modelo. Toma esta cifra como el minimo de tu entrada, no como la factura final.
Si, y a menudo por mucho. Los modelos de la era GPT-4o usan o200k_base mientras que GPT-4 y GPT-3.5 usan cl100k_base; el vocabulario mas reciente es bastante mas eficiente con texto CJK. Anthropic y Llama usan tokenizadores completamente distintos, y por eso esta herramienta no los ofrece en lugar de mostrar una cifra equivocada.
Depende de quien gestione la conversacion. Una llamada directa a la API falla con un error de longitud de contexto. Los frameworks y clientes de chat suelen recortar primero: lo mas habitual es descartar los mensajes mas antiguos, a veces fijando el system prompt y a veces resumiendo. El selector de estrategia te permite ver cada resultado sobre tu propia conversacion.
No hay una proporcion fija, y por eso estimarlo a ojo falla. Las palabras frecuentes suelen fundirse en un solo token mientras que los caracteres raros pueden costar varios, y o200k_base es bastante mas eficiente aqui que cl100k_base. Pega una muestra representativa y cambia de codificacion para ver la diferencia en tu propio texto.
Si. En terminos de presupuesto es un mensaje mas, y uno largo compite por el mismo espacio que el historial. Lo unico especial es que la mayoria de los clientes se niegan a descartarlo, que es justo lo que modela la estrategia de conservar system: el precio de fijarlo es que hay que sacrificar mas historial.
No. El vocabulario de codificacion se descarga a tu navegador y el recuento ocurre en un Web Worker de tu equipo. No hay ninguna peticion que transporte tu texto, ni registros, ni proveedor de modelos implicado, algo importante porque los prompts suelen llevar credenciales y datos de clientes.