En cada paso, un modelo de lenguaje produce una probabilidad sobre todo su vocabulario y después tres decisores la reducen. temperature reescala los logits: por debajo de 1 separa a los fuertes de los débiles y por encima acerca sus valores. top_k conserva solo los k más altos y renormaliza. top_p acumula de mayor a menor hasta que el total alcanza p, y el candidato que cruza esa línea se queda. Las cuatro etapas que ves son esos cuatro momentos, y los candidatos eliminados permanecen en su sitio con el nombre del parámetro que los descartó.
Los tres decisores no son conmutativos. Escalar primero implica que el truncado ve una distribución ya transformada: subir temperature aplana la curva, top_p tarda más en alcanzar su umbral y conserva más candidatos. Truncar primero significa que el corte se decide sobre las probabilidades originales y temperature solo transforma a los supervivientes. Cada SDK elige un orden distinto, así que esta herramienta expone la elección en lugar de esconder una detrás de un valor por defecto e insinuar que existe un único comportamiento estándar.
Las distribuciones de partida aquí están construidas, no capturadas: tres formas elegidas porque cada una hace visible a un decisor distinto, un favorito claro, varios rivales igualados y una cola larga. En pantalla se indican como construidas, porque una herramienta que muestra causa y efecto no puede permitirse ser vaga sobre qué mitad es real. Y la mitad real es justo la importante: temperature, top_k y top_p están implementados como en un muestreador de verdad, así que cada transición que observas es el cálculo auténtico. Lo que una distribución construida no puede darte es el tacto de un vocabulario real, y por eso cargar un modelo pequeño en el navegador se ofrece como el siguiente paso y no como un extra opcional.
Preguntas y respuestas frecuentes sobre este tema.
Actúan sobre cosas distintas. temperature transforma toda la distribución sin eliminar a nadie: decide cuánto mejor se ve un candidato fuerte frente a uno débil. top_p elimina candidatos, cortando en cuanto la probabilidad acumulada alcanza tu umbral. No conviene ajustar ambos porque interfieren: subir temperature aplana la curva, de modo que el mismo top_p necesita más candidatos para llegar al umbral y conserva tokens que creías excluidos. Mueve uno solo y observa la cadena para ver esa interferencia.
top_k es un cupo fijo: conserva los k candidatos más probables, descarta el resto y renormaliza. top_p es una porción fija de masa de probabilidad, también llamada muestreo por núcleo: recorre de mayor a menor sumando probabilidades y se detiene cuando el total alcanza p. El candidato que empuja la suma por encima de p se conserva, porque sin él no se alcanzaría el umbral, y por eso un p pequeño puede dejarte un único token. top_k siempre deja el mismo número de opciones; top_p deja un número que varía según lo seguro que esté el modelo en ese paso.
Porque el último paso es un sorteo, no una decisión. Los tres parámetros solo deciden qué candidatos siguen siendo elegibles y con qué pesos; el token que sale se extrae de ese conjunto ponderado. Por eso dos ejecuciones con parámetros idénticos comparten la misma reserva de candidatos y aun así pueden caer en tokens distintos. Pulsa extraer otra vez aquí y verás la cadena completamente quieta mientras el resultado cambia: eso es toda la aleatoriedad restante. Poner temperature en 0 reduce la reserva a un único candidato, y por eso se comporta de forma determinista.
Cambia uno cada vez y observa qué le hace a la cadena, en lugar de buscar un número recomendado. La dispersión suele indicar que aún son elegibles candidatos de baja probabilidad, así que apretar el corte con un top_p o un top_k menor los elimina sin alterar la forma de los que quedan. La repetición suele indicar que la reserva se ha colapsado sobre uno o dos candidatos dominantes, y ahí la palanca para volver a abrir la diferencia es subir temperature. Un método práctico: fija dos de los tres, recorre el tercero de conservador a agresivo y detente donde el conjunto superviviente encaje con tu tarea. No hay un valor universalmente correcto, y por eso esta herramienta muestra el mecanismo en lugar de recomendar ajustes.
La distribución de partida está construida para la demostración y así se indica, de modo que no proviene de un modelo. Todo lo que ocurre después se calcula en vivo en tu navegador y coincide con lo que hace un muestreador real. Por eso el mecanismo se transfiere a tus propias llamadas; los números concretos no. Tu llamada usa otro prompt y quizá otro modelo, otro tokenizador y otro orden de decisores, y los proveedores pueden añadir pasos que esta página no modela, como penalizaciones de repetición o frecuencia. Si quieres una distribución real con la que experimentar, carga un modelo pequeño en el navegador y la misma cadena se ejecutará sobre su salida auténtica.
Tres, cada uno elegido para que sea otro decisor el que importe. Con un favorito claro, el truncado apenas tiene nada que quitar y temperature es el único control con efecto visible. Con varios rivales igualados, un cambio pequeño en top_p cambia quién sobrevive, que es la forma más directa de sentir por qué la misma pregunta puede recibir respuestas distintas. Con una cola larga, el trabajo pesado lo hace top_k, que recorta una cola entera y no unos pocos rezagados. Elegir escenarios por forma y no por tema es deliberado: la forma es lo que determina qué parámetro merece la pena girar, y eso es lo que vale la pena aprender.