En cada paso, un modelo de lenguaje produce una probabilidad sobre todo su vocabulario y despues tres decisores la reducen. temperature reescala los logits: por debajo de 1 separa a los fuertes de los debiles y por encima acerca sus valores. top_k conserva solo los k mas altos y renormaliza. top_p acumula de mayor a menor hasta que el total alcanza p, y el candidato que cruza esa linea se queda. Las cuatro etapas que ves son esos cuatro momentos, y los candidatos eliminados permanecen en su sitio con el nombre del parametro que los descarto.
Los tres decisores no son conmutativos. Escalar primero implica que el truncado ve una distribucion ya transformada: subir temperature aplana la curva, top_p tarda mas en alcanzar su umbral y conserva mas candidatos. Truncar primero significa que el corte se decide sobre las probabilidades originales y temperature solo transforma a los supervivientes. Cada SDK elige un orden distinto, asi que esta herramienta expone la eleccion en lugar de esconder una detras de un valor por defecto e insinuar que existe un unico comportamiento estandar.
Las distribuciones de partida aqui estan construidas, no capturadas: tres formas elegidas porque cada una hace visible a un decisor distinto, un favorito claro, varios rivales igualados y una cola larga. En pantalla se indican como construidas, porque una herramienta que muestra causa y efecto no puede permitirse ser vaga sobre que mitad es real. Y la mitad real es justo la importante: temperature, top_k y top_p estan implementados como en un muestreador de verdad, asi que cada transicion que observas es el calculo autentico. Lo que una distribucion construida no puede darte es el tacto de un vocabulario real, y por eso cargar un modelo pequeno en el navegador se ofrece como el siguiente paso y no como un extra opcional.
Preguntas y respuestas frecuentes sobre este tema.
Actuan sobre cosas distintas. temperature transforma toda la distribucion sin eliminar a nadie: decide cuanto mejor se ve un candidato fuerte frente a uno debil. top_p elimina candidatos, cortando en cuanto la probabilidad acumulada alcanza tu umbral. No conviene ajustar ambos porque interfieren: subir temperature aplana la curva, de modo que el mismo top_p necesita mas candidatos para llegar al umbral y conserva tokens que creias excluidos. Mueve uno solo y observa la cadena para ver esa interferencia.
top_k es un cupo fijo: conserva los k candidatos mas probables, descarta el resto y renormaliza. top_p es una porcion fija de masa de probabilidad, tambien llamada muestreo por nucleo: recorre de mayor a menor sumando probabilidades y se detiene cuando el total alcanza p. El candidato que empuja la suma por encima de p se conserva, porque sin el no se alcanzaria el umbral, y por eso un p pequeno puede dejarte un unico token. top_k siempre deja el mismo numero de opciones; top_p deja un numero que varia segun lo seguro que este el modelo en ese paso.
Porque el ultimo paso es un sorteo, no una decision. Los tres parametros solo deciden que candidatos siguen siendo elegibles y con que pesos; el token que sale se extrae de ese conjunto ponderado. Por eso dos ejecuciones con parametros identicos comparten la misma reserva de candidatos y aun asi pueden caer en tokens distintos. Pulsa extraer otra vez aqui y veras la cadena completamente quieta mientras el resultado cambia: eso es toda la aleatoriedad restante. Poner temperature en 0 reduce la reserva a un unico candidato, y por eso se comporta de forma determinista.
Cambia uno cada vez y observa que le hace a la cadena, en lugar de buscar un numero recomendado. La dispersion suele indicar que aun son elegibles candidatos de baja probabilidad, asi que apretar el corte con un top_p o un top_k menor los elimina sin alterar la forma de los que quedan. La repeticion suele indicar que la reserva se ha colapsado sobre uno o dos candidatos dominantes, y ahi la palanca para volver a abrir la diferencia es subir temperature. Un metodo practico: fija dos de los tres, recorre el tercero de conservador a agresivo y detente donde el conjunto superviviente encaje con tu tarea. No hay un valor universalmente correcto, y por eso esta herramienta muestra el mecanismo en lugar de recomendar ajustes.
La distribucion de partida esta construida para la demostracion y asi se indica, de modo que no proviene de un modelo. Todo lo que ocurre despues se calcula en vivo en tu navegador y coincide con lo que hace un muestreador real. Por eso el mecanismo se transfiere a tus propias llamadas; los numeros concretos no. Tu llamada usa otro prompt y quiza otro modelo, otro tokenizador y otro orden de decisores, y los proveedores pueden anadir pasos que esta pagina no modela, como penalizaciones de repeticion o frecuencia. Si quieres una distribucion real con la que experimentar, carga un modelo pequeno en el navegador y la misma cadena se ejecutara sobre su salida autentica.
Tres, cada uno elegido para que sea otro decisor el que importe. Con un favorito claro, el truncado apenas tiene nada que quitar y temperature es el unico control con efecto visible. Con varios rivales igualados, un cambio pequeno en top_p cambia quien sobrevive, que es la forma mas directa de sentir por que la misma pregunta puede recibir respuestas distintas. Con una cola larga, el trabajo pesado lo hace top_k, que recorta una cola entera y no unos pocos rezagados. Elegir escenarios por forma y no por tema es deliberado: la forma es lo que determina que parametro merece la pena girar, y eso es lo que vale la pena aprender.