Un modelo de embeddings convierte cada pasaje en un vector: una lista de numeros que situa su significado como un punto en el espacio. La similitud es el coseno del angulo entre dos vectores, mostrado aqui de 0 a 1: los pasajes que tratan de lo mismo quedan cerca aunque no compartan palabras. La herramienta vectoriza tu consulta y cada candidato, los ordena por su similitud coseno con la consulta y traza tu linea top-k; en una canalizacion de recuperacion, solo lo que queda por encima de esa linea se devuelve. El solapamiento de palabras se calcula en paralelo como la proporcion de palabras de la consulta que contiene cada candidato, que es aproximadamente lo que premiaria un buscador por palabras clave.
Porque los dos veredictos discrepan justo en los casos que rompen la recuperacion. Un pasaje puede compartir la mayoria de las palabras de la consulta y significar otra cosa: la busqueda por palabras clave lo elige y la semantica lo deja fuera del top-k. Otro puede no compartir ninguna palabra y ser la respuesta correcta: las palabras clave lo pierden y los embeddings lo recuperan. Las marcas senalan ambos casos y la vista de evidencia detalla las palabras compartidas una a una. La puntuacion semantica no puede descomponerse igual: proviene de vectores de pasaje completo, y la herramienta lo dice en lugar de inventar atribuciones por palabra.
Las consultas y pasajes suelen contener datos de negocio, asi que nada sale del navegador: el modo demo incluye vectores construidos precomputados y el modo real descarga el modelo al navegador y ejecuta la inferencia localmente, sin llamadas a API ni registros. Los limites honestos: los numeros de la demo estan construidos para la guia y asi se indican; el modelo real es un modelo pequeno en ingles, por lo que las puntuaciones en otros idiomas no son fiables; y el solapamiento de palabras es una aproximacion deliberadamente simple a la busqueda por palabras clave, no una implementacion de BM25.
Preguntas y respuestas frecuentes sobre este tema.
Pega la consulta del usuario como Query y luego pega el pasaje que esperabas junto con los que realmente volvieron, como candidatos. El ranking muestra si el modelo realmente puntua tu pasaje por debajo de los demas, cuanta distancia hay y si solo se quedo fuera por poco del top-k. Si aqui queda alto pero en produccion sigue sin recuperarse, el problema esta en otra parte de la canalizacion: el troceado, los filtros o un modelo de embeddings distinto.
Es una medida de lo cerca que estan dos textos en significado, independientemente de las palabras que usen. Un modelo de embeddings asigna a cada texto un vector de modo que los textos sobre lo mismo queden cerca; la puntuacion es el coseno del angulo entre esos vectores. Por eso “my laptop will not turn on” y “the computer fails to boot” pueden puntuar alto sin compartir palabras, y por eso es la medida por la que realmente ordenan la busqueda semantica y las canalizaciones RAG.
Las puntuaciones van de 0 a 1: mas alto significa mas cercano en significado. Pero no hay un umbral universal: 0.7 puede ser una coincidencia fuerte con un modelo y mediocre con otro, porque los valores absolutos cambian con el modelo y el tipo de texto. Lo que se mantiene entre modelos es la comparacion: que candidato queda primero y cuanta distancia hay con el siguiente. Por eso las canalizaciones toman el top-k por ranking en lugar de todo lo que supere una puntuacion fija, y por eso esta herramienta destaca el ranking antes que los numeros.
La busqueda por palabras clave premia las palabras compartidas; la similitud semantica premia el significado compartido. Coinciden la mayoria de las veces, y los fallos interesantes viven donde no. Un pasaje lleno de las palabras de tu consulta que habla de otra cosa es un falso positivo de palabras clave; una parafrasis sin palabras comunes es un punto ciego de palabras clave. Las dos barras de cada fila ponen ambos veredictos lado a lado y las marcas senalan exactamente esos dos desacuerdos. Los sistemas de produccion suelen combinar ambas senales (busqueda hibrida) precisamente porque cada una falla de forma distinta.
Los modelos de embeddings se entrenan con enormes cantidades de pares de texto marcados como relacionados: preguntas con sus respuestas, parafrasis, titulos con sus articulos. El entrenamiento acerca los vectores de los pares relacionados y aleja los no relacionados; con suficientes ejemplos, la propia geometria codifica el significado: direccion y distancia reflejan lo que tiende a coocurrir como el mismo tema. El modelo no tiene un diccionario de sinonimos: la cercania es un resultado estadistico del entrenamiento, y por eso modelos distintos dibujan mapas ligeramente distintos y puntuan diferente el mismo par.
Puntua una consulta frente a un maximo de 12 pasajes candidatos, con dos escenarios de demostracion y un modo de modelo real. Las puntuaciones de la demo provienen de vectores construidos para la guia, claramente etiquetados, y el solapamiento, el ranking y el veredicto ejecutan el codigo real. El modo real descarga al navegador un pequeno modelo de embeddings en ingles (unos 23 MB); las puntuaciones en otros idiomas no son fiables y la herramienta lo indica. El solapamiento es una aproximacion deliberadamente simple a la vista de palabras clave, no BM25. No trocea documentos, no llama a ninguna API de embeddings ni reproduce las puntuaciones exactas de tu modelo de produccion: muestra el mecanismo por el que esos sistemas ordenan.