埋め込みモデルは各段落をベクトル、つまり意味を空間上の一点として位置づける数値の列に変換します。類似度は二つのベクトルのなす角のコサインで、ここでは 0 から 1 で表示されます。同じことを述べる段落は、共通の語がなくても近くに位置します。ツールはクエリと各候補をベクトル化し、クエリとのコサイン類似度で候補をランク付けし、top-k ラインを引きます。検索パイプラインでは、そのラインより上の段落だけが返されます。語の一致は、各候補がクエリの語をどれだけ含むかとして並行して計算され、キーワード検索エンジンが評価するものにほぼ相当します。
この二つの判定は、まさに検索が壊れる場面で食い違うからです。クエリの語の大半を共有しながら別のことを述べる段落は、キーワード検索では選ばれますが、セマンティック検索では top-k の外に置かれます。逆に共通語がまったくなくても正解である段落は、キーワード検索では見逃され、埋め込みでは拾われます。フラグは両方のケースを示し、証拠ビューは共有語を一つずつ列挙します。意味スコアは同じようには分解できません。段落全体のベクトルに由来するためで、ツールは語単位の帰属をでっち上げず、その事実を明記します。
クエリや段落には業務データが含まれがちなので、何もブラウザの外に出ません。デモモードは事前に構成されたベクトルを同梱し、実モードはモデルをブラウザにダウンロードしてローカルで推論します。API 呼び出しも記録もありません。誠実な限界として、デモの数値は解説用に構成されたものでありそのように表示されます。実モデルは小さな英語モデルであり、他言語のスコアは信頼できません。語の一致は意図的に単純化したキーワード検索の近似であり、BM25 の実装ではありません。
このテーマに関するよくある疑問と回答をまとめました。
ユーザーのクエリを Query に貼り、期待していた段落と実際に返ってきた段落を候補として貼り付けます。ランキングを見れば、モデルが本当にその段落を他より低く採点しているのか、差はどれくらいか、top-k にわずかに届かなかっただけなのかが分かります。ここで上位なのに本番で検索されない場合、問題はパイプラインの別の場所にあります。チャンク分割、フィルタリング、あるいは別の埋め込みモデルです。
使われている語に関係なく、二つのテキストが意味の上でどれだけ近いかを測る尺度です。埋め込みモデルは各テキストをベクトルに写像し、同じことを述べるテキスト同士が近くに来るようにします。類似度スコアはそのベクトルのなす角のコサインです。だからこそ「my laptop will not turn on」と「the computer fails to boot」は語を一つも共有していなくても高いスコアになり、セマンティック検索や RAG パイプラインが実際に順位付けに使う量でもあります。
ここでのスコアは 0 から 1 で、高いほど意味が近いことを示します。しかし普遍的なしきい値はありません。0.7 があるモデルでは強い一致でも、別のモデルでは平凡なことがあります。絶対値はモデルやテキストの種類によって変わるからです。モデルをまたいで信頼できるのは比較です。どの候補が一位か、次点との差はどれくらいか。検索パイプラインが固定スコア以上ではなく上位 k 件を取るのはそのためで、このツールが生の数値よりランキングを前面に出す理由でもあります。
キーワード検索は共有された語を評価し、意味類似度は共有された意味を評価します。両者はたいてい一致しますが、興味深い失敗は一致しない場所で起こります。クエリの語ばかり含みながら別のことを述べる段落はキーワード検索の誤検出であり、語をまったく共有しない言い換えはキーワード検索の盲点です。各行の二本のバーは二つの判定を並べ、フラグはまさにこの二種類の食い違いを示します。本番システムが両方の信号を組み合わせる(ハイブリッド検索)のは、それぞれ壊れ方が違うからです。
埋め込みモデルは、人間やデータパイプラインが関連ありとした膨大なテキストペアで訓練されます。質問とその回答、言い換え、タイトルとその記事などです。訓練は関連ペアのベクトルを近づけ、無関係なペアを遠ざけます。十分な例を経ると、空間の幾何そのものが意味を符号化します。その空間での方向と距離は、何が「同じ話題」として共起しやすいかを反映します。モデルは同義語辞典を持っているわけではなく、近さは訓練の統計的な結果です。モデルごとに描く地図が少しずつ違い、同じペアに違うスコアを付けるのもそのためです。
一つのクエリを最大 12 件の候補段落に対して採点し、二つのデモシナリオと実モデルモードを備えています。デモのスコアは解説用に構成されたベクトルによるもので、明確に表示され、語の一致、ランキング、判定は実際のコードで動きます。実モードは約 23 MB の小さな英語埋め込みモデルをブラウザにダウンロードします。他言語のスコアは信頼できず、ツールはそれを明記します。語の一致は意図的に単純化したキーワード視点の近似で、BM25 ではありません。文書のチャンク分割も、埋め込み API の呼び出しも、本番モデルの正確なスコアの再現もしません。それらのシステムが順位付けに使う仕組みを見せるためのツールです。