セマンティックキャッシュって何?
従来のキャッシュは「完全一致」頼み。2つのリクエストが一言一句同じでないと、前回の結果を返しません。セマンティックキャッシュはもっと賢く、「意味」がわかります。言い回しが変わっても、意味が同じなら「この質問、答えたことがある」と気づき、前の答えを再利用して再計算を省きます。普通のキャッシュと何が違う?
普通のキャッシュ:「文字」を見る「パスワードを変更する方法」と「パスワードを更新するには」は別のリクエスト扱いで、無駄にもう一度計算します。
セマンティックキャッシュ:「意味」を見る
質問を意味ベクトルに変え、文字ではなく「類似度」を比べます。意味が近ければキャッシュにヒットします。
どう動くのか
質問をベクトルにする埋め込みモデルでクエリを高次元ベクトルに符号化。意味が近いクエリほど、ベクトルも近くに並びます。
類似度を比べる
新しい質問が来たら、キャッシュ内のベクトルとの距離を計算。閾値を超えたら「同種の質問」と判定します。
ヒットしたら即返す
ヒット率が高ければ、多くのリクエストが大規模モデルを呼ばずに済み、コストも遅延も大きく下がります。
どこで活きるか
カスタマーサポートのQ&A、よくある質問、繰り返しの多いSaaS製品で特に価値があります。ユーザーが聞くのは結局、似たような質問ばかりだからです。ただし閾値を緩くしすぎると「似て見えて実は違う」質問を同じと誤判定し、間違った答えを返してしまいます。まとめ:セマンティックキャッシュは、「言い方は違えど同じ質問」だとAIに気づかせ、答えた分を再利用して安く速くする仕組みです。
コメント