状態空間モデルって何?
文章のような系列を処理するとき、Transformerは「全単語が他の全単語を見る」方式です。情報は豊富ですが、長さに対して計算量が「二乗」で膨らみます。状態空間モデル(SSM)は別の道を選びます。ゆっくり流れる川のように、常に更新される「隠れ状態」が、これまで見た情報を圧縮して後ろへ運び、読みながら更新していきます。長い系列ほど、メモリも時間も節約できます。Transformerとの違いは?
Transformer:全員が全員を見る各位置がすべての位置に注目。性能は高いが、長くなるほど高コスト。
SSM:状態のリレー
ひとつの「状態」を渡していく方式で、超長文で強みを発揮します。
なぜ急に注目されたか
線形の計算量長さが2倍でもコストは約2倍。二乗ではありません。長文がお得です。
長距離の依存
「前の文脈と今が遠く離れている」場面でも記憶を保てます。
ハードウェア親和性
計算パターンが規則的で、GPU上で効率よく動きます。
代表例と限界
Mambaは最も有名なSSMの変種のひとつ。SSMは長系列やリアルタイム推論で有望ですが、「全体を細かく比較する」タスクではTransformerがまだ優勢です。未来は置き換えではなく、補完関係でしょう。まとめ:状態空間モデルは系列処理の「新しい路線」。圧縮した状態のリレーで、長いテキストの効率を手に入れます。
コメント