Transformerって何?
Transformerは、2017年にGoogleのチームが論文で発表したニューラルネットワークのアーキテクチャです。登場は水中爆弾のようで、それまでのテキスト処理の常識を吹き飛ばし、今ではほぼすべての大規模言語モデルの共通の土台になっています。GPTもClaudeもGeminiも、中身はTransformerです。何を解決したのか
再帰型ネットワーク(RNN)は遅すぎた昔は文を1語ずつ読み、前の語を終えてから次の語へ。並列にできず、文が長くなると遅くなったり忘れたりしました。
Transformerは文全体を一度に見る
「アテンション」で各単語が文の中のほかの全単語を直接見られます。一度に並列処理でき、速くて長距離も覚えています。
中身はどんな形か
エンコーダーとデコーダー古典的な構成は二部。エンコーダーが入力を「読み」、デコーダーが出力を「書く」。翻訳は「一文読んで、一文書く」作業です。
マルチヘッドアテンション
「見方」は1つではなく、複数のアテンションが同時に働き、単語同士の関係を別々の角度から捉えます。
位置エンコーディング
全部を並列に処理するため、順序がわかりません。そこで「どれが先か」を別途教えます。
なぜAIを支配するのか
拡張性が桁違い。データ・計算・モデルサイズを増やすほど能力が伸び、天井が見えません。これが「スケーリング則」の舞台であり、大規模モデル時代の号砲です。まとめ:Transformerはアテンションで文全体を並列に読み、現代の大規模言語モデルの共通の土台です。
コメント