畳み込みニューラルネットワークは、局所的なパターンを検出することで、グリッド状のデータ (画像など) を処理することに優れています。ただし、CNN はデータ内のグローバルな関係を捉えることにはあまり効果を発揮しません。トランスフォーマーは、自己注意を使用し、入力データのさまざまな部分の重要度を、全体の一部として評価することでこれを克服しています。CNN は主に画像認識などのタスクに使用されますが、トランスフォーマーはテキストと画像の両方の処理に適応しており、より汎用性の高いソリューションセットを提供します。
- 入力埋め込み
- 位置エンコーディング
- トランスフォーマーブロック
- リニアブロック/ソフトマックスブロック
- 入力シーケンスが埋め込みと呼ばれる数値表現に変換され、トークンの意味論的意味を捉えます。
- 位置エンコーディングが、各トークンの埋め込みに一意のシグナルを追加して、シーケンス内のトークンの順序を維持します。
- マルチヘッド注意メカニズムが、それらの埋め込みを処理して、トークン間のさまざまな関係をキャプチャします。
- レイヤー正規化と残差接続により、トレーニングプロセスを安定させ、加速します。
- 自己注意レイヤーからの出力がフィードフォワードニューラルネットワークを通過して非線形変換向けに処理されます。
- 複数のトランスフォーマーブロックが積み重ねられ、それぞれが前のレイヤーの出力を改良します。
- 翻訳などのタスクでは、別のデコーダーモジュールが出力シーケンスを生成します。
- モデルは教師あり学習を使用してトレーニングされ、予測とグラウンドトゥルースの差を最小化します。
- 推論中、トレーニング済みのモデルは新しい入力シーケンスを処理して予測や表現を生成します。
- 自然言語処理
- 機械翻訳
- 音声認識
- 画像生成
- DNA 配列の解析
- タンパク質構造の解析