畳み込みニューラルネットワークは、局所的なパターンを検出することで、グリッド状のデータ (画像など) を処理することに優れています。ただし、CNN はデータ内のグローバルな関係を捉えることにはあまり効果を発揮しません。トランスフォーマーは、自己注意を使用し、入力データのさまざまな部分の重要度を、全体の一部として評価することでこれを克服しています。CNN は主に画像認識などのタスクに使用されますが、トランスフォーマーはテキストと画像の両方の処理に適応しており、より汎用性の高いソリューションセットを提供します。
- 入力埋め込み
- 入力埋め込みは、入力シーケンスを AI モデルが処理できる数学的ベクトルに変換します。トークン (単語など) は、トレーニング中に学習された意味情報と構文情報を持つベクトルに変換されます。
- 位置エンコーディング
位置エンコーディングは、各トークンの埋め込みに一意のシグナルを追加して、シーケンス内の位置を示します。これにより、モデルがトークンの順序を維持してシーケンス内でのそれらのコンテキストを理解できるようになります。- トランスフォーマーブロック
各トランスフォーマーブロックは、マルチヘッド自己注意メカニズムとフィードフォワードニューラルネットワークで構成されています。自己注意はさまざまなトークンの重要度を評価し、フィードフォワードネットワークはその情報を処理します。- リニアブロック/ソフトマックスブロック
リニアブロックは、複雑な内部表現を元の入力ドメインにマッピングします。次にソフトマックス関数が出力を確率分布に変換し、可能性のある各予測におけるモデルの信頼度を示します。
- 入力シーケンスが埋め込みと呼ばれる数値表現に変換され、トークンの意味論的意味を捉えます。
- 位置エンコーディングが、各トークンの埋め込みに一意のシグナルを追加して、シーケンス内のトークンの順序を維持します。
- マルチヘッド注意メカニズムが、それらの埋め込みを処理して、トークン間のさまざまな関係をキャプチャします。
- レイヤー正規化と残差接続により、トレーニングプロセスを安定させ、加速します。
- 自己注意レイヤーからの出力がフィードフォワードニューラルネットワークを通過して非線形変換向けに処理されます。
- 複数のトランスフォーマーブロックが積み重ねられ、それぞれが前のレイヤーの出力を改良します。
- 翻訳などのタスクでは、別のデコーダーモジュールが出力シーケンスを生成します。
- モデルは教師あり学習を使用してトレーニングされ、予測とグラウンドトゥルースの差を最小化します。
- 推論中、トレーニング済みのモデルは新しい入力シーケンスを処理して予測や表現を生成します。
- 自然言語処理
- トランスフォーマーにより、機械が人間の言語をより正確に理解、解釈、生成できるようになります。これは、正確な言語把握に依存するドキュメント要約や仮想アシスタントなどのアプリケーションをサポートします。
- 機械翻訳
- 言語間のリアルタイムで正確な翻訳も可能になります。トランスフォーマーは、長期的な依存関係とコンテキストを処理できるため、特に以前の検索/置換ソリューションと比較して、翻訳の精度が大幅に向上します。
- 音声認識
- 音声言語を正確に文字起こししてテキスト化することで音声テキスト変換アプリケーションを強化できます。これは、音声制御アプリケーションの開発や、聴覚障がい者のアクセシビリティの向上に特に有益です。
- 画像生成
- 画像生成モデルはトランスフォーマーを使用して、自然言語処理とコンピュータービジョンを結合し、テキストの記述から視覚メディアを作成します。この機能は、クリエイティブ系アプリケーションやマーケティングなどで使用されています。
- DNA 配列の解析
- DNA 配列をテキストと同様に扱うことで、遺伝子変異を予測したり、遺伝子パターンを理解したり、疾患に関連する領域を特定したりできるようにトランスフォーマーをトレーニングできます。
- タンパク質構造の解析
- トランスフォーマーはタンパク質中のアミノ酸の連続的な性質をモデル化し、その三次元構造を予測することができます。この理解は、創薬や生物学的プロセスの理解に非常に重要です。