Les réseaux neuronaux convolutifs excellent dans le traitement des données de type grille (comme les images) en détectant les schémas locaux. Cependant, les CNN sont moins efficaces pour saisir les relations globales au sein des données. Les transformeurs surmontent cet obstacle en faisant appel à l’auto-attention pour évaluer l’importance des différentes parties des données d’entrée dans un ensemble plus large. Bien que les CNN soient principalement utilisés pour des tâches telles que la reconnaissance d’image, les transformeurs ont été adaptés pour le traitement du texte et de l’image, offrant ainsi un ensemble de solutions plus polyvalent.
- Plongements d’entrée
- Les plongements d’entrée convertissent les séquences d’entrée en vecteurs mathématiques que les modèles d’IA peuvent traiter. Les jetons (tels que les mots) sont transformés en vecteurs qui contiennent les informations sémantiques et syntaxiques apprises pendant l’entraînement.
- Encodage positionnel
L’encodage positionnel ajoute des signaux uniques aux plongements de chaque jeton pour indiquer leur position dans la séquence. Cela garantit que le modèle peut conserver l’ordre des jetons et comprendre leur contexte dans la séquence.- Bloc transformeurs
Chaque bloc transformeur se compose d’un mécanisme d’auto-attention à têtes multiples et d’un réseau neuronal à propagation avant. L’auto-attention évalue l’importance des différents jetons, tandis que le réseau à propagation avant traite ces informations.- Blocs linéaires/softmax
Les blocs linéaires remappent les représentations internes complexes vers le domaine d’entrée d’origine. La fonction softmax convertit ensuite la sortie en une distribution de probabilités qui représente le niveau de fiabilité du modèle pour chaque prédiction possible.
- La séquence d’entrée est transformée en représentations digitales appelées « plongements », qui capturent la signification sémantique des jetons.
- L’encodage positionnel ajoute des signaux uniques aux plongements de chaque jeton pour préserver leur ordre dans la séquence.
- Le mécanisme d’attention multi-tête traite ces plongements pour capturer différentes relations entre les jetons.
- La normalisation des couches et les connexions résiduelles stabilisent et accélèrent le processus d’entraînement.
- La sortie de la couche d’auto-attention passe par des réseaux neuronaux à propagation avant pour effectuer les transformations non linéaires.
- Plusieurs blocs transformeurs sont empilés, chacun affinant la sortie de la couche précédente.
- Pour certaines tâches comme la traduction, un module décodeur séparé génère la séquence de sortie.
- Le modèle est entraîné via un apprentissage supervisé pour minimiser la différence entre les prédictions et la réalité.
- Pendant l’inférence, le modèle entraîné traite de nouvelles séquences d’entrée pour générer des prédictions ou des représentations.
- Traitement du langage naturel
- Les transformeurs permettent aux machines de comprendre, d’interpréter et de générer du langage humain plus précisément. Cela permet diverses applications telles que la synthèse de documents et les assistants virtuels, qui reposent sur une compréhension précise du langage.
- Traduction automatique
- Il est également possible d’effectuer des traductions précises et en temps réel d’une langue à l’autre. La capacité des transformeurs à gérer le contexte et les dépendances à long terme améliore considérablement la précision des traductions, en particulier par rapport aux solutions de type rechercher-remplacer précédentes.
- Reconnaissance vocale
- Les applications de synthèse vocale peuvent être améliorées en transcrivant avec précision le langage parlé en texte écrit. Cela est particulièrement utile pour développer des applications à commande vocale et améliorer l’accessibilité pour les malentendants.
- Génération d’images
- Les modèles de génération d’images utilisent des transformeurs pour créer des supports visuels à partir de descriptions textuelles, en fusionnant le traitement du langage naturel et la vision par ordinateur. Cette fonctionnalité est utilisée dans les applications créatives, le marketing, etc.
- Analyse de séquences d’ADN
- En traitant les séquences d’ADN de la même manière que le texte, les transformeurs peuvent être entraînés pour prédire les mutations génétiques, comprendre les schémas génétiques et identifier les régions liées à la maladie.
- Analyse de la structure des protéines
- Les transformeurs peuvent modéliser la nature séquentielle des acides aminés dans les protéines et prévoir leurs structures 3D. Cette compréhension est essentielle pour la découverte de médicaments et la compréhension des processus biologiques.