Les réseaux neuronaux convolutifs excellent dans le traitement de données en forme de grille (comme les images) en détectant des motifs locaux. Cependant, les CNN sont moins efficaces pour capturer les relations globales au sein des données. Les transformeurs surmontent cet obstacle en utilisant l’autoattention pour évaluer l’importance des différentes parties des données d’entrée en tant que partie d’un tout plus grand. Alors que les CNN sont principalement utilisés pour des tâches telles que la reconnaissance d’images, les transformeurs ont été adaptés pour le traitement du texte et des images, offrant ainsi un ensemble de solutions plus polyvalent.
- Vecteurs d’intégration de l’entrée
- Les vecteurs d’intégration de l’entrée convertissent les séquences d’entrée en vecteurs mathématiques que les modèles d’IA peuvent traiter. Les jetons (tels que les mots) sont transformés en vecteurs qui transportent des informations sémantiques et syntaxiques apprises pendant l’entraînement.
- Encodage positionnel
L’encodage positionnel ajoute des signaux uniques à l’intégration de chaque jeton pour indiquer sa position dans la séquence. Cela permet au modèle de préserver l’ordre des jetons et de comprendre leur contexte dans la séquence.- Bloc transformeur
Chaque bloc transformeur se compose d’un mécanisme d’autoattention multitête et d’un réseau neuronal à propagation directe. L’autoattention pondère l’importance des différents jetons, tandis que le réseau à propagation directe traite ces informations.- Blocs linéaires et fonction softmax
Le bloc linéaire mappe des représentations internes complexes vers le domaine d’entrée d’origine. La fonction softmax convertit ensuite la sortie en une distribution de probabilité, représentant la confiance du modèle dans chaque prédiction possible.
- La séquence d’entrée est convertie en représentations numériques appelées vecteurs d’intégration, qui capturent le sens sémantique des jetons.
- L’encodage de position ajoute des signaux uniques à l’intégration de chaque jeton afin de préserver l’ordre des jetons dans la séquence.
- Le mécanisme d’attention multitête traite ces vecteurs d’intégration pour capturer différentes relations entre les jetons.
- La normalisation des couches et les connexions résiduelles stabilisent et accélèrent le processus d’entraînement.
- La sortie de la couche d’autoattention est ensuite transmise à des réseaux neuronaux à propagation directe pour des transformations non linéaires.
- Plusieurs blocs de transformeurs sont empilés, chacun améliorant la sortie de la couche précédente.
- Pour les tâches comme la traduction automatique, un module de décodage distinct génère la séquence de sortie.
- Le modèle est entraîné à l’aide de l’apprentissage supervisé, afin de minimiser l’écart entre les prédictions et la vérité terrain.
- Lors de l’inférence, le modèle entraîné traite de nouvelles séquences d’entrée pour générer des prédictions ou des représentations.
- Traitement du langage naturel
- Les transformeurs permettent aux machines de comprendre, d’interpréter et de générer le langage humain avec plus de précision. Cela soutient des applications telles que la synthèse de documents et les assistants virtuels, qui reposent sur une compréhension précise du langage.
- Traduction automatique
- Les transformeurs rendent possibles des traductions multilingues en temps réel avec une grande précision. Leur capacité à saisir le contexte et à gérer les dépendances à long terme améliore nettement la qualité des traductions, surtout en comparaison avec les anciennes méthodes basées sur des correspondances mot à mot.
- Reconnaissance vocale
- Les applications de reconnaissance vocale, qui convertissent la parole en texte, sont bonifiées grâce aux transformeurs. Cela est particulièrement utile pour développer des applications à commande vocale et améliorer l’accessibilité pour les personnes malentendantes.
- Génération d’images
- Les modèles de génération d’images utilisent les transformeurs pour créer du contenu visuel à partir de descriptions textuelles, alliant ainsi traitement du langage naturel et vision artificielle. Cette capacité est notamment utilisée dans les domaines créatifs, le marketing et plus encore.
- Analyse de séquence d’ADN
- En considérant les séquences d’ADN comme du texte, les transformeurs peuvent être entraînés à détecter des mutations génétiques, à repérer des motifs récurrents et à identifier des segments associés à certaines maladies.
- Analyse de la structure des protéines
- Grâce à leur aptitude à modéliser les séquences d’acides aminés, les transformeurs peuvent prédire la structure tridimensionnelle des protéines. Cette capacité est cruciale pour la découverte de médicaments et pour une meilleure compréhension des mécanismes biologiques.