Convolutionele neurale netwerken blinken uit in het verwerken van rasterachtige gegevens (zoals afbeeldingen) door lokale patronen te detecteren. CNN's zijn echter minder effectief in het vastleggen van globale relaties binnen de gegevens. Transformatoren lossen dit op door zelfaandacht te gebruiken om het belang van verschillende delen van de invoergegevens als onderdeel van het grotere geheel af te wegen. CNN's worden voornamelijk gebruikt voor taken zoals beeldherkenning, maar transformatoren zijn aangepast voor zowel tekst- als beeldverwerking, waardoor ze een veelzijdiger pakket oplossingen bieden.
- Invoerinbeddingen
- Invoerinbeddingen converteren invoersequenties naar wiskundige vectoren die AI-modellen kunnen verwerken. Tokens (zoals woorden) worden omgezet in vectoren die semantische en syntactische informatie bevatten die tijdens de training is geleerd.
- Positionele codering
Positionele codering voegt unieke signalen aan de inbedding van elke token toe om de positie ervan in de sequentie aan te geven. Daardoor kan het model de volgorde van tokens behouden en de context binnen de sequentie begrijpen.- Transformatorblok
Elk transformatorblok bestaat uit een zelfaandachtmechanisme met meerdere punten en een voorwaarts doorvoerend neuraal netwerk. Zelfaandacht weegt het belang van verschillende tokens af, terwijl het voorwaarts doorvoerende netwerk deze informatie verwerkt.- Lineaire/softmax-blokken
Het lineaire blok wijst complexe interne weergaven weer toe aan het oorspronkelijke invoerdomein. De softmax-functie zet de uitvoer vervolgens om in een waarschijnlijkheidsverdeling, die het vertrouwen van het model in elke mogelijke voorspelling weergeeft.
- De invoersequentie wordt omgezet in numerieke weergaven die inbeddingen worden genoemd en die de semantische betekenis van de tokens vastleggen.
- Positionele codering voegt unieke signalen aan de inbedding van elke token toe om de volgorde van tokens in de sequentie te behouden.
- Het aandachtsmechanisme met meerdere punten verwerkt deze inbeddingen om verschillende relaties tussen tokens vast te leggen.
- Normalisatie van lagen en restverbindingen stabiliseren en versnellen het trainingsproces.
- De uitvoer van de zelfaandachtlaag gaat door voorwaarts doorvoerende neurale netwerken voor niet-lineaire transformaties.
- Er worden meerdere transformatorblokken gestapeld, die elk de uitvoer van de vorige laag verfijnen.
- Bij taken zoals vertalingen wordt de uitvoersequentie gegenereerd door een aparte decodermodule.
- Het model wordt getraind via begeleid leren om het verschil tussen voorspellingen en fundamentele waarheid te minimaliseren.
- Tijdens de gevolgtrekking verwerkt het getrainde model nieuwe invoersequenties om voorspellingen of weergaven te genereren.
- Natuurlijke taalverwerking
- Dankzij transformatoren kunnen machines menselijke taal nauwkeuriger begrijpen, interpreteren en genereren. Dit ondersteunt toepassingen zoals het samenvatten van documenten en virtuele assistenten, die afhankelijk zijn van een exact begrip van taal.
- Machinevertaling
- Ook nauwkeurige realtime vertalingen worden mogelijk. Het vermogen van transformatoren om afhankelijkheden over lange afstand en context te verwerken, verbetert de nauwkeurigheid van vertalingen aanzienlijk, vooral vergeleken met eerdere oplossingen op basis van zoeken en vervangen.
- Spraakherkenning
- Spraak-naar-tekst-toepassingen kunnen worden verbeterd door gesproken taal nauwkeurig om te zetten in geschreven tekst. Dit is met name nuttig bij het ontwikkelen van spraakgestuurde toepassingen en het verbeteren van de toegankelijkheid voor slechthorenden.
- Beeldgeneratie
- Modellen voor het genereren van beelden maken gebruik van transformatoren om visuele media te creëren op basis van tekstbeschrijvingen, waarbij natuurlijke taalverwerking en computervisie worden gecombineerd. Deze mogelijkheid wordt gebruikt in creatieve toepassingen, marketing en meer.
- DNA-sequentieanalyse
- Door DNA-sequenties op dezelfde manier te behandelen als tekst, kunnen transformatoren worden getraind om genetische mutaties te voorspellen, genetische patronen te begrijpen en ziektegerelateerde gebieden te identificeren.
- Analyse van eiwitstructuren
- Transformatoren kunnen de sequentiële aard van aminozuren in eiwitten modelleren en hun 3D-structuren voorspellen. Dit inzicht is van vitaal belang voor het uitvinden van geneesmiddelen en het begrijpen van biologische processen.