Las redes neuronales convolucionales destacan en el procesamiento de datos con formato cuadrícula (como las imágenes) mediante la detección de patrones locales. Sin embargo, estas redes neuronales son menos eficaces a la hora de capturar las relaciones globales dentro de los datos. Para superar esta dificultad, los transformadores usan la autoatención para determinar la importancia de las diferentes partes de los datos de entrada como partes del conjunto completo. Aunque las redes neuronales convolucionales se utilizan principalmente para tareas como el reconocimiento de imágenes, los transformadores se han adaptado para el procesamiento de texto e imágenes, lo que proporciona un conjunto de soluciones más versátil.
- Incrustaciones de entrada
- Las incrustaciones de entrada convierten las secuencias de entrada en vectores matemáticos que los modelos de IA son capaces de procesar. Los tokens (por ejemplo, las palabras) se transforman en vectores que transportan información semántica y sintáctica aprendida durante el entrenamiento.
- Codificación posicional
La codificación posicional añade señales únicas a la incrustación de cada token para indicar su posición en la secuencia. Esto garantiza que el modelo pueda conservar el orden de los tokens y comprender su contexto dentro de la secuencia.- Bloque transformador
Todos los bloques transformadores constan de un mecanismo de autoatención con varios cabezales y una red neural prealimentada. La autoatención determina la importancia de los distintos tokens, y la red prealimentada procesa esa información.- Bloques lineales y softmax
El bloque lineal asigna representaciones internas complejas al dominio de entrada original. A continuación, la función softmax convierte la salida en una distribución de probabilidad, y representa la confianza del modelo en cada una de las posibles predicciones.
- La secuencia de entrada se transforma en representaciones numéricas denominadas incrustaciones que capturan el significado semántico de los tokens.
- La codificación posicional añade señales únicas a la incrustación de cada token para preservar el orden de esos tokens en la secuencia.
- El mecanismo de atención multicabezal procesa estas incrustaciones para captar diferentes relaciones entre los tokens.
- La normalización de las capas y las conexiones residuales estabilizan y aceleran el proceso de entrenamiento.
- La salida de la capa de autoatención atraviesa las redes neuronales prealimentadas para llevar a cabo transformaciones no lineales.
- Se emplean varios bloques transformadores, y cada uno refina la salida de la capa anterior.
- En tareas como la traducción, un módulo decodificador independiente genera la secuencia de salida.
- El modelo se entrena por medio de aprendizaje supervisado para reducir al mínimo las diferencias entre las predicciones y la verdad fundamental.
- Durante la inferencia, el modelo entrenado procesa nuevas secuencias de entrada para generar predicciones o representaciones.
- Procesamiento de lenguaje natural
- Los transformadores permiten a las máquinas comprender, interpretar y generar lenguaje humano con mayor precisión. Esto hace posibles aplicaciones como el resumen de documentos y los asistentes virtuales, que requieren un lenguaje preciso.
- Traducción automática
- Estos modelos también hacen posibles las traducciones precisas y en tiempo real entre distintos idiomas. La capacidad de los transformadores para gestionar contextos y dependencias de largo alcance mejora significativamente la precisión de las traducciones, especialmente en comparación con las soluciones de búsqueda y sustitución anteriores.
- Reconocimiento de voz
- Las aplicaciones de voz a texto se pueden mejorar gracias a las transcripciones del lenguaje oral. Esto resulta especialmente útil para desarrollar aplicaciones controladas por voz y mejorar la accesibilidad para las personas con limitaciones auditivas.
- Generación de imágenes
- Los modelos de generación de imágenes utilizan transformadores para crear medios visuales a partir de descripciones textuales, un proceso en el que fusionan el procesamiento del lenguaje natural y la visión informática. Esta capacidad se utiliza en aplicaciones creativas, marketing y mucho más.
- Análisis de secuencias de ADN
- Al tratar las secuencias de ADN de manera similar al texto, los transformadores pueden entrenarse para predecir mutaciones genéticas, comprender patrones genéticos e identificar regiones relacionadas con enfermedades.
- Análisis de la estructura de las proteínas
- Los transformadores pueden modelar la naturaleza secuencial de los aminoácidos de las proteínas y predecir sus estructuras en 3D. Esta comprensión es vital para descubrir fármacos y comprender los procesos biológicos.