Las redes neuronales convolucionales sobresalen en el procesamiento de datos similares a la cuadrícula (como imágenes) mediante la detección de patrones locales. Sin embargo, las CNN son menos eficaces para capturar las relaciones globales dentro de los datos. Los transformadores superan esto mediante el uso de la autoatención para sopesar la importancia de diferentes partes de los datos de entrada como parte del todo general. Si bien las CNN se utilizan principalmente para tareas como el reconocimiento de imágenes, los transformadores se han adaptado para el procesamiento tanto de texto como de imágenes, lo que proporciona un conjunto de soluciones más versátil.
- Incrustaciones de entrada
- Las incrustaciones de entrada convierten las secuencias de entrada en vectores matemáticos que los modelos de IA pueden procesar. Los tokens (como las palabras) se transforman en vectores que llevan información semántica y sintáctica aprendida durante la formación.
- Codificación posicional
La codificación posicional agrega señales únicas a la incrustación de cada token para indicar su posición en la secuencia. Esto garantiza que el modelo pueda preservar el orden de los tokens y comprender su contexto dentro de la secuencia.- Bloque de transformador
Cada bloque de transformador consta de un mecanismo de autoatención de varias cabezas y una red neuronal prealimentada. La autoatención pondera la importancia de los diferentes tokens, mientras que la red prealimentada procesa esta información.- Bloques lineales/softmax
El bloque lineal asigna representaciones internas complejas al dominio de entrada original. La función softmax convierte la salida en una distribución de probabilidad, lo que representa la confianza del modelo en cada predicción posible.
- La secuencia de entrada se transforma en representaciones numéricas llamadas incrustaciones, que capturan el significado semántico de los tokens.
- La codificación posicional agrega señales únicas a la incrustación de cada token para preservar el orden de los tokens en la secuencia.
- El mecanismo de atención de varias cabezas procesa estas incrustaciones para capturar diferentes relaciones entre tokens.
- La normalización de capas y las conexiones residuales estabilizan y aceleran el proceso de formación.
- El resultado de la capa de autoatención pasa a través de redes neuronales prealimentadas para transformaciones no lineales.
- Se apilan varios bloques de transformador, y cada uno ajusta el resultado de la capa anterior.
- En tareas como la traducción, un módulo de decodificador separado genera la secuencia de salida.
- El modelo se forma mediante el aprendizaje supervisado para minimizar la diferencia entre las predicciones y la verdad básica.
- Durante la inferencia, el modelo formado procesa nuevas secuencias de entrada para generar predicciones o representaciones.
- Procesamiento del lenguaje natural
- Los transformadores permiten a las máquinas comprender, interpretar y generar lenguaje humano con mayor precisión. Esto admite aplicaciones como el resumen de documentos y los asistentes virtuales, que dependen de un lenguaje de comprensión preciso.
- Traducción automática
- También es posible realizar traducciones precisas en tiempo real entre idiomas. La capacidad de los transformadores para manejar dependencias de largo alcance y contexto mejora significativamente la precisión de las traducciones, en especial en comparación con soluciones anteriores de búsqueda y reemplazo.
- Reconocimiento de voz
- Las aplicaciones de voz a texto se pueden mejorar mediante la transcripción precisa del lenguaje hablado en texto escrito. Esto es particularmente útil para desarrollar aplicaciones controladas por voz y mejorar la accesibilidad para las personas con discapacidad auditiva.
- Generación de imágenes
- Los modelos de generación de imágenes utilizan transformadores para crear medios visuales a partir de descripciones textuales, fusionando el procesamiento del lenguaje natural y la visión por computadora. Esta competencia se utiliza en aplicaciones creativas, marketing y más.
- Análisis de secuencias de ADN
- Al tratar las secuencias de ADN de manera similar al texto, se puede formar a los transformadores para predecir mutaciones genéticas, comprender patrones genéticos e identificar regiones relacionadas con enfermedades.
- Análisis de la estructura de proteínas
- Los transformadores pueden modelar la naturaleza secuencial de los aminoácidos en las proteínas y predecir sus estructuras 3D. Esta comprensión es vital para el descubrimiento de medicamentos y la comprensión de los procesos biológicos.