As redes neurais convolucionais se destacam no processamento de dados semelhantes a grade (como imagens), detectando padrões locais. No entanto, as CNNs são menos eficazes na captura de relacionamentos globais dentro dos dados. Os transformadores superam isso por meio do uso da autoatenção para ponderar a importância de diferentes partes dos dados inseridos como parte do todo maior. Embora as CNNs sejam usadas principalmente para tarefas como o reconhecimento de imagem, os transformadores foram adaptados para o processamento de texto e imagem, fornecendo um conjunto mais versátil de soluções.
- Representações vetoriais de entrada
- As representações vetoriais de entrada convertem sequências de entrada em vetores matemáticos que os modelos de IA consigam processar. Tokens (como palavras) são transformados em vetores que carregam informações semânticas e sintáticas aprendidas durante o treinamento.
- Codificação posicional
A codificação posicional adiciona sinais exclusivos à representação vetorial de cada token para indicar sua posição na sequência. Isso garante que o modelo preserve a ordem dos tokens e entenda seu contexto dentro da sequência.- Bloco do transformador
Cada bloco do transformador consiste em um mecanismo de autoatenção multicabeças e uma rede neural feed-forward. A autoatenção pondera a importância de diferentes tokens, enquanto a rede feed-forward processa essas informações.- Blocos lineares/softmax
O bloco linear mapeia representações internas complexas de volta ao domínio de entrada original. A função Softmax converte o resultado em uma distribuição de probabilidade, representando a confiança do modelo em cada previsão possível.
- A sequência de entrada é transformada em representações numéricas chamadas de representações vetoriais, que capturam o significado semântico dos tokens.
- A codificação posicional adiciona sinais exclusivos à incorporação de cada token para preservar a ordem dos tokens na sequência.
- O mecanismo de atenção multicabeças processa essas representações vetoriais para capturar diferentes relacionamentos entre os tokens.
- A normalização da camada e as conexões residuais estabilizam e aceleram o processo de treinamento.
- A saída da camada de autoatenção passa por redes neurais feed-forward para fins de transformações não lineares.
- Vários blocos de transformador são empilhados, cada um deles refinando o resultado da camada anterior.
- Em tarefas como a tradução, um módulo decodificador separado gera a sequência do resultado.
- O modelo é treinado por meio de aprendizado supervisionado para minimizar a diferença entre as previsões e o rótulo verdadeiro.
- Durante a inferência, o modelo treinado processa novas sequências de entrada para gerar previsões ou representações.
- Processamento de linguagem natural
- Os transformadores capacitam as máquinas a entender, interpretar e gerar linguagem humana com mais precisão. Isso viabiliza aplicações como a geração de resumos de documentos e criação de assistentes virtuais, que dependem de uma linguagem precisa de compreensão.
- Tradução de máquina
- Também é possível gerar traduções precisas e em tempo real entre idiomas. A capacidade dos transformadores de lidar com dependências e contexto de longo alcance melhora significativamente a precisão das traduções, especialmente em comparação com as soluções anteriores de localização e substituição.
- Reconhecimento de fala
- As aplicações de conversão de fala em texto podem ser aprimoradas por meio da transcrição precisa do idioma falado em texto escrito. Isso é particularmente útil no desenvolvimento de aplicações controladas por voz e na melhoria da acessibilidade para as pessoas com deficiência auditiva.
- Geração de imagens
- Os modelos de geração de imagens usam transformadores para criar mídias visuais a partir de descrições textuais, mesclando processamento de linguagem natural e visão computacional. Esse recurso é usado em aplicações criativas, de marketing e muitas outras.
- Análise de sequência de DNA
- Ao tratar sequências de DNA de forma semelhante ao texto, os transformadores podem ser treinados para prever mutações genéticas, entender padrões genéticos e identificar regiões relacionadas à doença.
- Análise da estrutura das proteínas
- Os transformadores podem modelar a natureza sequencial dos aminoácidos nas proteínas, prevendo suas estruturas em 3D. Essa compreensão é vital para a descoberta de fármacos e para o entendimento dos processos biológicos.