El modelo Transformer fue propuesto en el paper 1Attention is All You Need2 3Vaswani et al.4 20175 y revolucion6 el campo del procesamiento del lenguaje natural 7NLP8. A diferencia de modelos anteriores como RNNs o LSTMs9 los Transformers no procesan la informaci10n de forma secuencial11 lo cual permite una mayor paralelizaci12n y eficiencia.
El modelo Transformer fue propuesto en el paper “Attention is All You Need” (Vaswani et al., 2017) y revolucionó el campo del procesamiento del ______.
Apuntes
El modelo Transformer fue propuesto en el paper “Attention is All You Need” (Vaswani et al., 2017) y revolucionó el campo del procesamiento del lenguaje natural (NLP). A diferencia de modelos anteriores como RNNs o LSTMs, los Transformers no procesan la información de forma secuencial, lo cual permite una mayor paralelización y eficiencia. Su estructura principal se basa en: Encoder: procesa la entrada y genera representaciones contextuales. Decoder: genera la salida a partir de las representaciones del encoder y salidas previas. 💡 GPT solo usa el decoder del Transformer, modificado para tareas de lenguaje autoregresivas. 2. Mecanismo de Atención Elemento clave: Self-Attention Permite al modelo "prestar atención" a todas las palabras de la secuencia para entender el contexto. Cada palabra se representa mediante tres vectores: Query (Q) Key (K) Value (V) La atención se calcula como: Attention(Q, K, V) = softmax(QKᵗ / √dₖ) * V Esto da pesos para combinar información de otras posiciones de la secuencia según su relevancia. 🔁 Multi-Head Attention: múltiples atenciones en paralelo permiten captar diferentes relaciones semánticas. 3. Arquitectura GPT GPT (Generative Pretra...
Estudia con juegos interactivos
Sube tus apuntes y genera flashcards, examenes y mas con IA
Empezar gratis