Tema

I concettimachine-learningNel grafo

Pesi di attenzione

I coefficienti, prodotti dalla softmax sui punteggi fra domanda e chiavi, con cui una posizione pesa le altre; sommano a 1

Si lega a

derivano da domanda, chiave e valore tramite la softmax; decidono la somma dei valori; sono azzerati sulle posizioni future dalla maschera causale

Da qui ci si arriva

  1. Meccanismo di attenzione

    Il calcolo che produce, per una posizione, una somma pesata dei valori delle altre posizioni, con pesi decisi dalla compatibilità fra domanda e chiavi

  2. Domanda, chiave e valore

    Le tre proiezioni apprese ricavate dal vettore di ogni posizione: la domanda interroga, la chiave si lascia trovare, il valore è il contenuto che viene trasmesso

  3. Maschera causale

    Il vincolo che impedisce a ogni posizione di usare le posizioni successive, ponendo a meno infinito i loro punteggi prima della softmax

  4. Cache di chiavi e valori

    La memoria che il motore riempie durante la generazione con le chiavi e i valori già calcolati, per non ricalcolarli: possibile perché il passato è fisso; nell'addestramento non esiste

Dove se ne parla

  1. Dai vettori alle relazioni: l'attenzione