Tema

I concettimachine-learningNel grafo

Embedding del token

Il vettore iniziale associato a un token prima che gli strati lo mettano in relazione col contesto

Si lega a

è selezionato dalla matrice degli embedding; in nanoGPT si somma all'embedding posizionale; coincide con un embedding di parola quando ogni token è una parola intera

Da qui ci si arriva

  1. Matrice degli embedding

    Un parametro appreso con una riga per ogni token e una colonna per ogni dimensione del vettore

  2. Embedding di parola

    Il vettore statico associato a una parola intera nei modelli storici come word2vec

  3. Embedding posizionale

    Un vettore che introduce l'informazione sulla posizione occupata dal token, usato da nanoGPT e da altre architetture

  4. Rappresentazione contestuale

    Il vettore trasformato dagli strati del modello in funzione degli altri token accessibili

  5. Problema della sequenza

    La difficoltà di trattare lunghezze variabili, ordine e dipendenze lontane senza legarli a una finestra rigida di ingressi

  6. Domanda, chiave e valore

    Le tre proiezioni apprese ricavate dal vettore di ogni posizione: la domanda interroga, la chiave si lascia trovare, il valore è il contenuto che viene trasmesso

  7. Testa d'uscita

    L'ultimo strato che riporta il vettore alla taglia del vocabolario, da cui la softmax produce le probabilità del prossimo token

Dove se ne parla

  1. Dai token ai vettori: l'embedding