Si lega a
riusa i pesi di attenzione e le proiezioni del pezzo sull'attenzione; cresce con la finestra di contesto; è ridotta dalle attenzioni raggruppate
Da qui ci si arriva
- Motore di inferenza
Il software che carica i pesi di un modello e li esegue per produrre le risposte: gestisce la cache, il campionamento e le richieste
- Attenzioni raggruppate
La famiglia di soluzioni nei pesi che comprime la cache di chiavi e valori: la GQA condivide chiavi e valori fra gruppi di teste, la MLA li comprime in un vettore latente; il motore può aggiungere la quantizzazione della cache al volo