Tema

I concettimachine-learningNel grafo

Motore di inferenza

Il software che carica i pesi di un modello e li esegue per produrre le risposte: gestisce la cache, il campionamento e le richieste

Si lega a

esegue l'architettura del blocco del Transformer; gestisce la cache di chiavi e valori; è il livello distinto dall'addestramento del bilancio delle evoluzioni

Da qui ci si arriva

  1. Modi di acquisto di un modello

    Le tre forme in cui un modello di linguaggio si compra: a servizio pagando a token, come modello privato su macchine a noleggio pagando a ore, o su macchine proprie come investimento; ogni forma sposta il punto dove i costi colpiscono

  2. Memoria unificata

    La memoria condivisa fra processore e scheda grafica, come nei chip Apple: un modello può usare tutta la memoria della macchina

  3. Parallelismo per livelli

    La spartizione del modello fra più computer per gruppi di strati: le attivazioni attraversano la rete da uno stadio all'altro a ogni token; somma la capacità delle macchine

  4. Parallelismo tensoriale

    La spartizione del modello per fette di matrice: ogni macchina tiene una parte di ogni strato e scambia le somme parziali a ogni passaggio; richiede un'interconnessione velocissima

Dove se ne parla

  1. I motori che eseguono i pesi: da llama.cpp allo streaming dal disco