Tema

I concettimachine-learningNel grafo

Rinforzo da preferenze umane

Il rinforzo la cui ricompensa è un gusto: classifiche umane, un modello di ricompensa, e l'addestramento a produrre risposte preferite

Si lega a

è un caso di apprendimento per rinforzo; si contrappone al rinforzo con ricompense verificabili

Da qui ci si arriva

  1. Istruzione supervisionata

    La seconda fase: riaddestrare il modello su coppie di istruzione e risposta, perché impari a obbedire invece di continuare; è l'inizio dell'allineamento

Dove se ne parla

  1. L'addestramento che fa la differenza: dal rinforzo al ragionamento