17 settembre 2026
Dream-RSI: quando l’IA migliora… senza cambiare il modello
Negli ultimi anni molti successi dell’AI in matematica e design di algoritmi hanno seguito lo stesso schema: un agente propone soluzioni, un valutatore assegna uno score, e un loop iterativo raffina il risultato. La parte davvero determinante, però, è spesso nascosta: la exploration policy, cioè come l’agente decide cosa provare dopo. Un approccio recente — soprannominato “Dream-RSI” — mostra come ottimizzare quella policy usando solo i dati già prodotti dai run precedenti, senza riaddestrare o modificare i pesi del modello. In questo articolo vediamo cos’è, perché funziona, dove finisce l’ingegneria della ricerca e dove inizierebbe davvero la self-improvement, e cosa implica per chi costruisce sistemi di agenti (e strumenti) nel mondo reale.