15 settembre 2026
Dai 5x ai 10x: come spremere WebGPU per l’inferenza AI nel browser
Portare l’inferenza AI nel browser non è più una curiosità: con WebGPU si vedono già miglioramenti di 5x–10x quando si scende di livello e si ottimizzano davvero grafi e kernel. In questo articolo vediamo perché la strada passa da un motore di inferenza dedicato, dalla scrittura di kernel WebGPU ad hoc e dalla fusione delle operazioni per ridurre letture/scritture in memoria.