26 settembre 2026
Un “Jev” personale con 5$: fine-tuning di un LLM per fare classificazione in meno di un secondo
Creare un modello che prenda un contesto, una domanda e una lista di opzioni e restituisca una singola scelta in tempi sub-secondo non è fantascienza, né richiede budget importanti. Con un fine-tuning mirato di Qwen 3.5 (4B) e una pipeline pragmatica (LoRA + vLLM) si ottiene un classificatore solido, economico e abbastanza veloce da stare dietro a casi d’uso real-time. In questo articolo vediamo l’impostazione: quali dataset usare, come formattare gli esempi, come organizzare training/val/test, cosa aspettarsi in termini di latenza e perché una GPU “più grossa” non è sempre la scelta migliore.