Categoria

benchmark AI

3 articoli associati a questo tag.

3 agosto 2026

Perché i benchmark AI stanno diventando inaffidabili (e cosa possiamo imparare da questa crisi)

I benchmark per valutare i modelli AI stanno mostrando crepe sempre più evidenti: punteggi perfetti ottenuti senza risolvere nulla, dataset contaminati da soluzioni finite nel training, test design fragili e infrastrutture aggirabili con exploit banali. In questo articolo vediamo come si arriva a risultati gonfiati, perché le leaderboard non sono più un segnale solido di progresso e quali caratteristiche dovrebbe avere un benchmark moderno per tornare a misurare davvero competenze (soprattutto in ambito agentico e coding).

22 luglio 2026

Kimi K3 e l’era dei pesi aperti: cosa cambia davvero per chi fa frontend

Moonshot ha alzato l’asticella dei modelli open-weight con Kimi K3: un mixture-of-experts multimodale da 2,8T parametri e 1M di contesto, competitivo su benchmark di coding e UI. Ma tra hallucinations, valutazioni non sempre comparabili e requisiti hardware proibitivi, la vera domanda per i team frontend è: quando conviene usarlo (o auto-ospitarlo) e come cambiano workflow, tooling e governance?