L’esame che doveva mettere in crisi l’AI ora mette in crisi i ricercatori
Humanity's Last Exam era nato per mettere in difficoltà qualunque modello AI, ma in un anno i punteggi sono cresciuti rapidamente. Il caso apre una domanda più ampia: i benchmark statici riescono ancora a misurare davvero le capacità dell’intelligenza artificiale? L'articolo L’esame che doveva mettere in crisi l’AI ora mette in crisi i ricercatori proviene da Agenda Digitale.