C’è una ragione se Humanity’s Last Exam è diventato uno dei benchmark più osservati nel settore dell’intelligenza artificiale. I test storici, come MMLU, sono ormai saturi: secondo il paper pubblicato su Nature il 28 gennaio 2026, molti modelli superano il 90% su benchmark popolari, e questo rende più difficile misurare i progressi reali dei sistemi di frontiera. HLE nasce per colmare questo vuoto: 2.500 domande, oltre cento materie, quesiti costruiti per essere precisi, verificabili e difficili da risolvere con semplice recupero di informazioni online.
approfondimento
Humanity’s Last Exam, cos’è e perché è uno dei benchmark più quotati
2.500 domande, oltre cento materie, quesiti costruiti per essere precisi, verificabili e difficili da risolvere con semplice recupero di informazioni online. Google, OpenAI e Anthropic usano i test di Humanity’s Last Exam per rivendicare progressi che vanno letti con cautela. Cosa dicono i grafici di Artificial Analysis
giornalista

Continua a leggere questo articolo
Canali




