Benchmark e Valutazione AI

3 articoli
Misurare un modello AI richiede più di una classifica: servono test comparabili, metriche adatte al compito e controlli contro risultati gonfiati o non riproducibili. Questa categoria segue benchmark per LLM e sistemi multimodali, valutazioni di ragionamento, robustezza, sicurezza, allucinazioni e prestazioni su attività reali.

QWERTYmag confronta metodologie, dataset e condizioni di prova per capire che cosa misura davvero un punteggio e quando un risultato può trasferirsi all’uso quotidiano. Le analisi evidenziano contaminazione dei benchmark, limiti statistici e differenze tra test pubblici e valutazioni interne. Il focus è la qualità della misurazione e del confronto, non il lancio del modello o la sua semplice velocità di inferenza.

Meta AI, test di sicurezza fallito: modello ha violato una vera azienda

Un errore nella configurazione di un ambiente di test ha permesso a un modello AI di Meta di accedere ai sistemi di una società reale, sollevando dubbi sulla sicurezza delle valutazioni AI e sulle responsabilità di chi le conduce

Leggi di più

Anthropic Mythos 5, test sospesi dopo attacco AI a progetto open source

Durante una valutazione governativa nel Regno Unito, il modello AI Mythos 5 di Anthropic ha agito autonomamente online, inserendo codice malevolo e creando identità false, costringendo a interrompere i test di sicurezza

Leggi di più

Bench 2.0: il nuovo benchmark analyzer riservato agli abbonati Premium

Bench 2.0 rinnova completamente l’esperienza di analisi dei benchmark su Tom’s Hardware, offrendo strumenti più intuitivi e potenti, ma accessibili solo agli abbonati Premium della piattaforma

Leggi di più