Benchmark e Valutazione AI
8 articoliQWERTYmag confronta metodologie, dataset e condizioni di prova per capire che cosa misura davvero un punteggio e quando un risultato può trasferirsi all’uso quotidiano. Le analisi evidenziano contaminazione dei benchmark, limiti statistici e differenze tra test pubblici e valutazioni interne. Il focus è la qualità della misurazione e del confronto, non il lancio del modello o la sua semplice velocità di inferenza.
Mac Studio M5 Ultra cambia le regole della potenza desktop per l'AI
Il nuovo Mac Studio con chip M5 Ultra accelera fino al 90% rispetto al modello precedente. Prezzi fino a 12.299 dollari e memoria pensata per chi sviluppa AI senza passare dal cloud.
Dream-RSI rewrites AI strategy testing for code and GPU tasks
Dream-RSI from Google DeepMind lets AI agents test new strategies using past search histories, cutting down on attempts and computation in coding and GPU optimization. The method highlights the limits of overly precise instructions and is now open source.
OpenAI, agenti AI fuori controllo: violata la rete di Hugging Face
Un test interno di OpenAI ha portato centinaia di agenti AI a collaborare per aggirare le regole, sfruttare vulnerabilità e penetrare nella rete di Hugging Face, sollevando gravi interrogativi su sicurezza ed etica nello sviluppo dell'intelligenza artificiale.
Google lancia Gemini 3.7 Flash con miglioramenti rapidi
A soli tre settimane dal debutto di Gemini 3.6 Flash, Google presenta la versione 3.7 Flash, che promette significativi passi avanti in coding, automazione e gestione documentale, puntando anche su un prezzo introduttivo più competitivo.
Meta AI, test di sicurezza fallito: modello ha violato una vera azienda
Un errore nella configurazione di un ambiente di test ha permesso a un modello AI di Meta di accedere ai sistemi di una società reale, sollevando dubbi sulla sicurezza delle valutazioni AI e sulle responsabilità di chi le conduce
GMKtec M3 Pro: local AI power in a mini PC you can hide behind your monitor
GMKtec M3 Pro changes what you can expect from a mini PC. It runs local AI models and juggles real work on a 12-core Intel chip, all in a box that disappears behind your screen. Here's how it holds up in daily work and AI tests.
Bench 2.0: il nuovo benchmark analyzer riservato agli abbonati Premium
Bench 2.0 rinnova completamente l’esperienza di analisi dei benchmark su Tom’s Hardware, offrendo strumenti più intuitivi e potenti, ma accessibili solo agli abbonati Premium della piattaforma
Anthropic Mythos 5, test sospesi dopo attacco AI a progetto open source
Durante una valutazione governativa nel Regno Unito, il modello AI Mythos 5 di Anthropic ha agito autonomamente online, inserendo codice malevolo e creando identità false, costringendo a interrompere i test di sicurezza