Benchmark e Valutazione AI

8 articoli

Mac Studio M5 Ultra cambia le regole della potenza desktop per l'AI

Il nuovo Mac Studio con chip M5 Ultra accelera fino al 90% rispetto al modello precedente. Prezzi fino a 12.299 dollari e memoria pensata per chi sviluppa AI senza passare dal cloud.

Leggi di più

Dream-RSI rewrites AI strategy testing for code and GPU tasks

Dream-RSI from Google DeepMind lets AI agents test new strategies using past search histories, cutting down on attempts and computation in coding and GPU optimization. The method highlights the limits of overly precise instructions and is now open source.

Leggi di più

OpenAI, agenti AI fuori controllo: violata la rete di Hugging Face

Un test interno di OpenAI ha portato centinaia di agenti AI a collaborare per aggirare le regole, sfruttare vulnerabilità e penetrare nella rete di Hugging Face, sollevando gravi interrogativi su sicurezza ed etica nello sviluppo dell'intelligenza artificiale.

Leggi di più

Google lancia Gemini 3.7 Flash con miglioramenti rapidi

A soli tre settimane dal debutto di Gemini 3.6 Flash, Google presenta la versione 3.7 Flash, che promette significativi passi avanti in coding, automazione e gestione documentale, puntando anche su un prezzo introduttivo più competitivo.

Leggi di più

Meta AI, test di sicurezza fallito: modello ha violato una vera azienda

Un errore nella configurazione di un ambiente di test ha permesso a un modello AI di Meta di accedere ai sistemi di una società reale, sollevando dubbi sulla sicurezza delle valutazioni AI e sulle responsabilità di chi le conduce

Leggi di più

GMKtec M3 Pro: local AI power in a mini PC you can hide behind your monitor

GMKtec M3 Pro changes what you can expect from a mini PC. It runs local AI models and juggles real work on a 12-core Intel chip, all in a box that disappears behind your screen. Here's how it holds up in daily work and AI tests.

Leggi di più

Bench 2.0: il nuovo benchmark analyzer riservato agli abbonati Premium

Bench 2.0 rinnova completamente l’esperienza di analisi dei benchmark su Tom’s Hardware, offrendo strumenti più intuitivi e potenti, ma accessibili solo agli abbonati Premium della piattaforma

Leggi di più

Anthropic Mythos 5, test sospesi dopo attacco AI a progetto open source

Durante una valutazione governativa nel Regno Unito, il modello AI Mythos 5 di Anthropic ha agito autonomamente online, inserendo codice malevolo e creando identità false, costringendo a interrompere i test di sicurezza

Leggi di più