Inferenza e Prestazioni AI
3 articoliL’inferenza è la fase in cui un modello già addestrato produce risposte, immagini, previsioni o altre elaborazioni. Tempi di risposta, capacità concorrente, memoria e costo per richiesta diventano decisivi quando un prototipo passa all’uso quotidiano o a un servizio con molti utenti.
Benchmark, test e analisi confrontano hardware, provider, quantizzazione, batching e diverse dimensioni di modello, distinguendo risultati di laboratorio da prestazioni osservabili in produzione. Gli aggiornamenti seguono nuove GPU, acceleratori, runtime e modelli più efficienti, traducendo i miglioramenti tecnici in costi operativi e qualità percepita.
Benchmark, test e analisi confrontano hardware, provider, quantizzazione, batching e diverse dimensioni di modello, distinguendo risultati di laboratorio da prestazioni osservabili in produzione. Gli aggiornamenti seguono nuove GPU, acceleratori, runtime e modelli più efficienti, traducendo i miglioramenti tecnici in costi operativi e qualità percepita.
OpenAI aggiorna ChatGPT: risposte più affidabili anche per gli utenti gratis
OpenAI introduce GPT-5.6 Sol per abbonati e GPT-5.6 Luna per tutti, con maggiore accuratezza, controllo sul ragionamento e chat testuali illimitate per gli utenti gratuiti. Cambiano limiti e protezioni, ma non i costi
Amazon limita l’uso interno di EC2 per gestire la domanda di CPU
Amazon Web Services ha chiesto ai propri ingegneri di ridurre l’utilizzo delle istanze EC2 a bassa occupazione per liberare capacità di calcolo destinata ai clienti esterni, in risposta alla crescente pressione delle applicazioni AI
ByteDance sviluppa un modello AI da 10 trilioni di parametri
ByteDance sta addestrando un modello di intelligenza artificiale che punta a raggiungere i 10 trilioni di parametri, superando di gran lunga le dimensioni dei principali modelli cinesi e avvicinandosi ai leader statunitensi come Anthropic