• 3 minuti
  • Pubblicato

Anthropic introduce la filigrana invisibile nei testi generati da Claude

Barbara Carminati Autrice di cybersecurity e privacy QWERTYmag

Scritto da Barbara Carminati

Anthropic introduce la filigrana invisibile nei testi generati da Claude QWERTYmag © www.qwertymag.it
Anthropic introduce la filigrana invisibile nei testi generati da Claude © www.qwertymag.it

Anthropic ha annunciato l'implementazione di un sistema di filigrana invisibile nei testi prodotti da Claude per rispettare l'AI Act europeo. La soluzione consente di rilevare i contenuti generati dall'AI senza alterare qualità, creatività o leggibilità.

Anthropic si prepara a rendere più semplice l'identificazione dei testi generati dall'intelligenza artificiale, introducendo una filigrana invisibile nei contenuti prodotti da Claude. Questa novità nasce per adeguarsi all'AI Act dell'Unione Europea, che impone agli operatori AI di segnalare chiaramente i contenuti generati artificialmente. Anthropic è tra le prime aziende a condividere dettagli concreti su come intende applicare la filigrana ai testi di Claude.

Come funziona la filigrana invisibile di Claude

La filigrana sviluppata da Anthropic non è visibile agli utenti comuni e non modifica in alcun modo la qualità, la creatività o la leggibilità dei testi generati. Il sistema si ispira all'approccio SynthID-Text di Google DeepMind e agisce durante la generazione del testo, senza aggiungere caratteri nascosti o alterare il risultato finale. In pratica, la filigrana interviene nelle scelte casuali che il modello compie quando seleziona la parola successiva, utilizzando una chiave segreta e il contesto delle parole precedenti per lasciare una traccia statistica rilevabile solo da chi possiede la chiave.

Secondo Anthropic, questa tecnica non influisce sulle prestazioni: non richiede token aggiuntivi, non rallenta la generazione e non aumenta i costi. La filigrana sarà applicata globalmente fin dal lancio, poiché al momento non è possibile limitarla solo all'Europa. I modelli Claude rilasciati prima del 2 agosto 2026 rientrano nel periodo transitorio previsto dall'AI Act e riceveranno la filigrana nei prossimi mesi.

Eccezioni e limiti: codice e risposte fattuali

La filigrana non viene applicata quando il modello deve fornire una risposta esatta, come nel caso di calcoli matematici o generazione di codice, dove una scelta arbitraria potrebbe compromettere la correttezza del risultato. Ad esempio, dopo "2 + 2 =", la filigrana non interviene perché solo "4" è la risposta corretta. Lo stesso vale per il codice, dove la precisione è fondamentale. Tuttavia, nei commenti o nelle parti di codice dove sono possibili più alternative, la filigrana può essere presente senza influire sul funzionamento.

La rilevabilità della filigrana dipende dalla lunghezza del testo e dal livello di "entropia" nelle scelte del modello: testi più lunghi e con maggiore varietà offrono più indizi per il rilevamento. Piccole modifiche o correzioni di punteggiatura potrebbero non essere sufficienti a eliminare la filigrana, mentre una riscrittura completa sì. Anche le traduzioni generate da Claude porteranno la filigrana, poiché ogni parola viene scelta dal modello.

Un'API per il rilevamento e la gestione dei file

Anthropic sta sviluppando un'API che permetterà di stimare la probabilità che un testo sia stato generato da Claude, pur precisando che non è possibile attribuire con certezza la paternità del contenuto. La filigrana non consente di distinguere tra testi scritti interamente da Claude e testi pesantemente modificati da utenti umani. Inoltre, la filigrana di Claude non è in grado di identificare contenuti prodotti da altri modelli AI, che potrebbero adottare sistemi diversi.

Per quanto riguarda le immagini (PNG, JPG, SVG) generate da Claude, Anthropic adotterà un approccio differente: invece di inserire una filigrana nel file, verrà aggiunto un metadato di provenienza C2PA firmato crittograficamente, che attesta la creazione o modifica tramite Claude.

Articoli correlati