I watermark sui video e sulle immagini li conosciamo tutti: sono quei loghi o scritte semitrasparenti sovrapposti nell’angolo per dire “questo contenuto è mio“. Altri ancora sono invisibili, annidati nel file che contiene l’immagine e impercettibili all’occhio umano.
In questi giorni sono diventati un argomento molto comune perché l’idea è quella di aiutare le persone a capire quando una immagine è genuina o generata dal computer. Ma come si fa a mettere un watermark su un testo fatto di parole senza che chi lo genera se ne accorga e possa rimuoverlo?
C’è la notizia: Anthropic ha annunciato l’arrivo di un watermark invisibile per il testo generato da Claude. Il “segnale”, secondo l’azienda, sarà molto resistente perché rimarrà attivo anche quando le persone copieranno e incolleranno la risposta, resistendo persino a piccole modifiche e riscritture. Come è possibile?
Ancora non lo sappiamo ma possiamo fare delle ipotesi e provare a spiegare in parole semplici come funzionano le principali tecnologie di questo settore (il watermarking dei testi), immaginando tre scenari principali.
La “Sinfonia delle Parole” (Il metodo statistico)
Iniziamo usando una analogia: la scelta del gelato. I modelli linguistici generano una parola dopo l’altra seguendo scenari statistici. Immaginiamo che il modello scriva una frase in cui deve indicare un gusto di gelato da passeggio. Dopo la parola “cono”, si può scegliere un gusto tra cioccolato, panna, fragola o pistacchio. In condizioni normali, la scelta è del tutto casuale.
Invece, gli ingegneri hanno pensato un approccio semplice ma sofisticato. Ogni volta che Claude deve scegliere la parola successiva in una frase, lo fa pescando tra due liste di parole, che sono state divise segretamente in due gruppi: parole “verdi” e parole “rosse”.
Ecco cosa succede senza cambiare il significato della frase né la qualità dell’italiano, l’intelligenza artificiale viene spinta a preferire leggermente le parole del gruppo “verde”. La prima conseguenza voluta è che un lettore umano legge un testo assolutamente naturale. Invece, il software di controllo che conosce la strategia e ha accesso alla lista delle parole rosse e verdi, notando una presenza sproporzionata di parole “verdi”, capirà subito che la frase è stata scritta da Claude.
Questa tecnica funziona praticamente sempre, anche se un utente cancella un paio di frasi o cambia qualche aggettivo. Infatti, la concentrazione statistica di parole “verdi” nel resto del testo rimane comunque troppo alta per essere una coincidenza umana. Ci sono lavori scientifici che hanno trovato questo approccio e verificato che sia efficace.

Il “Timbro della Sintassi” (Il metodo dello stile)
Anche qui usiamo un’analogia: l’impronta stilistica di uno scrittore. Sappiamo bene infatti che ogni autore umano ha il suo modo di costruire le frasi. C’è chi usa frasi corte e incisive, chi predilige le subordinate, chi usa spesso determinate metafore. È più sottile e articolato di così, ma questo tipo di predisposizione di ciascuno di noi è misurabile con una tecnica che si chiama stilometria.
In questo scenario, il watermark non dipende da quali singole parole vengono scelte, ma da come vengono collegate tra loro. L’intelligenza artificiale potrebbe essere programmata per seguire schemi grammaticali o stilistici impercettibili, ad esempio combinando la lunghezza dei periodi o la posizione degli avverbi secondo un codice preciso.
Anche in questo caso abbiamo una tecnica “inventata”, studiata e sperimentata dai ricercatori che ritengono che funzioni molto bene perché è una tecnica molto resistente. Anche se un utente prova a parafrasare il testo usando dei sinonimi, la struttura concettuale di fondo tende a rimanere invariata, rendendo il marchio ancora visibile ai software di analisi. A meno che, ovviamente, qualcuno non riscriva completamente il testo in un altro modo. Ma lo sforzo in questo caso sarebbe tale che tanto varrebbe scriverselo sin dall’inizio.
Gli “Inchiostri Invisibili” (I caratteri Unicode nascosti)
Terzo e ultimo approccio, il più debole, come si capisce, fin dall’analogia che lo descrive: il messaggio scritto col succo di limone.
Qui bisogna fare un piccolo salto “tecnico” per capire come viene rappresentato il testo sullo schermo, a prescindere che sia scritto da umani o da macchine. Tutti i computer e gli smartphone usano migliaia di codici e simboli per mostrare lettere e numeri a schermo. La codifica più importante e universalmente diffusa è l’Unicode. Tra i tantissimi simboli, esistono caratteri speciali detti “a larghezza zero”: sono veri e propri spazi vuoti che il sistema operativo legge, ma che l’occhio umano non vede.
L’obiettivo è sfruttarli, inserendoli nel testo. Con questa tecnica, l’intelligenza artificiale inserisce questi caratteri invisibili all’interno delle parole o tra gli spazi della risposta, componendo un vero e proprio codice nascosto. La tecnica funziona ma, fra le tre, è quella che ha dei limiti.
È perfetta per il semplice copia-incolla sul web. Tuttavia, basta incollare il testo in un blocco note che non supporta il testo con attributi stilistici o salvarlo in formato testo puro (.txt o .md) per fare “pulizia” ed eliminare questi caratteri. Per questo motivo, è probabile che Anthropic non lo usi o, nel caso, che lo usi solo come supporto ad altre tecniche più solide.

Quale strada sceglierà Anthropic?
Tutto questo apre alla domanda fondamentale: quale tecnica verrà scelta da Anthropic per fare dei watermark nei testi generati da Claude? Molto probabilmente vedremo una combinazione delle prime due opzioni (scelta di parole e struttura delle frasi).
Questo permetterà alle scuole, alle università, alle aziende e ai sistemi di verifica di riconoscere l’impronta di Claude in modo scientificamente certo, garantendo al contempo che la qualità, la fluidità e l’utilità del testo rimangano identiche per i lettori in carne e ossa. Oppure qualcuno riuscirà a creare delle contromisure e a “smontare” il watermark di Anthropic, magari sfruttando l’intelligenza artificiale?














