OpenAI introduce il watermarking ChatGPT nell’Unione Europea, una misura diretta per conformarsi alle nuove regole di trasparenza previste dall’AI Act. La società ha annunciato che inizierà ad applicare un segnale invisibile ai testi generati da ChatGPT e Codex per gli utenti idonei all’interno dell’UE. Parallelamente, gli sviluppatori che utilizzano le API potranno abilitare questa funzione su alcuni modelli specifici. È importante sottolineare che non si tratta di un’etichetta visibile, bensì di una traccia statistica incorporata nelle scelte lessicali del modello, progettata per essere rilevata da strumenti appositi.

Il watermarking in Europa: un passo verso la trasparenza

Il fulcro di questa iniziativa è la provenienza del contenuto. L’AI Act impone ai fornitori di sistemi di intelligenza artificiale generativa di rendere identificabili i contenuti prodotti automaticamente, in un formato leggibile anche da altri sistemi. Il watermarking ChatGPT risponde a questa esigenza: pur non avvisando il lettore in tempo reale, crea un pattern che può persistere anche dopo operazioni di copia e incolla, indicando che un determinato passaggio è stato generato o elaborato da un sistema OpenAI.

La decisione di OpenAI di implementare un rollout regionale e graduale, concentrandosi inizialmente sull’Europa, evidenzia il peso regolatorio dell’Unione Europea nel panorama tecnologico globale.

Questa strategia riflette anche una certa prudenza da parte dell’azienda riguardo a una tecnologia che, come ammesso, presenta ancora margini di miglioramento.

TextGrain: la tecnologia dietro il segnale invisibile

La tecnologia alla base di questo sistema è stata denominata textGrain. Essa opera aggiungendo un segnale statistico invisibile alle parole selezionate dal modello. In pratica, il sistema influenza in modo impercettibile le probabilità di scelta lessicale, senza compromettere la qualità percepibile del testo generato. Un rilevatore specializzato, dotato della chiave e del metodo corretti, è in grado di cercare questo pattern e stimare la presenza di un watermark OpenAI all’interno del contenuto.

OpenAI ha dichiarato di non aver riscontrato differenze significative nelle prestazioni dei modelli con il watermark attivo. Tuttavia, l’azienda ha chiarito che l’affidabilità del rilevamento varia notevolmente in base al contesto: testi lunghi e discorsivi offrono maggiori opportunità per l’incorporazione del segnale, mentre risposte brevi, contenuti matematici, traduzioni o testi con vincoli rigidi possono rendere il rilevamento più fragile e meno efficace.

I limiti e le sfide del rilevamento automatico

Un aspetto cruciale riguarda la robustezza del sistema. OpenAI ha evidenziato che la sostituzione di appena il 10% delle parole con sinonimi può ridurre in modo significativo la capacità di rilevare il watermark.

Modifiche più sostanziali, come traduzioni o rielaborazioni profonde del testo, possono ulteriormente indebolire o addirittura eliminare il segnale. Per queste ragioni, il rilevatore non sarà reso pubblico al momento del lancio. L’accesso sarà inizialmente limitato a ricercatori accreditati e a organizzazioni con comprovata esperienza nel settore.