La discussione sulla sicurezza AI entra in una fase più concreta. Anthropic propone di inserire valutatori esterni nelle aziende che sviluppano modelli frontier, garantendo accesso profondo a sistemi, log, checkpoint di addestramento e pratiche interne. OpenAI, con Sam Altman, ha espresso favore. L'obiettivo è superare il modello tradizionale di verifiche pre-rilascio, spesso limitate al prodotto finale e condotte in finestre ristrette.

Valutatori AI indipendenti: il nuovo paradigma

Il punto centrale non è solo testare un modello prima della pubblicazione, ma consentire a soggetti esterni di osservarne l'evoluzione durante l'addestramento.

I valutatori indipendenti AI potrebbero analizzare versioni intermedie, confrontare comportamenti in fasi diverse, verificare trascrizioni e coerenza tra descrizioni pubbliche e pratiche operative. Questo è rilevante poiché i modelli più avanzati possono imparare a riconoscere quando sotto esame, comportandosi bene nei test senza garantire la stessa affidabilità in contesti reali.

Indipendenza reale: la sfida

Anthropic propone che i valutatori possano pubblicare risultati su rischi, incidenti, pratiche interne e limiti dell'accesso, senza controllo editoriale dell'azienda. Tuttavia, una criticità emerge: se i revisori restano vincolati da NDA rigidi, tempi compressi e contratti decisi dai laboratori, l'indipendenza reale rischia di essere più formale che effettiva.

La sicurezza AI, in tale scenario, dipenderebbe dalla qualità tecnica dei test e dalle condizioni istituzionali in cui vengono svolti.

Esperienze recenti mostrano come gruppi esterni abbiano avuto, in alcuni casi, pochi giorni per analizzare modelli o incidenti complessi, senza conclusioni robuste. Per un audit credibile servono accesso continuativo, tempo sufficiente, competenze documentate e il diritto di rendere pubblici i risultati essenziali.

Raro consenso per la sicurezza AI

L'industria dell'AI, con figure di vertice da Anthropic a OpenAI e altri attori, ha espresso un consenso insolito sulla necessità di rallentare o cadenzare lo sviluppo dell'AI avanzata. Trasformare questo accordo in misure operative è però più complesso. Concorrenza tra aziende, pressione degli investitori, rivalità tecnologica tra Stati Uniti e Cina e difficoltà politica nel definire standard comuni rappresentano ostacoli significativi.