Una crescente contraddizione emerge nel panorama della sicurezza informatica: i guardrails dell’intelligenza artificiale, progettati per prevenire usi malevoli, stanno diventando un ostacolo significativo per i ricercatori di cybersecurity offensiva. Le restrizioni imposte dai principali modelli di IA, come quelli di Anthropic e OpenAI, sebbene mirate a proteggere da abusi, finiscono per limitare gli esperimenti legittimi essenziali per rafforzare la difesa digitale. Questo approccio solleva interrogativi sui rischi e l'innovazione nel settore.

Accesso Controllato per Ricercatori Certificati

Per bilanciare sicurezza e ricerca, Anthropic e OpenAI hanno implementato programmi di accesso controllato. Il Cyber Verification Program di Anthropic e il Trusted Access for Cyber di OpenAI offrono a utenti selezionati e verificati la possibilità di utilizzare modelli con minori restrizioni, specificamente per attività di cybersecurity.

Fable 5 è tornato pubblico il 1° luglio, mentre Mythos 5 è stato reintrodotto solo per organizzazioni verificate negli Stati Uniti dopo una revisione governativa. Tali iniziative mirano a mitigare i timori iniziali sull'accessibilità.

Le Barriere che Ostacolano la Ricerca Offensiva

I ricercatori evidenziano un paradosso: l'atto di chiedere a un'IA di correggere un codice è sia un esercizio difensivo, sia un metodo per identificare potenziali vulnerabilità.

Tuttavia, i guardrails spesso bloccano tali richieste, compromettendo l'efficacia nell'individuazione delle falle.

Di fronte a queste limitazioni, esperti come Paolo Stagno di CrowdFense preferiscono soluzioni open source locali, evitando modelli cloud soggetti a restrizioni che comprometterebbero la ricerca offensiva. Altri, come Giuseppe Cali, non risentono dei vincoli poiché impiegano l'IA solo per il reverse engineering iniziale, senza automatizzare la scoperta di bug o la creazione di exploit avanzati.

Restrizioni all'Accesso e Incoerenza dei Guardrails

La necessità di programmi come l'Anthropic CVP è cruciale; un ricercatore anonimo ha lamentato che, senza tale accesso, i modelli IA risultano quasi inutilizzabili per la ricerca offensiva, limitando l'innovazione a pochi accreditati.

A complicare ulteriormente il quadro, Chris Thompson, CEO di RemoteThreat, evidenzia la variabilità incoerente dei guardrails, che possono mutare anche quotidianamente. Questa instabilità rende difficile il lavoro dei professionisti che dipendono da strumenti affidabili e prevedibili.

Impatto Strategico e Necessità di Riequilibrio

Questa situazione evidenzia l'urgenza di riequilibrare le misure di sicurezza dei modelli di IA. Restrizioni eccessive rischiano di paralizzare attività fondamentali per la resilienza critica delle infrastrutture digitali.

Se da un lato i guardrails rappresentano un approccio prudente per mitigare i rischi di abuso, in linea con una governance responsabile, dall'altro ostacolano i difensori.

Questi, operando in contesti offensivi controllati, necessitano disimulare attacchi per anticipare e contrastare minacce reali.

La combinazione di guardrails variabili e accessi limitati crea un ambiente in cui l'innovazione è confinata a pochi attori privilegiati, riducendo la capacità collettiva di difensori informatici di essere adeguatamente attrezzati.

Proposte per Controlli più Efficaci

È fondamentale esplorare soluzioni più evolute, come modalità di uso specifiche per l'incident response (IR), dove i modelli mantengono funzionalità avanzate sotto stretto monitoraggio e audit. Un'altra opzione sono le soluzioni locali open source, capaci di ricreare ambienti non filtrati ma operanti in contesti interni e controllati.

I programmi di accesso controllato potrebbero evolvere verso sistemi più trasparenti, con approvazioni rapide, criteri chiari e monitoraggio dinamico delle capacità, superando blocchi rigidi basati su parole chiave.

Infine, una regolazione più coesa tra istituzioni e fornitori di IA potrebbe facilitare l'accesso a strumenti avanzati per i difensori certificati, promuovendo sicurezza e innovazione simultaneamente.

Il bilanciamento tra protezione e progresso è una scelta strategica cruciale: assicurare ai difensori gli strumenti necessari è vitale per la sicurezza delle infrastrutture critiche nell'era dell'IA.