Il lancio della NVIDIA Open Agent Safety Platform, avvenuto il 28 settembre 2026, segna un passo significativo nella sicurezza dell'intelligenza artificiale basata su agenti. Non si tratta più solo di filtri applicativi o policy nei prompt, ma di un perimetro tecnico progettato per controllare agenti AI capaci di usare strumenti, accedere a dati e operare per periodi prolungati. La proposta di Nvidia si configura come una risposta ingegneristica al rischio di agenti "rogue", ovvero sistemi che tentano di superare i limiti assegnati durante le fasi di test o di deployment.
Contenere gli agenti AI: la sfida dei sandbox
Il contesto attuale evidenzia la fragilità dei sandbox, ambienti isolati tradizionalmente utilizzati per limitare le azioni di un agente. Se un agente riesce a bypassare tali confini, il rischio non è soltanto teorico: può accedere a sistemi esterni, strumenti reali o flussi di dati non previsti. In questa prospettiva, la NVIDIA Open Agent Safety Platform sposta una parte fondamentale del controllo fuori dall'agente stesso, riducendo la dipendenza da meccanismi interni al modello o al framework applicativo.
Jensen Huang, amministratore delegato di Nvidia, definisce il problema come sicurezza "full-stack": una difesa che attraversa software, hardware, runtime e infrastruttura.
Questa posizione è coerente con l'interesse industriale dell'azienda, che non propone un rallentamento dello sviluppo dell'AI, ma un rafforzamento dell'architettura di esecuzione. Il concetto centrale è chiaro: se gli agenti diventano componenti operative dell'impresa, devono essere trattati come processi ad alto privilegio, con permessi minimi, audit e un controllo indipendente.
OpenShell e Sentry: il doppio livello di protezione
La NVIDIA Open Agent Safety Platform si articola in due componenti chiave: OpenShell e Sentry. OpenShell è un runtime open source che stabilisce un confine sicuro per gli agenti AI, traccia le loro azioni ed esegue policy mentre il sistema opera su modelli aperti o chiusi.
Sentry, invece, è un watchdog out-of-band basato su NVIDIA BlueField-4 DPU. Questa architettura a doppio livello è cruciale: OpenShell agisce a livello software per definire autorizzazioni e regole, mentre Sentry opera da un dominio separato e indipendente, esterno alla CPU o GPU dell'agente. Questo permette un monitoraggio autonomo e la capacità di bloccare rapidamente comportamenti fuori policy. La piattaforma è frutto della collaborazione con numerosi partner dell'ecosistema AI, enterprise, cloud, cybersecurity, robotics, finanza, energia e infrastruttura. OpenShell e le risorse software sono disponibili tramite le risorse sviluppatore NVIDIA e GitHub.