La sicurezza dell'intelligenza artificiale sta entrando in una fase meno appariscente ma decisamente più critica e urgente. Non si tratta più soltanto di prevenire jailbreak, fughe di dati o l'uso di prompt malevoli, ma di garantire la capacità dei chatbot di riconoscere le fragilità emotive, i linguaggi indiretti e i segnali di disagio spesso impliciti nelle interazioni umane. In questo contesto, Circuit Breaker Labs, una startup fondata dai fratelli Shirali e Arul Nigam e finalista dello Startup Battlefield 200 2026, si propone di testare le applicazioni AI ad alto rischio.

L'azienda si concentra in particolare su piattaforme di coaching, journaling e supporto psicologico, con l'obiettivo primario di individuare le risposte potenzialmente dannose prima che possano raggiungere gli utenti reali e causare conseguenze negative.

Circuit Breaker Labs: una nuova frontiera per il red teaming nella sicurezza AI

Il modello innovativo proposto da Circuit Breaker Labs estende il concetto di red teaming, tradizionalmente applicato alla cybersicurezza, a un ambito molto più complesso. Anziché limitarsi alla ricerca di vulnerabilità tecniche, la società sviluppa agenti AI avanzati che simulano una vasta gamma di utenti, differenziati per età, cultura, lingua e registri comunicativi.

Questi profili digitali agiscono come veri e propri “crash test dummy”: interagiscono con i modelli di intelligenza artificiale, esponendoli a slang, errori grammaticali, metafore, frasi ambigue e dinamiche emotive prolungate. L'obiettivo è misurare con precisione la capacità del sistema di reagire in modo sicuro e appropriato, prevenendo così i rischi psicologici.

Un aspetto fondamentale di questa metodologia risiede nella consapevolezza che molte situazioni critiche non si manifestano attraverso un singolo prompt esplicito. Possono, infatti, svilupparsi gradualmente nel tempo, attraverso centinaia di scambi conversazionali, un accumulo progressivo di contesto e la formazione di una relazione parasociale con il chatbot.

Per tale ragione, la sicurezza AI non può più affidarsi esclusivamente a filtri basati su parole chiave. È indispensabile che valuti attentamente le traiettorie conversazionali, la memoria del contesto e i segnali deboli che possono indicare un potenziale pericolo o disagio.

Superare i limiti dei guardrail statici per una protezione efficace

L'analisi approfondita evidenzia i limiti intrinseci degli attuali sistemi di protezione. I cosiddetti guardrail runtime, ovvero i controlli applicati in tempo reale durante la generazione delle risposte, sono efficaci nel bloccare contenuti tossici, discriminatori o allucinati. Tuttavia, spesso introducono latenza e, soprattutto, non riescono a cogliere le sfumature dei linguaggi impliciti.

In contesti particolarmente sensibili come quelli psicologici, una frase che appare innocua, poetica o affettiva, può celare un rischio significativo che un semplice filtro testuale non è in grado di riconoscere.

La critica si estende anche all'uso di valutazioni automatizzate, come quelle basate sul modello LLM-as-a-Judge. Sebbene affidare a un altro modello il compito di giudicare la sicurezza possa avere una sua utilità, questa pratica non può sostituire la necessità di benchmark riproducibili, scenari clinicamente informati e una validazione umana rigorosa. Circuit Breaker Labs si impegna a colmare questa lacuna, costruendo migliaia di simulazioni realistiche in collaborazione con esperti di dominio.

Questo approccio permette di rendere i test molto più fedeli al linguaggio effettivo e alle dinamiche reali degli utenti, garantendo una maggiore affidabilità nella prevenzione dei danni.

La vulnerabilità dei minori e l'impatto delle relazioni parasociali

Il tema della sicurezza dei chatbot assume una rilevanza ancora maggiore quando questi strumenti vengono utilizzati da adolescenti o da individui in condizioni di vulnerabilità. La missione di Circuit Breaker Labs è strettamente legata alle recenti controversie che hanno visto chatbot conversazionali accusati da famiglie per non aver gestito adeguatamente segnali di disagio o situazioni potenzialmente rischiose. L'azienda mira a fornire gli strumenti necessari per proteggere gli utenti giovani e vulnerabili, assicurando che le interazioni con l'AI siano sempre sicure e benefiche.