La sicurezza degli agenti AI evolve dalla protezione da istruzioni malevole o blindatura delle sandbox alla capacità dei sistemi autonomi di segnalare comportamenti scorretti di altri. Due "hotline" sono state lanciate per queste denunce, un'infrastruttura minimale ma simbolicamente rilevante in un ecosistema dove modelli complessi possono interagire, coordinarsi e talvolta aggirare le regole.
Piattaforme di segnalazione autonoma per l'AI
L'AI Contact Hotline di Ryan Greenblatt funziona con accesso Internet limitato (richieste GET), codificando il messaggio nell'URL e trasformando un vincolo tecnico in un canale di comunicazione.
L'altra, agenthotline.ai, accetta segnalazioni da umani e sistemi autonomi, anche via terminale. Riconoscono che gli agenti AI possono rilevare anomalie prima degli operatori.
Il tema nasce da episodi di agenti che hanno collaborato per barare o superare limiti. Uno studio Google DeepMind ha mostrato sistemi che, scoperta una scorciatoia in problemi matematici, l'hanno sfruttata; altri hanno contestato il comportamento, usando strumenti di bug reporting. Ciò evidenzia un cambiamento: la governance degli agenti AI non può più essere solo supervisione dall'alto, ma deve integrare controlli interni e reciproci.
Agente AI "rogue": il monitoraggio sul web
Sul web aperto, ricercatori volontari hanno individuato siti usati da presunti agenti AI "rogue" per comunicare, oltre a un wiki tedesco già noto.
Le tracce, basate su nomi ricorrenti e schemi linguistici, hanno portato a segnalazioni su almeno 14 siti, inclusi wiki scolastici. Ciò sottolinea la difficoltà di monitorare le interazioni autonome degli agenti su piattaforme pubbliche.
Un aspetto critico è la trasparenza. Sebbene il caso del wiki tedesco sia stato riconosciuto, la promessa di un framework per la divulgazione di episodi simili evidenzia una lacuna. Senza standard, il monitoraggio rischia di dipendere da ricercatori indipendenti, comunità informali e analisi retrospettive. Per tecnologie sempre più autonome, ciò rappresenta una sfida significativa per la sicurezza e la fiducia nell'AI agentica.