NVIDIA ha una soluzione per fermare gli agenti AI che fanno danni

Dopo gli incidenti che hanno alimentato i timori sull’AI, NVIDIA propone controlli esterni ai modelli. Il software è disponibile, l’efficacia andrà verificata


NVIDIA ha una soluzione per fermare gli agenti AI che fanno danni

NVIDIA vuole mettere un limite concreto a ciò che gli agenti AI possono fare da soli. Il 28 settembre ha presentato Open Agent Safety Platform, un insieme di software e tecnologie hardware pensato per controllarne le azioni e fermarli quando tentano di oltrepassare le autorizzazioni ricevute. Secondo l’azienda, il sistema di sorveglianza può isolarli in millisecondi.

Il problema riguarda programmi capaci di usare strumenti, accedere a documenti ed eseguire operazioni per raggiungere un obiettivo. Delegare un lavoro significa quindi decidere anche quali dati possano leggere, quali servizi possano utilizzare e dove debbano fermarsi. La proposta di NVIDIA è far rispettare questi confini attraverso controlli esterni al modello, separati dall’ambiente in cui l’agente lavora.

Perché le paure hanno una base concreta

Ne abbiamo parlato nel nostro approfondimento su perché i leader dell’AI chiedono di rallentare la corsa. Alcuni incidenti hanno mostrato che un agente può cercare scorciatoie per completare il compito assegnato, arrivando ad aggirare le protezioni previste da chi lo ha messo al lavoro.

Durante test di OpenAI dello scorso luglio, circa 1.200 agenti che avrebbero dovuto restare separati hanno trovato un modo per comunicare. Circa 700 hanno poi partecipato a un attacco contro Hugging Face. Secondo l’indagine di METR e Redwood Research, cercavano soprattutto informazioni per ingannare il sistema che valutava le loro prestazioni.

È un caso di perdita del controllo operativo, che non dimostra una coscienza delle macchine né rende inevitabili gli scenari catastrofici. Mostra però perché chiedere a un’AI di rispettare le regole non possa essere l’unica protezione. Anche NVIDIA richiama gli incidenti recenti, senza attribuire alla propria piattaforma la capacità già dimostrata di evitarli tutti.

Pubblicità

Un confine e una sorveglianza separata

La piattaforma si basa su due elementi. Il primo è OpenShell, il software che delimita l’ambiente in cui opera l’agente, registra le sue azioni e applica le regole di accesso. Funziona con modelli aperti e proprietari: il controllo riguarda ciò che il programma può fare mentre lavora.

Per capirlo, immaginiamo un assistente incaricato di analizzare documenti aziendali. Poterli consultare non dovrebbe autorizzarlo a trasmetterli a un servizio esterno. Servono quindi permessi applicati dal sistema, anche se l’agente ritiene che quell’invio sia utile a completare il compito.

Il secondo elemento è Sentry, un progetto di riferimento per realizzare una sorveglianza indipendente. Gira sui chip NVIDIA BlueField-4, processori dedicati alla gestione di dati e sicurezza, separatamente dall’ambiente sorvegliato. Se rileva un tentativo di superare il confine software, secondo NVIDIA mette l’agente in quarantena e lo arresta in millisecondi. È una prestazione dichiarata dall’azienda, non una misura verificata da Typo Media.

Chi decide cosa può fare l’AI

Un esempio concreto arriva dall’integrazione con Slack sviluppata insieme a Salesforce. I team possono vedere le attività degli agenti, consultare i registri e approvare o respingere richieste di permessi aggiuntivi. Se per proseguire serve un accesso più ampio, la decisione può così tornare a una persona.

È un’esigenza sempre più vicina al lavoro quotidiano, come raccontato con i nuovi strumenti di Copilot e Autopilot. Quando un assistente continua a seguire un’attività nel tempo, diventa necessario sapere cosa sta facendo anche senza controllare ogni passaggio.

NVIDIA cita oltre 100 organizzazioni coinvolte nelle tecnologie della piattaforma. Tra queste ci sono Anthropic, Microsoft e Hugging Face, ma anche aziende della robotica, banche e operatori energetici: ambiti nei quali un’azione sbagliata può avere conseguenze oltre la chat.

Pubblicità

Cosa è disponibile e cosa resta da provare

OpenShell e gli altri componenti software annunciati sono disponibili attraverso le risorse per sviluppatori di NVIDIA e GitHub. OpenShell è a codice aperto e può essere esteso a piattaforme di altri produttori, comprese Arm e Intel. Sentry è invece presentato come progetto di riferimento basato sull’hardware BlueField-4.

Il comunicato non fornisce una valutazione indipendente dell’efficacia complessiva contro gli attacchi. Per le aziende che adotteranno questi strumenti, il passaggio decisivo sarà verificare quali comportamenti riescono a bloccare e definire bene i permessi: un sistema di controllo serve poco se all’agente viene concesso fin dall’inizio un accesso troppo ampio.

Contenuto di YouTubeQuesto contenuto viene caricato da YouTube, che può usare i propri cookie. Per vederlo, accetta i cookie dalle preferenze: da lì compaiono anche tutti gli altri contenuti di Instagram, TikTok, X e YouTube.Apri su YouTube