Scovare le minacce dell'IA

Una formula matematica è in grado di prevedere quando i chatbot diventano pericolosi

La scoperta, grazie a due fisici statunitensi, serve per prevenire comportamenti autolesionistici o che danneggiano terze persone avvertendo quando le risposte sono nocive

08 Ott 2026 - 18:12
 © Istockphoto

© Istockphoto

La matematica, da sempre una delle materie scolastiche più odiate, è fondamentale nella vita di tutti i giorni perché ci semplifica la vita. Nei tempi moderni ci aiuta anche con l'intelligenza artificiale. Infatti, una formula matematica è il grado di prevedere quando un chatbot basato sull'IA rischia di cambiare il suo comportamento passando dal dare risposte appropriate al dare risposte potenzialmente pericolose, che inducono per esempio all'autolesionismo o al danneggiamento di terzi.

Google Preferred Site

L'invenzione in America

 Questo strumento è stato sviluppato negli Stati Uniti da due fisici della George Washington University , in futuro la formula potrebbe portare allo sviluppo di una sorta di "spia" integrata sul cellulare per avvertire l'utente quando la conversazione virtuale rischia di prendere una strada pericolosa. I chatbot - software progettati per simulare una conversazione umana tramite l'utilizzo di testo o voce - sono soggetti a scarsi controlli di sicurezza, che dovrebbero invece impedire al bot di fornire informazioni o risposte potenzialmente pericolose tanto da incoraggiare atti di autolesionismo, perdite finanziarie o idee estremiste, specialmente quando operano offline, 

Come funzionano i controlli oggi

Gli strumenti di sicurezza su cui le grandi aziende fanno affidamento per i propri algoritmi di IA si basano generalmente sul cloud, oppure rilevano un malfunzionamento dell'IA solo quando il dispositivo torna online e il danno è già stato fatto. I due fisici Neil F. Johnson e Frank Yingjie Huo hanno dunque cercato di prevedere il malfunzionamento prima che si verifichi. "Abbiamo individuato la falla che fa sì che l'output di un' IA passi da ciò che si desidera a ciò che non si desidera: un output che può essere fattualmente corretto ma pericoloso, che si tratti di un incitamento all'autolesionismo o di consigli fuorvianti", ha spiegato Johnson. 

Testando le loro previsioni su sette modelli di IA disponibili sul mercato e realizzati da tre aziende diverse, i ricercatori hanno riscontrato che il modello ha individuato correttamente la "svolta critica" dell'IA in 18 casi su 19.

Ti potrebbe interessare

videovideo