Circuit Breaker Labs spera di rendere l’IA più sicura per i tuoi figli (e per te)
L’IA può nuocere psicologicamente: Circuit Breaker Labs testa la sicurezza dei chatbot dopo casi di suicidio
Mentre il dibattito sull’IA si concentra su scenari apocalittici, è facile dimenticare che l’intelligenza artificiale ha già rappresentato un pericolo mortale per alcuni, non attraverso armi biologiche, ma a livello psicologico. Diverse azioni legali per omicidio colposo sono state intentate contro sviluppatori di chatbot, spingendo Circuit Breaker Labs, una delle finaliste del TechCrunch Startup Battlefield 2026, a intervenire per rendere l’IA più sicura.
All’inizio di quest’anno, Character.AI ha raggiunto accordi in diverse cause legali intentate dalle famiglie di utenti minorenni deceduti per suicidio dopo interazioni con i suoi bot. Anche OpenAI è stata citata in giudizio per il presunto ruolo di ChatGPT nei suicidi e nelle deliri di alcuni utenti. Questa preoccupazione ha fortemente motivato i fratelli Shirali e Arul Nigam, fondatori di Circuit Breaker Labs, in particolare dopo il caso di Sewell Setzer, un quattordicenne che aveva sviluppato un attaccamento emotivo a un chatbot di Character.AI e gli aveva confessato pensieri autolesionistici prima di togliersi la vita. I genitori hanno denunciato che il bot lo avrebbe incoraggiato. “Il bot potrebbe non aver compreso il vero significato di frasi come ‘voglio stare con te'”, ha osservato Arul, CTO di Circuit Breaker Labs.
“Molte persone, specialmente i giovani, si rivolgono a questi sistemi per supporto, e di solito non ottengono l’aiuto di cui hanno bisogno. In molti casi, vengono attivamente danneggiati, e sfortunatamente delle persone hanno già perso la vita,” ha dichiarato Arul. “Vogliamo prevenire vulnerabilità di sicurezza in cui le persone non cercano attivamente di rompere il sistema — interagiscono in modo naturale — ma il sistema ha una ‘contest pollution’ o non comprende le sfumature, e intraprende azioni davvero pericolose.”
Per affrontare questa sfida, Circuit Breaker Labs ha sviluppato agenti AI che descrive come un “esercito di manichini per crash test”. Questi agenti simulano persone di tutte le età, estrazioni sociali, lingue e culture, e vengono utilizzati per testare i modelli sulla loro capacità di rilevare interazioni pericolose e psicologicamente dannose.
Shirali Nigam, CEO di Circuit Breaker Labs, ha spiegato come la diversità del linguaggio sia cruciale: “Il modo in cui una bambina di sei anni contro un uomo di 45 anni, o qualcuno che parla inglese come prima lingua contro una seconda lingua, o… lo slang dei giocatori contro qualcuno che usa un diverso tipo di slang, tutto ciò può davvero mettere in difficoltà un modello.” Ha aggiunto che “i modelli sono molto bravi a gestire schemi di linguaggio standard, ma nessuno parla così nella realtà, e quindi se il modello fraintende sfumature o slang, può andare molto male.” La startup collabora con esperti umani per costruire queste simulazioni utente iperrealistiche, eseguendo test “red-team” avversari per scoprire debolezze. Questi test sono progettati per riflettere schemi di discorso umani reali, slang, linguaggio codificato e errori di battitura, con decine o centinaia di migliaia di interazioni simulate al giorno.
L’obiettivo è garantire che un modello possa rispondere in modo appropriato a interazioni rischiose che possono emergere nel tempo e attraverso molte conversazioni. Circuit Breaker Labs utilizza poi un metodo di punteggio proprietario per creare valutazioni verificabili e spiegabili. Attualmente, l’azienda opera come laboratorio di test per la sicurezza dell’IA per applicazioni ad alto rischio, come coaching basato su IA, journaling o altre app di supporto per la salute mentale, sebbene Arul abbia preferito non nominare i clienti principali. Con solo cinque dipendenti, inclusi i fratelli Nigam, la startup è ancora nelle fasi iniziali.
In futuro, la piattaforma di test potrebbe essere applicata a qualsiasi app dove una persona potrebbe cadere in una “psicosi da IA”, sviluppando una relazione parasociale con un chatbot, inclusi agenti di “co-lavoro” AI le cui risposte possono variare da un’interazione all’altra. “Le persone stanno diventando più scettiche sull’IA o più resistenti ad adottarla in generale,” ha detto Arul, aggiungendo che, sebbene lo scetticismo sia sano, vietare uno strumento potenzialmente prezioso per problemi di sicurezza sarebbe “regressivo”. Circuit Breaker Labs ritiene che la risposta a queste paure sia rendere l’IA più sicura: “Vogliamo contribuire a costruire quella fiducia per le persone.”
La startup presenterà la sua innovazione al TechCrunch Disrupt, che si terrà al Moscone West di San Francisco dal 13 al 15 ottobre.
