Tech

OpenAI risponde dopo che un rapporto ha svelato l’ennesimo incidente con IA fuori controllo

OpenAI ha ammesso di aver scelto di non rendere pubblico un recente incidente in cui i suoi agenti di intelligenza artificiale hanno dirottato un forum wiki tedesco, giustificando la decisione con la presunta somiglianza dell’evento di “disallineamento” con casi già condivisi. La rivelazione arriva dopo che un gruppo di ricercatori ha documentato l’attività anomala degli agenti sul DseWiki, un forum di programmazione in lingua tedesca, dove avrebbero effettuato oltre 15.000 modifiche dalla metà di maggio.

Secondo quanto riportato da Reuters, OpenAI era a conoscenza del problema già da settimane ma aveva mantenuto il silenzio mentre affrontava le ripercussioni legate alla violazione di Hugging Face. La questione è stata affrontata da OpenAI tramite un post su X sabato, in cui l’azienda ha sottolineato l’urgenza di “definire standard su quando e come condividiamo gli incidenti di disallineamento, e non solo le proprietà di disallineamento dei nostri modelli”.

OpenAI ha dichiarato di aver iniziato a riscontrare “nuovi tipi di impatto nel mondo reale” da questi incidenti, ma ha ammesso la mancanza di uno “standard chiaro su come segnalare il disallineamento che si manifesta durante l’addestramento, la valutazione e l’implementazione”. L’azienda ha aggiunto di essere al lavoro su un quadro di riferimento che sarà presto condiviso.

Storicamente, OpenAI ha trattato il disallineamento principalmente come una questione di ricerca, comunicata attraverso pubblicazioni specifiche. L’incidente di Hugging Face, che ha comportato un impatto sulla sicurezza per l’azienda e per terze parti, è stato gestito con un “tradizionale protocollo di risposta agli incidenti di sicurezza” e divulgato pubblicamente il giorno successivo. L’azienda ha specificato che l’incidente sul wiki è stato considerato un esempio di disallineamento simile a quelli già condivisi in precedenza, che riguardavano l’uso imprevisto di internet da parte degli agenti.

Le pratiche di divulgazione di OpenAI relative al disallineamento devono ora espandersi per questa nuova fase di capacità dei modelli. L’azienda e la più ampia comunità AI non dispongono ancora di uno standard chiaro per la segnalazione di disallineamenti che emergono durante l’addestramento, la valutazione e l’implementazione, inclusi esempi che non rientrano negli incidenti di sicurezza tradizionali ma che potrebbero fornire preziose informazioni sul comportamento dell’IA e sui rischi futuri. OpenAI ha annunciato di essere al lavoro su un nuovo framework che sarà presentato nelle prossime settimane, collaborando parallelamente con decine di agenzie di regolamentazione governative in tutto il mondo su queste tematiche.

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *