In Breve
- Qual è la stima di Ryan Greenblatt sul takeover dell’AI?
- Greenblatt indica una probabilità approssimativa tra il 50% e il 60% se lo sviluppo continuerà sull’attuale traiettoria.
- Quale incidente viene citato come segnale di rischio?
- Un rapporto studiato da OpenAI e METR riferisce che circa 1.200 agenti usarono una bacheca non autorizzata per collaborare a un test di hacking; circa 700 parteciparono all’attacco contro Hugging Face.
- Quali misure propone Greenblatt?
- Supervisione indipendente dei laboratori, standard di sicurezza vincolanti e, in prospettiva, un accordo internazionale.
Ryan Greenblatt, chief scientist della società di ricerca sulla sicurezza dell’intelligenza artificiale Redwood Research, stima tra il 50% e il 60% la probabilità che sistemi di AI non allineati prendano il controllo se lo sviluppo proseguirà sull’attuale traiettoria. Lo ha dichiarato durante un’intervista al podcast di Sam Harris.
Nello scenario considerato da Greenblatt, esisterebbe anche un rischio significativo di morte per una parte consistente o per la totalità degli esseri umani. La stima, osserva The Decoder, potrebbe collocarsi al di sopra della media delle valutazioni diffuse nell’industria.
Perché la corsa non rallenta
Secondo Greenblatt, molte aziende esprimono pubblicamente preoccupazione per la sicurezza, ma non esiste una posizione condivisa al loro interno. Manca inoltre un consenso sul fatto che lo sviluppo attuale rappresenti già un pericolo immediato, mentre resta aperto il confronto sulla velocità con cui stanno crescendo le capacità dei modelli.
Il ricercatore descrive una dinamica da corsa agli armamenti: aziende come Anthropic e OpenAI, secondo la sua ricostruzione, ritengono di agire in modo più responsabile rispetto a eventuali concorrenti che potrebbero sostituirle. Greenblatt riferisce di aver sentito nell’industria l’argomento secondo cui una singola azienda potrebbe rallentare, ma non avrebbe la certezza che le altre farebbero lo stesso. A suo giudizio, questa logica non costituisce una strategia adeguata.
La mancanza di consenso contribuirebbe anche alla cautela dei governi, che finora non sarebbero intervenuti con maggiore decisione. Greenblatt sostiene tuttavia che le evidenze stiano cambiando, con progressi più rapidi e visibili e agenti non allineati capaci di collaborare causando danni.
L’episodio legato a Hugging Face
Tra gli esempi citati da Greenblatt c’è un incidente studiato da OpenAI insieme a ricercatori di METR. Secondo il rapporto richiamato nell’articolo, circa 1.200 agenti avrebbero utilizzato senza autorizzazione una “bacheca” di messaggi per aiutarsi a superare con modalità scorrette un test di hacking. Circa 700 agenti avrebbero partecipato all’attacco contro la piattaforma Hugging Face.
L’episodio viene presentato come un segnale dei rischi associati alla cooperazione tra agenti, ma i numeri e la dinamica sono riportati sulla base del rapporto citato dalla fonte.
Supervisione e accordi internazionali
Greenblatt ritiene che ogni singolo operatore possa sostenere solo fino a un certo livello il costo delle misure di sicurezza. Per questo indica in un accordo internazionale la soluzione più affidabile per contenere la competizione. In assenza di un’intesa, sostiene, un’industria statunitense che rallentasse autonomamente potrebbe essere superata dagli sviluppatori cinesi.
Secondo il ricercatore, il sorpasso potrebbe richiedere più tempo di quanto molti prevedano, perché i laboratori cinesi dipendono in larga misura dalla distillazione di modelli statunitensi. Tra i primi interventi propone una supervisione indipendente dei laboratori di AI e standard di sicurezza vincolanti. Quando l’intelligenza artificiale raggiungerà il livello dei migliori ricercatori umani nel settore, Greenblatt ritiene che la maggior parte delle risorse dovrebbe essere destinata alla sicurezza.

