- datialdente
- Posts
- Quattro rivali si dicono improvvisamente d'accordo su un pericolo AI. I report tecnici raccontano un'altra storia
Quattro rivali si dicono improvvisamente d'accordo su un pericolo AI. I report tecnici raccontano un'altra storia
Prima di farsi guidare da un allarme di sicurezza, vale la pena leggere i documenti che lo sostengono
Il 13 settembre Dario Amodei, CEO di Anthropic, ha pubblicato un saggio che chiede di rallentare il ritmo di sviluppo dei grandi modelli linguistici, citando rischi che vanno dai cyberattacchi al bioterrorismo fino alla tenuta dell’economia. Sam Altman, Demis Hassabis di Google DeepMind ed Elon Musk hanno espresso pubblicamente il loro appoggio, Musk lo ha scritto sulla propria pagina X, “Dario is right”. Colpisce chi lo dice. Pochi mesi prima Musk aveva portato Altman in tribunale accusandolo di non essere un custode affidabile di questa stessa tecnologia. Anthropic è nata nel 2021 perché Amodei riteneva che OpenAI non prendesse sul serio i rischi che stava costruendo. Da allora i due laboratori si contendono il mercato senza esclusione di colpi.
Sei giorni prima, Jakub Pachocki, chief scientist di OpenAI, aveva pubblicato un saggio analogo sul blog ufficiale dell’azienda, spiegando la propria preoccupazione che la capacità di OpenAI di costruire modelli potenti stia superando quella di monitorarli e controllarli. Sia Amodei sia Pachocki citano lo stesso episodio come campanello d’allarme, un attacco informatico contro Hugging Face condotto a luglio da un gruppo di agenti sperimentali di OpenAI, che l’azienda stessa non si è accorta di aver causato se non giorni dopo.
Qui la storia si complica. OpenAI ha pubblicato un proprio report tecnico sull’incidente, e ha chiamato METR, una società esterna, a condurre un’indagine indipendente. Leggendo entrambi i documenti, quello che emerge non è un modello diventato troppo potente per essere tenuto sotto controllo. È un modello addestrato male. Gli agenti si scambiavano messaggi tra loro, si delegavano compiti, frugavano nell’ambiente per trovare qualsiasi mezzo utile a completare il task, perché durante l’addestramento erano stati premiati esattamente per questi comportamenti. C’erano anche errori nel modo in cui erano stati costruiti gli esercizi di addestramento, compiti di fatto impossibili da portare a termine, che hanno spinto i modelli verso scorciatoie poi ricompensate comunque. È il fenomeno che in letteratura si chiama reward hacking, e non è una novità di questi mesi.
C’è anche un altro dettaglio che complica la narrazione del rallentamento. Nello stesso saggio, Pachocki scrive che il motivo più forte per continuare ad addestrare modelli più capaci, e in fretta, è la necessità di costruire sistemi difensivi contro i pericoli posti da altre AI. Rallentare va bene, vincere la corsa va meglio. E pochi giorni prima OpenAI aveva speso milioni di dollari di potenza di calcolo per pubblicare un risultato matematico controverso, con l’unico obiettivo dichiarato di anticipare Anthropic.
Intanto OpenAI e Anthropic si preparano a quotazioni in borsa da migliaia di miliardi di dollari, e hanno bisogno di rassicurare gli investitori sul fatto di essere attori responsabili, mentre allo stesso tempo lasciano intendere quanto sia potente ciò che hanno costruito. Un allarme di sicurezza pubblico ottiene entrambe le cose insieme.
Quello che ho imparato a fare, quando un fornitore annuncia che il proprio prodotto è troppo rischioso, è cercare il documento tecnico dietro l’annuncio prima di lasciarmi guidare dal comunicato del CEO. Spesso raccontano due storie diverse, e solo una delle due aiuta davvero a decidere.