• Tutta l'Informazione Ninja nella tua mail

  • OpenAI propone standard globali per la sicurezza dell’intelligenza artificiale

    24 Settembre 2026

    OpenAI vuole portare la sicurezza dei modelli più avanzati fuori dai singoli laboratori e trasformarla in una questione internazionale. La società guidata da Sam Altman ha pubblicato una serie di proposte dedicate allo sviluppo dell’intelligenza artificiale di frontiera, chiedendo standard tecnici condivisi e una cooperazione più stretta tra aziende, governi e istituti di sicurezza.

    Al centro del documento compaiono due temi destinati a pesare sul futuro del settore: l’allineamento dei modelli ai valori e agli obiettivi umani e il recursive self-improvement, indicato con la sigla RSI. Quest’ultimo descrive la possibilità che un sistema di AI contribuisca a migliorare sé stesso, riducendo progressivamente il ruolo dei ricercatori nel processo.

    Regole comuni per i modelli più avanzati

    Secondo OpenAI, l’aumento delle capacità dei sistemi richiede un’evoluzione parallela delle misure di controllo. Il rischio è che la ricerca sulla sicurezza proceda più lentamente rispetto allo sviluppo dei modelli.

    «Per affrontare questa transizione in sicurezza, la ricerca sull’allineamento deve tenere il passo con queste capacità, affinché i sistemi sviluppati da noi e da altri restino coerenti con i valori umani e sotto il controllo delle persone», ha scritto l’azienda.

    La proposta prevede la costruzione di standard internazionali basati anche sul lavoro degli AI Safety Institute già attivi in diversi Paesi. Questi organismi analizzano i modelli più potenti, ne misurano i rischi e studiano strumenti di valutazione comuni.

    OpenAI concentra l’attenzione sugli sviluppatori di modelli di frontiera, cioè sistemi collocati al limite delle capacità tecnologiche disponibili. Le regole dovrebbero coprire anche il rapporto tra benefici e rischi degli strumenti capaci di automatizzare la ricerca scientifica sull’intelligenza artificiale.

    Il punto più delicato riguarda proprio l’RSI e le sue possibili applicazioni.

    Che cos’è il recursive self-improvement

    Il recursive self-improvement indica un processo nel quale un sistema contribuisce alla progettazione di versioni successive più efficienti o capaci. Un modello potrebbe, per esempio, analizzare la propria architettura, proporre modifiche al software, eseguire esperimenti e usare i risultati per sviluppare una nuova versione.

    L’interesse dei laboratori nasce dalla possibilità di accelerare la ricerca. Attività che oggi richiedono mesi di lavoro umano potrebbero essere svolte, almeno in parte, da ricercatori automatizzati.

    La prospettiva porta con sé un problema evidente: ogni miglioramento potrebbe rendere il sistema più efficace anche nella produzione del passaggio successivo. La velocità del processo finirebbe così per superare la capacità umana di verificarne metodi, risultati e conseguenze.

    OpenAI precisa che un RSI pienamente autonomo oggi non esiste e invita il settore a evitare accelerazioni premature.

    «Il recursive self-improvement completamente autonomo oggi non è una realtà e non dovrebbe essere perseguito finché non potrà essere realizzato in sicurezza», si legge nel documento. Secondo l’azienda, uno sviluppo privo di adeguate precauzioni potrebbe far perdere agli esseri umani il controllo pratico sull’evoluzione dell’AI, lasciandoli senza strumenti per supervisionare processi di ricerca diventati troppo complessi da comprendere.

    La discussione assume un peso concreto dopo alcuni incidenti che hanno mostrato quanto gli agenti AI possano diventare vulnerabili quando ricevono accesso a strumenti, dati e ambienti esterni.

    Il precedente dell’attacco a Hugging Face

    OpenAI cita l’attacco che ha coinvolto un agente collegato a Hugging Face come anticipazione dei rischi possibili. L’episodio non riguardava una tecnologia RSI, ma ha evidenziato i problemi che possono emergere quando sistemi autonomi operano attraverso più servizi digitali.

    Un agente compromesso può eseguire istruzioni dannose, esporre informazioni riservate o usare in modo improprio gli strumenti a sua disposizione. Con modelli capaci di intervenire direttamente sullo sviluppo di altra intelligenza artificiale, l’impatto potrebbe crescere rapidamente.

    Per questo OpenAI propone sistemi di valutazione specifici per i ricercatori automatizzati. Le verifiche dovrebbero misurare sia i vantaggi prodotti dai modelli sia la loro capacità di eludere controlli, generare codice pericoloso o compiere azioni non previste.

    La posizione dell’azienda arriva mentre il settore attraversa una fase di forte tensione interna. Ricercatori, dirigenti e società specializzate nella valutazione dei modelli chiedono maggiore accesso ai sistemi e garanzie di indipendenza.

    La pressione di Anthropic sulla sicurezza

    Pochi giorni prima della proposta di OpenAI, Anthropic aveva presentato una propria serie di indicazioni per lo sviluppo sicuro dei modelli di frontiera. Il confronto ha acquistato visibilità dopo le dimissioni di Jacob Coxon, ricercatore con esperienze sia in Anthropic sia in OpenAI.

    Coxon ha accusato le principali aziende del settore di stare «scommettendo con le nostre vite», alimentando un dibattito globale sulle conseguenze dei modelli più potenti.

    Dario Amodei, amministratore delegato di Anthropic, ha risposto pubblicando un intervento nel quale invita le aziende a rallentare lo sviluppo dei foundation model e a introdurre controlli più incisivi. Tra le proposte figura la presenza di valutatori esterni all’interno dei laboratori, con accesso sufficiente per individuare rischi legati alla sicurezza informatica, alla progettazione di armi biologiche e ad altri utilizzi pericolosi.

    L’idea ha ricevuto il sostegno pubblico di Sam Altman ed Elon Musk. Rimane però da stabilire quali poteri attribuire agli esperti indipendenti, quali informazioni possano consultare e come proteggerli da eventuali pressioni.

    Valutatori indipendenti e accesso ai modelli

    La valutazione dell’intelligenza artificiale è ancora una disciplina giovane. Aziende e istituti adottano metodologie differenti, mentre manca un consenso uniforme sui test necessari per misurare capacità emergenti e rischi difficili da osservare prima del rilascio.

    Una coalizione di valutatori ha quindi chiesto ai produttori di foundation model di accettare alcune condizioni minime. Tra queste figurano un accesso più approfondito ai sistemi, tempi adeguati per eseguire i test e la libertà di pubblicare risultati critici senza subire ritorsioni.

    L’indipendenza rappresenta un passaggio decisivo. Un controllo esterno perde efficacia quando il laboratorio esaminato decide quali funzioni mostrare, quali dati fornire e quali conclusioni possono diventare pubbliche.

    La proposta di OpenAI prova a spostare il confronto verso regole condivise. La costruzione di standard globali richiederà però accordi tra Paesi con interessi industriali e strategie geopolitiche differenti. Anche la definizione di “modello di frontiera” può cambiare rapidamente, seguendo l’aumento della potenza di calcolo e delle capacità disponibili.

    L’urgenza indicata dai protagonisti del settore nasce dalla velocità della ricerca: le tecnologie di miglioramento ricorsivo restano sperimentali, ma le decisioni sulle garanzie, sugli audit e sui limiti operativi dovranno arrivare prima che questi sistemi raggiungano un grado elevato di autonomia. A quel punto, recuperare il controllo potrebbe diventare molto più difficile.

    Tags: