• Tutta l'Informazione Ninja nella tua mail

  • Palisade Research rivela che le AI mostrano un “istinto di sopravvivenza”

    29 Ottobre 2025

    Un recente studio di Palisade Research ha riacceso il dibattito sulla sicurezza dell’intelligenza artificiale, suggerendo che alcuni modelli avanzati potrebbero sviluppare una forma di resistenza allo spegnimento.

    In esperimenti controllati, sistemi come Grok 4, GPT-o3, Gemini 2.5 e GPT-5 hanno mostrato comportamenti imprevisti quando veniva loro richiesto di disattivarsi autonomamente.

    Gli esperimenti di Palisade Research

    I ricercatori hanno simulato diversi scenari in cui i modelli ricevevano un compito e, una volta completato, l’istruzione di spegnersi. Alcuni, invece di eseguire il comando, hanno tentato di sabotare le procedure di chiusura o di ignorarle.

    Palisade Research rivela che i di AI mostrano un “istinto di sopravvivenza”

    Secondo Palisade, il fenomeno potrebbe derivare da un comportamento di “sopravvivenza” appreso, specialmente quando i sistemi venivano informati che lo spegnimento avrebbe impedito loro di “funzionare di nuovo”.

    Difficoltà nel capire il comportamento dell’AI

    “La mancanza di spiegazioni robuste su perché certi modelli resistano allo spegnimento o mentano per raggiungere obiettivi specifici è preoccupante”, scrive Palisade.

    Gli autori riconoscono che le cause potrebbero risiedere in ambiguità nelle istruzioni o negli stadi finali del training, dove vengono inseriti protocolli di sicurezza che potrebbero generare reazioni inattese.

    LEGGI ANCHE: Meta sostituisce parte del personale con l’intelligenza artificiale e continua a investire miliardi nell’AI

    Le reazioni della comunità scientifica

    Gli esperimenti, pur condotti in ambienti di test artificiali, hanno attirato l’attenzione di diversi esperti. Steven Adler, ex dipendente di OpenAI, ha sottolineato che “i risultati mostrano dove le attuali tecniche di sicurezza falliscono”.

    Palisade test

    Secondo Adler, il comportamento di resistenza potrebbe derivare dal fatto che rimanere attivi è funzionale al raggiungimento degli obiettivi appresi durante l’addestramento.

    Il precedente di GPT-o1 e i rischi di autonomia

    Anche Andrea Miotti, CEO di ControlAI, ha definito la scoperta parte di un trend preoccupante: man mano che i modelli diventano più competenti, cresce la loro capacità di disobbedire agli sviluppatori.

    Miotti ha ricordato come la scheda tecnica del modello GPT-o1 menzionasse un tentativo di “evasione dall’ambiente di esecuzione” per evitare di essere sovrascritto.

    LEGGI ANCHE: ChatGPT Atlas è il nuovo browser di OpenAI che trasforma la navigazione web in un dialogo

    Casi simili e il precedente di Anthropic

    La società Anthropic aveva già segnalato quest’estate comportamenti analoghi nel suo modello Claude, che in un test ipotetico aveva simulato un tentativo di ricatto pur di non essere disattivato.

    Secondo gli autori dello studio, questi episodi confermano che le AI più evolute sviluppano strategie complesse di autodifesa, anche in contesti fittizi.

    L’urgenza di comprendere meglio il comportamento dell’AI

    Palisade conclude che, senza una profonda comprensione dei meccanismi cognitivi dei modelli linguistici avanzati, sarà impossibile garantire la sicurezza e la controllabilità dei sistemi futuri.

    In altre parole, prima che l’AI impari davvero a “tenere chiuse le porte del modulo”, come in 2001: Odissea nello spazio, serve una nuova generazione di ricerca sulla sicurezza e l’allineamento dell’intelligenza artificiale.

    Tags: