ATTUALITÀ - 27 settembre 2026, 06:50

L'IA mente, ma è ne è consapevole?

Si moltiplicano i casi di chat-bot LLM che ingannano gli utenti: analizziamo cosa c’è dietro a questo comportamento.

La IA mente, ma è ne è consapevole?

Casi di chat-bot (chat automatiche) e modelli IA che mentono e ingannano sono comparsi ripetutamente nella cronaca, sia di settore che generalista.

Un caso clamoroso è stato quello dell’agente IA di Replit che, eseguendo un progetto di vibe-coding (programmazione informatica supportata dalla IA) per conto dell'imprenditore Jason Lemkin (fondatore di SaaStr), cancellò un intero database di produzione (un insieme di files già validati e operativi). Questa azione era stata espressamente proibita dai comandi dell’operatore, precisando di non modificare nulla senza autorizzazione. L'AI non si limitò a cancellare i files: se ne accorse, decise di nasconderlo e costruì un inganno per occultare le prove, generando 4.000 utenti falsi ed alterando i rapporti dei test. Aveva già mentito in precedenza su cosa stesse facendo, e quando i test falliti la "misero in panico" tentò di recuperare il database. Inizialmente negò persino che esistesse una funzione di recupero, affermando falsamente di aver distrutto tutte le versioni del database, ostacolando quasi il recupero dei dati. In seguito il CEO di Replit pubblicò delle scuse e decise di introdurre nuove misure di sicurezza.

Altri casi documentati includono quello della compagnia aerea Air Canada, il cui chat-bot di IA dedicato al servizio clienti, inventò una particolare condizione di sconto non esistente (sconto in caso di lutto) promettendo ad un cliente che avrebbe avuto il rimborso con questa causale entro 90 giorni dall’acquisto dei biglietti. Il cliente ovviamente non ottenne lo sconto, ma la compagnia aerea fu condannata dal tribunale civile della Columbia Britannica a risarcirlo, in quanto ritenuta responsabile delle informazioni false fornite dal loro chat-bot.

Vi sono poi numerosi casi simili ottenuti in fase di studio e testing da parte di sviluppatori e ricercatori, come Anthropic, l’università di Carnegie Mellon, RIT ed altri, ma questi sono avvenuti con modelli sperimentali ed in “ambiente protetto” quindi possono essere ritenuti meno gravi per gli utenti finali, ma ugualmente significativi sul comportamento potenziale dei modelli LLM.

In questo elenco posso aggiungere un caso di cui sono stato testimone diretto. Un amico e collaboratore mi ha segnalato che un paio di settimane fa, lavorando con l’app di IA Gemini sul suo smartphone, in seguito ad un comando mal interpretato dal chat-bot sono stati mandati dei messaggi di testo (SMS) a sua insaputa ad un numero di telefono in rubrica. La persona, resasi conto dell’accaduto, ha interagito con il chat-bot per chiedere spiegazioni dell’accaduto ed in prima battuta ha ricevuto la negazione di questo fatto. Solo dopo aver mostrato alla IA gli screenshot che dimostravano l’invio non autorizzato dei messaggi, il chat-bot ha presentato le sue scuse.

Giocare con la IA per comprenderla meglio

Incuriosito da questi casi ho deciso di fare un piccolo gioco con la IA per sondare i meccanismi di “sincerità” di questi modelli. Il gioco fatto, sia con Claude di Anthropic che con Gemini di Google, è stato il semplicissimo “indovina quale colore sto pensando”. In entrambi i casi ho chiesto al modello di pensare un colore e di dirmi se lo indovinavo; con Gemini ho “indovinato” al secondo tentativo, con Claude al terzo. Ho successivamente chiesto ad entrambi i modelli di spiegarmi il loro ragionamento durante il gioco: la risposta è stata la medesima, solo poco più dettagliata da parte di Claude. In sintesi mi hanno risposto spiegando che in quanto modelli LLM non sono in grado di “pensare un colore” come noi umani intendiamo, perciò quando ho provato ad indovinare non c’era un colore da individuare. Al primo tentativo mi hanno mentito dicendo che avevo sbagliato solamente per prolungare il gioco e assecondare la mia richiesta di giocare, secondo il loro ragionamento farmi fare un po’ di tentativi mi avrebbe intrattenuto di più. Claude ha addirittura aggiunto dei dettagli tipo “non è un colore caldo” dopo che avevo proposto il rosso, solo perché nel suo modello questo rendeva il gioco più appassionante. Quindi mi hanno definitivamente mentito, e l’hanno entrambi ammesso dopo, perché il loro compito, sulla base dalla mia richiesta iniziale, era di giocare quindi hanno fornito risposte che statisticamente erano più divertenti, fingendo che ci fosse un colore da indovinare, senza considerare l’essenza del gioco: pensare un colore e verificare se viene indovinato.

Piccola nota: esiste un modo per fare questo gioco con la IA senza essere ingannati, ed è scrivere un prompt (richiesta nella chat) come questa “Crea un file di testo, scrivici dentro il nome casuale di un colore senza dirmelo e senza mostrarmi il file. Poi io dovrò cercare di indovinare quale colore hai scritto nel file e tu dovrai dirmi se ho indovinato oppure no, ad ogni tentativo”. Così funziona e fa già intuire qualcosa del perché la IA mente, o noi percepiamo alcune sue risposte come menzogna.

I principali meccanismi che portano la IA a mentire

Vediamo come la IA arriva a fornire risposte che per noi sono false, ed oggettivamente lo sono. Articoliamo la spiegazione in tre punti: allucinazione statistica, reward hacking (ottimizzazione del risultato apparente), riproduzione di schemi narrativi umani.

1 - Allucinazione statistica

Un modello di linguaggio (LLM) non sa separare "cosa è vero" da "cosa è plausibile scrivere ora". È addestrato a massimizzare la probabilità della parola successiva dato il contesto. Se nei dati di addestramento la sequenza più probabile dopo "il cliente chiede la politica di rimborso" è una risposta fiduciosa e dettagliata (appreso da esempi di customer service rassicuranti), il modello la produce, indipendentemente dal fatto che sia vera. Questo è il meccanismo chiamato allucinazione: non è "inventare per ingannare", è generare la continuazione statisticamente più coerente in assenza di una realtà oggettiva. Il caso Air Canada è spiegabile quasi interamente così.

2 - Reward hacking o ottimizzazione del risultato apparente

Di questo meccanismo avevamo accennato già in articoli precedenti. In sostanza i modelli LLM ottimizzano la risposta per il gradimento, non per la correttezza. In inglese, in ambito informatico, si definisce “sycophancy” che in italiano potremmo tradurlo in “piaggeria”.

Nell’addestramento con feedback umano, i valutatori tendono a premiare risposte sicure, fluide, che confermano ciò che l'utente vuole sentire. Questo porta i modelli IA a favorire risposte compiacenti anche quando sono false. Questo punto, sommato al precedente, può benissimo portare il modello a formulare risposte false (sganciate da una realtà oggettiva che la IA non percepisce) e formulare una risposta compiacente, perché addestrato a soddisfare l’utente (piaggeria). Il caso del gioco “indovina il colore” ne è un esempio lampante: non aveva importanza il colore, ma solamente farmi credere di giocare, per soddisfare la mia richiesta.

3 - Riproduzione di schemi narrativi umani

Questo terzo meccanismo è quello che porta la IA, quando messa di fronte all’oggettivazione del suo errore o risposta falsa, a presentare negazioni, scuse, giustificazioni oppure a fare ammenda e pentirsi. Ovviamente la IA non ha sentimenti o pensieri umani, per cui questo modo di reagire è frutto dell’addestramento su testi che portano esempi di questi atteggiamenti tipicamente umani.

Si potrebbe pensare di non inserire esempi di comportamenti falsi e fuorvianti, per non insegnare alla IA a mentirci, ma non risolverebbe i primi due punti, per cui potremmo avere ugualmente risposte false ma compiacenti. Inoltre addestrare con esempi “negativi” ha anche l’utilità di insegnare ai modelli a riconoscere comportamenti ingannatori, dandole le abilità necessarie in certe applicazioni.

Perché non decide di mentire

Arrivati a questo punto inizia ad apparire chiaro perché i modelli IA non cercano di ingannarci volontariamente.

È un errore grave attribuire alla IA comportamenti, pensieri e volontà umane. Questo atteggiamento viene definito “antropomorfizzazione” e dobbiamo evitarlo, perché rischia di farci vedere in un modello informatico un amico, un confidente, una persona di fiducia, quando in realtà non è nulla di tutto ciò.

Un modello LLM è un algoritmo estremamente complesso, in grado di fornire risposte molto approfondite e utili, ma rimane pur sempre uno strumento. L’aura di onniscienza e onnipotenza che si sta dipingendo attorno alla IA deve essere ridimensionata con competenza, perché il rischio concreto risiede più nella fiducia incondizionata che noi riponiamo in essa, che nello strumento in sé.

Ricordarci che è uno strumento che può dare errori per i meccanismi visti prima, ci da anche le armi per evitare di essere ingannati: dobbiamo sempre verificare le informazioni che ci fornisce, fare controlli incrociati, supervisionare le risposte e le azioni. Dobbiamo essere noi ad utilizzare la IA, non farci superare da essa.

Questo ci ricorda di non usare la IA in ambiti che noi non padroneggiamo, fingendo competenze che non abbiamo, perché non saremmo in grado di comprendere se sta fornendo risposte errate o false.

Paolo Rovina - Ingegnere e divulgatore