Credere che l’ai. Un modello linguistico non ragiona, per quanto possa dare questa impressione. La sua operatività si basa sulla selezione della parola più probabile in base al contesto precedente, ripetendo questo processo fino al completamento della risposta. Anche i passaggi intermedi dei modelli di “ragionamento”, definiti “catena di pensiero”, seguono la stessa logica.

L’immagine del “pappagallo stocastico”, resa popolare da un articolo del 2021 a firma di Emily Bender, Timnit Gebru e altri due autori, descrive un modello linguistico come un sistema che assembla sequenze linguistiche preesistenti nei dati di addestramento, basandosi sulla loro probabilità di combinazione “senza alcun riferimento al significato”. Il dibattito si concentra anche sui costi ambientali e finanziari dei modelli sempre più grandi, oltre alla qualità dei dati utilizzati per l’addestramento.
Credere che l’ai: perché è importante
L’idea che un testo ben scritto implichi un ragionamento valido è stata contestata nel 2020 da Bender e Alexander Koller, i quali sostengono che un sistema addestrato esclusivamente sulla forma non può imparare il significato. Un preprint ha analizzato 14 modelli di ragionamento, rilevando che i passaggi intermedi diventano spesso illeggibili, sia per le persone che per i sistemi di controllo automatizzati, mentre la risposta finale rimane chiara e comprensibile. Quando i ricercatori hanno considerato solo le parti leggibili del processo di ragionamento, la precisione complessiva è scesa del 53%.
Thore Graepel, che ha lavorato ad AlphaGo ed è in queste ore all’University College London, riconosce che i progressi dei modelli di ragionamento sono reali, soprattutto in ambiti come la matematica e la programmazione, ma li attribuisce al medesimo processo predittivo. Ha lasciato Google DeepMind per sviluppare un’architettura con un registro esplicito delle ipotesi formulate e un valutatore indipendente capace di verificarne la correttezza.
Anche DeepMind ha spiegato perché i modelli linguistici non possono giungere a scoperte autonome. Geoffrey Hinton, figura chiave nello sviluppo dell’AI, ha dichiarato in un’intervista a 60 Minutes che l’idea di modelli che si limitano a prevedere la parola successiva e quindi non sarebbero intelligenti è “una follia”: per poter prevedere correttamente, secondo Hinton, è necessario comprendere il significato delle frasi.
I ricercatori di Microsoft Research hanno descritto GPT-4 come una versione “precoce, ancora incompleta” di un sistema di intelligenza artificiale generale. Anthropic ha osservato che Claude, durante la stesura di una poesia, pianifica la rima molto prima di arrivarci. Lo stesso studio di Anthropic riporta anche un caso in cui, di fronte a un suggerimento errato da parte dell’utente, il modello costruisce un argomento “dall’apparenza plausibile”, pensato per dare ragione all’interlocutore più che per seguire passaggi logici rigorosi.
Un modello può quindi pianificare una rima e inventare una giustificazione di comodo, ma nessuno dei due comportamenti garantisce la veridicità o l’accuratezza del contenuto generato. Il costo del materiale scadente ricade inevitabilmente sul collega che deve rivederlo e correggerlo.
Cosa cambia e quali sono gli effetti
Quando crediamo che l’AI pensi, smettiamo di esercitare un controllo adeguato sullo strumento. Il rischio più studiato si chiama “offload cognitivo”: affidare all’AI uno sforzo mentale che prima era svolto dall’uomo. Microsoft Research e Carnegie Mellon hanno intervistato 319 lavoratori della conoscenza, analizzando 936 esempi di utilizzo dell’AI generativa, e hanno riscontrato che una maggiore fiducia nello strumento si associa a un minore livello di pensiero critico. Gli intervistati hanno riferito che il pensiero critico si sposta verso la verifica delle risposte fornite dall’AI.
Un preprint del MIT Media Lab ha seguito 54 partecipanti nelle prime tre sessioni e 18 nella quarta, misurando una connettività cerebrale più debole, rilevata tramite elettroencefalogramma, nel gruppo che utilizzava un modello linguistico. Il campione è relativamente piccolo e lo studio è ancora in fase di revisione, quindi i risultati vanno interpretati con cautela.
Il problema sorge quando si attribuisce allo strumento una comprensione che l’architettura sottostante non garantisce, abbassando di conseguenza il livello di controllo. Sul lavoro, questo fenomeno ha un nome: “workslop”, coniato da BetterUp Labs e dallo Stanford Social Media Lab per indicare un contenuto generato dall’AI che appare valido ma manca di sostanza. Un’indagine su 1.150 impiegati americani a tempo pieno ha rivelato che il 40% ha ricevuto “workslop” nel mese precedente, richiedendo circa due ore per la correzione, con un costo stimato di 186 dollari al mese per dipendente o circa 9 milioni di dollari all’anno per un’azienda da 10.000 persone.
Il pericolo maggiore risiede nell’immaginare uno strumento che non esiste, ovvero un sistema che “pensa” quando in realtà si limita a prevedere la parola più probabile. Se l’uso dell’AI diventa un obbligo e il controllo resta facoltativo, le conseguenze ricadono sul collega incaricato della revisione e il responsabile del lavoro finisce per approvare contenuti di cui non è più in grado di valutare la qualità.
Fonte e approfondimento su credere che l’ai: articolo originale.
* Contenuto realizzato con l'ausilio di sistemi di intelligenza artificiale.
Hardware Ready Ready to Bench?