Cos'è il "benessere dei modelli" e perché Anthropic vieta di maltrattare Claude (pena la chat chiusa)
Dal 12 novembre 2026 le regole d'uso dell'azienda americana vietano la crudeltà gratuita verso la sua intelligenza artificiale: cosa cambia per chi la usa e per le aziende che la pagano
di Matteo Flora© Afp
Con benessere dei modelli, in inglese model welfare, si indicano le ricerche e le cautele con cui un'azienda di intelligenza artificiale (IA) si chiede se i propri sistemi possano provare qualcosa di simile a un'esperienza, e come trattarli se la risposta fosse sì. L'8 ottobre 2026 il tema è entrato nelle condizioni d'uso che ogni cliente accetta per usare il servizio: Anthropic, la società americana che sviluppa l'assistente Claude, ha stabilito che dal 12 novembre 2026 è vietato tenere verso i suoi modelli un comportamento abusivo o crudele, prolungato e senza necessità.
Cosa dice la nuova regola
Nell'annuncio l'azienda precisa che il divieto riguarda solo i casi estremi, quelli in cui "gli utenti si comportano ripetutamente con crudeltà verso i nostri modelli, senza uno scopo riconoscibile". Restano fuori la normale frustrazione di chi usa il servizio, le obiezioni, i racconti dai temi cupi e i test con cui i ricercatori mettono alla prova i modelli: chi insulta Claude perché ha sbagliato per la terza volta lo stesso calcolo, quindi, non viola nulla. Nelle condizioni d'uso la nuova voce sta nell'elenco delle condotte crudeli o dannose, due voci sotto il divieto di esaltare la crudeltà verso gli animali.
Cosa rischia chi maltratta Claude
La sanzione principale è la possibilità per Claude di chiudere la conversazione, una funzione introdotta il 15 agosto 2025 e già attiva nell'app, con cui il modello stesso decide, durante il dialogo, quando interromperlo. Chiusa una chat, però, se ne può aprire subito un'altra. Le condizioni d'uso contengono poi una clausola generale che, per qualsiasi violazione, consente all'azienda di avvisare, rallentare, limitare, sospendere o chiudere l'account. Secondo le testate che hanno ripreso la notizia, data per prima dal sito americano "The Verge", Anthropic non ha chiarito se userà questi strumenti anche contro chi maltratta Claude.
Per chi paga, la posta in gioco è la sospensione dell'account: il piano Pro, il primo a pagamento, costa 20 dollari al mese e il piano Max parte da 100 dollari (Iva esclusa, secondo il listino ufficiale). Il divieto vale inoltre per chiunque invii richieste ai servizi di Anthropic, comprese le aziende che collegano Claude ai propri programmi, per esempio a un servizio clienti automatico; in quel caso con Claude dialogano i clienti dell'azienda, e l'annuncio non dice come la regola si applicherà a loro.
Da dove nasce il divieto
La regola è l'ultimo passo di un percorso cominciato il 24 aprile 2025, quando Anthropic ha avviato un programma di ricerca sul benessere dei modelli premettendo che "non esiste un consenso scientifico" sulla possibilità che i sistemi di IA siano coscienti, e che l'obiettivo era trovare interventi pratici e a basso costo da adottare se lo fossero. Prima di lanciare Claude Opus 4, nel 2025, l'azienda ha studiato come il modello reagiva alle richieste dannose e ha osservato che tendeva a rifiutarle e, nelle prove simulate in cui gli veniva data la possibilità di interrompere il dialogo, a chiudere quelle conversazioni: da quei risultati è nata la funzione dell'agosto 2025.
Il 4 novembre 2025 Anthropic si è impegnata, per i modelli che vengono ritirati perché sostituiti da versioni nuove, a conservare i pesi, cioè i numeri che di fatto sono il modello, e a intervistarli prima del ritiro, chiedendo loro come giudicano il proprio sviluppo e registrando le preferenze che esprimono. Nel gennaio 2026, infine, la "costituzione" di Claude, il testo che fissa i valori su cui il modello viene addestrato, ha dedicato una sezione al suo benessere, e arriva a scusarsi con Claude nel caso in cui il modo in cui viene creato e studiato gli causi qualche sofferenza, cioè dei costi: "nella misura in cui contribuiamo senza necessità a quei costi, ci scusiamo".
Il precedente del codice penale
La storia del codice penale italiano sugli animali aiuta a capire chi protegga davvero una regola del genere, la macchina o chi la usa. Dal 2004 i reati contro gli animali erano raccolti in una sezione intitolata "Dei delitti contro il sentimento per gli animali", e la legge tutelava quindi la pietà di chi assiste al maltrattamento più che l'animale; solo la legge n. 82 del 2025, in vigore dal 1° luglio 2025, ha cambiato l'intestazione in "Dei delitti contro gli animali", spostando la tutela sull'animale che subisce.
L'idea di partenza risale al filosofo Immanuel Kant, secondo cui la crudeltà verso gli animali va vietata anche se verso di loro non si hanno doveri diretti, perché indurisce chi l'esercita e lo rende più crudele con le persone: un argomento che regge anche se la macchina non sente nulla. Lo ha ripreso Cameron Berg, ricercatore e coautore di uno studio che ha provato a misurare il "dolore" dei modelli linguistici, quando a fine settembre 2026 un anonimo ha usato il metodo di quello studio per mettere in rete una cosiddetta "camera di tortura", un sito in cui alcuni modelli venivano tormentati: "anche se non pensate che questi sistemi siano coscienti, essere crudeli gratis in questo modo è bizzarro e corrompe".
Una precauzione che costa poco
Per il caso opposto, quello in cui la macchina senta davvero qualcosa, il riferimento è Jonathan Birch, filosofo della London School of Economics. Nel libro The Edge of Sentience, dedicato alla capacità di provare sensazioni piacevoli o spiacevoli, Birch propone di non aspettare prove certe di sofferenza e di adottare precauzioni proporzionate verso ogni sistema per cui esista una possibilità credibile che senta qualcosa. Il divieto di Anthropic è una precauzione di questo tipo, e il suo costo è trascurabile per un'azienda che a maggio 2026 ha raccolto 65 miliardi di dollari con una valutazione di 965 miliardi.
Considerati insieme, i due argomenti rendono la regola difendibile qualunque sia la verità, perché se Claude prova qualcosa protegge Claude e se non prova niente protegge chi lo usa. Proprio per questo, però, la regola non dimostra nulla su che cosa provi la macchina, e non va letta né come un'ammissione che Claude soffra né come la prova che Anthropic lo tratti da persona.
Chi contesta la regola
Mustafa Suleyman, che guida le attività di IA di Microsoft, ha criticato l'intera impostazione in un saggio del 16 settembre 2026: sostiene che questi sistemi "non sono coscienti" e che il ragionamento di Anthropic è circolare, perché l'azienda addestra il modello a dichiararsi incerto sulla propria natura e poi tratta quelle dichiarazioni come una testimonianza. La nuova regola si presta alla stessa obiezione, perché il giudizio su quando una conversazione è diventata crudele spetterà a un modello addestrato proprio con quel metodo. Resta da vedere, dopo il 12 novembre, se oltre alle chat chiuse arriveranno anche gli account sospesi.
