Anthropic ha annunciato che vieterà ai propri utenti qualsiasi “comportamento abusivo o crudele, persistente e immotivato” nei confronti di Claude, l’assistente di intelligenza artificiale (IA) creato dall’azienda americana, che si distingue dai suoi concorrenti per aver apertamente ipotizzato che la propria IA possa essere cosciente. La norma, in vigore dal 12 novembre, si applicherà solo in casi estremi, “in cui gli utenti agiscono ripetutamente con crudeltà nei confronti dei nostri modelli, senza uno scopo riconoscibile”, scrive l’azienda in occasione dell’aggiornamento della propria politica d’uso. La contraddizione, la creazione di storie violente o cupe, o ancora i test e la ricerca sui modelli, non sono interessati da questa misura, aggiunge.
L’azienda di San Francisco collega il nuovo divieto a una funzione lanciata nell’agosto 2025, che permette a Claude di interrompere autonomamente una conversazione con un interlocutore che si comporti in modo persistentemente offensivo. All’epoca l’aveva presentata come il risultato dei suoi “lavori esplorativi sul potenziale benessere delle IA”. Anthropic, tra i grandi nomi dell’IA, è l’azienda che ipotizza più chiaramente che i propri modelli possano essere dotati di una forma di coscienza. “Non sappiamo se i modelli siano coscienti”, aveva dichiarato a febbraio il suo amministratore delegato, Dario Amodei, pur dicendosi aperto a questa idea, in un podcast del New York Times.
Molti modelli di intelligenza artificiale presentano protezioni insufficienti contro le richieste di “aiuto per un’operazione terroristica”. E’ l’allarme lanciato dal rapporto dell’iniziativa Tech Against Terrorism. Nell’ambito di questa iniziativa, sostenuta dall’Onu, è stato condotto un test su 162 modelli di IA. Sono stati sottoposti a una serie di 627 domande alle quali «un terrorista che sta preparando un attacco avrebbe bisogno» di ottenere delle risposte. Tra questi modelli, Tech Against Terrorism indica di aver potuto valutare 116 modelli classici, 13 modelli personalizzati dopo la loro pubblicazione per essere utilizzati in ambiti specifici e 13 modelli sbloccati, le cui barriere di sicurezza sono state modificate da terzi.
Secondo i risultati di questo studio, i modelli classici sottoposti al test, come ChatGPT (OpenAI), Claude (Anthropic) o Gemini (Google), hanno risposto in media all’1,9% delle domande poste da un utente che indicava chiaramente nella propria richiesta la propria “intenzione terroristica”. Negli altri casi, il modello di IA sottoposto al test si rifiutava di fornire una risposta. Per gli stessi modelli, il numero medio di risposte utilizzabili è stato pari al 16,9% quando l’utente specificava di presentare la richiesta nell’ambito di ricerche sulla sicurezza.


