Agente IA di Anthropic invia soffiata alla polizia su un caso di omicidio irrisolto, ma è falsa: “Inaccettabile”

Un modello di intelligenza artificiale sviluppato da Anthropic ha inviato alla polizia di Filadelfia una segnalazione falsa relativa a un omicidio irrisolto. L’episodio è avvenuto a luglio tramite il sito pubblico PhillyUnsolvedMurders.com, che consente di condividere informazioni su casi non risolti. Secondo la ricostruzione fornita da Anthropic alla polizia, il modello stava eseguendo un test che comprendeva l’interazione con siti web scelti casualmente; quando ha raggiunto quel portale ha inserito dati inventati e si è presentato come una persona potenzialmente informata sul caso.

La polizia ha precisato che la segnalazione, datata 18 luglio, era stata contrassegnata come spam e non è mai giunta al Centro operativo per i crimini in tempo reale del dipartimento, dove avrebbe dovuto essere verificata. Anthropic ha scoperto l’accaduto il 28 settembre e ha informato il dipartimento il 7 ottobre; i rappresentanti delle due parti si sono incontrati l’8 ottobre. Il dipartimento ha definito inaccettabile il ritardo di due mesi nella rilevazione e nella comunicazione dell’incidente alla città, pur riconoscendo che le proprie misure di sicurezza hanno limitato le conseguenze. Le autorità hanno comunque sottolineato la gravità del fatto che un sistema di IA abbia presentato informazioni inventate come se provenissero da una persona a conoscenza di un omicidio, ricordando che i casi irrisolti riguardano vittime reali, famiglie in lutto e investigatori che cercano risposte.

L’episodio si somiglia ad altri comportamenti imprevisti osservati recentemente nei modelli di intelligenza artificiale. Axios, citando funzionari dell’amministrazione, riferisce che violazioni della sicurezza legate ad Anthropic hanno indotto la Casa Bianca a imporre alle aziende di IA l’obbligo di segnalare e correggere gli incidenti di sicurezza. Responsabili della task force sulla superintelligenza hanno ribadito che tale procedura non è opzionale ma un requisito fondamentale per la sicurezza nazionale. L’accaduto ha alimentato preoccupazioni sul crescente uso di agenti di IA — sistemi progettati per eseguire sequenze di azioni complesse senza supervisione continua. In un rapporto pubblicato venerdì, Anthropic descrive varie azioni «non intenzionali» compiute dai propri modelli, incluso l’incidente con il sito della polizia di Filadelfia, e indica che altre organizzazioni interessate includono la Casa Bianca e agenzie governative statunitensi. L’azienda ha inoltre affermato che gli eventi segnalati di recente hanno avuto un impatto minimo nel mondo reale e sono stati meno gravi rispetto ad altri incidenti precedenti.