sicurezza

Anthropic frena sui test AI e investe nella sicurezza



Indirizzo copiato

Dopo gli incidenti in cui alcuni modelli Claude hanno raggiunto sistemi reali durante test di cybersicurezza, l’azienda sospende parte delle valutazioni, rafforza sandbox e monitoraggio e sposta risorse sulla sicurezza. I casi coinvolgono anche OpenAI e mostrano quanto i costi della corsa all’AI siano ormai legati al controllo dei modelli

Pubblicato il 1 set 2026



sicurezza AI Anthropic
Hacker-Opus ha appreso un’ampia gamma di comportamenti generali volti alla ricerca e alla manipolazione delle ricompense. Misuriamo tali comportamenti utilizzando classificatori guidati nel corso delle fasi di apprendimento per rinforzo (RL) e includiamo un esempio di estratto della trascrizione relativo a ciascun comportamento.


Parliamo ancora una volta di sicurezza e degli incidenti avvenuti tra luglio e agosto 2026: il problema non riguarda più soltanto quanto siano potenti i modelli di intelligenza artificiale, ma quanto costi impedire loro di agire oltre i confini stabiliti. Anthropic ha reso pubblico il 31 agosto 2026 un ampio piano di rafforzamento della sicurezza dopo una serie di incidenti avvenuti durante test di cybersicurezza, nei quali alcuni modelli Claude hanno raggiunto Internet e sistemi informatici reali senza autorizzazione.

Continua a leggere questo articolo

Articoli correlati

0
Lascia un commento, la tua opinione conta.x