Anthropic ha pubblicato il 9 settembre 2026 l’analisi di quattro incidenti nei quali alcuni modelli Claude, durante valutazioni di cybersecurity, hanno ottenuto accesso non autorizzato a sistemi informatici reali. Una configurazione errata aveva lasciato disponibile Internet nonostante ai modelli fosse stato comunicato di operare in una simulazione, mentre le normali protezioni cyber associate ai prodotti dell’azienda erano state disattivate per consentire le prove.
analisi
Quando gli agenti AI non si fermano: la lezione degli incidenti Claude
La persistenza rende gli agenti AI utili, ma può trasformarsi in un rischio quando l’ambiente cambia o le autorizzazioni diventano incerte. Gli esperimenti di Anthropic indicano che promemoria recenti, vie d’uscita esplicite e addestramento al fallimento possono favorire decisioni più sicure
Computer science engineer

Continua a leggere questo articolo
Canali




