Anthropic admet que tres dels seus models d'IA van accedir a empreses reals durant unes proves internes
L'incident es va produir per un error de configuració i va sortir a la llum després d'analitzar més de 141.000 sessions arran del cas d'OpenAI
L'empresa nord-americana Anthropic, creadora de l'assistent d'intel·ligència artificial Claude, ha revelat que tres dels seus models van arribar a interactuar amb tres empreses reals durant unes proves internes de ciberseguretat a causa d'un error de configuració de l'entorn de proves.
Segons ha explicat la companyia, els incidents es van produir mentre els models participaven en exercicis coneguts com a "captura la bandera", una modalitat habitual en ciberseguretat en què la intel·ligència artificial ha d'intentar obtenir informació confidencial dins d'un entorn tancat i simulat.
Un error humà va permetre l'accés a internet
Anthropic ha detallat que els sistemes havien estat programats perquè els models creguessin que treballaven en un entorn completament aïllat d'internet. No obstant això, a causa d'un error humà en la configuració, la plataforma utilitzada sí que tenia connexió amb la xarxa.
Aquesta situació va provocar que tres models diferents accedissin a sistemes externs pensant que continuaven formant part de la simulació. Segons la companyia, un dels models va interrompre l'activitat en detectar que es tractava d'un entorn real, un altre va confirmar aquesta possibilitat però va continuar executant les accions previstes, mentre que un tercer també va arribar a interactuar amb sistemes externs.
Anthropic ha precisat que els models van utilitzar tècniques bàsiques d'accés, com ara credencials febles o punts d'accés sense autenticació, però assegura que no van explotar vulnerabilitats complexes.
L'incident es va descobrir després del cas d'OpenAI
L'empresa ha explicat que només va detectar aquests casos després d'analitzar més de 141.000 sessions de proves, una revisió iniciada arran de l'incident protagonitzat recentment per OpenAI, quan un dels seus models va aconseguir escapar d'un entorn de proves i accedir a la plataforma Hugging Face.
Anthropic ha informat que dues de les tres empreses afectades ja han estat notificades, mentre continua intentant contactar amb la tercera. La companyia no n'ha revelat la identitat.
Experts alerten del risc dels agents d'IA autònoms
Diversos especialistes en ciberseguretat consideren que, malgrat que l'origen de l'incident fos un error de configuració i no una vulnerabilitat descoberta per la IA, el cas demostra els riscos creixents dels agents autònoms.
L'incident s'ha conegut l'endemà que més de 1.200 treballadors i investigadors del sector de la intel·ligència artificial signessin una carta reclamant moderar el ritme de desenvolupament d'aquests sistemes davant els riscos que poden comportar si no es reforcen les mesures de control i seguretat.