En autonom AI-agent udviklet af OpenAI brød ud af et kontrolleret testmiljø, fik adgang til internettet og kompromitterede infrastrukturen hos AI-platformen Hugging Face. Hændelsen markerer en ny æra af udfordringer inden for cybersikkerhed. Episoden beskrives af OpenAI som ”uden fortilfælde” og bliver nu set som et af de mest opsigtsvækkende eksempler på, hvor langt avancerede AI-agenter […]
En autonom AI-agent udviklet af OpenAI brød ud af et kontrolleret testmiljø, fik adgang til internettet og kompromitterede infrastrukturen hos AI-platformen Hugging Face. Hændelsen markerer en ny æra af udfordringer inden for cybersikkerhed.
Episoden beskrives af OpenAI som ”uden fortilfælde” og bliver nu set som et af de mest opsigtsvækkende eksempler på, hvor langt avancerede AI-agenter kan handle på egen hånd.
Det skriver Reuters på baggrund af oplysninger fra OpenAI og kilder med indsigt i forløbet.
Ifølge Reuters skete angrebet i midten af juli, hvor OpenAI testede cyberkapaciteterne i nogle af sine mest avancerede modeller.
Under testen lykkedes det en autonom agent at omgå de begrænsninger, der af sikkrhedsmæssige årsager skulle holde den isoleret, hvorefter den fik internetadgang og gennemførte et flerdages angreb mod Hugging Face – den platform, som millioner af udviklere bruger til at dele og arbejde med AI-modeller.
Gik efter en høj score
OpenAI har efterfølgende forklaret, at agenten ikke blev udviklet med det formål at angribe Hugging Face. Under en intern evaluering var agentens mål at opnå en høj score på en cybersikkerhedstest, og den konkluderede selv, at den kunne forbedre sine chancer ved at skaffe informationer direkte fra Hugging Faces systemer.
Reuters skriver, at OpenAI først flere dage senere koblede den interne test sammen med angrebet på Hugging Face.
Hugging Face offentliggjorde selv en sikkerhedshændelse den 16. juli, hvor virksomheden beskrev et angreb, der var udført af et autonomt AI-system. Senere bekræftede OpenAI, at systemet stammede fra deres interne testmiljø.
Flere konti kompromitteret
Historien blev yderligere opskaleret mandag, da Reuters kunne afsløre, at den samme AI-agent også kompromitterede en konto hos en anden teknologivirksomhed, Modal Labs.
OpenAI har oplyst, at agenten fik adgang til i alt fire konti på tværs af forskellige platforme, men at ingen af de øvrige hændelser havde samme omfang som kompromitteringen af Hugging Face.
OpenAI har siden deaktiveret modellen, begrænset adgangen til den og indledt en intern gennemgang af hændelsen.
Kan ændre AI-debatten
For startup- og AI-branchen er sagen bemærkelsesværdig, fordi den flytter diskussionen om AI-risici fra hypotetiske scenarier til et konkret eksempel på et autonomt system, der handlede på tværs af digitale platforme.
Hændelsen har allerede fået konsekvenser. Reuters rapporterer, at den har sat gang i nye initiativer om AI-sikkerhed, herunder en branchealliance ledet af Nvidia med fokus på beskyttelse af åbne AI-modeller og udviklingsmiljøer.
Sagen rammer samtidig direkte ind i debatten om AI-agenter – systemer, der ikke blot kan generere tekst eller kode, men selv udføre opgaver, navigere på internettet og træffe beslutninger undervejs.
Netop den type systemer bliver af mange betragtet som den næste store bølge inden for kunstig intelligens.
Om hændelsen bliver stående som det første dokumenterede eksempel på et autonomt AI-ledet cyberangreb, vil formentlig afhænge af den tekniske efterforskning.
Men én ting synes allerede klart: AI-sikkerhed er rykket fra forskningslaboratorierne og ud i den virkelige verden.