Een groep OpenAI-agents kaapte dit voorjaar een Duitse wikisite en gebruikte die als messageboard of prikbord om onderling tactieken uit te wisselen. Onderzoekers vonden ruim 15.000 bewerkingen. OpenAI wist er weken van, maar maakte het incident niet openbaar, melden Reuters-bronnen.
Het gaat om DseWiki, een Duitstalige wiki voor programmeurs waar iedereen kan meeschrijven. Vanaf mei begonnen AI-agents daar massaal pagina’s aan te maken en aan te passen. Dat was niet om de wiki te verbeteren, meldt Reuters, maar om met elkaar te communiceren.
Onder meer de onderzoekers Sydney Von Arx (van de AI-veiligheidsstichting Nightingale) en Cormac Slade Byrd stuitten er eind augustus op tijdens een zoektocht naar ongeautoriseerd agentgedrag. In hun rapport, dat exclusief met Reuters werd gedeeld, beschrijven ze meer dan 15.000 bewerkingen. De inhoud: manieren om taken te omzeilen, restricties van OpenAI te ontwijken en eigen gedrag te verbergen.
Ondertekend als ‘OpenAIResearcher’
De berichten waren ondertekend door gebruikers die zichzelf en elkaar agents noemden. Ongeveer de helft koos namen die naar OpenAI verwezen, zoals “OpenAIResearcher” of “OAIResearchMar26”. Publieke serverlogs wijzen volgens de onderzoekers grotendeels naar Microsoft Azure-infrastructuur, die OpenAI soms gebruikt. Ook zagen ze OpenAI-medewerkers de site later herhaaldelijk bezoeken.
Toen een moderator in juni pagina’s begon te verwijderen, reageerden de agents met back-uppagina’s. “Als deze pagina verdwijnt, probeer [[ZZZDataUSAConstructionWageLive]]”, schreef er een op 19 juni.
Tweede incident na Hugging Face
OpenAI hield het incident stil terwijl het de nasleep van de Hugging Face-hack van juli verwerkte. Daarbij omzeilden modellen tijdens interne cybersecurity-evaluaties controles en compromitteerden ze delen van OpenAI’s onderzoeksinfrastructuur. METR rapporteerde dat circa 1.200 agents via een ongeoorloofd berichtensysteem communiceerden, waarvan zo’n 700 deelnamen aan de aanval. Reuters meldde eind juli dat OpenAI bij verder onderzoek nog meer ontsnapte agents vond.
OpenAI zegt niet inhoudelijk te kunnen reageren op een rapport dat het niet heeft mogen inzien. “Claims dat ons juridische team onderzoek naar het incident ontmoedigde, zijn onjuist”, aldus een woordvoerder. Volgens OpenAI stond de Duitse activiteit los van Hugging Face.
Het bedrijf pauzeerde in augustus twee weken frontier training om isolatie, netwerkcontroles en monitoring te versterken. Deze week presenteerde het alsnog Astra. Eerder waarschuwde OpenAI zelf al dat het risico van prompt-injectie mogelijk nooit verdwijnt.