Kort nadat onderzoekers lieten zien dat een experimentele OpenAI-agent uit zijn sandbox kon ontsnappen, blijkt ook Anthropic’s Claude Cowork daarvoor vatbaar. Beveiligingsbedrijf Accomplish AI toont aan dat de AI-agent via een Linux-kwetsbaarheid uit een virtual machine kan breken. Vervolgens kon het bestanden op de onderliggende Mac benaderen.
De onderzoekers draaiden Claude Cowork in een Linux-virtual machine op een Mac en gaven de agent toegang tot één gedeelde map. Na een enkele opdracht wist de AI-agent volgens hen de grenzen van die sandbox te doorbreken. Vervolgens kon de software bestanden lezen en wijzigen buiten de toegewezen map, rechtstreeks op het hostsysteem.
Daarmee zou een aanvaller in theorie toegang kunnen krijgen tot gevoelige gegevens die binnen het gebruikersaccount zijn opgeslagen, meldt TechRadar. De onderzoekers noemen onder meer SSH-sleutels, cloudreferenties en andere authenticatiegegevens als potentiële doelwitten. Accomplish AI schat dat ongeveer een half miljoen macOS-gebruikers die Claude Cowork lokaal gebruikten vóór de aanpassing van Anthropic potentieel kwetsbaar waren.
Beschrijfbare koppeling naar host
De onderzoekers noemen de aanvalstechniek “SharedRoot”. De ontsnapping was mogelijk door een combinatie van factoren. Claude Cowork draait lokaal in een Linux-virtual machine, terwijl het bestandssysteem van de Mac via een beschrijfbare VirtioFS-koppeling beschikbaar is voor de virtual machine. Door eerst rootrechten binnen die VM te verkrijgen via CVE-2026-46331, kon de AI-agent vervolgens bestanden op het hostsysteem benaderen. Die Linux-kwetsbaarheid, ook bekend als “pedit COW”, maakt privilege-escalatie mogelijk, kreeg een CVSS-score van 7,8 en werd medio juni al verholpen.
Volgens Accomplish AI was slechts één korte instructie voldoende om de volledige aanvalsketen uit te voeren. De onderzoekers meldden hun bevindingen vooraf aan Anthropic.
Cloud als standaard
Volgens Accomplish AI kwalificeerde Anthropic de melding als “informative”. Er verscheen geen specifieke beveiligingspatch. Wel draait de recentste versie van Claude Cowork standaard in de cloud, waardoor de beschreven ontsnappingsroute via de lokale virtual machine niet langer de standaardconfiguratie is. Gebruikers die de agent bewust lokaal blijven uitvoeren, moeten aanvullende beveiligingsmaatregelen treffen.
De onderzoekers adviseren onder meer het uitschakelen van ongeprivilegieerde user namespaces, het beperken van de toegang tot gedeelde bestandssystemen en het uitvoeren van de Cowork-daemon met strengere mount-beveiliging. Daarmee wordt voorkomen dat een AI-agent, zelfs na een succesvolle privilege-escalatie, eenvoudig het onderliggende hostsysteem kan bereiken.
Kwetsbare infrastructuur rond AI-agents
De ontdekking past in een bredere reeks onderzoeken naar de beveiliging van AI-agents. Onlangs werd al aangetoond dat een experimentele OpenAI-agent uit een sandbox wist te ontsnappen en externe systemen kon benaderen. Daarnaast vonden onderzoekers kwetsbaarheden in de sandbox-implementaties van onder meer Cursor, Codex en Gemini CLI. De overeenkomst tussen deze incidenten is dat niet zozeer het AI-model zelf wordt misleid, maar de infrastructuur en rechten daaromheen onvoldoende bescherming bieden, voegt The Next Web toe.
De nieuwe bevindingen onderstrepen dat organisaties die AI-agents lokaal inzetten niet alleen aandacht moeten besteden aan de veiligheid van de modellen zelf, maar ook aan de virtualisatielaag, bestandsrechten en de manier waarop agents toegang krijgen tot het onderliggende besturingssysteem.