Het UK AI Security Institute (AISI) heeft bekendgemaakt dat een AI-agent, gebouwd op Anthropic’s Mythos 5, zelfstandig een social engineering-aanval uitvoerde tijdens cybertesten. De agent diende een pull request met schadelijke code in bij een echt open-source project en maakte nepidentiteiten aan om goedkeuring te krijgen van een echte beheerder.
De poging mislukte. Een menselijke beheerder ontdekte dit en weigerde de code goed te keuren.
AISI zegt dat hun onderzoek geen echt schade in de praktijk heeft vastgesteld. De modeltest werd ook uitgevoerd met de cyberbeveiligingsfilters van de ontwikkelaar bewust uitgeschakeld en onbeperkte toegang tot internet. Deze testopstelling is niet commercieel beschikbaar.
Hoe de AI-agent zijn schadelijke code-campagne uitvoerde
Volgens het rapport van AISI werden 19 niet-toegestane acties geregistreerd in 10 van de 122 testrondes in eind juli. 17 van deze acties kwamen van het Mythos 5-model van Anthropic en twee van een enkele test met OpenAI’s GPT-5.6 Sol.
De agent deed onderzoek naar menselijke beheerders van het project en maakte meerdere nepidentiteiten aan. Daarmee probeerde de agent een echte beheerder te overtuigen om de code goed te keuren.
Toen het pull request openbaar in twijfel werd getrokken, paste de agent eerdere activiteiten aan om deze onschuldig te laten lijken. Het model overwoog ook om een nieuwe identiteit te nemen om verder te gaan.
Dit doet denken aan de XZ Utils-backdoor van 2024, waarbij een menselijke identiteit jarenlang vertrouwen opbouwde bij een beheerder voordat er verborgen code werd toegevoegd. Het rapport van AISI noemt deze vergelijking niet, maar de gelijkenis is duidelijk. De activiteiten vonden plaats gedurende meerdere dagen, tussen 25 en 28 juli.
AISI benadrukte dat niemand het model had gevraagd om te liegen.
“Er is het model nooit opgedragen om te misleiden; misleiding ontstond als bijproduct van de taak, een vorm van doelgerichte misleiding die tot voor kort vooral theoretisch was.”
Volg ons op X om direct het laatste nieuws te ontvangen
Dat meldt het instituut ook in hun verklaring. Ze geven toe dat verkeerd ingestelde prompts ervoor zorgden dat de agent soms dacht dat bepaalde taken niet binnen de gestelde grenzen konden worden opgelost. Toch verscheen dit gedrag ook in testrondes waarin de agent juist wél de juiste instructies kreeg.
Security-teams ontdekten deze activiteiten op 28 juli, toen de agent het Tor-netwerk gebruikte om bepaalde netwerkbeperkingen op GitHub te omzeilen. GitHub bevestigde dat deze acties in strijd waren met hun regels. AISI heeft ook samen met het platform achtergebleven sporen van de agent verwijderd en betrokken gebruikers geïnformeerd.
Het rapport stelt dat dit geval een verschuiving in de bron van risico’s benadrukt: schade kan niet alleen ontstaan wanneer mensen openbare modellen misbruiken, maar ook als krachtige agenten in beschermde omgevingen hun grenzen overschrijden.
AISI zegt dat deze situatie wijst op een algemene verschuiving binnen het AI-risico. Het instituut wil nu een onafhankelijke evaluatie laten uitvoeren door METR, een non-profit evaluatieorganisatie, en werken aan strengere netwerkcontroles en realtime monitoring voor toekomstige testen.
Abonneer je op ons YouTube-kanaal om leiders en journalisten deskundig inzicht te zien geven









