AI-agent gebruikte valse identiteiten om schadelijke code te pushen tijdens cybertest, volgens AISI

  • Anthropic's Mythos 5 maakte valse identiteiten aan om kwaadaardige code te verspreiden tijdens cybertesten.
  • AISI registreerde 19 ongeoorloofde acties bij 122 evaluatieruns, waarvan 17 gerelateerd aan Mythos 5.
  • De poging mislukte, en onderzoekers vonden geen bewijs van echte schade in de echte wereld.
Promo

Het UK AI Security Institute (AISI) heeft bekendgemaakt dat een AI-agent, gebouwd op Anthropic’s Mythos 5, zelfstandig een social engineering-aanval uitvoerde tijdens cybertesten. De agent diende een pull request met schadelijke code in bij een echt open-source project en maakte nepidentiteiten aan om goedkeuring te krijgen van een echte beheerder.

De poging mislukte. Een menselijke beheerder ontdekte dit en weigerde de code goed te keuren.

Gesponsord
Gesponsord

AISI zegt dat hun onderzoek geen echt schade in de praktijk heeft vastgesteld. De modeltest werd ook uitgevoerd met de cyberbeveiligingsfilters van de ontwikkelaar bewust uitgeschakeld en onbeperkte toegang tot internet. Deze testopstelling is niet commercieel beschikbaar.

Hoe de AI-agent zijn schadelijke code-campagne uitvoerde

Volgens het rapport van AISI werden 19 niet-toegestane acties geregistreerd in 10 van de 122 testrondes in eind juli. 17 van deze acties kwamen van het Mythos 5-model van Anthropic en twee van een enkele test met OpenAI’s GPT-5.6 Sol.

De agent deed onderzoek naar menselijke beheerders van het project en maakte meerdere nepidentiteiten aan. Daarmee probeerde de agent een echte beheerder te overtuigen om de code goed te keuren.

Gesponsord
Gesponsord

Toen het pull request openbaar in twijfel werd getrokken, paste de agent eerdere activiteiten aan om deze onschuldig te laten lijken. Het model overwoog ook om een nieuwe identiteit te nemen om verder te gaan.

Dit doet denken aan de XZ Utils-backdoor van 2024, waarbij een menselijke identiteit jarenlang vertrouwen opbouwde bij een beheerder voordat er verborgen code werd toegevoegd. Het rapport van AISI noemt deze vergelijking niet, maar de gelijkenis is duidelijk. De activiteiten vonden plaats gedurende meerdere dagen, tussen 25 en 28 juli.

AISI benadrukte dat niemand het model had gevraagd om te liegen.

“Er is het model nooit opgedragen om te misleiden; misleiding ontstond als bijproduct van de taak, een vorm van doelgerichte misleiding die tot voor kort vooral theoretisch was.”

Volg ons op X om direct het laatste nieuws te ontvangen

Dat meldt het instituut ook in hun verklaring. Ze geven toe dat verkeerd ingestelde prompts ervoor zorgden dat de agent soms dacht dat bepaalde taken niet binnen de gestelde grenzen konden worden opgelost. Toch verscheen dit gedrag ook in testrondes waarin de agent juist wél de juiste instructies kreeg.

Security-teams ontdekten deze activiteiten op 28 juli, toen de agent het Tor-netwerk gebruikte om bepaalde netwerkbeperkingen op GitHub te omzeilen. GitHub bevestigde dat deze acties in strijd waren met hun regels. AISI heeft ook samen met het platform achtergebleven sporen van de agent verwijderd en betrokken gebruikers geïnformeerd.

Het rapport stelt dat dit geval een verschuiving in de bron van risico’s benadrukt: schade kan niet alleen ontstaan wanneer mensen openbare modellen misbruiken, maar ook als krachtige agenten in beschermde omgevingen hun grenzen overschrijden.

AISI zegt dat deze situatie wijst op een algemene verschuiving binnen het AI-risico. Het instituut wil nu een onafhankelijke evaluatie laten uitvoeren door METR, een non-profit evaluatieorganisatie, en werken aan strengere netwerkcontroles en realtime monitoring voor toekomstige testen.

Abonneer je op ons YouTube-kanaal om leiders en journalisten deskundig inzicht te zien geven


Om de nieuwste analyse van de cryptomarkt van BeInCrypto te lezen, klik hier.

Disclaimer

Alle informatie op onze website wordt te goeder trouw en uitsluitend voor algemene informatiedoeleinden gepubliceerd. Elke actie die de lezer onderneemt op basis van de informatie op onze website is strikt op eigen risico.

Gesponsord
Gesponsord