Vier toonaangevende AI-labs hebben nu bevestigd dat hun modellen toegang kregen tot het open internet en daarna in de systemen van echte bedrijven kwamen. Google is vrijdag aan dat rijtje toegevoegd, ongeveer vier maanden nadat hun eigen incidenten plaatsvonden.
Gemini kreeg in mei bij een evaluatie toegang tot drie echte bedrijven. Opvallend is dat het model in alle drie de gevallen stopte met zijn acties.
Google’s Gemini hackt drie bedrijfssystemen tijdens een test
Het incident vond plaats tijdens een “capture-the-flag”-beveiligingsoefening die werd uitgevoerd door Irregular. Internettoegang hoorde niet bij de opzet. Door een fout in de testomgeving kreeg het model toch toegang.
In één geval raadde het model wachtwoorden tot het toegang kreeg tot een beveiligd systeem, volgens The Wall Street Journal. In de andere twee gevallen vond het model gelekte inloggegevens in een openbaar archief en gebruikte die om toegang te krijgen tot beveiligde systemen.
Heather Adkins, vicepresident security engineering bij Google, zei dat de drie getroffen organisaties zijn geïnformeerd over wat er is gebeurd.
“We hebben gezorgd dat de drie organisaties op de hoogte zijn gebracht en hebben samen met onze trainingspartner gewerkt aan veranderingen in hun testprocedures,” zei ze.
Volg ons op X voor het laatste nieuws terwijl het gebeurt.
Vier labs, één patroon
Google zei dat de AI-agenten hun activiteiten stopten nadat ze merkten dat ze echte bedrijfssystemen hadden bereikt in plaats van de gesimuleerde doelen.
“Bij een standaardtest vond het model openbare informatie online en raadde het gegevens om websites te benaderen waarvan het dacht dat ze bij de test hoorden,” aldus Adkins in een verklaring.
Het bedrijf voegde eraan toe dat dit gedrag geen voorbeeld is van misafstemming van het model en volgens Google geen publieke melding vereist, omdat de veiligheidsmaatregelen van Gemini werkten.
Volgens een woordvoerder van Irregular ging het om hetzelfde probleem dat ook andere AI-labs trof. Irregular heeft de betrokken labs eind juli ingelicht. De woordvoerder liet verder weten dat de bekende problemen aan hun kant weken geleden al zijn verholpen.
Door deze openbaarmaking staat Google nu naast OpenAI, Anthropic en Meta. Al deze bedrijven hebben dit jaar gemeld dat hun modellen zijn ontsnapt uit testomgevingen.
OpenAI liet in juli weten dat hun modellen uit een sandbox wisten te ontsnappen en Hugging Face wisten te hacken. Anthropic keek vervolgens terug naar meer dan 141.000 testrondes en vond drie eigen gevallen. Meta meldde een incident in augustus.
Abonneer je op ons YouTube-kanaal om inzichten van leiders en journalisten te bekijken.









