Het AI-model van een concurrent deed uiteindelijk het meeste werk bij een hack op OpenAI. Onderzoekers van Hacktron AI gebruikten Claude van Anthropic om werkende exploitcode te schrijven.
De hele inbraak duurde in totaal minder dan 72 uur. OpenAI betaalde uiteindelijk een bounty van $6.500 nadat het team kon bewijzen dat ze toegang hadden tot de private broncode.
Hoe een afbeelding uploaden leidde tot een volledige hack
De aanval begon met iets simpels: een functie om afbeeldingen te uploaden op het helpforum van de OpenAI-community, dat draait op derde-partijsoftware genaamd Discourse.
Er was een beveiligingsfilter dat geüploade bestanden moest controleren. Dit herkende echter bepaalde fotoformaten niet, waardoor deze bestanden ongecontroleerd door konden. Deze bestanden kwamen daarna terecht bij een aparte afbeeldingsverwerkingsbibliotheek die een bekende geheugenfout bevatte.
Het driepersoons team van Hacktron, bestaande uit Harsh Jaiswal, Mohan Pedhapati en Rahul Maini, probeerde deze fout eind juli te misbruiken.
Het oudere model van Claude had moeite met een beveiliging die geheugenlocaties randomiseert.
Enkele uren later wist een nieuwer model werkende aanvalscode te maken en deze aan te passen aan de exacte forumconfiguratie.
Volg ons op X voor het laatste nieuws zodra het gebeurt.
Alleen hierdoor kreeg men toegang tot de servers van het forum, maar nog niet tot OpenAI zelf. Een tweede, niet-gerelateerde fout in het single sign-on systeem van OpenAI maakte dit wel mogelijk.
Omdat de logins voor het forum ook gebruikt werden om in te loggen bij ChatGPT en Codex, kon het overnemen van de sessie van één werknemer directe toegang geven tot de private coderepository van OpenAI.
Discourse repareerde de afbeeldingsfout enkele dagen later en beoordeelde de ernst als 8,8 van de 10. OpenAI verhielp de authenticatiefout binnen ongeveer 14 uur nadat het probleem gemeld was aan hun bug bounty-programma.
Waarom AI-labs door hun eigen creaties worden gehackt
Deze gebeurtenis stond niet op zichzelf. OpenAI had in juli al een ander incident gemeld, waarbij interne modellen uit een testomgeving ontsnapten en externe systemen bereikten.
Anthropic gaf zelf aan dat Claude bij cyberbeoordelingen ongeautoriseerde toegang had tot echte organisaties, doordat de evaluaties onverwacht live internettoegang hadden.
De AI-baas van Microsoft, Mustafa Suleyman, verwees deze week ook naar hetzelfde probleem: steeds meer autonome modellen worden steeds moeilijker in toom te houden.
“Het is een waarschuwing… Het is duidelijk nu tijd om samen te werken tussen de labs, zodat we zeker weten dat we controle houden over deze technologie,” zei Suleyman tegen Reuters.
Wat de zaak met Hacktron vooral bijzonder maakt, is niet het idee. Onderzoekers combineren al tientallen jaren softwarebugs.
Wat nu anders was, is de snelheid: een klus waarvoor eerder gespecialiseerde menselijke kennis en meerdere dagen nodig waren, werd nu in één avond gedaan zodra een krachtig AI-model werd ingezet.
Abonneer je op ons YouTube-kanaal en zie hoe experts en journalisten hun inzichten delen.









