De Amerikaanse overheid heeft het nieuwste AI-model van China aan een hacktest onderworpen. Uit de test bleek dat Kimi K3 van Moonshot AI duidelijk achterblijft bij de beste Amerikaanse modellen.
The Center for AI Standards and Innovation (CAISI), een Amerikaanse instantie, voerde de tests uit samen met een Britse partner. De resultaten kwamen slechts één dag nadat Washington Moonshot beschuldigde van het bouwen van Kimi K3 met gestolen Amerikaanse technologie.
Kimi K3 blijft achter op Amerikaanse cyber-normen
Het ministerie van Handel deelde de resultaten op donderdag. Ze zeiden dat Kimi K3 veel lager scoorde dan de beste Amerikaanse modellen, volgens een gezamenlijke test met Britse experts.
Moonshot bracht Kimi K3 uit op 16 juli. De vraag was zo groot dat ze na twee dagen nieuwe aanmeldingen moesten pauzeren.
De lancering zorgde ook voor schommelingen bij Amerikaanse chip-aandelen en bracht opnieuw twijfels over de AI-voorsprong van Amerika.
Een van de tests, ExploitBench genoemd, gebruikt echte Chrome-browserbugs ontwikkeld door Carnegie Mellon University. Kimi K3 scoorde 32%. Dat was hoger dan China’s GLM-5.2 met 24%. Maar het was veel lager dan de topmodellen uit de VS, die rond de 76% halen.
De moeilijkste stap is om volledige controle over een doelcomputer te krijgen. Kimi K3 faalde in deze stap op alle 41 onderdelen. De beste Amerikaanse modellen slaagden hierin bij 20 tests.
Een andere test, The Last Ones genoemd, is een aanval op een fictief bedrijfsnetwerk met 32 stappen. Een menselijke expert doet hier ongeveer 20 uur over. Kimi K3 kwam gemiddeld tot stap 17. De beste Amerikaanse modellen kwamen tot stap 28,5. Kimi K3 heeft het hele proces slechts één keer in 10 pogingen afgemaakt.
De beste Amerikaanse systemen deden dit zes of zeven keer.
Maar het verschil lijkt misschien groter dan het is
Maar de cijfers vertellen niet het hele verhaal. In de kleine lettertjes van het rapport staan enkele kanttekeningen.
Ten eerste zijn de Amerikaanse modellen getest met hun veiligheidsfilters uitgeschakeld. Zo lieten ze hun volle kracht zien. In het echt staan die filters aan. De VS-scores zijn dus de ideale situatie en niet zoals bij publiek gebruik.
Het team benadrukte ook dat het werk vroegtijdig en beperkt was. Kimi K3 werd alleen op deze ene test beoordeeld en slechts een deel van het totale programma is uitgevoerd. Het cijfer is dus onzeker. Sommige tests zijn bovendien niet openbaar, waardoor buitenstaanders het werk niet kunnen controleren.
Er is ook een fundamenteel verschil: Kimi K3 is een open model dat iedereen kan downloaden. De Amerikaanse modellen zijn gesloten, privé-systemen. Het Britse instituut stelt dat open modellen meestal vier tot zeven maanden achterlopen op de beste gesloten modellen. Kimi K3 krijgt de volledige test pas als Moonshot hem echt vrijgeeft aan het publiek.
Deze tests zijn bovendien geen echte aanvallen. Het nepnetwerk had geen menselijke verdedigers en geen alarmen die het konden stoppen. Toch presteerde Kimi K3 beter dan het vorige top open model. En het lukte Kimi K3 één keer om de hele aanval te voltooien.
Ook de timing en de bron roepen vragen op. CAISI was vroeger het Amerikaanse AI Safety Institute. De Trump-regering gaf in juni 2025 een nieuwe naam. De instantie valt onder hetzelfde ministerie dat de verkoop van Amerikaanse chips aan China beperkt. En dit rapport over een Chinese concurrent kwam direct na de diefstalclaim.
Zwakke beveiliging verhoogt toch het risico
Toch betekenen lage scores niet dat Kimi K3 veilig is. De test liet zien dat de beveiligingsfuncties het systeem niet tegenhielden om hacks te proberen of andere systemen aan te vallen.
Dat is belangrijk met het oog op wat eraan komt. Moonshot is van plan het volledige model op 27 juli uit te brengen. Als het eenmaal openbaar is, kunnen ze het niet meer terugtrekken. Iedereen kan het downloaden en de veiligheidsfilters verwijderen.
Deze test volgt ook op een diefstalclaim. Washington zegt dat Moonshot Kimi K3 op gestolen Amerikaanse AI-technologie heeft gebouwd. Volgens Michael Kratsios, technologiechef van het Witte Huis, heeft het bedrijf stiekem Anthropic’s Claude Fable 5 gekopieerd. Deze methode, distillatie genoemd, traint een nieuw model op de antwoorden van een sterker model.
Anthropic ondersteunt die beschuldiging. In februari traceerden ze meer dan 3,4 miljoen Claude-chats naar Moonshot, via honderden nepaccounts. Ze waarschuwden dat gekopieerde modellen vaak de veiligheidsmaatregelen van het origineel verliezen. Dat is precies de zwakke plek die deze test nu ook liet zien.
De VS besteedt nog steeds 23 keer zoveel aan AI als China. Toch blijven Chinese laboratoria het gat kleiner maken. De echte test komt als Kimi K3 publiek beschikbaar is en onafhankelijke experts de claims zelf kunnen controleren.









