Grok 4.5 behaalt topresultaat in agent-test: bevestigt Musk’s Opus-Class claim

  • Grok 4.5 behaalt topresultaat op onafhankelijke agent-benchmark, ondersteunt Musk's kostenclaims.
  • Het model scoorde 51,4% op AutomationBench-AA, met de laagste kosten onder de leiders.
  • Het model registreerde echter ook 0,63 regelovertredingen per taak, meer dan concurrenten.
Promo

Elon Musk noemde Grok 4.5 een Opus-klasse model dat sneller werkt en minder kost. Een onafhankelijk, agentisch benchmarkresultaat geeft nu echt bewijs voor die claim.

Op AutomationBench-AA van Artificial Analysis behaalde Grok 4.5 de eerste plaats met een score van 51,4% en een kostprijs van $0,34 per taak. Daarmee versloeg het zowel Claude Fable 5 (48,6%) als Claude Opus 4.8 (48,5%).

Gesponsord
Gesponsord
AutomationBench-AA score van AI-modellen.
AutomationBench-AA score van AI-modellen. Bron: Artificial Analysis

Een onafhankelijke controle op de claim van Elon Musk

SpaceXAI bracht Grok 4.5 deze week uit voor het publiek, gebaseerd op het V9-model met 1,5 biljoen parameters. Musk’s belofte kwam voort uit eerste interne evaluaties.

AutomationBench-AA verandert dat nu. Artificial Analysis voert de benchmark onafhankelijk uit en houdt de takenlijst geheim, zodat er geen vervuiling kan optreden.

Gesponsord
Gesponsord

De test bestaat uit 657 taken verdeeld over 40 gesimuleerde apps, zoals Gmail, Slack, Salesforce en HubSpot. Er wordt gemeten welk percentage doelstellingen een agent afrondt zonder regels te overtreden.

Volg ons op X om direct het laatste nieuws te krijgen

Grok 4.5: goedkoper, sneller en meestal volgens de regels

Grok 4.5 kostte per taak $0,34, ver onder Fable 5’s $1,35 en Opus 4.8’s $1,46. Gemini 3.5 Flash kwam het dichtst bij met $0,49.

Het model gebruikte ongeveer 8.000 outputtokens per taak, ongeveer een kwart van het totaal van Opus 4.8. Die efficiëntie verklaart het grootste deel van het kostenverschil, precies zoals Musk bij de lancering beschreef.

“Het totale tokengebruik van 0,44M per taak is een van de laagste op het scorebord. De lage kosten komen door deze efficiëntie en doordat tokens goedkoop zijn,” aldus Artificial Analysis.

Bovendien bereikte Grok 4.5 79,9% van de taakdoelen en behaalde het 21,9% van de taken volledig. Binnen het domein Finance, het moeilijkste onderdeel, werd 71% gehaald, meer dan Fable 5’s 64% en Opus 4.8’s 62%.

Toch overtrad het model vaker regels dan de directe concurrenten. Het noteerde gemiddeld 0,63 regelovertredingen per taak, tegenover 0,55 voor Opus 4.8 en 0,46 voor Gemini 3.5 Flash.

Dit verschil is belangrijk voor bedrijven die agents inzetten in echte financiële systemen, waar één overtreding hoge kosten kan opleveren.

Abonneer je op ons YouTube-kanaal om experts en journalisten hun inzichten te horen delen

Disclaimer

BeInCrypto streeft naar onbevooroordeelde, transparante verslaggeving. Dit nieuwsartikel is bedoeld om accurate en actuele informatie te verstrekken. Lezers wordt echter geadviseerd de feiten onafhankelijk te verifiëren en een professional te raadplegen voordat zij beslissingen nemen op basis van deze inhoud. Houd er rekening mee dat onze Algemene Voorwaarden, ons Privacybeleid en onze Disclaimers zijn bijgewerkt.

Gesponsord
Gesponsord