Mark Zuckerberg lanceerde woensdag Muse Code in bèta, Meta’s eerste artificial intelligence (AI) programmeeragent. Anthropic’s Claude Opus 5 scoort echter beter in alle vier de vergelijkingen die Meta bij de lancering heeft gepubliceerd.
Meta deelde deze grafieken alsnog. Het bedrijf biedt een goedkoper hulpmiddel aan, niet een betere. Onafhankelijke testdata laten zien dat het verschil nog groter is dan wat Meta liet zien.
Volg ons op X om het laatste nieuws meteen te ontvangen
Meta’s eigen grafieken geven Anthropic elke ronde de winst
Muse Spark 1.2 is het model in Muse Code. Het behaalde 82,9% op Terminal-Bench 2.1.
Claude Opus 5 behaalde op dezelfde test 86,7%. Terminal-Bench is ontwikkeld door het Laude Institute en Stanford-onderzoekers. Het bestaat uit 89 echte opdrachten in systeemherstel, datawerk en beveiliging.
De tweede plaats is niet slecht. Muse Code versloeg OpenAI’s Codex met 81,8% en Grok Build met 81,6%.
De volgende grafiek was strenger. DeepSWE 1.1 bestaat uit 113 programmeertaken waarbij de internettoegang uitgeschakeld is tijdens het beoordelen. Muse Spark 1.2 zakte naar de derde plaats met 59,3%.
Meta publiceerde daarna een eigen test, gebaseerd op 440 echte pull requests van eigen ingenieurs. Muse Spark 1.2 haalde daar 70,6%, ongeveer negen punten achter Opus 5.
Die score ligt slechts 2,3 punten boven Muse Spark 1.1, het model dat Meta in juli uitbracht.
Het model dat Meta uit de programmeergrafieken liet
Meta vergeleek zichzelf met GPT-5.6 Terra. OpenAI heeft echter een sterker model, Sol genaamd, dat Meta buiten alle drie de programmeergrafieken heeft gehouden.
Sol staat bovenaan het onafhankelijke Terminal-Bench 2.1 leaderboard met 89,5%. Opus 5 volgt met 89,1%.
Beide scores zijn hoger dan de 86,7% die Meta voor Opus 5 liet zien. Meta koos voor een zwakkere instelling van zijn sterkste rivaal en kwam alsnog achter te liggen.
Vergeleken met Sol, de echte nummer één, loopt Muse Spark 1.2 achter met 6,6 punten in plaats van 3,8.
Meta liet Sol wel op één plek zien. Bij een GPU kernel-taak met meer dan 1.000 tooloproepen presteerde Sol 71,2% beter dan de basislijn. Muse Spark 1.2 haalde 68,7% en eindigde vierde van zes.
Er is één kanttekening, maar dan andersom. Muse Spark 1.2 staat nog niet op dat openbare leaderboard. Daar zijn tot nu toe slechts 26 van de 183 geteste modellen opgenomen. Die 82,9% is dus nog steeds een Meta-cijfer.
“Muse Spark 1.2 is onze volgende stap naar de toekomst, er komen grotere en sterkere modellen,” zei Zuckerberg in een bericht.
Zuckerberg kan binnenkort het model huisvesten dat de zijne verslaat
Meta is naar verluidt in gesprek om rekenkracht te leasen aan Anthropic. Die deal kan $10 miljard waard zijn in twee jaar. De datacenters van Meta zouden dan helpen de Claude-modellen te draaien waar Muse Code juist tegen bedoeld is.
De mensen achter Muse Code waren duur. Zuckerberg betaalde in juni 2025 $14,3 miljard voor Scale AI en oprichter Alexandr Wang, die nu Meta Superintelligence Labs leidt.
Prijs is het enige waar Wang nu op stuurt. De tarieven zijn gelijk aan de lancering in juli van Meta’s eerste betaalde API met $1,25 per miljoen inputtokens en $4,25 per miljoen outputtokens.
Een contributor-niveau is meer dan 10 keer goedkoper. Ontwikkelaars komen in aanmerking als ze toestaan dat Meta traint op hun werk. Wang wilde geen cijfers geven over het aantal gebruikers van de Muse Spark-lijn.
Volgens Meta’s boekhouding is de korting nodig. De omzet steeg met 28% tot $60,8 miljard afgelopen kwartaal, maar de operationele winst daalde met 8% tot $18,8 miljard.
De operationele marge daalde naar 31%, terwijl dit een jaar eerder nog 43% was. Allemaal alleen al door $31,08 miljard aan uitgaven aan kapitaalprojecten dit kwartaal. Meta verwacht tot wel $145 miljard aan investeringen dit jaar.
Muse Code heeft wel technische voordelen die Claude Code mist. Achtergrondagents kunnen context vasthouden gedurende een sessie. Subagents werken in aparte kopieën van een repository.
Meta heeft een sterke nummer twee gebouwd en deze geprijsd als budget-optie. De bèta zal uitwijzen of ontwikkelaars een paar procentpunt nauwkeurigheid willen ruilen voor een rekening die ongeveer een tiende zo groot is.









