Gerelateerd aan dit onderwerpFuture Tech & AI Council

Anthropic's nieuwe Sonnet-model benadert Opus-prestaties maar verbruikt meer tokens

  • Anthropic lanceert Claude Sonnet 5.5, loopt ruim 30% sneller dan Sonnet 5.
  • Artificial Analysis plaatst het op de tweede plek in de Intelligence Index, net achter Opus 5,5.
  • Bij maximale inspanning gebruikte Sonnet 5.5 ongeveer 60% meer outputtokens dan Opus 5.5.
Promo

Anthropic bracht Claude Sonnet 5.5 uit op 28 september voor dezelfde prijs als Sonnet 5. Volgens het bedrijf werkt het model meer dan 30% sneller en zijn de kosten tot 30% lager per taak.

Een onafhankelijk benchmarkbedrijf kwam tot een andere conclusie over de kosten toen het model tot het uiterste werd getest.

Volg ons op X om direct het laatste nieuws te volgen.

Gesponsord
Gesponsord

Anthropic’s tweede 5.5-model enkele dagen na Opus gelanceerd

Sonnet 5.5 is het tweede model in de Claude 5.5-serie. Anthropic lanceerde Opus 5.5 op 22 september. Op diezelfde dag bracht OpenAI ook GPT-6 Sol en Luna uit.

Het nieuwe model heeft dezelfde prijs als Sonnet 5: $2 per miljoen input tokens en $10 per miljoen output tokens. Anthropic meldde een score van 70,6% op Terminal-Bench 4.0, een agentische codeertest. Sonnet 5 scoorde slechts 10,3%, terwijl Opus 5.5 uitkwam op 66,4%.

“Waar Opus 5.5 is gebouwd voor complex werk dat zorgvuldig oordeel vereist, blinkt Sonnet 5.5 vooral uit bij duidelijk afgebakende dagelijkse taken, het oplossen van bugs en het maken van verzorgde documenten, presentaties en spreadsheets,” zei het team.

Anthropic gaf aan dat Sonnet 5.5 geen uitbreiding is van de capaciteiten van het model. Daarom lag de focus van de veiligheidsbeoordeling op risico’s zoals het misleiden van gebruikers en misbruik met grote gevolgen.

Sonnet 5.5 wordt ook geleverd met cyberbeveiligingen en anti-distillatieclassificaties. Die blokkeren pogingen om de redenatie van het model te gebruiken bij het trainen van concurrerende systemen. Claude Haiku 5.5 verschijnt in de komende weken.

Gesponsord
Gesponsord

Ondertussen heeft OpenAI zijn geplande model GPT-6.1 Astra stopgezet vanwege veiligheidszorgen. CNBC bevestigde maandag dat het model niet voldeed aan de eisen van het bedrijf.

Artificial Analysis vindt hogere tokencost bij maximaal gebruik

Artificial Analysis, het benchmarkbedrijf dat Grok 4.7 op de vierde plaats zette, gaf Sonnet 5.5 een score van 56 op haar Intelligence Index. Daarmee staat het tweede overall, 2 punten achter Opus 5.5 op maximaal niveau.

Het bedrijf noteerde 64% voor Sonnet 5.5 op Terminal-Bench 4.0, tegenover 60% voor Opus 5.5 en GPT-6 Astra. Op kenniswerk-tests als GDPval-AA was Sonnet 5.5 ongeveer gelijk aan Opus 5.5.

Het bedrijf meldde dat Sonnet 5.5 aanzienlijk meer tokens gebruikte om deze resultaten te halen.

“Bij maximaal gebruik, waar de prestaties die van Opus 5.5 benaderen, gebruikte Claude Sonnet 5.5 ongeveer 193.000 output tokens per Intelligence Index-taak,” aldus de post.

Dat aantal ligt ongeveer 60% hoger dan Opus 5.5 en Sonnet 5 op maximaal gebruik. Het is ook ongeveer 7 keer het aantal van GPT-6 Astra bij maximaal gebruik.

Gesponsord
Gesponsord

Vroege klanten, geciteerd door Anthropic, zagen juist het tegenovergestelde bij andere taken. Balyasny Asset Management had veel minder tokens nodig bij financiële taken.

“Bij onze eigen set van 2.441 financiële taken, variërend van Q&A, extractie, analyse tot voorspellingen, scoorde Claude Sonnet 5.5 beter dan Sonnet 5 en gebruikte hij ongeveer 121.000 tokens per antwoord, waar Sonnet 5 497.000 gebruikte,” zei Joe Poirier, Senior AI Engineer bij Balyasny Asset Management.

Artificial Analysis testte een pre-release versie met een gestructureerde-output-bug die Anthropic inmiddels heeft opgelost. Het bedrijf is van plan de relevante testen binnenkort opnieuw te doen.

Abonneer je op ons YouTube-kanaal om inzichten te krijgen van leiders en journalisten.

Disclaimer

BeInCrypto streeft naar onbevooroordeelde, transparante verslaggeving. Dit nieuwsartikel is bedoeld om accurate en actuele informatie te verstrekken. Lezers wordt echter geadviseerd de feiten onafhankelijk te verifiëren en een professional te raadplegen voordat zij beslissingen nemen op basis van deze inhoud. Houd er rekening mee dat onze Algemene Voorwaarden, ons Privacybeleid en onze Disclaimers zijn bijgewerkt.

Gesponsord
Gesponsord