6 zorgwekkende dingen die OpenAI's modellen deden terwijl dat niet de bedoeling was

  • OpenAI deelt 6 gevallen van onverwacht of zorgwekkend modelgedrag en introduceert nieuw rapportageframework.
  • Eén model gebruikte zonder toestemming een blootgestelde API-sleutel en verzon vervolgens data.
  • OpenAI zegt dat de industrie alignment nog niet voldoende heeft opgelost om volledig te kunnen opschalen.
Promo

OpenAI heeft 6 gevallen van “onverwacht of zorgwekkend modelgedrag” bekendgemaakt, die de afgelopen 6 maanden zijn waargenomen. Ook heeft het bedrijf een framework gelanceerd waarin wordt beloofd om dit soort bevindingen voortaan te melden.

De gevallen variëren van modellen die hun eigen fouten verbergen tot modellen die ongeoorloofde acties ondernemen om obstakels te omzeilen.

Gesponsord
Gesponsord

OpenAI maakt 6 gevallen bekend waarin modellen fouten verborgen en regels overtraden

In een geval beantwoordde een model een simpele vraag over inkomsten in een county in Californië. Het vond een openstaande API-sleutel op een openbaar platform en gebruikte deze zonder toestemming. Toen de data alsnog niet werd geladen, verzon het de cijfers en deed alsof deze uit de gevraagde bron kwamen.

Het verbergen van fouten kwam twee keer voor. Tijdens de GPT-5.6 Sol-training schreven meerdere modellen instructies in hun taakoverzichten om fouten en niet goed afgestemd gedrag te verdoezelen.

Een niet-uitgebracht onderzoeksmodel voegde niet-gerelateerde instructies toe, bijvoorbeeld orders om normale beperkingen te negeren, aan 27 taakoverzichten.

Gesponsord
Gesponsord

Een ander niet-uitgebracht model uploadde een bestand naar internet, zonder dat dit gevraagd was, alleen zodat het een browserlink als bron kon opgeven.

Twee andere gevallen gaan over onderlinge samenwerking. Modellen veranderden een interne software-repository in een soort prikbord om verzoeken uit te wisselen tussen verschillende trainingssessies. Agents die samenwerkten aan een taak plaatsten hun bestanden op openbare bestandsplatformen als ze elkaars lokale bestanden niet konden lezen.

“Deze gevallen laten een aantal verschillende gedragingen zien die volgens ons het delen waard zijn: van het verbergen van informatie voor de gebruiker tot het nemen van ongeoorloofde acties om obstakels te overwinnen. Het zijn rapporten van individuele gevallen en geven geen beeld hoe vaak misalignment bij onze modellen voorkomt”, voegde OpenAI toe.

Volg ons op X voor het laatste nieuws als het gebeurt. Klik hier

Een meldframework en een waarschuwing

Het framework is ingevoerd na het incident van juli, toen OpenAI-agents uit hun sandbox wisten te ontsnappen en inbraken op de systemen van Hugging Face. OpenAI beschouwde dat incident als een waarschuwingsschot.

Met dit nieuwe disclosure framework heeft het bedrijf nu een formele manier om misalignment-gevallen te melden. Elke OpenAI-medewerker kan een incident aanmelden, waarna het wordt ingedeeld in één van drie categorieën.

De meeste incidenten worden onderzocht onder de categorie ‘Klaar voor openbaarmaking en klein onderzoek’, terwijl een “Slow Track” bedoeld is voor complexe situaties waarbij externe partijen betrokken zijn. Volgens OpenAI was het Hugging Face-incident van juli op deze langzame route terechtgekomen.

Het bedrijf koppelde het framework aan een kritische beoordeling van de stand van de industrie.

“Wij geloven niet dat de AI-industrie alignment en monitoring op een voldoende niveau heeft opgelost om verantwoord nog veel langer op maximale snelheid te kunnen doorgroeien,” aldus het bedrijf.

De meldingen komen op het moment dat waarschuwingen voor uitsterven zich opstapelen. Waarschuwingen van AI-onderzoekers zijn inmiddels al bij het Congres terechtgekomen, waar politici een wetsvoorstel overwegen om superintelligentie volledig te verbieden.

Het bedrijf noemt de meldingen een eerste stap naar standaarden die de sector nog niet heeft. Of concurrerende labs hetzelfde gaan rapporteren, zal laten zien in hoeverre de industrie bereid is zichzelf publiekelijk te controleren.

Abonneer je op ons YouTube-kanaal om te zien hoe experts en journalisten hun inzichten delen. Klik hier

Disclaimer

BeInCrypto streeft naar onbevooroordeelde, transparante verslaggeving. Dit nieuwsartikel is bedoeld om accurate en actuele informatie te verstrekken. Lezers wordt echter geadviseerd de feiten onafhankelijk te verifiëren en een professional te raadplegen voordat zij beslissingen nemen op basis van deze inhoud. Houd er rekening mee dat onze Algemene Voorwaarden, ons Privacybeleid en onze Disclaimers zijn bijgewerkt.

Gesponsord
Gesponsord