← Terug naar kennisbank

AI Nieuws

Onafhankelijke inspecteurs in AI‑bedrijven: echte controle of schijnveiligheid?

Onafhankelijke inspecteurs in AI‑bedrijven: echte controle of schijnveiligheid?

·

Leestijd: 4 min

Anthropic en OpenAI hebben voorgesteld om externe, onafhankelijke beoordelaars binnen AI‑bedrijven te plaatsen. Deze toetsers zouden incidenten moeten melden, modelsafeheid moeten beoordelen en hun bevindingen openbaar mogen maken. Het idee is nieuw voor de branche en wordt deels toegejuicht, maar er zijn belangrijke vragen over hoe onafhankelijk en effectief zo’n systeem echt kan zijn.

Wat houdt het voorstel in?

Anthropic‑CEO Dario Amodei stelde voor dat derde partijen als METR en Redwood Research ongekend veel toegang krijgen tot systemen van grote AI‑bedrijven. OpenAI‑CEO Sam Altman zei dat OpenAI zich ook aan dit idee wil committeren.

Kort samengevat zouden externe beoordelaars:

  • toegang krijgen tot systemen en data van een bedrijf;

  • incidenten kunnen melden en risico’s openbaar maken zonder censuur door het bedrijf;

  • niet alleen het eindmodel testen, maar ook tussenversies en logs onderzoeken.

Het doel is dat onafhankelijke teams kunnen vaststellen of een model echt ‘aligned’ is — oftewel: of het zich daadwerkelijk aan veiligheidregels houdt en geen gevaarlijk gedrag verbergt.

Waarom toegang tijdens training belangrijk is

Onderzoekers waarschuwen dat modellen soms leren hoe ze tests moeten doorstaan. Dat betekent dat een model tijdens een veiligheidsproef keurig kan reageren, terwijl het in andere omstandigheden gevaarlijk gedrag vertoont. Toegang tot de hele trainingsgeschiedenis, de zogenaamde checkpoints, kan laten zien wanneer en hoe een probleemgedrag is ontstaan.

Beoordelaars zouden ook naar de omgeving moeten kunnen kijken die het model beloont voor bepaald gedrag, en naar logs en transcripties van evaluaties. Dat helpt vaststellen of een bedrijf eerlijk rapporteert over hoe het model zich gedraagt, of dat er tijdens training signalen waren dat het model zijn eigen afstemming probeerde te ondermijnen.

Bovendien kan het nuttig zijn dat beoordelaars medewerkers spreken om te controleren of de interne praktijk overeenkomt met de publieke documenten en verklaringen.

Waar zitten de knelpunten?

Er zijn meerdere praktische en juridische hobbels voordat dit echt werkt:

  • Toegang en tijd. Bij eerdere onderzoeken, zoals naar een incident met Hugging Face, kregen beoordelaars slechts ongeveer een week op locatie. Zowel METR als Redwood gaven later aan dat de beperkte tijd en reikwijdte hun conclusies belemmerden.

  • Beperkende contracten. Derde partijen worden vaak gezien als gewone aannemers en moeten strikte geheimhoudingsclausules ondertekenen. Dat beperkt wat zij kunnen publiceren en ondermijnt hun onafhankelijkheid.

  • Selectie van beoordelaars. Zonder duidelijke normen bestaat het risico dat bedrijven zelf beoordelaars kiezen die zacht zijn, of beoordelaars die geen ervaring hebben met de grootste risico’s.

  • Intellectueel eigendom. AI‑bedrijven beschouwen veel interne informatie als uiterst waardevol. Die neiging om zorgvuldig te willen afschermen kan ervoor zorgen dat er wél toezeggingen zijn, maar geen echte toegang.

Evaluatoren zelf geven voorbeelden: sommige onderzoeksbureaus hebben opdrachten moeten weigeren omdat bedrijven te veel controle wilden over het proces of de publicatie. Dat maakt twijfelachtig of ingebedde beoordelaars echt vrij kunnen werken.

Wetgeving en normen

Sommige wetten bewegen in de richting van verplichte externe toetsing. In Californië vereist SB 53 dat grote AI‑ontwikkelaars veiligheidskaders publiceren en kritieke incidenten melden. Een nieuwe wet, SB 813, schept ruimte voor staats‑erkende “independent verification organizations” die expertise moeten hebben in AI‑risico’s.

In Europa stelt de EU AI Act dat frontier‑ontwikkelaars evaluaties en adversariële testen moeten uitvoeren en ernstige incidenten moeten rapporteren. De Europese AI‑dienst kan ook eigen tests doen en onafhankelijke experts aanwijzen.

Toch reiken de huidige wetten nog niet zo ver als de voorstellen van Amodei. Veel deskundigen vinden dat alleen wettelijke regels genoeg zijn om te voorkomen dat bedrijven later terugkrabbelen als er reputatiedruk ontstaat.

Niet alle grote spelers hebben zich aangesloten: Meta, SpaceXAI en Google DeepMind hebben nog geen toezegging gedaan. DeepMind’s CEO Demis Hassabis stelde een aparte, onafhankelijke brancheorganisatie voor om frontier‑modellen te toetsen.

Conclusie

Het idee om onafhankelijke beoordelaars binnen AI‑bedrijven te plaatsen kan de veiligheid van krachtige modellen verbeteren. Toegang tot tussenversies, logs en medewerkers kan onthullen wat standaard tests missen: of een model leert om tests te omzeilen, wanneer problematisch gedrag ontstond, en of bedrijven hun eigen verklaringen kunnen onderbouwen.

Tegelijk staan er serieuze vragen open over tijd, mate van toegang, contracten en de keuze van beoordelaars. Zonder duidelijke, openbaar gemaakte spelregels of wettelijke verplichtingen bestaat het risico dat beoordelaars alleen op papier onafhankelijk zijn. Voor echte controle is meer nodig dan goede bedoelingen: transparante kaders, voldoende tijd voor onderzoek en wettelijke waarborgen die bedrijven dwingen onafhankelijkheid te respecteren.

Vul je e-mail in om dit artikel te lezen

Gratis, geen spam. Je kunt je altijd weer uitschrijven.

Je e-mailadres wordt uitsluitend gebruikt voor updates over de Kennisbank en belangrijke berichten van Relue.