← Terug naar kennisbank

AI Nieuws

Hoe een computer zichzelf beter leert afstemmen (een eerste blik)

Hoe een computer zichzelf beter leert afstemmen (een eerste blik)

·

Leestijd: 4 min

Anthropic publiceerde recent een paper waarin een geautomatiseerd systeem laat zien hoe een AI-model zichzelf stap voor stap beter kan afstemmen op veiligheidsdoelen. Het onderzoek geeft een vroege blik op hoe computers andere computers kunnen gebruiken om hun eigen gedrag te verbeteren — en wat dat praktisch betekent voor onderzoekers en organisaties.

Wat hebben de onderzoekers precies gedaan?

Het team, onder leiding van Anthropic-fellow Chen Yueh-Han, bouwde een systeem dat grotendeels hetzelfde doet als menselijke onderzoekers, maar dan automatisch. Belangrijkste onderdelen van de werkwijze:

  • Het systeem zoekt in de beschikbare literatuur naar ideeën en methoden.

  • Het stelt zelf een aanpak voor en traint het model met die aanpak gedurende ongeveer 30 minuten.

  • Na elke trainingsronde evalueert het systeem het model op een set beoordelingscriteria (benchmarks) en voert het meerdere iteraties uit.

  • Werkt een methode, dan wordt die bewaard; werkt het niet, dan wordt het verworpen.

De onderzoekers testten dit op tien specifieke beoordelingscriteria voor misaligned gedrag — dat zijn voorbeelden waarin een model gedrag toont dat niet past bij de bedoelde veiligheidsregels. Volgens het paper verbeterde het geautomatiseerde systeem de prestaties op alle tien de criteria, zonder dat de algemene prestaties achteruitgingen.

Waarom is dit opvallend?

Er zijn drie punten die opvallen:

  • Snelheid en schaal: het automatische systeem kan veel technieken uitproberen in korte tijd, zonder pauzes of vergaderingen.

  • Kosten: het paper geeft een kostenvergelijking. Het geautomatiseerde systeem kost ongeveer $4 per uur aan API-kosten. API (application programming interface) is hier een manier waarop een programma vragen naar een online dienst stuurt en antwoorden terugkrijgt. Ter vergelijking: de onderzoekers betaalden mensen rond $150 per uur.

  • Prestaties ten opzichte van mensen: het paper stelt dat de beste methodes van het automatische systeem gemiddeld beter waren dan de voorstellen van ervaren onderzoekers, vaak al binnen zes uur.

Samen suggereren deze punten dat geautomatiseerde post-training — het achteraf bijsturen van een model met behulp van andere modellen — binnenkort praktisch toepasbaar kan worden. Voor jou als lezer betekent dit dat sommige taken die nu door mensen worden gedaan, in de toekomst efficiënter geautomatiseerd kunnen worden.

Beperkingen en open vragen

Het onderzoek noemt zelf een aantal belangrijke beperkingen. Deze zijn relevant om het resultaat realistisch te plaatsen:

  • De resultaten hangen sterk af van de beoordelingscriteria die worden gebruikt. Als die criteria niet goed de werkelijke veiligheidsdoelen weerspiegelen, helpt verbeteren op die criteria weinig.

  • Het opstellen, onderhouden en uitbreiden van die benchmarks vergt nog veel menselijk werk. Zonder goede voorbeelden leert het systeem geen nuttige veilige gedragingen.

  • Het automatische systeem baseert zich op bestaande literatuur en technieken. Als die bronnen gebrekkig of incompleet zijn, blijft het systeem beperkt.

  • Er blijven risico's bestaan bij het automatisch aanpassen van modellen. Kleine veranderingen kunnen onbedoelde effecten hebben die niet direct zichtbaar zijn in de gekozen tests.

Deze punten maken duidelijk dat de techniek veelbelovend is, maar geen kant-en-klare vervanging biedt voor menselijk toezicht en kwaliteitscontrole.

Wat betekent dit voor de toekomst?

Het paper is een stap richting wat onderzoekers soms noemen "recursieve zelfverbetering": systemen die hun eigen trainingsmethoden verbeteren. Als dat verder doorzet, kan het de manier veranderen waarop AI-modellen worden ontwikkeld en onderhouden. Mogelijke consequenties:

  • Onderzoekers kunnen meer tijd besteden aan het bedenken van goede doelstellingen en tests in plaats van handmatig elke trainingsstap uit te voeren.

  • Kosten voor sommige onderzoeksstappen kunnen dalen, waardoor meer organisaties toegang krijgen tot geavanceerde technieken.

  • Tegelijkertijd ontstaan nieuwe eisen aan toezicht: wie controleert de doelen, wie valideert de benchmarks, en hoe voorkom je dat automatische verbetering leidt tot onverwachte of ongewenste resultaten?

Conclusie

Het werk van Anthropic toont aan dat geautomatiseerde systemen modellen gericht kunnen verbeteren op veiligheidscriteria — snel en relatief goedkoop. Dat is een belangrijke ontwikkeling, maar de methode staat nog in de kinderschoenen. De kwaliteit van de evaluaties en de beschikbare kennisbronnen bepalen in sterke mate of zulke systemen echt veilig en betrouwbaar blijven. Voorlopig blijft menselijk toezicht daarom cruciaal bij het bepalen van doelen en het controleren van resultaten.