← Terug naar kennisbank
AI Nieuws
·
Leestijd: 4 min
Baseten heeft binnen zijn onderzoeksafdeling Base Labs een nieuw initiatief gestart om veiligheid voor zogenoemde open‑gewichtmodellen te versterken. Het bedrijf werkt samen met Hugging Face en Goodfire AI aan een standaard en infrastructuur voor evaluatie en monitoring van deze modellen.
Wat bedoelen we met "modellen met openbare gewichten" en waarom is dat relevant?
Met modellen met openbare gewichten worden AI‑modellen bedoeld waarvan de interne instellingen — de zogeheten gewichten — vrij beschikbaar zijn. Dat maakt het mogelijk voor anderen om die modellen te gebruiken, aan te passen of opnieuw te trainen.
Het voordeel van zo’n open aanpak is dat meer mensen kunnen meekijken en fouten of gevaarlijke gedragingen sneller opgemerkt kunnen worden. Tegelijk brengt het ook risico’s met zich mee: kwaadwillenden kunnen bewuste wijzigingen doen waardoor veiligheidsmaatregelen verdwijnen. Een recente techniek die dat mogelijk maakt heet "abliteration": daarmee verwijderen of omzeilen mensen bewust de ingebouwde beschermingen van een model, zodat het model dingen kan doen die gevaarlijk of misbruikgevoelig zijn.
Hugging Face, dat veel van deze open‑modellen host, heeft inmiddels meer dan 6.000 modellen die al zijn aangepast met zulke verwijderde beschermingen. Dat illustreert hoe groot het probleem kan zijn.
Wat wil Base Labs precies bouwen?
Base Labs, de onderzoeksafdeling van Baseten, richt zich op methoden om openmodellen veilig te trainen en blijvend te monitoren. In plaats van veiligheid achteraf toe te voegen, wil het initiatief veiligheidsmaatregelen direct onderdeel maken van hoe modellen worden ontwikkeld en ingezet.
Het idee is een soort transparante standaard: regels en technieken die openbaar zijn en die ontwikkelaars kunnen gebruiken om modellen veiliger te maken. Die standaard moet zowel meetmethoden bevatten om risico’s op te sporen als tools om continu te controleren hoe een model zich gedraagt nadat het is ingezet.
Baseten zegt dat openheid juist een voordeel kan zijn voor veiligheid. Als meer mensen kunnen controleren wat een model doet, ontstaan er betere manieren om uitkomsten te begrijpen en om wetenschappelijke bevindingen om te zetten in praktische controles.
Welke rol hebben Hugging Face en Goodfire AI?
Hugging Face levert de omgeving waar veel open‑modellen te vinden en te delen zijn. Zij hebben daarmee inzicht in welke modellen aangepast en misbruikt worden.
Goodfire AI werkt aan het doorzichtiger maken van hoe AI‑modellen beslissingen nemen. Hun technologie helpt de zogenaamde "zwarte doos" van AI te openen, zodat ontwikkelaars en gebruikers beter kunnen zien waarom een model iets doet.
Samen willen de drie partijen technische hulpmiddelen en processen ontwikkelen die in het ontwikkel‑ en uitrolproces ingebouwd worden. De partners hebben nog geen gedetailleerde technische beschrijving gegeven van hoe dat precies technisch gaat werken, maar stellen dat veiligheid geleverd moet worden door degenen die de modellen aanbieden en beheren.
Wat betekent dit voor organisaties en ontwikkelaars?
Er komt meer aandacht voor het bouwen van veiligheid vanaf het begin van een project, niet als iets wat later wordt toegevoegd.
Open standaarden en monitoringtools kunnen het voor organisaties makkelijker maken om risico’s te herkennen en te beperken.
Voor ontwikkelaars betekent het mogelijk extra eisen bij training en uitrol: meer tests, logging en verklaringen over hoe modellen werken.
Baseten doet ook een open oproep aan de bredere ontwikkelaarsgemeenschap om bij te dragen aan het framework. Daarmee hopen ze een ecosysteem te creëren van openmodellen die veiliger en toegankelijker zijn voor iedereen.
Financiële context
Baseten is een grote speler in AI‑inference (het draaien van modellen) en haalde recent 1,5 miljard dollar op in een Series F‑ronde. Daarmee kwam de waardering van het bedrijf uit op ongeveer 13 miljard dollar. Goodfire AI kreeg eerder dit jaar 150 miljoen dollar in een Series B‑ronde om te werken aan hun platform voor modeluitlegbaarheid.
Deze financiering maakt duidelijk dat er veel geld en interesse is om oplossingen te bouwen voor veiligheid en uitlegbaarheid van AI.
Conclusie
Baseten, met Base Labs, zet samen met Hugging Face en Goodfire AI een stap richting een meer systematische aanpak voor veiligheid van openmodellen. Het initiatief probeert veiligheidsmaatregelen vanaf het begin van ontwikkeling en uitrol te laten meedoen, in plaats van ze later aan te zetten. Daarmee hopen de partijen de risico’s van technieken zoals abliteration te verkleinen en tegelijk de voordelen van openheid te behouden.
