← Terug naar kennisbank
AI Nieuws
·
Leestijd: 4 min
Vals is een jong bedrijf dat wil veranderen hoe modellen voor kunstmatige intelligentie (AI) worden getest. Het doel is simpel: eerlijker en praktischer beoordelen of een model echt doet wat bedrijven beloven.
Waarom oude testen tekortschieten
Veel bestaande toetsen meten vooral algemene kennis. Ze kijken bijvoorbeeld of een model feiten kent of standaardexamenvragen kan beantwoorden. Die toetsen zijn vaak openbaar. Daardoor kunnen bedrijven hun modellen specifiek op die vragen trainen. Het resultaat: hoge scores, maar geen garantie dat het model in echte situaties goed werkt.
Tegelijk lopen die oude systemen achter op de recente ontwikkeling van modellen. Nieuwe modellen leren sneller en voeren veel complexere taken uit. Dat vraagt om andere soorten toetsen, die niet alleen kennis meten maar ook echte werksituaties nabootsen.
Hoe Vals anders te werk gaat
Vals houdt de precieze testopgaven geheim. Dat voorkomt dat bedrijven hun modellen alleen op de toets optimaliseren. In plaats van algemene kennis meet Vals of een model goede resultaten levert in concrete beroepssituaties. De tests zijn gericht op taken uit sectoren als recht, financiën en softwareontwikkeling.
De startup werd in 2024 opgericht en groeide snel. Vals haalde eerder durfkapitaal van 8VC en Bloomberg Beta. Recent kwam er een Series A-financieringsronde van 40 miljoen dollar, geleid door Andreessen Horowitz. Oprichter Rayan Krishnan, in de oorspronkelijke tekst genoemd als co-founder, zegt dat hij dit bedrijf begon omdat bestaande evaluaties niet meer aansluiten op wat moderne modellen kunnen.
Wat Vals precies meet
Vals beoordeelt niet alleen of een model het juiste antwoord geeft. De tests proberen ook te meten of een model echt nuttig is in een beroep en welke risico's het met zich meebrengt. Voorbeelden van gebieden waar Vals naar kijkt:
Recht: kan een model juridische documenten redigeren of adviseren op het niveau van een vakgenoot?
Financiën en coderen: levert het model werk dat dezelfde kwaliteit heeft als dat van een mens?
Cybersecurity en biosecurity: kan het model veiligheidsrisico's vergroten of verminderen?
Geestelijke gezondheidszorg: hoe presteert het model bij gevoelige, menselijke onderwerpen?
Internationale regelgeving: bijvoorbeeld hoe een model omgaat met regels als de Geneefse Conventie.
Vals ontwikkelt ook tests voor complexere thema’s, zoals "recursive self-improvement" — toetsen of een model zichzelf kan aanpassen en verbeteren op manieren die gevolgen hebben voor veiligheid en betrouwbaarheid.
Wie betaalt en waarom dat belangrijk is
Bedrijven betalen Vals om hun modellen te laten testen. Dat lijkt misschien vreemd: waarom betalen om te horen dat iets niet goed werkt? Maar een betrouwbare meting helpt precies bij het ontdekken van problemen en het verbeteren van modellen. Vergelijk het met een student die op een officieel examen gaat om te weten waar hij staat.
De uitkomsten van zulke tests worden ook steeds belangrijker bij zakelijke beslissingen. Organisaties die nieuwe modellen willen kopen of gebruiken kijken naar resultaten van onafhankelijke toetsing. Vals meldt dat de omzet dit jaar acht keer hoger is dan vorig jaar en dat het team van acht mensen uitgroeide naar 25. Er lopen plannen om te verhuizen naar een groter kantoor en personeel uit te breiden. Ook is er een programma gestart om evaluaties voor overheidsinstanties te doen.
Oprichter Krishnan zegt dat dit soort toetsing belangrijk zal worden naarmate AI een groter deel van de economie gaat uitmaken. Volgens hem kunnen onafhankelijke benchmarks mede bepalen hoe bedrijven over hun modellen rapporteren en welke modellen in de praktijk worden gebruikt.
Conclusie
Vals probeert een strengere, praktijkgerichte standaard te zetten voor het toetsen van kunstmatige intelligentie (AI). Door tests achter te houden en echte beroepssituaties te simuleren, wil het bedrijf eerlijkere en nuttigere informatie geven over wat modellen wél en niet kunnen. Voor organisaties die AI willen inzetten, kunnen dergelijke onafhankelijke toetsingen straks een belangrijke rol gaan spelen bij keuzes en vertrouwen.
