← Terug naar kennisbank
AI Nieuws
·
Leestijd: 5 min
AI-agents beloven veel, maar ze blijken vaak moeilijk betrouwbaar te maken in het echte werk. Veel bedrijven ontdekken dat een agent die goed lijkt in een testomgeving, in de praktijk fouten maakt wanneer meerdere bedrijfsprogramma's tegelijk meedoen. Dit artikel legt uit wat Arga doet om dat probleem op te lossen en wat dat voor jou kan betekenen.
Waarom AI-agents in bedrijven lastig zijn
AI-agents moeten taken uitvoeren in bestaande zakelijke programma's, zoals Salesforce (klantbeheer), Workday (personeelsadministratie) of je e-mailprogramma. In zulke systemen ontstaan snel ingewikkelde situaties: twee mensen maken bijvoorbeeld apart eenzelfde klant aan in verschillende programma's. Een agent moet dan herkennen dat het om dezelfde organisatie gaat en precies één vervolgmail sturen, naar de juiste contactpersoon.
Veel tests voor AI gebruiken een eenvoudige interface, een zogenaamde API (API, een manier waarop twee computerprogramma's gegevens en opdrachten uitwisselen). Zulke tests zijn vaak "stateless": ze behandelen elke keer een losse opdracht zonder de volledige context van een compleet bedrijfsproces. In de echte wereld werken programma's echter samen, met rechten, koppelingen en specifieke regels. Daardoor ontstaan fouten die in eenvoudige tests niet zichtbaar zijn.
Daarnaast is het moeilijk om grote aantallen tests te draaien met echte bedrijfssoftware. Programma's zoals Salesforce of Outlook kun je niet zomaar snel terugzetten naar een beginstand of eenvoudig kopiëren om duizenden scenario's te draaien. Daardoor is het lastig om een agent via veel oefenrondes te leren wat wel en niet werkt.
Hoe Arga het anders aanpakt
Arga bouwt voor bedrijfssoftware een volledige digitale kopie — een soort slimme testomgeving die het echte programma nauwkeurig nabootst. Dat gaat verder dan alleen een API: Arga replicaat houdt rekening met gebruikersrechten, koppelingen tussen systemen en de dynamiek van een werkdag. Hierdoor ontstaat een veilige plek waar een agent uitgebreid kan oefenen.
De basisideeën:
Arga maakt een digitale tweeling van een programma, zodat de agent in een realistische omgeving kan leren zonder het echte systeem te beïnvloeden.
De omgeving is eenvoudig te resetten of aan te passen. Daardoor kun je hetzelfde scenario veel keer herhalen, wat belangrijk is voor leermethodes die op trial-and-error werken.
Meerdere omgevingen kunnen tegelijk draaien, zodat een agent leert omgaan met interacties tussen verschillende programma's (bijvoorbeeld CRM en e-mail).
Philip Li, CEO en medeoprichter van Arga, illustreerde dat met een voorbeeld: een persoon legt een potentiële klant aan in Salesforce, terwijl een collega tegelijk een contact probeert te benaderen via HubSpot. Een agent moet dan herkennen dat het om dezelfde organisatie gaat en beslissen wie de e-mail moet krijgen. Zulke beslissingen vereisen inzicht in de samenhang tussen systemen — precies waar Arga op focust.
Arga kondigde aan $10 miljoen aan seed-investeringen te hebben opgehaald. De ronde werd geleid door General Catalyst, met deelname van Box Group, Emergence, Gradient en SV Angel. Dat soort steun laat zien dat beleggers kansen zien in betere test- en trainingsomgevingen voor agents.
Waarom dit belangrijk is voor bedrijven
De aanpak van Arga verkleint een aantal risico's en maakt AI-oplossingen betrouwbaarder. Concreet levert dit op:
Minder fouten bij taken die meerdere systemen raken.
Snellere en veiligere training van agents, omdat je scenario's herhaaldelijk en gecontroleerd kunt doorlopen.
Mogelijkheid om complexe werkprocessen na te bootsen, zodat de agent beslissingen kan leren maken in realistische omstandigheden.
Een belangrijk technisch punt hierbij is wat soms de "reinforcement gap" wordt genoemd. AI-trainers gebruiken vaak reinforcement learning (RL, een manier van leren waarbij een systeem door veel herhalingen leert welke acties beloond worden). Voor programmeertaken bestaan al geavanceerde hulpmiddelen om zo'n leeromgeving op te zetten. Voor bedrijfssoftware bestonden die hulpmiddelen veel minder, waardoor agents trager beter werden. Door realistische, herhaalbare omgevingen te bieden, helpt Arga die kloof te dichten.
Volgens Yuri Sagalov van General Catalyst is een herhaalbare sandbox-omgeving belangrijker voor agents dan voor mensen. Met een goede testomgeving kun je risico's beperken en sneller ontdekken of een agent veilig en effectief werkt.
Wat kun jij daarmee verwachten?
Als jouw organisatie AI wil inzetten om routinetaken te automatiseren, is het nuttig om te weten dat niet alle AI-oplossingen op dezelfde manier getest zijn. Een agent die alleen in simpele tests is beoordeeld, kan in de praktijk anders gedrag vertonen.
Door te trainen in een realistische kopie van de werksoftware kun je:
betrouwbaarder automatiseren van taken die meerdere systemen raken;
minder last hebben van onverwachte fouten of dubbele acties;
veiliger experimenteren voordat je een agent in het echte systeem laat werken.
Conclusie
Arga richt zich op een praktisch probleem: AI-agents leren in de labomgeving leidt niet altijd tot goed gedrag in de echte bedrijfsomgeving. Met digitale kopieën van softwaresystemen biedt Arga een manier om agents veilig, herhaalbaar en realistischer te trainen. Voor bedrijven die AI willen inzetten in bestaande programma's kan dit het verschil maken tussen een probleemloze toepassing en een systeem dat foutgevoelig is in de praktijk.
