← Terug naar kennisbank
AI Nieuws
·
Leestijd: 4 min
PrismML is een jong bedrijf dat bezig is met een opvallende techniek: het maakt grote taalmodellen veel kleiner, zodat ze op een gewone pc of zelfs op een krachtigere smartphone kunnen draaien. Dat kan veranderen hoe jij AI gebruikt — minder vertraging, lagere kosten en meer privacy omdat het op het apparaat zelf draait.
Wat doet PrismML?
PrismML ontwikkelt compressiemethoden om bestaande grote taalmodellen sterk te verkleinen zonder veel prestatieverlies. Het bedrijf komt voort uit onderzoekers van Caltech en wordt geleid door professor Babak Hassibi. Als adviseur werkt Ion Stoica mee, bekend van de universiteit van Berkeley en verschillende technologiebedrijven.
Onlangs bracht PrismML een model uit dat Bonsai 2 27B heet. Dit model is gebaseerd op een populair model van Alibaba, Qwen3.8 27B, maar is samengeperst tot ongeveer 5,9 GB. Dat is ongeveer negen tot tien keer minder geheugen dan het origineel, waardoor het praktisch op een pc past en mogelijk ook op high‑end smartphones.
PrismML haalde een eerste investeringsronde van 22,25 miljoen dollar. Investeerders zijn onder andere Khosla Ventures, Cerberus Capital en Caltech.
Hoe werkt die verkleining precies?
Een model bestaat uit miljoenen tot miljarden getallen die bepalen hoe het model reageert. Die getallen noemen onderzoekers vaak "gewichten" — zij leggen vast wat het model geleerd heeft tijdens de training.
Normaal worden die gewichten opgeslagen met veel precisie. PrismML gebruikt een techniek die gewichten vereenvoudigt tot drie mogelijke waarden: +1, −1 of 0. Dit heet "ternaire" gewichten. Omdat elk gewicht nu veel minder informatie hoeft op te slaan, neemt de totale opslagruimte sterk af. Voor wie technisch wil lezen: waar men vaak 16 bits per gewicht gebruikt, volstaan met ternaire waarden veel minder ruimte.
De methode is open-source (vrij beschikbaar voor iedereen om te gebruiken en aan te passen), met documenten en code die beschikbaar zijn op onder meer een GitHub‑pagina van het project.
Wat levert dit op in de praktijk?
PrismML zegt dat Bonsai 2 27B ongeveer 98% van de prestaties van het originele Qwen‑model haalt op gemiddelde tests. Een eerdere versie van Bonsai behaalde 95%. Die getallen komen uit benchmarktests: gestandaardiseerde proeven om modellen te vergelijken.
PrismML meldt ook dat de eerdere modellen tientallen miljoenen keren zijn gedownload: de eerste versie meer dan 11 miljoen keer en andere kleinere varianten nog eens 2,6 miljoen keer. Dat wijst op duidelijk gebruikersinteresse.
De praktische voordelen zijn:
Minder hardware nodig: krachtige AI draait op een gewone pc of telefoon.
Lagere kosten: je hoeft geen dure rekenkracht in de cloud te betalen.
Meer privacy: gegevens blijven op jouw apparaat en worden niet naar externe servers gestuurd.
Zoals adviseur Ion Stoica het samenvat: slimme modellen zitten straks letterlijk aan je vingertoppen, gratis omdat ze op je eigen apparaat draaien, en privé omdat je niets naar de cloud hoeft te sturen.
Beperkingen en toekomstplannen
Compressie heeft vrijwel altijd enige invloed op de prestaties. PrismML zegt dat het verlies klein is en in veel gevallen weinig uitmaakt voor echt gebruik. Bovendien speelt de software rond het model (de "harness" waarin het model draait) een grote rol in hoe goed een model daadwerkelijk presteert.
PrismML richt zich nu op nog grotere modellen — modellen met honderden miljarden parameters — en verwacht dat het makkelijker wordt om die grootse modellen te comprimeren zonder veel intelligentie te verliezen. Het idee is: hoe groter het originele model, hoe meer ruimte er is om te verwijderen zonder dat de kernkennis verdwijnt.
Er werken ook andere bedrijven aan vergelijkbare compressietechnieken, bijvoorbeeld Multiverse Computing. PrismML benadrukt dat hun aanpak onderscheidend is omdat het verlies in tests klein blijft.
Er gaan berichten dat PrismML praat met grote hardwarefabrikanten over toepassing op telefoons, maar Hassibi wilde daar niet publiekelijk op ingaan.
Conclusie
PrismML ontwikkelt technieken die grote taalmodellen sterk kunnen verkleinen zonder veel kwaliteit in te leveren. Dat maakt het mogelijk om geavanceerde taal‑AI lokaal te draaien op pc's en mogelijk smartphones. Voor gebruikers betekent dit snellere respons, lagere kosten en meer privacy, en voor ontwikkelaars nieuwe mogelijkheden om slimme toepassingen zonder zware cloudinfrastructuur aan te bieden.
