← Terug naar kennisbank

AI Nieuws

Meer uit bestaande GPU’s halen: hoe Kog snel AI-antwoord wil geven

Meer uit bestaande GPU’s halen: hoe Kog snel AI-antwoord wil geven

·

Leestijd: 4 min

Kog, een Franse startup, wil AI-modellen veel sneller laten antwoorden op de gewone datacenter-GPU’s die bedrijven al gebruiken. In plaats van nieuwe, speciale chips te kopen, zet Kog in op diepgaande software-optimalisaties om meer rekensnelheid uit bestaande hardware te halen. Dat trok flink wat aandacht en zakelijke interesse.

Waar draait het om?

AI-modellen gebruiken veel rekentijd als ze tekst of andere output moeten genereren. Die fase heet inference: het laten antwoorden van een model nadat het is getraind. Snelle inference is belangrijk als mensen of bedrijven meteen resultaat willen, bijvoorbeeld bij het schrijven van code, het genereren van content of interactieve apps.

Kog liet met een demo zien dat hun aanpak op standaard datacenter-GPU’s tot 3.000 tokens per seconde mogelijk is voor één verzoek. Dat was met een klein model van ongeveer 2 miljard parameters, de Laneformer 2B, dat Kog open-source (vrij beschikbaar gemaakt) heeft gepubliceerd.

Waarom is dat nieuws?

  • Veel bedrijven gebruiken nu dure of speciale chips óf betalen extra voor snellere diensten. Kog wil die noodzaak verminderen door bestaande GPU’s slimmer te benutten.

  • De startup claimt vergaande snelheidswinst, zoals '30x sneller' in sommige situaties. Als dat ook werkt voor grotere modellen, kan dat veel kosten en wachttijd schelen.

  • De aanpak trok direct belangstelling: Kog kreeg tientallen serieuze leads en meerdere samenwerkingen met ontwerpers van games en apps die snellere resultaten willen.

Hoe doet Kog dat?

Kog kijkt heel diep naar hoe GPU’s intern werken en past de software precies daarop aan. Dat betekent onder meer:

  • het analyseren van geheugen en bandbreedte van de GPU,

  • het optimaliseren van de kleinste berekeningen op laag niveau (soms zelfs in assembly-taal),

  • herontwerpen van de datastromen zodat de hardware efficiënter gebruikt wordt.

De oprichter Gaël Delalleau combineert een achtergrond in natuurkunde met ervaring in offensive cybersecurity. Volgens hem helpt dat om zowel de wetenschappelijke als de 'reverse-engineering'-kant te beheersen: weten welke fysieke wetten de GPU bepalen en hoe je die kunt omzeilen of benutten.

Grenzen en concurrentie

Kog heeft een duidelijke beperking: de methode is erg handwerk. Voor elke nieuwe GPU moet het team weken tot maanden diep in de hardware duiken. Met een klein team van ongeveer 11 mensen kan Kog daardoor voorlopig niet snel alle chips ondersteunen.

Daarnaast zijn er andere spelers die ook werken aan snellere inference, zoals bedrijven die speciale chips ontwerpen (bijvoorbeeld Cerebras) of softwarebedrijven die hardware-agnostische oplossingen maken (zoals ZML). Kog positioneert zich echter als zeer laag-niveau en vergelijkbaar met onderzoeksgroepen die zich volledig op GPU-architectuur richten.

Ook geldt dat de demo’s nog vooral op kleinere modellen waren. Grote taalmodellen (LLM, oftewel grote taalmodellen) zijn veel zwaarder en vormen een grotere uitdaging voor inference-chips. Kog moet bewijzen dat hun truc ook daar werkt vóór het echt grote zakelijke succes kan volgen.

Markt en plannen

Kog richt zich in eerste instantie op software-engineers en bedrijven die last hebben van wachttijden bij AI-diensten. Snelle antwoorden zijn voor hen direct productieverhogend. Daarnaast werkt Kog met designpartners die apps en games maken, waar sneller genereren direct extra omzet kan opleveren.

Het bedrijf heeft steun van partijen als Scaleway en wordt ondersteund door Franse investeringsprogramma’s, waaronder Bpifrance en French Tech 2030. Kog verwacht zijn eerste grote model met ongeveer 10x versnelling te demonstreren in september; dat moet helpen om meer klanten en extra investeringen aan te trekken.

Conclusie

Kog zet in op één simpele maar ambitieuze gedachte: haal meer uit de GPU’s die bedrijven al hebben, in plaats van meteen nieuwe hardware te kopen. De technische aanpak is diepgaand en arbeidsintensief, maar als het ook werkt voor grote modellen kan dat veel wachttijd en kosten besparen. Voorlopig blijft bewijs op grotere modellen en bredere ondersteuning van verschillende GPU’s de belangrijkste toetssteen voor succes.

Vul je e-mail in om dit artikel te lezen

Gratis, geen spam. Je kunt je altijd weer uitschrijven.

Je e-mailadres wordt uitsluitend gebruikt voor updates over de Kennisbank en belangrijke berichten van Relue.