← Terug naar kennisbank
AI Nieuws
·
Leestijd: 3 min
Je ziet steeds meer teksten die een taalmodel heeft geschreven. Onderzoekers van het marketingbureau Graphite onderzochten welke woorden en zinnen zulke teksten verraden — de zogenoemde “tells”.
Wat onderzocht Graphite?
Graphite begon met een controlegroep van 10.000 artikelen die vóór de komst van ChatGPT zijn gepubliceerd. Die dienden als voorbeeld van menselijke schrijfwijze.
Daarna lieten ze verschillende moderne taalmodellen dezelfde teksten herschrijven op basis van samenvattingen. Dat moest voorkomen dat de modellen simpelweg de oorspronkelijke zinnen kopieerden. Vervolgens vergeleken de onderzoekers hoe vaak bepaalde woorden, zinnen en zinsconstructies in de AI-teksten voorkwamen in vergelijking met de menselijke voorbeelden.
Uiteindelijk identificeerde Graphite ruim 13.000 zinsdelen die minstens twee keer zo vaak in AI-tekst voorkwamen — hun definitie van een "tell".
Wat kwamen ze tegen bij de modellen?
De studie laat zien dat elk model zijn eigen voorkeuren en eigenaardigheden heeft. Enkele opvallende voorbeelden:
Claude Opus 5.5 gebruikt opvallend vaak het woord "dependable" — 23 keer vaker dan in menselijke teksten. Daarnaast zegt dit model veel vaker dat iets "belangrijk is": de uitdrukking "this matters" kwam 116 keer vaker voor, en "why X matters" 92 keer vaker.
OpenAI’s Astra heeft andere gewoontes. Dit model houdt van formuleringen als "another dimension" en zwakt vaak beweringen af met woorden als "may provide" of "can provide". Ook gebruikt Astra vaak een soort corrigerende formulering: iets wordt niet alleen beschreven als X maar als meer dan of anders dan X — dat kwam in Astra-teksten ruim honderd keer vaker voor dan bij mensen.
Bij de GPT-modellen zagen de onderzoekers dat de woordverdeling juist verder afwijkt van de menselijke verdeling, terwijl bij de Claude-modellen die kloof juist kleiner lijkt te worden, volgens Greg Druck van Graphite.
Veranderingen in interpunctie en andere kleine dingen
Een oude aanwijzing voor AI-tekst was veel gebruik van de em-dash (—). De nieuwste modellen lijken dat bijna uit te bannen:
Opus 5.5 gebruikte de em-dash 99% minder dan in menselijke voorbeelden.
Astra gebruikt de em-dash 88% minder.
Gemini 3.1 Pro heeft de em-dash vrijwel volledig uit zijn teksten gehaald.
Toch verdwijnen de ene tells en verschijnen andere. Volgens de onderzoekers nemen modellen specifieke bekende patronen weg, maar dan ontstaan er nieuwe opvallende gewoontes.
Waarom blijven die tells bestaan?
De labs achter de modellen geven aan dat hun nieuwste versies "natuurlijker" en duidelijker schrijven. Toch blijkt uit het onderzoek dat sommige typerende formuleringen hardnekkig blijven. De reden hiervoor is technisch maar belangrijk in het kort:
Moderne taalmodellen zijn extreem groot en bevatten miljarden instellingen. Het is moeilijk om elk klein patroon tijdens het trainen of testen compleet te verwijderen.
Ontwikkelaars kunnen gericht bekende fouten aanpakken, maar andere patronen duiken elders op. Het is een beetje een kat-en-muisspel: bekende ontboezemingen verdwijnen, nieuwe nemen hun plaats in.
Volgens Graphite is het niet zo dat het aantal tells sterk afneemt; de samenstelling verandert vooral per modelversie.
Conclusie
Taalmodellen ontwikkelen herkenbare schrijfgewoontes. Sommige gewoontes verdwijnen na updates, andere verschijnen juist weer. Voor jou als lezer betekent dit dat er aanwijzingen bestaan om machinaal gegenereerde teksten te herkennen — maar er is geen simpele, blijvende vinkjeslijst. Elk model en elke versie heeft zijn eigen voorkeuren, en onderzoekers zullen blijven zoeken naar die patronen terwijl de modellen verbeteren.
