Achtergrond - Schreef een mens of een machine het? Zo werkt AI-detectiesoftware
In dit artikel:
AI-detectiesoftware wordt getraind met voorbeelden van zowel menselijke als door taalmodellen gemaakte teksten. Op basis daarvan probeert de software kenmerken te vinden die beide soorten tekst van elkaar onderscheiden. De tools leveren daarbij geen nieuw tekstmateriaal op, maar geven een waarschijnlijkheid of label.
GPTZero kijkt onder meer naar taalgebruik, zoals woordkeuze, grammatica, herhaling en variatie in zinslengte. Menselijke teksten zijn volgens onderzoekers vaak minder voorspelbaar en gevarieerder. Dat wordt onder meer gemeten met ‘burstiness’. Daarnaast gebruikt de tool perplexiteit: een maat voor de voorspelbaarheid van woordreeksen. Een hogere perplexiteit zou eerder op menselijke tekst wijzen. Turnitin en Copyleaks trainen hun modellen met gelabelde datasets, waarin vooraf vaststaat of teksten door mensen of AI zijn geschreven. Daardoor leren de systemen zelfstandig patronen herkennen en kunnen ze verschillende tekstsoorten analyseren. Sommige programma’s bekijken bovendien overlappende tekstgedeelten of letten op kenmerken zoals lettergreepverdeling en het gebruik van koppeltekens.
Pangram werkt volgens onderzoeker Marijke Van Vlasselaer anders dan veel oudere systemen. De ontwikkelaars beschikken naar eigen zeggen over 28 miljoen menselijke en AI-gegenereerde teksten. Voor elk menselijk document lieten zij met een speciale opdracht een vergelijkbare AI-versie maken, met hetzelfde onderwerp, dezelfde toon, stijl en lengte. Vervolgens zoekt het systeem naar verschillen tussen deze twee ‘gespiegelde’ verzamelingen. Deze aanpak, mirrorprompting genoemd, moet diepere patronen blootleggen dan alleen woordvoorspelbaarheid en tekstvariatie. Andere programma’s combineren overigens meerdere methodes; GPTZero gebruikt bijvoorbeeld taalkundige en statistische analyses, terwijl Turnitin machinelearning met statistische metingen verenigt.
De betrouwbaarheid staat onder druk doordat nieuwe taalmodellen steeds natuurlijker schrijven. In een onderzoek herkenden Copyleaks, Turnitin en GPTZero grote delen van sommige AI-teksten niet. Pangram presteerde daar beter: de tool identificeerde 97 procent van volledig door AI gemaakte teksten en behaalde een nauwkeurigheid van 92,5 procent bij gedeeltelijk gegenereerde of door AI menselijker gemaakte teksten. De uitkomsten zijn minder betrouwbaar bij teksten van minder dan honderd woorden; volgens Van Vlasselaer is ongeveer 250 woorden nodig om voldoende patronen te kunnen analyseren. Ook grondig herschreven AI-tekst wordt moeilijker herkend.
Een detectiescore is bovendien niet zonder risico. In voorbeelden werd het boek Moby Dick ten onrechte voor 44 procent als AI-tekst aangemerkt. De Amerikaanse student Orion Newby werd door zijn universiteit van fraude beschuldigd nadat Turnitin zijn tekst volledig als AI-gegenereerd beoordeelde, terwijl een andere detector nul procent aangaf. Onderzoek van Van Vlasselaer vond bij vier geteste systemen geen valspositieven, maar zulke fouten kunnen grote gevolgen hebben, bijvoorbeeld wanneer studenten naar een examencommissie worden verwezen.
Omdat taalmodellen zich blijven ontwikkelen, moeten detectietools telkens worden bijgesteld. Onderwijsinstellingen zouden een uitslag daarom alleen als aanwijzing moeten gebruiken en eerst met studenten overleggen. Versiegeschiedenis, kladteksten en ander bewijsmateriaal kunnen helpen om vast te stellen hoe een tekst tot stand kwam. Volgens Van Vlasselaer kan controle studenten bovendien aansporen om zorgvuldiger met AI om te gaan.
Vandaag Inside: Johan Derksen: ‘KLM ontziet Camiel Eurlings, maar moet hem gewoon een levenslang vliegverbod geven!’