De afgelopen paar weken kwam de AI-detectietool Pangram meerdere keren in het nieuws. Zo heeft de Volkskrant tweets van Rob Jetten door Pangram laten controleren. Volgens de NOS en Pangram schrijven Kamerleden een kwart van hun kamervragen met AI. Hoe werkt AI-detectiesoftware precies?
De achterliggende technologie van AI-detectiesoftware komt op veel vlakken overeen met die van llm's. Ontwikkelaars trainen ook AI-detectiesoftware op een grote dataset, met één groot verschil. Waar llm's in principe getraind zijn op menselijke teksten, trainen ontwikkelaars detectiesoftware op zowel menselijke als AI-gegenereerde tekst. Vervolgens trainen ze de systemen om de twee typen tekst te onderscheiden.
Taalkundige en statistische methodes
AI-detectietools gebruiken diverse methodes om een AI-tekst te onderscheiden van een menselijke tekst. Zo gebruikt GPTZero de taalkundige methode. Deze is gebaseerd op hoe taal wordt gebruikt in een tekst, zoals de grammatica en woordkeuze.
Het idee is dat gegenereerde teksten vaak een eigen stijl en structuur hebben. Marijke Van Vlasselaer, die AI-detectiesoftware onderzoekt, vertelt aan Tweakers: "Mensen schrijven vrij chaotisch en gevarieerd, terwijl een llm doorgaans ongebruikelijke zinsconstructies niet snel zal maken."
'Mensen schrijven vrij chaotisch en gevarieerd.'
Vaak bevatten gegenereerde teksten veel herhaling, terwijl mensen meer geneigd zijn om gevarieerd te schrijven. Die variatie uit zich in lengte, toon en overgangen in de tekst. Mensen gebruiken bijvoorbeeld sneller signaalwoorden om overgangen in een tekst aan te geven. Onderzoekers noemen dit burstiness. GPTZero detecteert aan de hand van die kenmerken hoe natuurlijk een tekst overkomt en geeft dan met een score aan hoeveel van de tekst er vermoedelijk met AI geschreven is.
GPTZero gebruikt daarnaast de statistische methode om teksten te onderscheiden. Deze methode leunt op waarschijnlijkheid en patronen in een tekst. Hiervoor meet het programma de perplexiteit. Die geeft aan hoe voorspelbaar een sequentie woorden is. De schrijfstijl in AI-gegenereerde tekst is vaak voorspelbaarder dan bij menselijke tekst. Een llm baseert zich op een al bestaande dataset en mensen niet altijd. Hoe hoger de perplexiteit, hoe waarschijnlijker het is dat de tekst van een mens komt.
Methode met machinelearning
Twee andere AI-detectietools, Turnitin en Copyleaks, gebruiken de learning-based methode. Ontwikkelaars trainen een algoritme via machinelearning op grote, gelabelde datasets die bestaan uit zowel menselijke als AI-gegenereerde teksten. Het model krijgt dus een groot aantal voorbeelden voorgeschoteld waarvan vooraf bekend is of ze door een mens of door AI zijn geschreven.
Doordat deze methode gebaseerd is op machinelearning, leert het algoritme zichzelf om automatisch patronen en kenmerken te herkennen die door een mens geschreven teksten onderscheiden van AI-teksten. Verder kan zo'n algoritme zich door deze methode ook makkelijker aanpassen aan verschillende typen tekst. Daardoor beschouwen onderzoekers het als flexibeler.
Extra technieken
In de praktijk verfijnen ontwikkelaars deze methodes met aanvullende technieken. AI-detectiesoftware kan afzonderlijke zinnen lastig beoordelen op AI-gebruik. Daarom splitst Turnitin documenten op in overlappende stukken tekst om zinnen binnen de context te kunnen beoordelen. Copyleaks weegt mee hoe gelijkmatig lettergrepen zijn verdeeld in een tekst en hoe koppeltekens voorkomen in te tekst.
Volgens Van Vlasselaer heeft het detectieprogramma Pangram de uniekste methode. "Pangram heeft een dataset van 28 miljoen AI-gegenereerde en volledig menselijk geschreven teksten. Voor elke menselijke tekst schreven de ontwikkelaars een prompt. Daarmee maken ze van diezelfde menselijke tekst een AI-genereerde tekst."
Die prompt draagt het model op om een tekst te genereren die in onderwerp, toon, stijl en lengte exact hetzelfde is als het menselijk origineel.
Van Vlasselaer legt uit dat er dan twee datasets ontstaan: een met alleen menselijke tekst en een met AI-gegenereerde tekst. Daarboven draait een algoritme dat patronen herkent op een diepgaander niveau dan alleen de perplexiteit of burstiness. Deze methode heet mirrorprompting.
Mirrorprompting
De Belgische onderzoeker denkt dat mirrorprompting de reden is dat Pangram betrouwbaarder is dan andere detectiesoftware: "De andere oudere detectiesoftware richt zich eigenlijk alleen op de perplexiteit en burstiness. Pangram doet dat helemaal niet op die manier. Het programma heeft twee gespiegelde datasets om ook echt aan die patroonherkenning te kunnen doen."
De slechtere betrouwbaarheid van de andere methodes komt door de vooruitgang van AI-modellen zoals GPT-4o. Die kunnen steeds beter natuurlijke teksten schrijven. Daardoor kunnen modellen zoals GPTZero niet meer op alleen perplexiteit en burstiness leunen om onderscheid te maken.
Het betekent niet dat elke detectiesoftware maar één methode gebruikt. Zo gebruikt GPTZero zowel de taalkundige methode als de statistische methode en combineert Turnitin de learning-based methode met de statistische methode.
Valspositieve resultaten
Onderwijsinstellingen gebruiken de tools vaak om te controleren of studenten hun masterthesis bij elkaar hebben geprompt. De achterliggende technologie werpt echter de vraag op hoe betrouwbaar AI-detectiesoftware precies is: taalmodellen kunnen fouten maken en hallucineren.
Hoewel detectiesoftware overeenkomsten vertoont met llm's, is er een belangrijk verschil: detectiesoftware genereert geen tekst. "Hallucinaties ontstaan wanneer een nieuwe tekst gegenereerd wordt. Pangram genereert geen tekst, maar kent alleen labels toe via patroonherkenning en machinelearning", legt Van Vlasselaer uit.
Dat zegt weinig over de foutmarges van detectiesoftware. Als een van de tools ten onrechte een tekst van een student bestempelt als door AI geschreven (een valspositief resultaat), kan dat grote gevolgen hebben. Onderwijsinstellingen sturen studenten regelmatig naar de examencommissie voor fraude nadat detectiesoftware AI-gebruik detecteert. Onderzoek wijst echter uit dat de kans op een valspositief resultaat erg klein is. "In ons eigen onderzoek vertoonde geen van de vier geteste AI-detectoren een false positive", vertelt Van Vlasselaer.
Moby Dick en van 100 naar 0 procent
Dat de tools in de studie geen valspositieve resultaten detecteren, wil niet zeggen dat er geen risico daarop bestaat. Zo sloeg de AI-tool Research Prospect rood uit toen Sam Illingworth het 19e-eeuwse boek Moby Dick door de tool haalde. AI zou 44 procent ervan hebben geschreven.
Eerder dit jaar won de Amerikaanse student Orion Newby een rechtszaak over AI-geschreven tekst. AI-tool Turnitin gaf aan dat AI zijn tekst voor 100 procent had gegenereerd. De universiteit beschuldigde hem van fraude, maar toen hij zijn tekst door andere AI-detectiesoftware haalde, kreeg de tekst een score van 0 procent AI.
Bij (deels) AI-genereerde teksten zijn de resultaten een stuk wisselvalliger. Copyleaks, Turnitin en GPTZero zagen grote passages met AI-tekst over het hoofd. Pangram komt met afstand als winnaar uit de test: de tool herkende 97 procent van volledig AI-gegenereerde teksten en haalde een nauwkeurigheid van 92,5 procent bij deels gegenereerde teksten en AI-teksten die een taalmodel op verzoek had geprobeerd menselijker te herschrijven.
Wel heeft een tool zoals Pangram verschillende beperkingen, waarschuwt Van Vlasselaer: "AI-detectietools zijn een stuk minder betrouwbaar onder de 100 woorden, omdat er in een korte tekst te weinig patronen te herkennen zijn. Die hoge betrouwbaarheid geldt pas vanaf 250 woorden."
Het onderzoek wijst ook uit dat de detectiesoftware het ook veel minder snel oppikt als iemand taalkundig goed onderlegd is en een AI-gegenereerde tekst grondig herschrijft op grammaticaal en semantisch niveau.
Kat-en-muisspel
De onderzoekers benadrukken dat bijvoorbeeld onderwijsinstellingen niet kunnen'We gaan eerst met de studenten in gesprek.'
vertrouwen op een vaste tool. AI-modellen ontwikkelen zich snel. In de toekomst kan er dus zomaar een model op de markt komen met output die detectietools niet meer effectief kunnen onderscheiden van schrijfsels van een mens. Detectiesoftware loopt altijd achter, doordat ontwikkelaars het model opnieuw moeten trainen zodra er een nieuwe versie van een llm uitkomt.
Om die reden zegt Van Vlasselaer, die zelf in het hoger onderwijs werkt, dat de uitkomst van een AI-detectietool alleen als signaal moet worden gezien: "Wij gebruiken detectiesoftware zelf als beleidsinstrument in het onderwijs, maar wel met een aantal safeguards. We gaan eerst met de studenten in gesprek. Dan vertellen we dat we patronen hebben opgemerkt van AI-gegenereerde tekst. Heeft de student nog materiaal? Heeft de student nog versiegeschiedenis? Heeft de student nog stukjes van onvoltooide tekst? Op die manier kan het helpen als signaalfunctie."
Van Vlasselaer zegt dat studenten hun gedrag kunnen wijzigen doordat ze op de hoogte zijn van controle met deze tools. "Als studenten weten dat je mogelijk gepakt kunt worden omdat je iets hebt gedaan dat niet mag, denken we dat ze zorgvuldiger zullen omgaan met AI."
Redactie: Lumen Heijdendael • Eindredactie: Marger Verschuur
:strip_exif()/i/2008381628.jpeg?f=imagenormal)
:strip_exif()/i/2008381652.jpeg?f=imagenormal)
/i/2007460884.png?f=imagenormal)
:strip_exif()/i/2008381474.jpeg?f=imagenormal)
:strip_exif()/i/2008199392.jpeg?f=imagenormal)
/u/28892/flo.png?f=community)
:strip_icc():strip_exif()/u/4202/crop59500930db0d0_cropped.jpeg?f=community)
/u/1902572/crop63ca043445b24_cropped.png?f=community)
:strip_icc():strip_exif()/u/299039/dv3.jpg?f=community)