Door Lumen Heijdendael

Stagiair nieuwsredactie

Schreef een mens of een machine het? Zo werkt AI-detectiesoftware

23-09-2026 • 17:15

16

Schreef een mens of een machine dit? Zo werkt AI-detectiesoftware

De afgelopen paar weken kwam de AI-detectietool Pangram meerdere keren in het nieuws. Zo heeft de Volkskrant tweets van Rob Jetten door Pangram laten controleren. Volgens de NOS en Pangram schrijven Kamerleden een kwart van hun kamervragen met AI. Hoe werkt AI-detectiesoftware precies?

De achterliggende technologie van AI-detectiesoftware komt op veel vlakken overeen met die van llm's. Ontwikkelaars trainen ook AI-detectiesoftware op een grote dataset, met één groot verschil. Waar llm's in principe getraind zijn op menselijke teksten, trainen ontwikkelaars detectiesoftware op zowel menselijke als AI-gegenereerde tekst. Vervolgens trainen ze de systemen om de twee typen tekst te onderscheiden.

Taalkundige en statistische methodes

AI-detectietools gebruiken diverse methodes om een AI-tekst te onderscheiden van een menselijke tekst. Zo gebruikt GPTZero de taalkundige methode. Deze is gebaseerd op hoe taal wordt gebruikt in een tekst, zoals de grammatica en woordkeuze.

Het idee is dat gegenereerde teksten vaak een eigen stijl en structuur hebben. Marijke Van Vlasselaer, die AI-detectiesoftware onderzoekt, vertelt aan Tweakers: "Mensen schrijven vrij chaotisch en gevarieerd, terwijl een llm doorgaans ongebruikelijke zinsconstructies niet snel zal maken."

'Mensen schrijven vrij chaotisch en gevarieerd.'

Vaak bevatten gegenereerde teksten veel herhaling, terwijl mensen meer geneigd zijn om gevarieerd te schrijven. Die variatie uit zich in lengte, toon en overgangen in de tekst. Mensen gebruiken bijvoorbeeld sneller signaalwoorden om overgangen in een tekst aan te geven. Onderzoekers noemen dit burstiness. GPTZero detecteert aan de hand van die kenmerken hoe natuurlijk een tekst overkomt en geeft dan met een score aan hoeveel van de tekst er vermoedelijk met AI geschreven is.

GPTZero gebruikt daarnaast de statistische methode om teksten te onderscheiden. Deze methode leunt op waarschijnlijkheid en patronen in een tekst. Hiervoor meet het programma de perplexiteit. Die geeft aan hoe voorspelbaar een sequentie woorden is. De schrijfstijl in AI-gegenereerde tekst is vaak voorspelbaarder dan bij menselijke tekst. Een llm baseert zich op een al bestaande dataset en mensen niet altijd. Hoe hoger de perplexiteit, hoe waarschijnlijker het is dat de tekst van een mens komt.

Methode met machinelearning

Twee andere AI-detectietools, Turnitin en Copyleaks, gebruiken de learning-based methode. Ontwikkelaars trainen een algoritme via machinelearning op grote, gelabelde datasets die bestaan uit zowel menselijke als AI-gegenereerde teksten. Het model krijgt dus een groot aantal voorbeelden voorgeschoteld waarvan vooraf bekend is of ze door een mens of door AI zijn geschreven.

Robothand op toetsenbord, met mens. Beeld: GettyImages (Photo by Peter Endig, picture alliance)
Beeld: GettyImages (Photo by Peter Endig, picture alliance)

Doordat deze methode gebaseerd is op machinelearning, leert het algoritme zichzelf om automatisch patronen en kenmerken te herkennen die door een mens geschreven teksten onderscheiden van AI-teksten. Verder kan zo'n algoritme zich door deze methode ook makkelijker aanpassen aan verschillende typen tekst. Daardoor beschouwen onderzoekers het als flexibeler.

Extra technieken

In de praktijk verfijnen ontwikkelaars deze methodes met aanvullende technieken. AI-detectiesoftware kan afzonderlijke zinnen lastig beoordelen op AI-gebruik. Daarom splitst Turnitin documenten op in overlappende stukken tekst om zinnen binnen de context te kunnen beoordelen. Copyleaks weegt mee hoe gelijkmatig lettergrepen zijn verdeeld in een tekst en hoe koppeltekens voorkomen in te tekst.

Volgens Van Vlasselaer heeft het detectieprogramma Pangram de uniekste methode. "Pangram heeft een dataset van 28 miljoen AI-gegenereerde en volledig menselijk geschreven teksten. Voor elke menselijke tekst schreven de ontwikkelaars een prompt. Daarmee maken ze van diezelfde menselijke tekst een AI-genereerde tekst."

Die prompt draagt het model op om een tekst te genereren die in onderwerp, toon, stijl en lengte exact hetzelfde is als het menselijk origineel.

Robot schrijft. Beeld: Getty Images (hoto by Uli Deck, picture alliance)
Beeld: Getty Images (Photo by Uli Deck, picture alliance)

Van Vlasselaer legt uit dat er dan twee datasets ontstaan: een met alleen menselijke tekst en een met AI-gegenereerde tekst. Daarboven draait een algoritme dat patronen herkent op een diepgaander niveau dan alleen de perplexiteit of burstiness. Deze methode heet mirrorprompting.

Mirrorprompting

De Belgische onderzoeker denkt dat mirrorprompting de reden is dat Pangram betrouwbaarder is dan andere detectiesoftware: "De andere oudere detectiesoftware richt zich eigenlijk alleen op de perplexiteit en burstiness. Pangram doet dat helemaal niet op die manier. Het programma heeft twee gespiegelde datasets om ook echt aan die patroonherkenning te kunnen doen."

De slechtere betrouwbaarheid van de andere methodes komt door de vooruitgang van AI-modellen zoals GPT-4o. Die kunnen steeds beter natuurlijke teksten schrijven. Daardoor kunnen modellen zoals GPTZero niet meer op alleen perplexiteit en burstiness leunen om onderscheid te maken.

Het betekent niet dat elke detectiesoftware maar één methode gebruikt. Zo gebruikt GPTZero zowel de taalkundige methode als de statistische methode en combineert Turnitin de learning-based methode met de statistische methode.

Valspositieve resultaten

Onderwijsinstellingen gebruiken de tools vaak om te controleren of studenten hun masterthesis bij elkaar hebben geprompt. De achterliggende technologie werpt echter de vraag op hoe betrouwbaar AI-detectiesoftware precies is: taalmodellen kunnen fouten maken en hallucineren.

ChatGPT: afbeelding gemaakt met prompt 'maak een andere afbeelding van hallucineren'
ChatGPT-afbeelding gemaakt met de prompt 'maak een andere afbeelding van hallucineren'

Hoewel detectiesoftware overeenkomsten vertoont met llm's, is er een belangrijk verschil: detectiesoftware genereert geen tekst. "Hallucinaties ontstaan wanneer een nieuwe tekst gegenereerd wordt. Pangram genereert geen tekst, maar kent alleen labels toe via patroonherkenning en machinelearning", legt Van Vlasselaer uit.

Dat zegt weinig over de foutmarges van detectiesoftware. Als een van de tools ten onrechte een tekst van een student bestempelt als door AI geschreven (een valspositief resultaat), kan dat grote gevolgen hebben. Onderwijsinstellingen sturen studenten regelmatig naar de examencommissie voor fraude nadat detectiesoftware AI-gebruik detecteert. Onderzoek wijst echter uit dat de kans op een valspositief resultaat erg klein is. "In ons eigen onderzoek vertoonde geen van de vier geteste AI-detectoren een false positive", vertelt Van Vlasselaer.

Moby Dick en van 100 naar 0 procent

Dat de tools in de studie geen valspositieve resultaten detecteren, wil niet zeggen dat er geen risico daarop bestaat. Zo sloeg de AI-tool Research Prospect rood uit toen Sam Illingworth het 19e-eeuwse boek Moby Dick door de tool haalde. AI zou 44 procent ervan hebben geschreven.

Eerder dit jaar won de Amerikaanse student Orion Newby een rechtszaak over AI-geschreven tekst. AI-tool Turnitin gaf aan dat AI zijn tekst voor 100 procent had gegenereerd. De universiteit beschuldigde hem van fraude, maar toen hij zijn tekst door andere AI-detectiesoftware haalde, kreeg de tekst een score van 0 procent AI.

De literaire klassieker Moby Dick. Beeld: Getty Images (Craig F. Walker, The Boston Globe)
De literaire klassieker Moby Dick. Beeld: Getty Images (Craig F. Walker, The Boston Globe)

Bij (deels) AI-genereerde teksten zijn de resultaten een stuk wisselvalliger. Copyleaks, Turnitin en GPTZero zagen grote passages met AI-tekst over het hoofd. Pangram komt met afstand als winnaar uit de test: de tool herkende 97 procent van volledig AI-gegenereerde teksten en haalde een nauwkeurigheid van 92,5 procent bij deels gegenereerde teksten en AI-teksten die een taalmodel op verzoek had geprobeerd menselijker te herschrijven.

Wel heeft een tool zoals Pangram verschillende beperkingen, waarschuwt Van Vlasselaer: "AI-detectietools zijn een stuk minder betrouwbaar onder de 100 woorden, omdat er in een korte tekst te weinig patronen te herkennen zijn. Die hoge betrouwbaarheid geldt pas vanaf 250 woorden."

Het onderzoek wijst ook uit dat de detectiesoftware het ook veel minder snel oppikt als iemand taalkundig goed onderlegd is en een AI-gegenereerde tekst grondig herschrijft op grammaticaal en semantisch niveau.

Kat-en-muisspel

De onderzoekers benadrukken dat bijvoorbeeld onderwijsinstellingen niet kunnen'We gaan eerst met de studenten in gesprek.' vertrouwen op een vaste tool. AI-modellen ontwikkelen zich snel. In de toekomst kan er dus zomaar een model op de markt komen met output die detectietools niet meer effectief kunnen onderscheiden van schrijfsels van een mens. Detectiesoftware loopt altijd achter, doordat ontwikkelaars het model opnieuw moeten trainen zodra er een nieuwe versie van een llm uitkomt.

Om die reden zegt Van Vlasselaer, die zelf in het hoger onderwijs werkt, dat de uitkomst van een AI-detectietool alleen als signaal moet worden gezien: "Wij gebruiken detectiesoftware zelf als beleidsinstrument in het onderwijs, maar wel met een aantal safeguards. We gaan eerst met de studenten in gesprek. Dan vertellen we dat we patronen hebben opgemerkt van AI-gegenereerde tekst. Heeft de student nog materiaal? Heeft de student nog versiegeschiedenis? Heeft de student nog stukjes van onvoltooide tekst? Op die manier kan het helpen als signaalfunctie."

student gebruikt Macbook Neo. Bron: Apple
Studenten moeten zorgvuldiger omgaan met AI. Beeld: Apple

Van Vlasselaer zegt dat studenten hun gedrag kunnen wijzigen doordat ze op de hoogte zijn van controle met deze tools. "Als studenten weten dat je mogelijk gepakt kunt worden omdat je iets hebt gedaan dat niet mag, denken we dat ze zorgvuldiger zullen omgaan met AI."

Redactie: Lumen Heijdendael • Eindredactie: Marger Verschuur

Reacties (16)

Sorteer op:

Weergave:

Ik vind het heel belangrijk datviemand die een diploma haalt ook echt zijn diploma verdient heeft. Anders hebben diploma's geen waarde. Dus ook niet voor mensen die het helemaal zelf gedaan hebben.


Tegelijkertijd is AI er en gaat niet weg. Als je een onderzoek hebt gedaan en je vraagt AI je te helpen schrijven, of je gebruikt AI zelf bij je onderzoek, prima toch. Jij bent verantwoordelijk voor de inhoud, dat die klopt, en bij de verdediging moet je laten zien dat je de inhoud snapt.

Natuurlijk anders bij een samenvatting van een boek of iets dergelijks. Maar dat is meer een middelbare school activiteit waar je uiteindelijk ook een hoop proefwerken moet doen zonder AI naast je.

Vraag me ook af, hoeveel % van je diploma gehaald kan worden met AI. Mijn gevoel zegt niet veel omdat het eindverslag slechts beperkt meetelt in je 4 of 5 jarige studie.
Ik ben dan wel geinteresseerd in de invloed van ondersteunende tools als Grammarly (spellingscontrole op steroids) dit soort scores beinvloeden. Want die is AI gebaseerd, maar stelt alleen verbteringen van stukjes tekst voor. Maar vele kleine stukjes maken een grote...
Volgens mij is de betere manier om de te beoordelen tekst, te vergelijken met eerder werk dat iemand heeft geschreven in het pre-LLM tijdperk. De frauderende groep 6 basisschoolleerling pak je daar niet mee, maar over het algemeen is er van iedere persoon die op het moment enigszins in de belangstelling staat, wel tekst beschikbaar van voor 2023.
Als ik AI gebruik om mijn tekst te verbeteren, dan komt AI met betere suggesties. Ik kan deze dus niet gebruiken, omdat het te goed geschreven is, en als AI wordt getagd. Ik vind het wel lastig om kwalitatief mindere zinnen te kiezen in een professionele tekst.
edit:
Pangram even getest: 100% of this text is Human Written.
Grappig, was allemaal AI. Voorlopig hoef ik me dus niet ongerust te malen. LOL

[Reactie gewijzigd door honey op 23 september 2026 18:27]

AI veroorzaakt veel ruis, hier in het detecteren van het niveau van een student, maar ik merk het ook op het werk. Er wordt zoveel geproduceerd, maar tot voor kort was er altijd een proces voor je iets begon te maken. Je moest collega's mee krijgen, budgetten krijgen. Nu begint iedereen direct alles te maken, zonder zich af te vragen of er al iets gelijkaardig bestaat, of hetgeen gemaakt wordt goed is (of alleen iets is dat de bedenker interesseert). Ik zie bij ons momenteel een wildgroei aan intern ontwikkelde tools. Goed management is belangrijker dan ooit om dat te beperken en in goede banen te leiden. Cultureel zijn we niet klaar voor AI.

Neemt niet weg dat AI onvermijdelijk is. Ik zou een student die geen AI gebruikt daarvoor minpunten geven. Het is een tool die je helpt om een goed product te maken. Het is als je thesis met de hand schrijven, alleen op basis van informatie uit de bibliotheek. Je toont daarmee dat je niet klaar bent voor de arbeidsmarkt. Er moet natuurlijk wel iets veranderen bij de evaluatie. Om te weten in welke mate een student het nodige niveau behaalt moet er nu gewoon beter tijdens de verdediging doorgevraagd worden. Eén optie is dat je op je thesis 1/4de van je punten krijgt en de rest op een examen over je thesis (dat kan schriftelijk en uitgebreid zijn, bvb door de prof gegenereerd op basis van AI).

[Reactie gewijzigd door NoTechSupport op 23 september 2026 18:23]

Laat je studenten de tussenstappen in hun scriptie opslaan en meesturen. Dan krijg je de opbouw te zien. De denk- en correctiestappen. Bespreek de tussenstappen met je student of deze nog op het juiste spoor zit.

Scheelt hoop gedoe.
Zo moeilijk is het toch niet voor het Nederlands. Als je een tekst hebt met goed lopende zinnen, correcte grammaticale constructies en geen spelfouten heb je een tekst van een AI te pakken. Als je daarentegen een Nederlandse tekst met veel (te veel) Engelse woorden ziet, kromme zinnen, verkeerd gebruikte uitdrukkingen, verkeerde vervoegingen en verbuigingen, en daarbij nog een heleboel spelfouten, heb je met een echte moedertaalspreker te maken.

Triest, maar wel de waarheid. Sla er de reacties onder het gemiddelde Tweakers-artikel maar op na.
Heb net een skill voor mijn AI agent in gebruik genomen: Humanizer, om AI tekst menselijker te laten lijken. :)
Geweldig! Je volgende werk mag je met een vulpen schrijven. Grafieken op ruitjespapier intekenen. Werkt zeer efficiënt kan ik je verzekeren.
Een student geneeskunde die met AI zijn scriptie schrijft en zo zijn diploma semi-fraduleus haalt, zal vroeg of laat toch zichzelf tegenkomen als hij geconfronteerd wordt met een acute en levensbedreigende operatie die hij moet uitvoeren en dan kan hij niet terugvallen op AI als hij de operatieverpleging het scalpelmes in zijn handen duwt om in te grijpen en moeilijk kan zeggen even online op te zoeken, hoe hij het ook moet doen en welke aders hij moet doorsnijden.....
Tja, ik studeer zelf geneeskunde en je slaat hier nogal wat stappen over. Iemand die z’n scriptie door AI laat maken moet nog steeds alle tentamens halen, coschappen doorlopen en voldoende scoren op de iVTG. (interuniversitaire voortgangstoets geneeskunde, waarbij je tijdens je opleiding steeds opnieuw op je volledige medische kennis wordt getoetst) Met een AI-scriptie ben je daar niet ineens vanaf.

Een scriptie/masteronderzoek gaat vooral om wetenschappelijk onderzoek, dus een onderzoeksvraag opstellen, data verzamelen, analyseren en interpreteren. Ook nuttig als arts, zeker. Maar dat is toch wat anders dan de kennis en vaardigheden die je dagelijks bij patiënten gebruikt. Iemand kan prima weten hoe je een patiënt onderzoekt en behandelt, en ondertussen de kantjes eraf lopen bij z’n onderzoek.

En je krijgt na het inleveren van je scriptie ook niet opeens een scalpel in je handen gedrukt met de opdracht om zelfstandig een spoedoperatie te doen. Daar zit nog een hele opleiding tussen.

Je scriptie volledig laten genereren en als eigen werk inleveren is gewoon bedrog. Daar hoeven we zeker niet moeilijk over te doen. Maar de sprong naar ‘dan staat die straks in de OK zonder te weten wat hij moet doorsnijden’ is wel erg groot. Alsof de rest van die opleiding niet bestaat.
Een scriptie schrijven is niet hetzelfde als onderzoek doen en experimenten uitvoeren. AI kun je mooi gebruiken om makkelijker wat puntjes te scoren op grammatica en spelling, gezien de nededlandse taal niet de hoogste prio is voor een geneeskundige (en eigenlijk in zo veel vakgebieden niet).

Tja, vroeger nam je info over via wikipedia en vermelde je de bronnen die wikipedia gebruikte. Later moest je de teksten van wikipedia aanpassen (in eigen woorden zetten) of as quote. Recent met AI teksten maken en nu met AI de AI gegenereerde teksten menselijker maken. Een kat en muis spel.
Is het nog steeds zo duidelijk als een AI agent de initiële tekst schrijft en een mens het in eigen woorden herverteld? Of althans zo zou ik het doen mocht ik dit 20 jaar geleden tijdens mijn studie hebben kunnen ge-/misbruiken.

Om te kunnen reageren moet je ingelogd zijn