AI-detector: een signaal, geen oordeel
AI-detectie is binnenkort beschikbaar — het staat op de planning, maar is nog niet live. Zodra het beschikbaar is, zullen alle AI-detectoren — ook de onze — soms verkeerd zitten. Noplag geeft een gekalibreerde waarschijnlijkheidsscore terug, geen ja/nee-oordeel, en publiceert het percentage fout-positieven voor niet-moedertaalsprekers Engels. We bouwen dekking voor ChatGPT, Claude, Gemini, GPT-5 en Llama. Lees wat de score daadwerkelijk betekent voordat u er op handelt — zeker bij besluiten over studenten of sollicitanten. Detectie is een van meerdere signalen. Het mag nooit het enige zijn.
Detectiesignaturen voor elke grote LLM.
Elk model laat een ander statistisch patroon achter. Wij volgen ze per release en publiceren kalibratie per model, zodat u weet waar de score op gebaseerd is voor de LLM die de tekst schreef.
ChatGPT
gpt-4o, o1, o3-families. We volgen outputverschuiving per release; kalibratie per model wordt binnen 30 dagen na elke release bijgewerkt. Rapport vermeldt de modelfamilie waarop het signaal het meest lijkt.
Claude
Sonnet-, Opus-, Haiku-niveaus voor 3.x en 4.x. Detectiesignaal verschilt per modus (denken vs. snel); kalibratie per modus vermeld in elk rapport.
Gemini
1.5 Pro, 2.0 Flash, 2.5 Pro. Multilingual signaal zwakker bij niet-Engelse teksten; rapport geeft dat aan als 'lage-bronzekerheid' in plaats van het te verbergen.
GPT-5
OpenAI’s release van augustus 2025. Gedragspatroon wijkt af van gpt-4o; wij trainen opnieuw met referentie-uitvoer van de modelkaart binnen 30 dagen.
Llama
3, 3.1, 3.3-familie. Zelfgehoste varianten zijn moeilijker — fijnslijpen verandert het patroon. Rapport geeft ‘waarschijnlijk LLM-gegenereerd, familie Llama’ aan, niet een specifieke versie.
Elke AI-detector vlagt niet-moedertaalsprekers vaker. Dit doen wij eraan.
Liang et al. (Stanford, 2023) vond 61% fout-positieven op TOEFL-essays — zes keer zo veel als bij moedertaalsprekers. Elke detector. Ook de onze, voordat we het gecorrigeerd hebben.
Het Stanford-artikel
Liang et al. (2023) testten alle commerciële AI-detectoren op TOEFL-essays van niet-moedertaalsprekers Engels. De benchmarkdetector vlagt 61% als AI-gegenereerd — zes keer zo hoog als bij moedertaalsprekers. Zelfde teksten, zelfde taak.
Wat wij gekalibreerd hebben
We hebben de classifier opnieuw getraind zonder ESL-gerelateerde stijlkenmerken — uniforme zinslengte, eenvoudigere woordkeus, minder idiomatiek tellen niet als AI-signaal. Alleen stijl-ongevoelige kenmerken. We voorspellen op structuur, niet op afwerking.
Restfoutpercentage
Na de aanpassing: een gedocumenteerd betrouwbaarheidsinterval per taal, in plaats van één enkel getal. Tabellen per taal worden gepubliceerd zodra de functionaliteit de evaluatie doorstaat — precies wat een institutionele audit vereist.
Wanneer negeren
Beoordeelt u een niet-moedertaalspreker en valt de score in de 20–80% band, zie het dan alleen als advies. We tonen ‘lage zekerheid — interpreteer met voorzichtigheid’ expliciet in het rapport zodat de gebruiker weet wanneer geen actie te ondernemen.
Wat we nog steeds missen
Hybride teksten — LLM-concept, native-editor-nagekeken — zijn lastiger dan pure gevallen. Rapport geeft ‘gemengd signaal, waarschijnlijk hybride’ aan, geen gok; een deel van de resterende fout zit hier.
Waar we meten
Openbare TOEFL-essaysets, Pan-Hispano academische inzendingen en CEFR-gegradeerd meertalig schrijfwerk. Dezelfde data als gebruikt door Liang et al., plus 8 nieuwere corpora verzameld in 2024-2026. Referenties worden samen met de methodologie gepubliceerd wanneer de functionaliteit beschikbaar komt.
Een waarschijnlijkheid, geen oordeel.
De score is een waarschijnlijkheid tussen 0% en 100%. Boven 80%: hoge zekerheid AI-gegenereerd. Onder 20%: hoge zekerheid menselijk. De 20–80% band is waar u het ziet als één van meerdere signalen, niet als bewijs. Gebruik detectie om een gesprek te starten, nooit om er een te sluiten.
Hoge zekerheid dat de tekst door een mens is geschreven. Het percentage fout-positieven voor deze categorie wordt per taal gepubliceerd zodra de functionaliteit de evaluatie doorstaat.
Het model is niet zeker. Behandel de score als één van meerdere inputs — recente schrijfvoorbeelden, eerdere versies, werk in de les. Neem in deze band geen actie op basis van alleen deze score.
Grote zekerheid dat de tekst door een groot taalmodel is geproduceerd. Nog steeds geen oordeel. Combineer met context (prompts, browsegeschiedenis, mondelinge toelichting) voor een beslissing.
- 5LLM-families die bij de lancering worden ondersteund
- 61%ESL-fout-positiefpercentage, Stanford '23
- 30dgeplande frequentie van hertraining na elke modelrelease
- v1.2beoogde releasedatum voor AI-detectie
- 2024detectie R&D start
Wij staan voor integriteit. Wij leveren geen tool om detectie te omzeilen.
Een humanizer is een tool om AI-detectie te ontwijken — het herschrijft LLM-output om de detectiescore te verlagen. We zouden er een kunnen bouwen. Maar we doen het niet. Het hele punt van dit product is AI-gebruik zichtbaar maken, niet verbergen. Als detectie nuttig moet zijn, mogen detectie en humanizers niet van dezelfde aanbieder komen. Wij kiezen een kant. Als we humanizers noemen bij dit product, is dat om u te informeren dat ze bestaan en mogelijk al op de tekst zijn toegepast — niet om er één te verkopen.
Lees het volledige standpuntVergelijking met GPTZero, Originality.ai en Winston.
Op onderwijs gericht, geen plagiaatmodule, ondoorzichtige kalibratie. Alleen AI-detectie; als u ook plagiaat in één rapport wilt, heeft u twee tools nodig.
Detectie + plagiaat + open-source engine. Kalibratiegegevens per model gepubliceerd. Zelfde rapport, zelfde leverancier, volledig controleerbaar.
‘97% nauwkeurigheid’ als marketing. Gepubliceerd fout-positiefpercentage niet bekendgemaakt. Alleen Engelse kalibratie. Gesloten source — u kunt de cijfers niet controleren.
Eerlijk over bias bij niet-moedertaalsprekers (we verwijzen expliciet naar Liang 2023). Kalibratie voor meerdere talen. Open-source engine; de methodologie wordt samen met de functionaliteit gepubliceerd.
Sterk in ChatGPT-detectie. Minder sterk bij Claude en Gemini. Duur bij groot volume; prijsbanden na 10k woorden/maand.
Dekt elke grote modelfamilie met gelijk kalibratieniveau. Vaste prijs tot Pro-niveau. Zelfhosting mogelijk voor organisaties met compliance-eisen.
Twaalf vragen, eerlijke antwoorden.
Als we het antwoord niet weten, zeggen we dat ook. We werken de lijst bij als de kalibratie wijzigt.
- Is AI-detectie accuraat?
- Eerlijk antwoord: geen enkele detector is betrouwbaar bij teksten onder de ~200 woorden, en elke detector heeft fout-positieve percentages die variëren per schrijfstijl, taal en gebruikte LLM. Noplag belooft de kalibratiegegevens te publiceren, zodat je weet wat 'nauwkeurig' betekent voor jouw specifieke toepassing; deze gegevens worden samen met de functionaliteit gepubliceerd.
- Vlagt Noplag mijn niet-moedertaal Engels als AI?
- Het kan — en we zijn daar transparant over. Liang et al. (Stanford 2023) toont dat elke commerciële AI-detector ESL-schrijfwerk overvlagt. Onze waarborgen begrenzen fout-positiefpercentages voor bekende ESL-patronen, en we publiceren het resterende percentage. Als het signaal onzeker is, staat dat expliciet in het rapport.
- Welke AI-modellen detecteert Noplag?
- Bij de start dekt AI-detectie ChatGPT (gpt-4o, o1, o3), Claude (Sonnet / Opus / Haiku, 3.x en 4.x), Gemini (1.5 / 2.0 / 2.5), GPT-5, en Llama 3.x. Detectie wordt binnenkort toegevoegd; kwaliteit verschilt per model, rapport vermeldt welk modelpatroon de score weergeeft.
- Hoe verschilt dit van GPTZero of Originality.ai?
- Wij combineren AI-detectie met plagiaatcontrole en leveren de engine als open source. GPTZero biedt alleen detectie. Originality.ai is gesloten bron met niet-gepubliceerde gegevens over ESL-bias. Zie /vs-gptzero en /vs-originality-ai voor gedetailleerde vergelijkingen.
- Kunnen studenten deze detector omzeilen met een humanizer?
- Ja — humanizers bestaan, en we zijn daar eerlijk over. Zwaar herschrijven na LLM-generatie verlaagt het detectiesignaal. We leveren geen humanizer (dat past niet bij ons doel). Zie AI-detectie altijd als één signaal, nooit als einduitslag.
- Wat betekent een ‘fout-positief' hier?
- Door mensen geschreven tekst die als AI-gegenereerd wordt beoordeeld. We meten en publiceren het percentage per taal en schrijfstijlcluster. Geen enkele detector heeft een fout-positief percentage van nul — een hoge score als bewijs zien in plaats van als signaal om verder te onderzoeken is precies het misbruik dat we met deze pagina willen voorkomen.
- Verkoopt u een ‘detectie met 99% nauwkeurigheid’ garantie?
- Nee. Iedereen die beweert een blijvende nauwkeurigheid van boven de ~85% te halen over verschillende schrijfstijlen, talen en LLMs, geeft een onjuist beeld van wat wiskundig mogelijk is. Wij publiceren het daadwerkelijke betrouwbaarheidsinterval per taal zodra de functionaliteit de evaluatie doorstaat. We verkopen geen zekerheid.
- Is AI-detectie gratis?
- AI-detectie komt binnenkort. Bij lancering gratis op de gratis tier — zelfde 2.500-woordlimiet als plagiaatcheck. Betaalde tier verhoogt de limiet; AI-detectie wordt nooit een aparte, betaalde optie.
- Hoe actueel is de modeldekking?
- We trainen de detectie opnieuw bij nieuwe LLM-releases, binnen 30 dagen. Staat een model nog niet in onze kalibratie, dan meldt het rapport ‘waarschijnlijk LLM-gegenereerd, onbekend model’ in plaats van een gok.
- Heeft u meertalige AI-detectie?
- Engels, Spaans, Frans, Duits en Portugees hebben gevalideerde kalibratie — Engels geeft sterkste signaal. Andere talen worden gemarkeerd als ‘lage-bron — interpreteer extra voorzichtig.’ Rapport vermeldt welk kalibratieniveau voor uw tekst geldt.
- Kan ik AI-detectie integreren via API?
- Binnenkort. AI-detectie staat op de planning; bij livegang zal de /v1/checks endpoint zowel plagiaat- als AI-detectiescores teruggeven. Zie /plagiarism-checker-api en /docs/api.
- Wat als ik het niet eens ben met een score?
- Laat het ons weten. We registreren correcties, trainen bij iedere modelrelease binnen 30 dagen opnieuw, en publiceren de gedragswijziging van het model tussen releases. Detectie is niet perfect; liever horen we dat het fout zit, dan dat we doen alsof dat niet gebeurt.
AI-detectie — binnenkort gratis tot 2.500 woorden.
Kalibratiegegevens, fout-positieve percentages en modelpatronen worden allemaal gepubliceerd. Zie wat achter de score zit voordat u actie onderneemt.
Stel mij op de hoogte zodra live