P0Kommt bald — ChatGPT, Claude, Gemini, GPT-5, Llama
Kommt bald

KI-Detektor – ein Signal, kein Urteil

KI-Erkennung folgt bald – steht auf unserer Roadmap, ist noch nicht live. Wenn sie verfügbar ist, wird jeder KI-Detektor – auch unserer – gelegentlich falsch liegen. Noplag liefert einen kalibrierten Wahrscheinlichkeitswert, kein Ja/Nein-Urteil. Die Falsch-Positiv-Rate bei nicht-muttersprachlichen Englischschreibenden wird veröffentlicht. Abdeckung für ChatGPT, Claude, Gemini, GPT-5 und Llama ist vorgesehen. Lesen Sie, was der Score tatsächlich bedeutet, bevor Sie danach handeln – besonders bei Entscheidungen zu Studierenden oder Bewerbenden. Erkennung ist ein Signal von mehreren. Es sollte nie das einzige bleiben.

0 / 1,500 words
Kalibrierdaten veröffentlichtESL-Bias-SchutzFünf Modellfamilien
ERKENNUNG PRO MODELL

Erkennungssignaturen für alle wichtigen LLMs.

Jedes Modell hinterlässt eigene statistische Spuren. Wir verfolgen sie je Release und veröffentlichen eine modellbasierte Kalibrierung, damit Sie wissen, was der Score pro LLM aussagt.

OpenAI

ChatGPT

gpt-4o-, o1-, o3-Familien. Wir verfolgen Output-Drift je Release; Kalibrierung pro Modell jeweils innerhalb von 30 Tagen erneuert. Im Bericht steht, zu welcher Modellfamilie das Signal am ehesten passt.

Anthropic

Claude

Sonnet-, Opus-, Haiku-Tiers für 3.x und 4.x. Das Erkennungssignal unterscheidet sich je Modus (detailliert vs. schnell); die jeweilige Kalibrierung ist im Bericht vermerkt.

Google

Gemini

1.5 Pro, 2.0 Flash, 2.5 Pro. Mehrsprachige Signale sind für nicht-englische Texte schwächer; im Bericht wird das als "low-resource confidence" benannt statt verschwiegen.

OpenAI

GPT-5

OpenAIs Release von August 2025. Die Signatur unterscheidet sich von gpt-4o; Kalibrierung erfolgt mit den Referenzausgaben der Model Card innerhalb von 30 Tagen nach Release.

Meta (open-weight)

Llama

Familie 3, 3.1, 3.3. Selbst gehostete Varianten sind schwieriger — Finetuning verändert die Signatur. Im Bericht heißt es 'vermutlich LLM-generiert, Familie Llama' statt einer konkreten Version.

ESL-SCHREIBENDEN-BIAS

Jeder KI-Detektor kennzeichnet zu viele Nicht-Muttersprachler. Unsere Gegenmaßnahmen.

Liang et al. (Stanford, 2023) stellten fest: 61% Falsch-Positive bei TOEFL-Essays – sechsmal so viel wie bei Muttersprachlern. Jeder Detektor. Auch unser, bevor wir angepasst haben.

Das Stanford-Paper

Liang et al. (2023) haben kommerzielle KI-Detektoren mit TOEFL-Essays von Nicht-Muttersprachlern geprüft. 61% als KI erkannt – sechsfache Rate im Vergleich zu Muttersprachlern. Gleiche Texte, gleiche Aufgabe.

Was wir neu kalibriert haben

Wir haben unser Modell ohne typische ESL-Stilmerkmale trainiert – gleichbleibende Satzlänge, einfacherer Wortschatz, weniger Idiome werden nicht als KI-Signal gewichtet. Nur stilunabhängige Merkmale. Wir leiten aus Struktur, nicht Oberflächenglätte ab.

Restfehlerquote

Nach der Korrektur: eine dokumentierte, sprachspezifische Konfidenzintervall statt einer einzelnen Kennzahl. Sprachspezifische Tabellen werden veröffentlicht, sobald die Funktion die Evaluierung besteht – genau das, was eine institutionelle Prüfung verlangen würde.

Wann überschreiben

Wenn Sie einen ESL-Text auf 20–80% Score prüfen, gilt: Nur als Hinweis behandeln. Im Bericht steht explizit 'geringe Sicherheit – mit Vorsicht interpretieren', sodass klar ist, wann Zurückhaltung geboten ist.

Was wir noch nicht erfassen

Hybrid-Texte – per LLM erstellt, dann von Muttersprachlern überarbeitet – sind schwieriger als reine Texte. Im Bericht steht dann 'gemischtes Signal, vermutlich Hybridfall', statt zu raten. Ein Teil der Restfehler liegt hier.

Wie wir messen

Öffentliche TOEFL-Aufsatzsammlungen, pan-hispanische akademische Einreichungen und CEFR-bewertete mehrsprachige Texte. Gleiche Datenbasis wie bei Liang et al., ergänzt um 8 neuere Korpora aus den Jahren 2024–2026. Quellenangaben werden mit der Methodik veröffentlicht, sobald die Funktion bereitgestellt wird.

WAS DER SCORE BEDEUTET

Eine Wahrscheinlichkeit, kein Urteil.

Der Score ist eine Wahrscheinlichkeit zwischen 0% und 100%. Über 80%: hohe Wahrscheinlichkeit für KI. Unter 20%: hohe Wahrscheinlichkeit für menschliche Autorenschaft. 20–80% ist der Bereich, in dem Sie den Score als einen von mehreren Faktoren nutzen – kein Beweis. Beginnen Sie das Gespräch, nicht beenden.

0–20%
WAHRSCHEINLICH MENSCHLICH

Hohe Wahrscheinlichkeit, dass der Text von einer Person verfasst wurde. Die Falsch-Positiv-Rate für diesen Bereich wird pro Sprache veröffentlicht, sobald die Funktion die Evaluierung besteht.

20–80%
UNKLAR — NACHPRÜFEN

Das Modell ist nicht sicher. Score nur als einen Datenpunkt neben anderen nutzen – aktuelle Schreibproben, frühere Entwürfe, Klassenarbeiten. Kein Handeln nur auf Basis dieses Bereichs.

80–100%
WAHRSCHEINLICH LLM-GENERIERT

Hohe Wahrscheinlichkeit für einen LLM-Text. Immer noch kein Urteil. Kontext einbeziehen (Prompts, Browserverlauf, mündliche Verteidigung) vor einer Entscheidung.

Jeder Bereich wird mit einer veröffentlichten Fehlermarge pro Sprache ausgeliefert, sobald die Funktion die Evaluierung besteht.
  • 5LLM-Familien, die zum Start abgedeckt werden
  • 61%ESL-Falsch-Positiv-Quote, Stanford '23
  • 30dgeplante Trainingsfrequenz nach jeder Modellveröffentlichung
  • v1.2geplanter Veröffentlichungstermin für AI-Content-Detection
  • 2024Forschung zu Erkennung startet
WARUM KEIN HUMANIZER

Wir sind auf Integritätsseite. Kein Tool zum Umgehen der Erkennung.

Ein Humanizer dient dazu, KI-Erkennung zu umgehen – er schreibt LLM-Output um und senkt den Score. Wir könnten einen bauen. Tun wir aber nicht. Kern dieses Produkts ist es, KI-Nutzung sichtbar zu machen, nicht sie zu verbergen. Wenn Erkennung helfen soll, darf der gleiche Anbieter keine Humanizer anbieten. Wir haben uns klar entschieden. Wenn wir im Produkt Humanizer nennen, dann zur Aufklärung: Sie existieren und könnten beim Text upstream genutzt worden sein – aber wir verkaufen keinen.

Ganze Position lesen
IM VERGLEICH ZU STANDALONE-KI-DETKTOREN

Wie wir im Vergleich zu GPTZero, Originality.ai, Winston stehen.

GPTZERO

Fokus auf Bildung, keine Plagiatsprüfung, intransparente Kalibrierung. Nur KI-Erkennung; wer Plagiatsprüfung im selben Bericht braucht, braucht zwei Tools.

Erkennung + Plagiat + Open-Source-Engine. Kalibrierdaten pro Modell veröffentlicht. Gleicher Bericht, gleicher Anbieter, vollständig prüfbar.

ORIGINALITY.AI

'97% Genauigkeit'-Marketing. Falsch-Positiv-Rate unbekannt. Nur Englisch-Kalibrierung. Geschlossene Quelle – Score nicht nachprüfbar.

Offenheit bezüglich ESL-Bias (Liang 2023 wird namentlich zitiert). Mehrsprachige Kalibrierung. Open-Source-Engine; die Methodik wird mit der Funktion veröffentlicht.

WINSTON

Stark bei ChatGPT-Erkennung. Schwächer für Claude und Gemini. Teurer bei höherem Volumen; Preisstufen ab 10k Wörter/Monat.

Deckt jede große Modellfamilie mit gleich starker Kalibrierung ab. Flatrate-Tarife bis Pro-Stufe. Self-Hosting für Compliance-Anforderungen.

HÄUFIG GEFRAGT

Zwölf Fragen, ehrliche Antworten.

Wenn wir keine Antwort kennen, steht das da. Wir aktualisieren diese Liste bei neuer Kalibrierung.

Ist KI-Erkennung zuverlässig?
Ehrliche Antwort: Kein Detector ist bei Texten unter ca. 200 Wörtern zuverlässig, und jeder Detector hat Falsch-Positiv-Raten, die je nach Schreibstil, Sprache und verwendetem LLM variieren. Noplag verpflichtet sich, seine Kalibrierdaten zu veröffentlichen, damit Sie wissen, was „genau“ für Ihren Anwendungsfall bedeutet; die Daten werden zusammen mit der Funktion bereitgestellt.
Wird Noplag meinen nicht-muttersprachlichen Englischtext als KI erkennen?
Es kann passieren – wir sind offen damit. Liang et al. (Stanford 2023) zeigte: Jeder KI-Detektor kennzeichnet überproportional viele ESL-Texte. Unsere Schutzmaßnahmen begrenzen die Falsch-Positiv-Raten für bekannte ESL-Muster und wir veröffentlichen die Restfehlerquote. Wenn das Signal unsicher ist, steht das im Bericht.
Welche KI-Modelle erkennt Noplag?
Zum Start umfasst KI-Erkennung ChatGPT (gpt-4o, o1, o3), Claude (Sonnet / Opus / Haiku, 3.x und 4.x), Gemini (1.5 / 2.0 / 2.5), GPT-5 und Llama 3.x. Die Funktion folgt bald; die Erkennungsqualität variiert je Modell. Im Bericht steht, auf welches Modell sich der Score bezieht.
Was unterscheidet das von GPTZero oder Originality.ai?
Wir kombinieren KI-Erkennung mit Plagiatsprüfung und stellen die Engine als Open Source bereit. GPTZero bietet nur Erkennung. Originality.ai ist Closed Source und veröffentlicht keine Daten zum ESL-Bias. Zeilenweise Vergleiche unter /vs-gptzero und /vs-originality-ai.
Können Studierende mit Humanizern dieses Tool umgehen?
Ja – Humanizer gibt es, und das muss klar gesagt werden. Starkes Umschreiben nach dem LLM-Entwurf senkt das Erkennungssignal. Wir liefern keinen Humanizer (es widerspricht unserem Ziel). KI-Erkennung ist einer von mehreren Faktoren, nie ein abschließendes Urteil.
Was bedeutet hier ‚False Positive‘?
Von Menschen geschriebener Text wird als KI-generiert bewertet. Wir messen und veröffentlichen die Rate pro Sprache und Schreibstil-Cluster. Bei keinem Detector liegt sie bei null – eine hohe Bewertung als Beweis statt als Hinweis zu behandeln, der überprüft werden sollte, ist das Fehlverhalten, das wir mit dieser Seite adressieren.
Verkaufen Sie ‚99% Genauigkeit‘-Versprechen?
Nein. Wer eine anhaltende Genauigkeit von über ca. 85 % über Schreibstile, Sprachen und LLMs hinweg behauptet, stellt die mathematischen Möglichkeiten falsch dar. Wir veröffentlichen das tatsächliche Konfidenzintervall pro Sprache, sobald die Funktion die Evaluierung besteht. Wir verkaufen keine Gewissheit.
Ist KI-Erkennung kostenlos?
KI-Erkennung wird bald angeboten. Zum Start im freien Tarif kostenlos – wie Plagiatserkennung mit Limit bei 2.500 Wörtern. Bezahlte Tarife erhöhen das Limit; KI-Erkennung wird nicht als separater Aufpreis verkauft.
Wie aktuell ist die Modellabdeckung?
Wir kalibrieren die Erkennung für neue LLMs binnen 30 Tagen. Fehlt ein Modell noch, steht im Bericht: 'vermutlich LLM-generiert, Modell unbekannt', statt eine Familie zu raten.
Haben Sie mehrsprachige KI-Erkennung?
Englisch, Spanisch, Französisch, Deutsch, Portugiesisch sind validiert – Englisch am stärksten. Andere Sprachen werden mit 'low-resource — mit besonderer Vorsicht interpretieren' markiert. Im Bericht steht, welche Kalibrierungsstufe gilt.
Kann ich KI-Erkennung per API einbinden?
Bald. Die Funktion ist geplant; bei Start gibt /v1/checks sowohl Plagiats- als auch KI-Scores zurück. Siehe /plagiarism-checker-api und /docs/api.
Was, wenn ich mit einem Score nicht einverstanden bin?
Sagen Sie uns Bescheid. Wir protokollieren Korrekturen, trainieren nach jedem Modell-Update binnen 30 Tagen und veröffentlichen beobachtete Modelländerungen. Perfekt ist das System nicht; wir hören lieber von Fehlern als so zu tun, als gäbe es keine.

KI-Erkennung bald verfügbar, gratis bis 2.500 Wörter.

Kalibrierdaten, Falsch-Positiv-Raten und Modell-Signaturen werden veröffentlicht. Sehen Sie hinter den Score, bevor Sie danach handeln.

Benachrichtigen, wenn online
KI-Detektor für ChatGPT, Claude, Gemini, GPT-5