WISSENSCHAFT700 Mio.+ wiss. Arbeiten · Apache 2.0

Plagiatsprüfung für akademische Texte

Plagiatsprüfung speziell für wissenschaftliches Schreiben — Abgleich mit 700 Mio.+ Publikationen aus OpenAlex, CORE, arXiv, PubMed Central und Crossref. Zitationssensitive Kategorisierung. Apache 2.0-Engine, von jeder institutionellen IT prüfbar.

0 / 1,500 words
700 Mio.+ wiss. ArbeitenZitationssensitive EinordnungApache 2.0 · institutionell prüfbar
DAS WISSENSCHAFTSKORPUS

Fünf Quellen. 700 Mio.+ Werke. Alles Open-Access oder DOI-registriert.

Kein Zugriff auf kostenpflichtige Inhalte — wir prüfen nur mit Open-Access-Indizes. Mehr Abdeckung für aktuelle Open-Access-Forschung; weniger für ältere, hinter Paywalls liegende Zeitschriftenjahrgänge.

01 · INDEXmonatlich

OpenAlex

250 Mio.+ Arbeiten

Offener wissenschaftlicher Index — ersetzt früher die Microsoft Academic Graph. Bezieht Zeitschriftenbeiträge, Konferenzpapiere, Datensätze, Bücher aus allen Fachrichtungen ein.

02 · OPEN ACCESSwöchentlich

CORE

290 Mio.+ Arbeiten

Größtes Open-Access-Repository für wissenschaftliche Arbeiten. Volltextindex aus über 11.000 Repositorien. Starke Abdeckung europäischer + britischer Publikationen.

03 · PREPRINTtäglich

arXiv

2,4 Mio.+ Preprints

Physik, Mathematik, Informatik, quantitative Biologie, Statistik, VWL. Prüft gegen die Version, die Ihre Gutachterin auf arXiv gesehen hat.

04 · BIOMEDwöchentlich

PubMed Central

10 Mio.+ Arbeiten

Offenes Archiv für Biomedizin und Lebenswissenschaften. Volltext + Metadaten. NIH-Publikationen und Spiegelungen von Fachzeitschriften.

Crossref · 150 Mio.+ DOI-registrierte Arbeiten · für kanonisches Matching + Zitierpfade genutzt
WISSENSCHAFTLICHE WORKFLOWS

Drei Workflows. Ein Produkt.

Ob Zeitschrifteneinreichung, Verteidigung eines Dissertationskapitels oder Feinschliff am Drittmittelantrag — der Checker passt zum Prozess und nicht umgekehrt.

01

01 · Zeitschriftenvorprüfung

Abgleich des Manuskripts im Open-Access-Universum vor der eigentlichen Einreichung. iThenticate / Crossref Similarity Check läuft danach beim Verlag ohnehin — Sie möchten wissen, was der Editor sieht, bevor er es sieht. Flatrate Pro ermöglicht Iterationen über Entwürfe, ohne Pro-Dokument-Kosten.

02

02 · Dissertation / Kapitelprüfung

Kapitelweise prüfen oder komplette Dissertation einfügen. Selbstzitate über eigene Kapitel werden erkannt, aber gesondert eingestuft (üblicher Vorgang in Dissertationen). Literaturverzeichnis vom Score automatisiert ausgeschlossen. Versionsvergleich zwischen Januar- und Mai-Entwurf zeigt, was sich geändert hat.

03

03 · Drittmittelantrag / Literaturüberblick

Standardpassagen aus früheren Anträgen sollen nicht als Plagiat gewertet werden. Ein sauber zitiertes Literaturreview auch nicht. Das Klassifikationsmodell unterscheidet korrekt zwischen legitimer Wiederverwendung (eigene Arbeiten, referenziert) und unbeabsichtigtem Kopieren. Der Score spiegelt wider, wo wirklich ein Problem liegt.

ZITATIONS-SENSITIVE KLASSIFIKATION

Sechs Kategorien. Jede Übereinstimmung fällt in eine.

Ein 28%-Score bei einem stark zitierten Review liest sich anders als 28% bei paraphrasierten Abschnitten ohne Quellen. Die Klassifikation macht den Unterschied.

01 · Direktzitat (zitiert)

Anführungszeichen + Quellenangabe oder Fußnote. Erkannt wie erwartet, nicht in die Ähnlichkeitswertung eingerechnet. Mehrere Zitierstile werden automatisch erkannt (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Blockzitat

Eingerückte Passage (40+ Wörter) mit nachgestellter Zitation. Erkannt wie erwartet. Muster 1,3 cm Einzug + Zitation wird erkannt; fehlender Einzug löst Formatierungswarnung aus.

03 · Paraphrase (zitiert)

Satzstruktur-Übereinstimmung mit Quellenangabe irgendwo im Absatzumfeld. Wird mit reduziertem Gewicht gezählt. „Smith (2023) argumentiert...“ wird als legitime Quellenangabe eingestuft.

04 · Allgemeinwissen

Phrasen, die in 2.000+ unabhängigen Quellen erscheinen („Wasser kocht bei 100°C“, technische Definitionen, bekannte Formeln). Nicht vergleichswirksam. Schwelle kann je Fachgebiet angepasst werden.

05 · Literaturverzeichnis

Referenzliste wird anhand von Überschrift und Layout erkannt. Komplett von der Ähnlichkeitswertung ausgeschlossen. Originalität ist hier nicht erforderlich — Markierung hätte keinen Wert.

06 · Unattributierte Paraphrase

Satzstruktur-Übereinstimmung ohne Zitat im Kontext, keine Anführungszeichen, kein Blockzitat. DIE relevante Kategorie für den Score. Wird voll gewertet, andere Treffer nicht.

DER WISSENSCHAFTLICHE REPORT

Klassifikation pro Abschnitt. Quelle als URL. Ende-zu-Ende prüfbar.

Jeder erkannte Abschnitt enthält DOI / URL der Quelle, Kategorie, Zeitstempel des Korpus-Snapshots und den Engine-Commit. Nachvollziehbar im Peer-Review, bei Integritätsprüfungen oder IT-Audits.

REPORT · 4.217 Wörter · 47 Abschnitte klassifiziertDer moderne Roman: Eine Neubewertung · Kapitel 3
Headline · 8,2%Engine · v0.4.2
#TREFFERABSCHNITT · QUELLEKLASSIFIKATION
12

Moderne ist weniger eine kohärente Bewegung als eine Konstellation von Ablehnungen — von Realismus, Fortschritt, der einheitlichen Persönlichkeit... (Eysteinsson, 1990, S.117).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
ZITAT · ZITIERT
18

Eliots Betonung der Unpersönlichkeit rahmt die Lyrik als konstruiertes Artefakt, nicht als Bekenntnis.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARAPH. · ZITIERT
23

Der Roman entstand aus einer grundsätzlich bürgerlichen Weltsicht des 18. Jahrhunderts.

openalex.org/W12345678 · Watt (1957) — Treffer ohne Quelle
UNZUGESCHR.
31

Joyces Bewusstseinsstrom verdankt viel James' Psychologie der inneren Dauer.

James, W. (1890). The Principles of Psychology, ch.IX (in der Literaturliste erwähnt)
PARAPH. · ZITIERT
34

Eigene zuvor veröffentlichte Dissertation, Kapitel 1.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · Selbstzitat, in diesem Absatz nicht explizit angegeben
SELF-CITE
41

Alle Referenzen — Eysteinsson, Eliot, Joyce, James, Watt und 32 andere.

Literaturverzeichnis, S. 38–41
REFS · AUSGESCHLOSSEN
Headline 8,2 % = Gewicht für unattributierte Paraphrase + Selbstzitate; zitierte Treffer + Literatur ausgeschlossen.
  • 700 Mio.+wissenschaftliche Arbeiten indexiert
  • 6Zitierstile automatisch erkannt
  • 5Sprachen zum Start kalibriert
  • 3%ESL-Bias-Restfehler (dokumentiert)
  • Apache2.0 · IRB-geprüft
FÜR PEER-REVIEW ABSICHERBAR

Drei Dinge, die ein Blackbox-Checker in der Fakultätsanhörung nicht übersteht.

01 · REPRODUZIERBARER SCORE

Gleiche Arbeit gegen gleichen Commit erneut ausführen

Jeder Report führt X-Engine-Commit und Korpus-Zeitstempel. Auch Monate später lässt sich das Manuskript mit exakt demselben Engine-Stand wieder prüfen — gleicher Input, gleicher Algorithmus, gleiches Ergebnis. Bei Closed-Source-Checkern kann ein Training im Hintergrund den Score unerklärlich verändern.

Reproduzierbarkeit ist unser Mindestanspruch an wissenschaftliche Integrität.
02 · ALGORITHMUS PRÜFBAR

Apache 2.0-Quellcode auf GitHub — mitbringen zur Sitzung

Wenn die KI-Erkennung (coming soon, v1.2-Releaseplan) eingeführt wird und eine Beanstandung ansteht, können Sie den Engine-Commit, den exakten Quellcode zum Entscheidungswert und jede Sprachkalibrierung für Nicht-Muttersprachler zeigen. Kein Screenshot einer Support-Mail.

github.com/NoplagLabs/noplag-engine — öffentlich, von Google Scholar indexiert.
03 · ESL-BEWUSSTE ERKENNUNG

Von Liang et al. 2023 dokumentiert; Gegenmaßnahmen sind auf der Roadmap vorgesehen

Stanford 2023 wies bei TOEFL-Aufsätzen eine Falsch-Positiv-Rate von 61,3 % bei einfachen Detektoren nach. Wenn die KI-Erkennung von Noplag eingeführt wird (bald verfügbar, v1.2-Roadmap), enthält das Ergebnisband eine ESL-Anpassung, wenn das lexikalische Profil auf nicht-muttersprachliches Englisch hinweist. Verbleibende Fehler werden dokumentiert, nicht als null ausgegeben. Überschreibungen werden mit Engine-Commit und Begründung protokolliert.

/docs/developers/benchmarks — PAN-PC-11-Methodik und Ergebnisse.
EINFACHER FÜR DEN EINKAUF

Eine Apache 2.0-Engine, die Ihre IT vor Vertragsabschluss tatsächlich prüfen kann.

Bei institutionellen Ausschreibungen zu Plagiatssoftware kommen immer dieselben Fragen: Wo wird das Dokument gespeichert, wie funktioniert der Matching-Algorithmus, wer hat Zugriff, wie läuft die Löschung, wie stimmt die Genauigkeit mit dem Verkaufsversprechen überein. Bei Closed-Source bleibt das Verkaufsfrage per Call. Bei Apache 2.0 klonen Sie das Projekt, prüfen die Engine selbst, kontrollieren Datenflüsse, Testdatenlöschung und verifizieren die F1-Werte am eigenen Set. Wir argumentieren nicht für weniger Kontrolle — sondern dafür, dass Kontrolle überhaupt möglich ist. Deshalb kommen jetzt auch Universitäten an Bord, die sonst keine neuen Plagiatsdienste angenommen haben.

Zum Einkaufsleitfaden
FAQ

Die Fragen, die Wissenschaftler wirklich stellen.

Ersetzt dies iThenticate für die Zeitschriftenvorprüfung?

In den meisten Fällen nein — wenn Ihre Zielzeitschrift iThenticate verlangt (Elsevier, Springer, Wiley, IEEE), läuft dort sowieso eine Prüfung beim Einreichen. Was Noplag ersetzt, ist die eigene Überprüfung über mehrere Entwürfe vorab. iThenticate kostet $125 je Dokument, also kritisch ab dem 4. Entwurf; Flatrate Pro nicht. Der volle iThenticate-Vergleich: noplag.com/vs-ithenticate.

Und ProQuest-Dissertationen? Haben Sie die nicht?

Richtig — das ist ein echter Gap. ProQuests Dissertationsdatenbank ist proprietär, kostenpflichtig und nicht in OpenAlex/CORE. Wir decken die Open-Access-Basis (~700 Mio. Texte) ab, was nach 2018 breiter ist als ProQuest; für ältere, geschützte Dissertationen aber nicht. Wenn der Abgleich mit US-PhD-Dissertationen Ihr Hauptbedarf ist, ist iThenticate das passende Tool.

Wie geht die Engine mit exotischen Zitierstilen um?

MLA, APA, Chicago / Turabian, Harvard, Vancouver und IEEE erkennt die Engine automatisch am Literaturverzeichnis. Bei weniger verbreiteten Stilen (ACS, AMA, ASA, Bluebook, Oxford) werden Intervalle über Anführungszeichen + parenthetische Quellen erkannt; Stilspezifische In-Text-Prüfung ist auf v1.2-Roadmap. Beim Self-Hosting kann man im Alignment-Modul ergänzen.

Wie hoch ist die Falsch-Positiv-Rate bei stark zitierten Reviews?

Niedriger, als Reviewer von nicht zitierten Abschnitten erwarten, weil richtig zitierte Stellen beim Score ausgeschlossen sind. Wir messen ~3,4 % Falsch-Positivrate auf dem PAN-PC-11-Ausschnitt (dort ist viel legitimes Zitieren enthalten). Andere Wettbewerber ohne Klassifikation liegen bei 12–18 %.

Kann ich meine eigenen vorherigen Publikationen ausschließen?

Im Pro-Tarif: Erstellen Sie eine Selbstzitat-Whitelist (ORCID, eigene DOIs, Repository-URL). Matches werden als SELF-CITE markiert und zählen nicht zum Score. Praktisch für Forscher, die eigene Arbeiten re-use-n; Zitieren eigener Forschung gilt nicht als Plagiat.

Wie sieht die Mehrsprachigkeit konkret aus?

Die Erkennung ist zum Start für Englisch, Spanisch, Portugiesisch, Polnisch und Ukrainisch kalibriert. Weitere Sprachen folgen. Die Erkennungsqualität wird anhand von PAN-PC-11 gemessen; sprachspezifische Auswertungen sind geplant. Am stärksten ist die Engine bei europäischen Sprachen mit langer Validierungshistorie; neuere Sprachen werden nachgereicht, sobald ihre Kalibrierung abgeschlossen ist.

Was bedeutet „Apache 2.0“ für den institutionellen Einkauf?

Ihre IT / Ihr DSB / Ihre Ethikkommission kann github.com/NoplagLabs/noplag-engine klonen, die Engine in einer Sandbox ausführen, den Datenfluss prüfen, die vollständige Umsetzung des Rechts auf Löschung testen und unsere veröffentlichten Benchmark-Ergebnisse mit einem eigenen Testkorpus nachvollziehen. Ohne Vertragsunterzeichnung, ohne NDA, ohne Vertrauen in unser Marketing. Für Institutionen mit entsprechendem Beschaffungsprozess ist das der entscheidende Schritt.

Erkennt die KI auch Claude-3 + Gemini-Texte, oder nur GPT?

KI-Erkennung folgt in Kürze — auf der v1.2-Roadmap, nicht zum Start verfügbar. Die Methode ist Binoculars (Hans et al. 2024), modellunabhängig: kein Training pro LLM, sondern Vergleich der Perplexität eines kleinen Referenzmodells mit dem Testtext, was generalisiert. Genauigkeitswerte werden erst nach Abschluss der Evaluierung veröffentlicht, nicht vorab, auf gemischten LLM-Inhalten (zum Vergleich: ~70 % bei Claude-3 für GPT-basierte Detektoren). Die Methodik-Publikation dokumentiert die Fehlerquellen; wir verschweigen sie nicht.

Und wenn mein Betreuer einen Treffer anzweifelt?

Jeder Treffer enthält Quelle (DOI), Korpus-Zeitstempel, Engine-Commit und Klassifikationsgrund. Der Check ist mit exakt dieser Engine wiederholbar. Drucken Sie den Report aus, alle Pfade sind klickbar nachvollziehbar. Es gibt keinen „Score-Vertrauen“-Modus, wie ihn Blackbox-Checker bieten.

Wie ist das mit Self-Hosting bei Medizin/HIPAA?

Apache 2.0 + Docker — läuft komplett im eigenen Netz. Kombinierbar mit PostgreSQL + Redis im eigenen Rechenzentrum; keine Daten verlässt die eigene VPC. Sinnvoll für klinische Texte, Falldokumentationen oder Forschung vor Veröffentlichung, die nicht in eine Cloud darf. Für Großkunden als indizierbares Korpus-Bundle verfügbar.

Kapitel against 700 Mio+ wissenschaftliche Werke prüfen.

Fügen Sie ein Dissertationskapitel, einen Drittmittelantrag oder einen Manuskript-Entwurf ein. Der Bericht zeigt, was erwartet, was zitationspflichtig und was Ihr Eigenes ist. Bis 2.500 Wörter kostenfrei. Apache 2.0, falls Ihr IRB vorher den Algorithmus prüft.

Plagiatsprüfung für akademische Texte – zitatsensitiv