RESEARCHPre-Submission · Self-Citation-Erkennung · EU-Standort · IRB-prüfbar

Plagiatsprüfung für Forschende vor Einreichung

Pre-Submission-Check von Manuskripten gegen 700M+ wissenschaftliche Arbeiten. "Meine Ordner" verfolgt Ihre eigenen Publikationen, damit legitime Selbstzitate den Score nicht erhöhen. EU-Standort für sensible Pre-Publication-Forschung. Apache 2.0-Engine — IRB-prüfbar.

700M+ wissenschaftliche ArbeitenSelf-Citation-WhitelistEU-Standort · IRB-prüfbar
WO IM PROZESS SIE AUCH SIND

Vier Forschungsrollen. Ein Self-Check-Workflow.

PHD / DOKTORARBEIT

Pre-Submission von Dissertationskapiteln

Iteration über Kapitel hinweg. Selbstzitate in Entwürfen verfolgen.

  • Kapitelweiser Check + Versionshistorie
  • Self-Citation-Whitelist (Ihr ORCID + DOI-Liste)
  • Bibliographie automatisch ausgeschlossen
POST-DOC

Manuskript vor Zeitschrifteneinreichung

iThenticate prüft beim Einreichen; wir vorher.

  • 700M+ Open-Access-Schriften
  • Zitationsklassifizierung (zitiert vs unzitiertes Paraphrasieren)
  • Pauschalpreis Pro · ohne Einzelabrechnung iterieren
FÖRDERANTRAG

Literaturübersicht + Proposal-Prüfung

Übernahme von eigenen früheren Antragstexten ist üblich — markieren.

  • Eigene frühere Publikationen + Anträge erkennen
  • Co-Autor-Whitelist (Vorarbeiten der Mitwirkenden)
  • Klassifizierungsbericht als PDF für Kollaborierende exportieren
LABOR-PI

Laborweite Pre-Publication QA

Probleme bei allen Laboreinreichungen zentral erfassen.

  • Ordner je Projekt + pro Postdoc
  • EU-Standort für klinische / sensitive Primärdaten
  • Apache 2.0-Engine — IRB-prüfbar
PRE-SUBMISSION-WORKFLOW

Drei Schritte vor der Einreichung beim Journal.

Iterativ ausführen. Selbstzitate erkennen, damit sie bei der Einreichung Ihren iThenticate / Crossref-Score nicht erhöhen. KI-Detektion kommt bald – Vorschau möglich, bevor Reviewer 2 es anspricht.

01

01 · Entwurf + Whitelist

Kapitel- oder Manuskriptenwurf hochladen. Ihr ORCID + eine Liste Ihrer DOIs (Whitelist) angeben — eigene Publikationen werden als SELF-CITE markiert, nicht als Plagiat. Co-Autor-DOIs inkludieren bei Kollaborationen; die Engine erkennt legitimes 'Scholarly Recycling'.

02

02 · Die Kaskade starten

L1 Winnowing → aktuell Live-Web, L2 MinHash (v1.1) und L3 Vektor-Embeddings (v1.2) folgen. Erkennt wörtliche und nahezu wörtliche Übernahmen; Paraphrasenerkennung kommt mit L2 und L3. Zitationsklassifizierung trennt Zitate von nicht zitierten Paraphrasen. Mehrsprachig, mit kalibrierter Erkennung für Englisch, Spanisch, Portugiesisch, Polnisch und Ukrainisch zum Start; weitere Sprachen folgen. Median: 47 Sekunden pro Manuskript.

03

03 · Prüfen + iterieren

Der Bericht markiert Abschnitte nach Kategorien: SELF-CITE (Ihr eigenes, erwartet), CITED (zitiert mit Angabe, erwartet), CITED-PARA (paraphrasiert mit Zitat, gering gewichtet), UNCITED-PARA (bedarf Aufmerksamkeit), und AI-LIKELY (mit ESL-Anpassung) kommt bald. Reproduzierbar — Engine-Commit + Corpus-Snapshot auf jedem Bericht gestempelt.

SELBSTZITATE

Sechs Arten legitimen Text-Recyclings — keine soll Ihren Score erhöhen.

Blackbox-Checker markieren jeden Treffer als Plagiat. Forschende recyceln Texte zu Recht häufig. So behandelt der Klassifizierer solche Fälle.

01 · EIGENE VORARBEITEN

ORCID + DOI-Whitelist. Ihre bereits veröffentlichen Arbeiten werden bei Treffer als SELF-CITE markiert — nicht als Plagiat. Häufig in Literaturübersichten („wie ich in Chen 2023…“) und Förderanträgen mit eigenen Vorarbeiten.

02 · MITAUTORSCHAFT

ORCID von Kollaborierenden auf die Whitelist setzen. Koverfasste Arbeiten werden als CO-CITE markiert. Nützlich, wenn ein Manuskript auf einer gemeinsamen Publikation mit identischem Methodenteil basiert.

03 · LABORTEXT

PI-Ordner geteilter Corpus: Standardmethoden, Laborprotokolle, Ethikerklärungen, die in mehreren Laborpublikationen genutzt werden. Als LAB-CITE taggen und nicht werten. IRB-geprüfte Textbausteine müssen nicht bei jedem Manuskript neu geschrieben werden.

04 · EMBARGOIERTE PREPRINTS

Eigener Manuskript-Preprint (z.B. arXiv / bioRxiv), der nun eingereicht wird. Der Klassifizierer erkennt Preprint-→Journal-Entwicklung und markiert als PREPRINT-SELF. Nicht wertungsrelevant. Journale, die Preprints explizit ausschließen, können strenger konfiguriert werden.

05 · ZURÜCKGEZOGENE ZITATE

Crossref Retraction Watch-Integration markiert Abschnitte, die zurückgezogene Arbeiten zitieren. Beeinflusst Ihren Score nicht — aber besser vor der Einreichung wissen. Findet das „letzten Monat zurückgezogen“-Problem vor Reviewer 2.

06 · IRB / SENSITIV

EU-Standort (api.eu.noplag.com) hält das Manuskript in der EU. Engine kann vollständig im eigenen Netzwerk gehostet werden (HIPAA / GDPR / Patientendaten). Apache 2.0 + Docker; kein Traffic verlässt Ihr VPC.

MEINE ORDNER · LABORANSICHT

Sortiert nach Projekt. Audit-Trail nach Datum.

Manuskripte nach Projekt, Laborjahr oder Förderperiode gruppieren. Entwürfe später mit gleichem Engine-Commit neu prüfen — Berichte sind monatelang reproduzierbar.

MEINE ORDNER · Dr. Hirano Lab · CompBio24 Manuskripte · 6 Projekte
EU-STANDORTNeuer Ordner
ORDNERDOKSLETZTE AKTIVITÄTREGION
Projekt: PD-L1-Expressions-Kohorte8 ManuskripteEntwurf v3 geprüft · vor 2 Std.EU
Projekt: Synthetic-Bio-Sicherheitsreview5 Manuskripteeinreichfertig · gesternEU
Förderprojekt: NIH R01 Verlängerung J33 ManuskripteLit-Review v2 geprüft · vor 2 TagenEU
Laborerbe: Methoden + Ethiktext4 Doks · geteiltLab-Whitelist aktualisiert · vor 1WEU
Preprints: arXiv ausstehend2 ManuskriptePREPRINT-SELF markiert · vor 1WEU
Archiviert (2022–2024)12 ArbeitenSelf-Citation-ReferenzsetEU
Alle Ordner EU-Standort · verschlüsselt ruhend · IRB-prüfbarer Engine-Commit auf jedem BerichtReproduzierbarkeit: Engine v0.4.2 aktiv
700M+indexierte wissenschaftliche Arbeiten
5Detektionssprachen zum Start, werden erweitert
EUStandort-Endpoint verfügbar
Apache2.0 · IRB-prüfbar
Crossref+ Retraction Watch-Integration
DATENSCHUTZ

Drei Anforderungen an einen Checker für sensible Pre-Publication-Forschung.

01 · EU-STANDORT

Manuskripte verlassen nie die EU-Infrastruktur

Pro+ läuft auf api.eu.noplag.com. Gehostet in EU-basierten Hetzner-Rechenzentren (Falkenstein + Helsinki). Einreichung, Fingerprint-Store und Bericht bleiben in der EU. Standardmäßig DSGVO-konform; DPA auf Anfrage.

Hilfreich für Kollaborationen mit EU-Partnern unter Horizon-Europe-Anforderungen.
02 · SELF-HOST

Engine intern im Institut betreiben

Apache 2.0 + Docker Compose. Gesamte Erkennungspipeline läuft auf Ihrer Infrastruktur. Eigene Postgres + Redis nutzen; Corpus als indizierbares Bundle auf Enterprise. Kein Traffic verlässt Ihr VPC. Die richtige Wahl für klinische Studiendaten, Patientenfälle oder wirtschaftlich sensible Forschung.

Passt zu Slurm-Clustern und existierender Auth (SAML, LDAP, OIDC).
03 · RECHT AUF LÖSCHUNG

Alle gespeicherten Fingerprints löschen

Ein Klick in Einstellungen. Innerhalb 24h werden alle Fingerprints, Berichte, Whitelist-Einträge und Metadaten zu Ihrem Account gelöscht. DSGVO Art. 17-konform. Self-Host-Nutzer mit Direktzugriff auf DB; Cloud-Nutzer über dokumentiertes Lösch-API.

Löschprotokoll wird zu Compliance-Zwecken behalten.
IRB-PRÜFBAR

Eine Apache 2.0-Engine, die Ihr IRB vorab prüfen kann.

Institutionelle Prüfungen zu Plagiatssoftware hängen oft an den gleichen Fragen: Wo landet das Manuskript nach Einreichung, wie funktioniert der Abgleich, werden Patienten-/Sensitivdaten übertragen, wie läuft die Löschanfrage, ist die Messgenauigkeit reproduzierbar? Bei Closed-Source-Anbietern werden diese Fragen im Vertriebsgespräch geklärt. Bei Apache 2.0 kann Ihr IRB das Repo clonen, Engine in der Sandbox laufen lassen, Datenfluss prüfen, Löschpfad nachvollziehen und die publizierten F1-Scores mit eigener Testmenge bestätigen. Wir wollen keine billigere Prüfung — sondern eine, die Ihr IRB auch abschließen kann. Deshalb akzeptieren Forschungsdatenbüros, die sonst keine neuen Plagiatsanbieter zulassen, dieses Produkt.

IRB-Review-Guide lesen
IRB-FRAGEN, DIREKT BEANTWORTET
Q1Wo landet das Manuskript? — Tenant-isolierte EU-Postgres-DB beim EU-Standort. Quelltext wird nach 30 Tagen entfernt, außer wenn längere Aufbewahrung aktiviert ist.
Q2Wird mit Einreichungen trainiert? — Nein. Eingereichte Manuskripte werden nicht für Model-Training genutzt. Steht explizit im DPA.
Q3Patienten-/Sensitivdaten-Handling? — Engine vollständig intern im eigenen Netzwerk hosten. Kein Traffic verlässt Ihr VPC. HIPAA-kompatibler Betrieb.
Q4Algorithmus-Review? — Apache 2.0 unter github.com/NoplagLabs/noplag-engine. Lesbar, prüfbar, reproduzierbar.
Q5Mehrinstitutioneller Zugriff? — Pro Tenant rollenbasierte Kontrolle. Auditlog für jeden Zugriff. Oder Self-Host, damit Daten nie das Haus verlassen.
Q6Recht auf Löschung? — Ein Klick in Settings. 24h-Abschluss. DSGVO Art. 17-konform. Auditlog wird geführt.
FAQ

Fragen aus der Forschungspraxis.

Warum ändert sich mein Ähnlichkeitsscore, wenn ich ORCID + DOI-Liste hinzufüge?
Die Engine klassifiziert rückwirkend jeden Treffer auf der Whitelist als SELF-CITE statt UNCITED-PARA. Die Treffer bleiben, werden aber anders gewichtet. SELF-CITE wird im Hauptscore fast nicht gewertet. Konkretes Beispiel: Wenn ein Kapitel zweimal auf Ihr eigenes Preprint und einmal auf eine Co-Autor-Arbeit referenziert, werden drei Abschnitte von „gerechnet“ zu „erwartetes Recycling“ umgelabelt.
Trainiert die Engine mit eingereichten Manuskripten?
Nein. Übermittelte Texte werden nur als Fingerprint (Winnowing-Hashes – nicht rückführbare Signatur) gespeichert und nach 30 Tagen aus Ihrer tenant-isolierten Datenbank entfernt, sofern keine Aufbewahrung aktiviert ist. Der auf Binoculars basierende KI-Detektor (bald verfügbar) ist nur mit öffentlichen Korpora vortrainiert; Kundentexte fließen nicht ein. Explizit im DPA geregelt.
Was ist mit meinem Preprint auf arXiv / bioRxiv?
Wenn Sie die Preprint-DOI auf die Whitelist setzen, werden Treffer als PREPRINT-SELF markiert und zählen nicht in den Ähnlichkeitsscore. Die Engine erkennt, dass Preprint → Journal-Ergänzung üblich ist. Journale mit Preprint-Verbot (gibt es noch) lassen sich entsprechend strikter konfigurieren — aber große Journale (Nature, Cell, NEJM, PLOS) akzeptieren Preprints, und die SELF-Markierung entspricht diesem Modell.
Wie wird der KI-Detektor ESL-Coautoren behandeln?
AI-Erkennung kommt bald — auf der v1.2 Roadmap. Bei Veröffentlichung erfolgt eine sprachspezifische Kalibrierung mit einem auf ESL angepassten Urteil. Wenn das lexikalische Profil auf nicht-muttersprachliches Englisch hinweist (häufig bei internationalen Teams), wird das Urteil als ESL ADJ mit dokumentiertem Restrisiko ausgegeben, nicht als Null-Behauptung. Liang et al. 2023 wiesen 61,3 % Falsch-Positiv-Rate bei TOEFL-Aufsätzen für naive Detektoren nach; unsere Gegenmaßnahmen sind unter /docs/developers/benchmarks dokumentiert. ESL-Mitautor:innen werden nicht ungerecht markiert.
Lässt sich die Engine auf Slurm-Clustern batchweise betreiben?
Ja — Apache 2.0 + Docker. Führen Sie den Engine-Container auf den Compute-Nodes Ihres Clusters aus; lesen Sie Daten aus Ihrem gemeinsamen Dateisystem ein; geben Sie Berichte als JSON an die gewünschte Pipeline aus. Geeignet für die Stapelprüfung eines ganzen Jahres Laborergebnisse gegen den aktuellen Korpus-Snapshot. Beispiel-Slurm-sbatch-Skript unter github.com/NoplagLabs/noplag-engine.
Wie sieht es bei klinischen / Patientendaten-Manuskripten aus?
Self-Host im eigenen VPC. Kein Traffic verlässt Ihr Netz. Die Engine benötigt für Corpus-Checks (ohne Live-Web-Prüfung) keine Internetverbindung. HIPAA-kompatible Installation bei passender Infrastruktur; Ihre IT betreibt es wie jede interne Anwendung.
Wo ist der Unterschied zu iThenticate beim Einreichen?
iThenticate prüft beim Einreichen und der Editor sieht es — keine Iteration möglich. Noplag ist das Pre-Submission-Self-Check-Tool. Die Kaskade ist vergleichbar für Open-Access-Inhalte (tatsächlich noch breiter seit Plan-S); schmaler für bezahlte / Paywall-Inhalte, für die iThenticate lizenziert. Viele Forschende brauchen Self-Citation, das iThenticate nicht abdeckt.
Gibt es eine Integration mit meinem Referenzmanager (Zotero / Mendeley / EndNote)?
Whitelist-Import unterstützt BibTeX, RIS und ORCID-API direkt. Zotero-Export hochladen oder ORCID einfügen — alle DOIs werden in Sekunden übernommen. Echtzeit-Sync für Mendeley + EndNote steht auf der Roadmap für v1.2; aktuell funktioniert Export.
Wie ist die Mehrsprachigkeitsabdeckung für Publikationen in Nicht-Englisch?
Erkennung ist zum Start für Englisch, Spanisch, Portugiesisch, Polnisch und Ukrainisch kalibriert; weitere Sprachen folgen. Am stärksten bei europäischen Sprachen (lange Kalibrierungshistorie). Erkennungsqualität ist auf PAN-PC-11 benchmarked; sprachspezifische Evaluation ist geplant. Besonders geeignet für akademische Kontexte in Europa und Südamerika.
Was passiert, wenn zitierte Arbeiten nach Einreichung zurückgezogen werden?
Crossref Retraction Watch meldet es bei jedem Re-Check automatisch. Nach Einreichung besser vorher Bescheid wissen (manche Journale verlangen das explizit). Score bleibt unverändert, aber Reviewern fällt es nicht erst später auf.

Kapitelfassung durch die Kaskade laufen lassen. Self-Citation-Breakdown sehen.

Manuskriptentwurf, Dissertationskapitel oder Literatur-Review einfügen. ORCID hinzufügen. SELF-CITE-, CITED- und UNCITED-PARA-Intervalle sehen, AI-LIKELY folgt. Bis 2.500 Wörter kostenlos. EU-Standort für sensible Pre-Publication-Dokumente im Pro+.

Plagiatsprüfung für Forschende vor Einreichung