Plagiatsprüfung für Verlage – Vorabprüfung und Audit
Vorabprüfung von Freelancer-Beiträgen, Syndikationsaudits für übernommene Inhalte und eine REST-API, die Ihr Tech-Team direkt ins CMS integrieren kann. Die Erkennungsengine ist Apache 2.0 — lesbar vor dem Rollout, nicht danach.
Vier Arbeitsplätze. Ein Workflow.
Freelance-Pitch vor Beauftragung prüfen
10 Minuten pro Einreichung – bevor Budget gebunden wird.
- Entwurf/Clip einfügen, frühere Veröffentlichungen sehen
- KI-Wahrscheinlichkeit je Absatz (bald), ESL-bewusst
- Schluss mit dem Hin und Her um die Frage "Original?"
Den Tages-Queue vorm Druck prüfen
Sammlung tagesaktueller Artikel im Bulk vor Freigabe.
- Queue-Ansicht nach Ähnlichkeit + KI-Score sortiert
- Schwellenwerte pro Sektion (Kommentar, News, Rezension)
- Audit-Log pro Reporter für die Qualitätsstelle
Strittige Einreichung prüfen
Algorithmus lesen, dann die gefundenen Intervalle prüfen.
- X-Engine-Commit für Reproduzierbarkeit
- Entscheidung im Tool mit Dokumentation überschreiben
- Apache 2.0 — nachprüfbar bei Korrektur-Prüfung
Partner im Republishing prüfen
Canonical-Tag-Status im Syndikationsnetzwerk überprüfen.
- Canonical-bewusste Erkennung (ORIGIN / SYND OK / LEAK)
- Wöchentlicher Diff-Report nach Partner
- DMCA-tauglicher Nachweis bei Bedarf
Drei Schritte, bevor Artikel live im CMS landet.
Per API in Ihren Redaktionsprozess eingebettet, im Bulk vor Veröffentlichung oder einmalig im Dashboard. Selbe Engine, selbe Berichtsstruktur, flexibel einsetzbar.
01 · Intake
Einreichung landet in der CMS-Warteschlange — .docx / .gdoc / Einfügen oder CMS-Push via Webhook. Metadaten wie Autor + Sektion + zugeteilter Redakteur werden fürs Audit-Log mitgeführt.
02 · Scan + Klassifikation
Kaskade prüft offen zugängliches Web, Common Crawl und (optional) Ihr eigenes Archiv. Zitationsklassifikation trennt Direktzitate (mit Quelle) von unzitierten Paraphrasen. KI-Wahrscheinlichkeit je Absatz kommt bald, ESL-bewusst. Median 42 Sekunden pro Artikel.
03 · Entscheiden + Veröffentlichen
Redakteur sieht: Headline-Ähnlichkeit, Kategoriesplit, sortierbare Quellenliste (KI-Score + ESL-Flag bald verfügbar). Drei Optionen: veröffentlichen, zurück an Autor mit Anmerkung, an Standards-Desk eskalieren. Entscheidung mit Engine-Commit + Korpus-Snapshot geloggt.
Vier CMS-Oberflächen. Ein REST-Standard.
Noplag direkt im bestehenden CMS einbinden. API-Spezifikation bleibt gleich – nur die Integrationsebene variiert (WordPress-Hooks, Ghost-Actions, Drupal-Events, individuelle Webhooks).
Offizielles Plugin aus dem WordPress.org Plugin-Verzeichnis. Gutenberg-kompatibel.
- Vorabprüfungs-Metabox für jeden Beitragstyp
- Block-Level-Hervorhebung im Editor
- Audit-Log über WP REST API
Webhook-Integration + Admin-API-Consumer. Kompatibel mit Mitgliederinhalten.
- Vorabprüfung via Webhook bei save_draft
- Tag-basierte Scan-Policy pro Inhaltstyp
- Selbsthost-freundlich (Noplag self-host + Ghost self-host)
Contrib-Modul von drupal.org. Über Field-API eingebunden.
- Plagiatsfeld pro Inhaltstyp
- Workflow-Anbindung an Content Moderation
- Multi-Site-Konfiguration unterstützt
Webhooks + OpenAPI 3.0 Spec. Für Headless CMS, In-house-Lösungen, alles Weitere.
- POST /v1/checks von jedem CMS-Hook
- HMAC-signierte Webhook-Callbacks
- Python + Node SDKs aus OpenAPI-Spec
Heutige Veröffentlichungs-Queue. Sortierbar, audit-geloggt.
Artikelweise Zeilen mit Reporter, Sektion, Ähnlichkeit, KI-Score und Klick zum hervorgehobenen Bericht. Sortierbar. Sichere Artikel im Bulk abnicken, Rest eskalieren.
Sehen Sie, wer republished — und ob der Canonical-Tag nach Hause zeigt.
Verteilnetzwerk im Überblick
Fügen Sie die Domains, an die Sie syndizieren (Medium, LinkedIn, Substack, Ihre Netzwerkpartner), als Allowlist hinzu. Wöchentlicher Crawler prüft: Welche Partner führen korrekt auf Ihre Quelle (ORIGIN), welche haben Canonical-Tag verloren (SEO-Leck), und wer repostet ohne Erlaubnis (SCRAPED).
Von wessen Blog fehlt Ihr Name?
Offene Web-Scans im Monatsvergleich finden nicht erlaubte Domains, die Textabschnitte übernehmen. Treffer kommt mit Snapshot und Datum — DMCA-tauglicher Nachweis am Tag des Auftauchens. Wir stellen keine DMCAs, liefern aber die Unterlagen.
Interne Duplikate im eigenen Auftritt
Scan auf Ordnerebene: Veröffentlichten Korpus in einen Ordner legen; Engine baut eine Ähnlichkeitsmatrix. Erwischt z.B. 47 Stadtseiten mit gleichem Standardabsatz — Helpful-Content-Update-Risiko vorab sichtbar.
Drei Richtlinien, die Ihr Standards Desk vor Vertragsabschluss prüft.
Erstens – eingereichte Artikel werden niemals zum Training eines Modells verwendet. Weder für uns noch für Dritte. Eingereichte Texte werden gehasht, im Mandanten indexiert und nach 30 Tagen gelöscht, sofern keine explizite Speicherung erfolgt. Zweitens – das KI-Urteil (bald verfügbar, auf der Roadmap) erfolgt absatzweise, nicht artikelweise, und wird mit Engine-Commit und Zeitstempel des Korpus-Snapshots gekennzeichnet. Ein angefochtener KI-Flag lässt sich Monate später mit demselben Commit reproduzieren. Kein stilles Retraining. Drittens – Apache 2.0 erlaubt es Ihrem Engineering-Team, github.com/NoplagLabs/noplag-engine zu klonen, auf eigener Infrastruktur zu betreiben, den Datenfluss zu prüfen und den Löschpfad vollständig zu verifizieren. Die meisten institutionellen Beschaffungsprüfungen für Plagiatssoftware scheitern an diesen drei Punkten; wir beantworten sie vorab.
Leitfaden für das Standards Desk lesenWas das Standards Desk vor dem Kauf wirklich fragt.
- Werden unsere Artikel zum Training des KI-Modells genutzt?
- Nein. Übermittelte Artikel werden nur gehasht (Winnowing-Hashes) und tenant-isoliert gespeichert. Der Text selbst wird nach 30 Tagen entfernt, außer Sie schalten manuell auf Archiv. Das KI-Erkennungsmodell — Binoculars-basiert (Hans et al. 2024), Roadmap — wird auf öffentlichen Korpora vortrainiert. Kundentexte werden dafür nie hinzugefügt. Explizit in der DPA.
- Wie kann das KI-Urteil absatzweise Streit überstehen?
- KI-Erkennung folgt in Kürze – auf der v1.2-Roadmap, nicht zum Start verfügbar. Bei Auslieferung wird jeder markierte Absatz mit Engine-Commit und Korpus-Snapshot versehen. Derselbe Absatz liefert beim erneuten Prüfen mit diesem Commit exakt das gleiche Ergebnis. Der Algorithmus ist offen unter github.com/NoplagLabs/noplag-engine (Apache 2.0); der Perplexity-Schwellenwert ist dokumentiert, ebenso die ESL-angepasste Kalibrierung. Es gibt keinen „Score-vertrauen“-Modus.
- Was ist mit Freelancern aus Regionen mit schwacher Anbindung?
- Die Erkennung ist zum Start für Englisch, Spanisch, Portugiesisch, Polnisch und Ukrainisch kalibriert; weitere Sprachen folgen. Die Erkennungsqualität ist auf PAN-PC-11 benchmarked; sprachspezifische Auswertungen sind geplant. Die KI-Entscheidung kennzeichnet nicht-muttersprachliches Englisch als ESL ADJ statt LIKELY-AI, wenn das lexikalische Muster darauf hinweist.
- Kann man auch intern auf eigener Infrastruktur hosten?
- Ja — Apache 2.0-Engine + Docker. Läuft komplett im eigenen Netz. Kombinierbar mit bestehendem Postgres + Redis vor Ort; keinerlei Übertragung von Einreichungen ins Internet. Relevant für Newsrooms mit starkem Quellen-/Konfidenzschutz vor Veröffentlichung.
- Gibt es Anbindung an unser CMS?
- WordPress (offizielles Plugin), Ghost (Admin-API + Webhooks), Drupal (Contrib-Modul). Sonst — Custom-CMS, Headless, Eigenlösung — REST + OpenAPI 3.0 Spec geben genug Basis, um einen Hook in unter einem Tag zu bauen. Python/Node SDKs aus der Spec.
- Was macht das Syndikations-Audit genau?
- Ihre Domains in eine Allowlist (medium.com/@you, Partnerdomains) aufnehmen. Wöchentlicher Crawl prüft Canonical-Tag: ORIGIN (zeigt auf Sie), SYND OK (zeigt korrekt via Partner), LEAK (Tag fehlt/falsch — Ranking gesplittet), SCRAPED (kopierte Fassung ohne Tag, unzulässige Domain). Bei SCRAPED: Snapshot mit Zeitstempel für DMCA-Nachweis.
- Preismodell für ein 30-Personen-Redaktionsteam?
- Premium für $79/Monat: 5.000 Wörter pro Check, 5.000 Artikel/Monat, volle API- und CMS-Integration. Hohe Mengen (10.000+ Artikel/Monat): Enterprise-Vertrag nach Korpusgröße + dedizierter Infrastruktur. Es gibt keine Nutzerlizenzen pro Reporter; Skalierung über Menge.
- Was ist mit OpEds, Syndikation, Buchauszügen mit erlaubter Wiederverwertung?
- Pro+ bietet Schwellen pro Sektion — Nachrichten, Kommentar, Rezension, Auszug unterscheiden. Ein OpEd mit Zitat einer Senatsrede löst nicht dasselbe aus wie ein News-Artikel mit übernommenem Mitbewerbertext. Die Zitaterkennung trennt legitime Quellen von versehentlicher Dopplung.
- Verlangsamt es die Veröffentlichungs-Pipeline?
- Median 47 Sekunden für Checks mit 1.500–4.000 Wörtern. CMS-Hook läuft asynchron — beim Speichern in Entwurf, Urteil meist sichtbar, wenn das Lektorat fertig ist. Lange Texte (8.000+ Wörter) dauern ca. 90 Sekunden, können als separater Pre-Publish-Job laufen (keine Synch-Verarbeitung nötig).
- Kann unser Archiv als Privatkorpus eingebunden werden?
- Ja — Enterprise. Archiv bulk importieren, Korpus im Tenant privat halten, Engine prüft neue Einreichungen gegen eigene Altdaten. Erwischt Selbstzitate (teilweise legitim, teils nicht) und geplante Übernahmen unter neuem Autorenkürzel.
Testen Sie den Queue mit einem Entwurf. Sehen Sie die Einzelansicht.
Word-Dokument, Google Doc oder CMS-Export hochladen. In 47 Sekunden ein Absatz-für-Absatz-Bericht. Bis 2.500 Wörter frei; Pro-Tarif für Volumen; Enterprise für Korpus + dedizierte Infrastruktur.