Plagiatkontroll för förlag och publicister
Förhandskontroll av frilansbidrag, revision av återpublicerat innehåll och ett REST API som teknikteamet kan koppla direkt till CMS:et. Upptäcktsmotorn är Apache 2.0 — kan granskas före införande, inte efter.
Fyra redaktioner. Ett arbetsflöde.
Kontrollera ett frilansförslag före uppdrag
10 minuter per bidrag, innan redigeringsbudgeten förbrukas.
- Klistra in utkast/klipp, se tidigare publicerade versioner
- AI-sannolikhet per stycke (kommer snart), ESL-anpassad
- Hoppa över diskussionen kring ”är detta original?”
Kör dagens kö före pressläggning
Bulkgranska dagens artiklar innan de kommer till CMS:ets publiceringskö.
- Kövyn sorterad på likhet + AI-poäng
- Tröskelvärden per sektion (op-ed, nyhet, recension)
- Granskningsspårning per reporter för standarddesk
Utred ett ifrågasatt bidrag
Läs algoritmen, läs de matchade intervallen.
- X-Engine-Commit-reproducerbarhet
- Åsidosätt domslut med dokumenterad orsak
- Apache 2.0 — försvarbar vid rättelsesida
Granska partner som återpublicerar
Följ canonical-taggar över nätverket.
- Canonical-medveten detektering (ORIGIN / SYND OK / LEAK)
- Veckovisa differensrapporter per partner
- DMCA-bevispaket på begäran
Tre steg innan artikeln når publiceringskön.
Inbäddad via API, körs som bulk före pressläggning eller enskilt i dashboarden. Samma motor, samma rapportformat.
01 · Inlämning
Bidraget landar i CMS-kön — dra-släpp .docx / .gdoc / klistra in, eller så skickar CMS via webhook. Metadata om författare, sektion och redaktör följer dokumentet för revisionsloggen.
02 · Skanna + klassificera
Kedjan kör mot öppna webben + Common Crawl + (valbart) ert eget bakgrundsarkiv. Citeringsklassificering skiljer direktcitat (med källa) från okrediterad omskrivning. AI-sannolikhet per stycke kommer snart, ESL-anpassad. Median 42 sekunder per artikel.
03 · Beslut + publicera
Redaktören ser: rubrikens likhet, uppdelning per kategori, sorteringsbar källista (AI-poäng med ESL-flagga kommer snart). Tre val: publicera, skicka tillbaka med anteckning eller skicka vidare till standarddesk. Beslutet loggas med engine commit + corpus snapshot.
Fyra CMS-ytor. Ett REST-kontrakt.
Koppla Noplag till ert befintliga CMS. Samma API-yta, integrationen skiljer sig (WordPress hooks, Ghost actions, Drupal events eller egna webhooks).
Officiellt plugin från WordPress.org Plugins Directory. Gutenberg-kompatibel.
- Pre-publish meta-ruta för alla inläggstyper
- Blockmarkering i editorn
- Revisionslogg via WP REST API
Webhook-integration + Admin API-klient. Kompatibel för medlemsinnehåll.
- Pre-publish webhook vid save_draft
- Taggbaserad skanningspolicy per innehållstyp
- För egen hosting (Noplag och Ghost självhostad)
Modul via drupal.org. Bygger på Field API.
- Plagiatfält per innehållstyp
- Arbetsflöde med Content Moderation
- Stöd för multisite-konfigurationer
Webhooks + OpenAPI 3.0. För headless CMS, in-house eller annat.
- POST /v1/checks från valfri CMS-hook
- Webhook-återkoppling signerad med HMAC
- Python + Node SDKs från OpenAPI-specen
Dagens publiceringskö. Sorterbar, revisionsloggad.
En rad per artikel med reporter, sektion, likhet, AI-poäng och klickbar rapport. Sortera, masspublicera säkra artiklar, skicka vidare resten.
Se vem som återpublicerar — och om canonical taggen pekar hem.
Följ ditt distributionsnät
Lägg till de domäner ni syndikerar till (Medium, LinkedIn, Substack, egna partners) i en tillåtelselista. Veckorapport som visar vilka partners som har rel=canonical som pekar hem (ORIGIN-kredit), saknade (SEO-läckage) och vilka som publicerar utan tillåtelse (SCRAPED).
Vems blogg saknar din byline?
Månadsvisa skillnadsscanningar hittar otillåtna domäner som publicerar matcher från era artiklar. Matchen har tidsstämplad ögonblicksbild — DMCA-nivå, daterad bevis när kopian publicerats. Vi skickar inte in DMCA (det är juridik), men ger er underlaget.
Intern duplicering på egna sidor
Mappbaserad kontroll: lägg era publicerade artiklar i en mapp, motorn bygger likhetsmatris mellan alla par. Hittar identisk boilerplate, ex. 47 stadssidor med samma stycke — risk för Helpful-Content-uppdatering ni bör känna till före Google.
Tre policies standarddesk behöver innan avtal.
För det första — inskickade artiklar används aldrig för att träna någon modell. Varken vår eller någon annans. Inskickad text fingeravtrycks, indexeras i din tenant och raderas efter 30 dagar om den inte uttryckligen sparas. För det andra — AI-bedömningen (kommer snart, finns på vår roadmap) kommer att göras per stycke, inte per artikel, och märkas med engine-commit och corpus-snapshotens tidsstämpel. En ifrågasatt AI-flagga kan återskapas månader senare mot samma commit. Ingen tyst omträning. För det tredje — Apache 2.0 innebär att ert tekniska team kan klona github.com/NoplagLabs/noplag-engine, köra den på egen infrastruktur, granska datavägarna och verifiera rätten till radering från början till slut. De flesta upphandlingsgranskningar av plagiatkontrollverktyg fastnar på just de tre frågorna; vi försökte besvara dem direkt.
Läs standarddesk-guidenVad standarddesk faktiskt frågar innan avtal.
- Kommer våra artiklar användas för att träna er AI-modell?
- Nej. Inlämnade artiklar fingerprintas (endast winnowing-hashar) och indexeras isolerat per kund. Själva texten raderas efter 30 dagar om ni inte valt att spara. AI-detekteringsmodellen — Binoculars-baserad (Hans et al. 2024), kommer inom kort — förtränas på publika korpus. Kundinnehåll läggs aldrig till. Explicit i DPA.
- Hur hanteras AI-utslag per stycke vid reporter-dispyter?
- AI-detektering kommer snart — finns på v1.2-roadmapen, inte tillgänglig vid lansering. När den släpps kommer varje flaggat stycke att märkas med engine-commit och corpus-snapshot. Kör samma stycke mot den commiten och bedömningen blir identisk. Algoritmen är öppen på github.com/NoplagLabs/noplag-engine (Apache 2.0), där tröskelvärdet för perplexity och ESL-justerad kalibrering dokumenteras. Vi har inget läge där man förväntas 'lita på poängen'.
- Hur funkar det för frilansare med dålig uppkoppling?
- Detekteringen är kalibrerad för engelska, spanska, portugisiska, polska och ukrainska vid lansering. Fler språk tillkommer. Detekteringskvalitet är benchmarkad mot PAN-PC-11; utvärdering per språk finns på roadmapen. AI-bedömning som är justerad för ESL flaggar icke-modersmålstalande engelska som ESL ADJ istället för LIKELY-AI när den lexikala signaturen tyder på det.
- Kan vi självhosta i vår newsroom-infrastruktur?
- Ja — Apache 2.0-motor + Docker. Allt körs i ert nätverk. Anslut till egen Postgres + Redis; inget skickas utanför er VPC. Relevans: redaktioner med krav på källskydd eller konfidentialitet före publicering.
- Funkar det med vårt CMS?
- WordPress (officiellt plugin), Ghost (Admin API + webhooks), Drupal (contrib-modul). Annars — eget CMS, headless, in-house — REST + OpenAPI 3.0 ger teknikteamet allt för att bygga pre-publiceringshook under en dag. Python och Node SDKs från spec.
- Vad gör syndikeringsrevisionen?
- Lägg till dina distributionsdomäner som tillåtelselista (medium.com/@you, partners domäner). Veckoscanning visar canonical-tag status: ORIGIN (pekar till er), SYND OK (partner, pekar till er), LEAK (canonical fattas eller pekar annanstans — SEO delning), eller SCRAPED (kopierad, ingen canonical, otillåten domän). Scraped-kategorin har tidsstämplat snapshot för DMCA-bevis.
- Hur prissätts det för 30 reportrar?
- Premium 79$/månad ger 5 000 ord/kontroll, 5 000 artiklar/månad, full API + CMS. Högvolym (10 000+ artiklar/månad) har Enterprise-avtal per corpus + dedicerad infrastruktur. Inget volymtak per reporter; volymen styr.
- Hur fungerar det för op-eds, syndikering och bokutdrag där viss återanvändning förväntas?
- Tröskel per sektion på Pro+ — skilj känslighet för nyhet, opinion, recension, syndikat. Ett op-ed med direktciterad senatdebatt ska inte flaggas likadant som en artikel som återanvänder konkurrenters formulering. Citeringsklassificering skiljer legitima citat från oavsiktlig återanvändning.
- Kommer arbetsflödet att sakta ner publicering?
- Median 47 sekunder per artikel (1 500–4 000 ord). CMS-integrationen är asynkron – triggas på save_draft, redaktör ser svar innan korrekturläsning är klar. Långformat (8 000+ ord) tar ca 90 sekunder, körs då som fristående jobb.
- Kan vi lägga till vårt eget arkiv som privat korpus?
- Ja — Enterprise-nivå. Bulkimport av gammalt material till hyrestagar-privat korpus, så varje ny inlämning jämförs mot ert eget arkiv. Upptäcker egen återanvändning (ibland okej, ibland inte) och återbruk under nytt byline.
Kör ett utkast via kön. Se per artikel-vyn.
Släpp in Word-dokument, Google Docs eller CMS-exporterad artikel. Rapport per stycke på 47 sekunder. Gratis upp till 2 500 ord; Pro för volym; Enterprise för privat korpus + infrastruktur.