Verificare plagiat pentru editori pre-publicare și audit
Verificări pre-publicare pentru materiale trimise de colaboratori, audituri pentru conținut republicat, și un REST API ușor de integrat în CMS-ul dumneavoastră. Motorul de detecție este Apache 2.0 — lizibil înainte de adoptare, nu după.
Patru birouri. Un singur flux.
Verificați o propunere freelance înainte de alocare
10 minute pe trimitere, înainte de a angaja bugetul editorial.
- Lipiți un draft / fragment, vedeți versiuni publicate anterior
- Probabilitate AI pe paragraf (în curând), sensibil la ESL
- Evitați discuțiile pe tema „este original?”
Rulați coada zilei înainte de publicare
Scanați în masă articolele din ziua respectivă înainte să intre în coada de publicare din CMS.
- Listă sortabilă după similaritate + scor AI
- Praguri pe secțiune (op-ed vs știri vs recenzie)
- Jurnal de audit pe reporter pentru biroul de standarde
Investigați o trimitere contestată
Citiți algoritmul, apoi intervalele găsite.
- Reproducibilitate X-Engine-Commit
- Suprascrieți verdictul cu motiv documentat
- Apache 2.0 — argumentabil la corecturi publice
Auditați partenerii care vă republică
Urmăriți starea tag-ului canonical pe rețeaua de redistribuire.
- Detectare conștientă de canonical (ORIGIN / SYND OK / LEAK)
- Raport săptămânal de diferențe per partener
- Pachet de dovezi tip DMCA la cerere
Trei pași înainte ca articolul să intre în coada de publicare CMS.
Integrat în fluxul editorial prin API, rulat în masă înainte de publicare sau individual din dashboard. Același motor, același format de raport, se potrivește unde e nevoie.
01 · Preluare
Trimiterea ajunge în coada CMS — drag & drop .docx / .gdoc / lipit text, sau CMS trimite prin webhook. Metadatele autor + secțiune + editor asociat însoțesc documentul pentru jurnalul de audit.
02 · Scanare + clasificare
Cascada rulează pe web-ul deschis + Common Crawl + (opțional) propriul dumneavoastră corpus de arhivă. Clasificarea citărilor separă citatele directe (cu atribuție) de parafrazările fără sursă. Probabilitate AI per paragraf (în curând), sensibil la ESL. Medie 42s pe articol.
03 · Decizie + publicare
Editorul vede: similaritate titlu, detalii pe categorie, listă sortabilă a surselor (scor AI cu marcaj ESL-ajustat, în curând). Trei acțiuni: publicare, retrimitere cu observații, sau escaladare la standarde. Decizia e salvată cu engine commit + snapshot de corpus.
Patru platforme CMS. Un singur contract REST.
Conectați Noplag la CMS-ul deja folosit de redactori. Suprafața API e aceeași — diferă doar stratul de integrare (hooks WordPress, acțiuni Ghost, evenimente Drupal, sau proprii webhooks).
Plugin oficial din WordPress.org Plugins Directory. Compatibil Gutenberg.
- Meta-box pre-publicare la fiecare tip de articol
- Subliniere la nivel de bloc în editor
- Audit log prin WP REST API
Integrare webhook + Admin API consumer. Compatibil cu conținut pentru membri.
- Webhook pre-publicare pe save_draft
- Politică scanare pe nivel de tag/context
- Self-host prietenos (Noplag self-host + Ghost self-host)
Modul contrib de pe drupal.org. Atașare bazată pe Field-API.
- Câmp plagiat pe tip de conținut
- Integrare cu Content Moderation
- Configurare multi-site suportată
Webhooks + OpenAPI 3.0 spec. Pentru headless CMS, sisteme interne sau altceva.
- POST /v1/checks din orice hook CMS
- Callback-uri webhook semnate HMAC
- SDK-uri Python + Node generate din OpenAPI spec
Coada de publicare de azi. Sortabilă, auditată.
Rânduri pe articol cu reporter, secțiune, similaritate, scor AI, și link către raportul evidențiat. Sortabil. Aprobați în masă textele sigure, escaladați restul.
Vedeți cine vă republică — și dacă tag-ul canonical vă indică sursa.
Urmăriți-vă rețeaua de distribuție
Adăugați domeniile unde redistribuiți (Medium, LinkedIn, Substack, parteneri de rețea) într-o allowlist. Raportul săptămânal arată care parteneri au rel=canonical corect (credit ORIGIN), care lipsesc (scurgere SEO), care reposteză fără permisiune (SCRAPED).
Pe ce blog lipsește semnătura dumneavoastră?
Scanări diferențiale lunare pe web-ul deschis semnalează domenii nepermise care publică fragmente din articolele dumneavoastră. Potrivirea vine cu snapshot datat — dovadă DMCA de la ziua apariției copiei. Nu depunem DMCA-uri (e decizie juridică); vă oferim documentația.
Duplicare internă între paginile proprii
Scanare pe nivel de director: încărcați corpusul publicat; motorul construiește matricea de similaritate pentru fiecare pereche. Prinde paragraful boilerplate repetat pe 47 de pagini — risc pentru Helpful-Content-Update pe care ar trebui să-l știți înainte de Google.
Trei politici pe care biroul de standarde le va solicita înainte de contract.
Primul aspect — articolele trimise nu antrenează niciun model. Nici al nostru, nici al altcuiva. Textul trimis este amprentat, indexat în tenantul dumneavoastră și șters după 30 de zile, cu excepția cazului în care este păstrat explicit. Al doilea — verdictul AI (în curs de dezvoltare, pe roadmap) va fi la nivel de paragraf, nu de articol, și va fi etichetat cu commit-ul engine-ului și data snapshot-ului corpusului. Un paragraf marcat ca AI contestat va reproduce același rezultat după luni, dacă se folosește același commit. Fără reantrenare automată. Al treilea — Apache 2.0 permite echipei dumneavoastră tehnice să cloneze github.com/NoplagLabs/noplag-engine, să ruleze engine-ul pe infrastructura proprie, să auditeze fluxul de date și să verifice procesul de ștergere a datelor cap-coadă. Majoritatea evaluărilor instituționale pentru software de detectare a plagiatului se blochează la aceste trei întrebări; am încercat să le răspundem din start.
Citiți ghidul standardelorÎntrebările reale de la biroul de standarde înainte de achiziție.
- Articolele noastre vor fi folosite la antrenarea modelului AI?
- Nu. Articolele trimise sunt amprentate (doar hash-uri winnowing) și indexate izolat. Textul e șters după 30 zile dacă nu optați explicit pentru păstrare. Modelul AI de detecție — Binoculars-based (Hans et al. 2024), în curând pe roadmap — va folosi doar corpusuri publice; nu adăugăm niciodată conținut client. Specificat clar în DPA.
- Cum supraviețuiește verdictul AI-per-paragraf unei dispute cu reporterul?
- Detectarea AI va fi disponibilă în curând — este pe roadmap pentru v1.2, nu la lansare. Când va fi lansată, fiecare paragraf marcat va include commit-ul engine-ului și snapshot-ul corpusului. Dacă rulați același paragraf cu același commit, verdictul va fi identic. Algoritmul este public la github.com/NoplagLabs/noplag-engine (Apache 2.0); pragul de perplexitate este documentat, la fel și calibrarea ajustată pentru ESL. Nu există mod „aveți încredere în scor”.
- Cum rezolvați trimiterile colaboratorilor din piețe cu bandă redusă?
- Detectarea este calibrată pentru engleză, spaniolă, portugheză, poloneză și ucraineană la lansare, cu alte limbi în curs de adăugare. Calitatea detectării este evaluată pe PAN-PC-11; evaluarea pe fiecare limbă este pe roadmap. Verdictul AI ajustat pentru ESL marchează textele scrise de vorbitori non-nativi de engleză ca ESL ADJ, nu LIKELY-AI, atunci când semnătura lexicală indică acest lucru.
- Se poate găzdui local, pe infrastructura redacției?
- Da — motor Apache 2.0 + Docker. Rulează doar în rețeaua dumneavoastră. Se asociază cu Postgres + Redis local; niciun text nu iese din VPC. Util pentru redacții stricte cu protecția surselor sau confidențialitate pre-publicare.
- Funcționează cu CMS-ul nostru?
- WordPress (plugin oficial), Ghost (Admin API + webhooks), Drupal (modul contrib). Pentru alte CMS — custom, headless, intern — REST + OpenAPI 3.0 livrează tot ce trebuie pentru un hook pre-publicare în <1 zi. SDK-uri Python și Node generate din spec.
- Ce face efectiv funcția de audit de redistribuire?
- Adăugați domeniile din rețea ca allowlist (medium.com/@..., domenii parteneri). Raportul săptămânal analizează starea canonical: ORIGIN (indicând spre dvs), SYND OK (de la un partener), LEAK (canonical lipsă sau spre altă sursă — fragmentare SEO), sau SCRAPED (copie integrală, fără canonical, domeniu nepermis). Copia scrape vine cu snapshot datat pentru dovadă DMCA.
- Cum funcționează prețurile pentru o redacție cu 30 reporteri?
- Premium la $79/lună oferă 5.000 cuvinte/verificare, 5.000 articole/lună, API și integrări CMS complete. Pentru volume mari (10.000+ articole/lună), Enterprise e tarifat la corpus + infrastructură dedicată. Fără cost per utilizator; volumul scalează.
- Ce facem cu op-ed-uri, redistribuire și extrase de carte unde 'reluarea' e permisă?
- Praguri pe secțiune în Pro+ — setați sensibilitate diferită pe știri vs op-ed vs recenzie vs extras redistribuit. Un op-ed care citează mot-a-mot dintr-un discurs nu ar trebui tratat ca un articol de știri ce copiază limbajul concurenței. Clasificarea citării separă citatele legitime de reutilizare accidentală.
- Încetinește fluxul de publicare?
- Timp median: 47 secunde per articol la 1.500–4.000 de cuvinte. Hook-ul de integrare CMS este asincron — rulează la save_draft, verdictul apare până la finalul corecturii. Articole lungi (8.000+ cuvinte) iau ~90 secunde și pot fi verificate pre-publicare, nu cu hook sincron.
- Putem adăuga arhiva proprie ca corpus privat?
- Da — nivel Enterprise. Ingestați bulk conținutul arhivat într-un corpus privat, astfel încât motorul verifică orice nouă trimitere și față de arhiva proprie. Prinde auto-reciclarea reporterilor (uneori legitim, alteori nu), și reutilizarea intenționată a conținutului vechi.
Rulați o versiune de test prin coadă. Vedeți raportul pe articol.
Încărcați un Word, un Google Doc sau un articol exportat din CMS. Primiți raport pe paragraf în 47 de secunde. Gratuit până la 2.500 cuvinte; Pro pentru volume; Enterprise pentru corpus + infrastructură dedicată.