NEWSROOMRedakcionālais process · CMS API · sindikācijas audits

Plaģiāta pārbaude izdevējiem – pirmspublicēšanas un audits

Pārbaudes pirms publicēšanas ārštata autoru materiāliem, sindikācijas audits pārepublicētam saturam un REST API, ko Jūsu inženierija var integrēt esošajā CMS. Dzinējs — Apache 2.0. Lasāms pirms ieviešanas, ne pēc.

Pirmspublicēšanas processSindikācijas auditsCMS-gatavs REST API
TIEM, KAS APSTIPRINA PUBLICĒŠANU

Četras nodaļas. Viens process.

REDAKTORS

Izvērtējiet ārštata piedāvājumu pirms uzdevuma izsniegšanas

10 minūtes uz iesniegumu, pirms budžeta piešķiršanas rediģēšanai.

  • Ielīmējiet melnrakstu vai fragmentu, skatiet iepriekšējās publikācijas
  • AI varbūtība pa paragrāfiem (drīzumā), ņem vērā ESL
  • Nav jāatkārtojas ar jautājumu 'vai tas ir oriģināls?'
VADOŠAIS REDAKTORS

Aizvadiet dienas rindas pirms preses

Masveida pārbaude visiem dienas rakstiem pirms CMS publicēšanas rindas.

  • Rindas skats pēc līdzības un AI rezultāta
  • Sliekšņi pa sadaļām (viedokļraksti, ziņas, recenzijas)
  • Audita pēdas pēc autora (standartu nodaļai)
STANDARTU NODAĻA

Izmeklējiet apstrīdētu iesniegumu

Lasiet algoritma darbību, tad saskaņotos fragmentus.

  • X-Engine-Commit reproducējamība
  • Pārrakstiet rezultātu ar dokumentētu iemeslu
  • Apache 2.0 — aizstāvams korekciju pārskatā
SINDIKĀCIJA

Auditējiet partneru pārpublicēšanu

Sekojiet canonical tag stāvoklim sindikācijas tīklā.

  • Canonical-atpazīšanas pārbaude (ORIGIN / SYND OK / LEAK)
  • Nedēļas atšķirību atskaite pēc partnera
  • DMCA-klases pierādījumu pakotne pēc pieprasījuma
PIRMSPUBLICĒŠANAS PROCESS

Trīs soļi pirms raksta nonākšanas CMS rindā.

Iebūvēts Jūsu redakcionālajā plūsmā caur API, izpildāms masveidā pirms preses vai atsevišķi panelī. Tas pats dzinējs, tā pati atskaites forma, pielāgojas vietai.

01

01 · Saņemšana

Iesniegums nonāk Jūsu CMS rindā — ievelciet .docx / .gdoc, ielīmējiet vai CMS nosūta caur webhook. Autora, sadaļas un redaktora metadati nonāk kopā ar dokumentu uz audita žurnālu.

02

02 · Skatīt un klasificēt

Pārbaude notiek pret atvērto tīmekli, Common Crawl un (pēc izvēles) Jūsu pašu arhīva korpusu. Citātu klasifikācija atdala tiešas citācijas (ar norādi) no necitēta pārrakstījuma. AI iespējamība pa paragrāfiem drīzumā, ņem vērā ESL. Vidēji 42 sekundes uz rakstu.

03

03 · Lēmums un publicēšana

Redaktors redz: virsrakstu līdzību, sadalījumu pa kategorijām, šķirojamu avotu sarakstu (AI rezultāts ar ESL atzīmi drīzumā). Trīs rīcības: publicēt, atgriezt ar piezīmēm, pārsūtīt uz standartu nodaļu. Lēmums tiek reģistrēts ar engine commit un korpusa momentuzņēmumu.

CMS INTEGRĀCIJAS

Četras CMS vides. Viens REST līgums.

Pievienojiet Noplag CMS sistēmā, ko jau lieto Jūsu žurnālisti. API saskarne nemainās — atšķiras tikai integrācijas slānis (WordPress hooks, Ghost actions, Drupal notikumi vai Jūsu webhooks).

WordPress5.5+

Oficiālais spraudnis no WordPress.org Plugins Directory. Savietojams ar Gutenberg.

  • Pirmspublicēšanas meta-logs katram ieraksta tipam
  • Izcelšana blokos redaktorā
  • Audita žurnāls caur WP REST API
Ghost4.0+

Webhook integrācija + Admin API. Atbalsta dalībnieku saturu.

  • Webhook pirms publicēšanas aktivizējas saglabājot melnrakstu
  • Tagu līmeņa pārbaudes politika pēc satura veida
  • Savietojams pašpārvaldītām instalācijām (Noplag + Ghost self-host)
Drupal9+ / 10

Contrib modulis no drupal.org. Lauku-API piesaiste.

  • Plaģiātisma lauks pēc satura veida
  • Workflou integrācija ar Content Moderation
  • Multi-vietņu konfigurācija atbalstīta
CustomREST

Webhooks + OpenAPI 3.0 specifikācija. Priekš headless CMS, pašu sistēmām vai jebkam citam.

  • POST /v1/checks no jebkura CMS hook
  • HMAC-parakstīti webhook zvani
  • Python + Node SDK pieejami no OpenAPI specifikācijas
REDAKCIONĀLAIS SKATS

Šodienas publicēšanas rinda. Šķirojama, auditēta.

Katra raksta rinda ar autoru, sadaļu, līdzības procentu, AI rezultātu, ar iespēju atvērt izcelto atskaiti. Šķirojama. Masveida apstiprināšana drošiem rakstiem, pārējos — pārsūtīšana tālāk.

PUBLICĒŠANAS RINDA · Otrdiena, 21. maijs7 raksti gaida · 2 pārsūtīti
Sadaļa: VisasMasveida publicēšana OK
RAKSTSAUTORSSADAĻALĪDZĪBAAI %REZULTĀTSDARBĪBA
Dome pieņem jaunu zonējuma likumu pilsētas centrammelnraksts · 1 840 vārdiMarisol ChenVIETĒJIE6%0.04OKPublicēt
Iekšējā atjaunošana: secinājumi no Q1 fiaskomelnraksts · 1 840 vārdiTobias ReinhartTEHNOLOĢIJAS12%0.08OKPublicēt
Kā AI izmainīja mūsu redakciju 18 mēnešosmelnraksts · 1 840 vārdiPriya AnandVIEDOKLIS38%0.62APTURĒTPārskatīt
Modernisma romāni un balss jautājumsmelnraksts · 1 840 vārdiSara BeltranKULTŪRA22%0.18OKPublicēt
Valsts Senāta budžeta strīds — kas tālākmelnraksts · 1 840 vārdiMarcus AdekunlePOLITIKA67%0.41ESKALĒTPārskatīt
Klimata bēgļi: piecu gadu sekošanamelnraksts · 1 840 vārdiYuki HiranoTEMATISKS RAKSTS14%0.06OKPublicēt
Tehnoloģiju peļņa: kurš uzvarēja, kurš zaudējamelnraksts · 1 840 vārdiDiego MoralesBIZNESS51%0.28APTURĒTPārskatīt
Parādīti 7 no 7 · sakārtoti pēc sadaļas, tad pēc iesnieguma laikaaudita žurnāls: 47 lēmumi šodien · 2 eskalēti
47svidējais pārbaudes ilgums uz rakstu
4CMS integrācijas
RESTOpenAPI 3.0 · gatavs pašpārvaldei
0iesniegumi izmantoti apmācībai (politika)
5noteikšanas valodas, tiks papildinātas
SINDIKĀCIJAS AUDITS

Redziet, kas Jūs pārpublicē — un vai canonical tag norāda uz Jūsu lapu.

01 · CANONICAL STATUS

Uzraugiet savu izplatīšanas tīklu

Pievienojiet domēnus, kuros veicat sindikāciju (Medium, LinkedIn, Substack, partneri) baltajam sarakstam. Nedēļas pārmeklēšana atskaita, kuri partneri izmanto rel=canonical uz Jūsu lapu (ORIGIN), kuriem tas nav (SEO noplūde), kuri pārpublicē bez atļaujas (SCRAPED).

Atrodiet LinkedIn pārpublicējumu, kas zaudēja canonical dēļ platformas ierobežojuma.
02 · SCRAPER NOTEIKŠANA

No kura bloga Jūsu vārds pazudis?

Atvērtā tīmekļa ikmēneša pārbaudes atrod ārpus baltā saraksta domēnus, kas publicē Jūsu rakstu fragmentus. Katrā sakritībā ir datēts momentuzņēmums — DMCA līmeņa pierādījums ar datumu, kad raksts parādījies. Mēs DMCA nepārvaldām (tas ir juridisks lēmums); mēs piedāvājam pierādījumu kopu.

Eksportējiet pierādījumu PDF formātā juridiskajam padomniekam.
03 · DUBLIKĀTU AUDITS

Iekšējā dublēšanās Jūsu pašu lapās

Pro līmeņa pārbaude pa mapēm: ielādējiet savu publicēto rakstu kolekciju mapē; dzinējs izveido līdzības matricu pārī starp visiem. Atklāj 47 pilsētu lapas ar vienu un to pašu ievadrindkopu — risks 'Helpful-Content-Update', par ko būtu jāzina pirms Google pamanījis.

Izpildiet reizi nedēļā; eksportējiet matricu kā CSV.
REDAKCIJAS PRINCIPI

Trīs politikas, ko standartu nodaļa prasīs pirms līguma slēgšanas.

Pirmkārt — iesniegtie raksti nekad netiek izmantoti modeļa apmācībai. Ne mūsu, ne citu. Iesniegtais teksts tiek pirkstu nospiedumu veidā indeksēts jūsu nomnieka vidē un dzēsts pēc 30 dienām, ja vien nav norādīta ilgāka saglabāšana. Otrkārt — AI satura atpazīšana (drīzumā, izstrādes plānā) būs pa rindkopām, nevis visam rakstam, un katrs rezultāts būs marķēts ar dzinēja commit un korpusa momentuzņēmuma laika zīmogu. Ja AI atzīme tiek apstrīdēta, to varēs atkārtot pēc vairākiem mēnešiem ar to pašu commit. Klusa pārapmācība nenotiek. Treškārt — Apache 2.0 licence ļauj jūsu inženieriem klonēt github.com/NoplagLabs/noplag-engine, darbināt to savā infrastruktūrā, auditēt datu plūsmu un pārbaudīt dzēšanas tiesību ceļu pilnā apjomā. Lielākā daļa institucionālo iepirkumu pārskatu par plaģiāta pārbaudēm apstājas pie šiem trim jautājumiem; mēs centāmies uz tiem atbildēt jau sākumā.

Izlasiet standartu nodaļas rokasgrāmatu
REDAKCIJAS J&A
Q1Vai dzinējs mācās no mūsu rakstiem? — Nē. Iesniegtā satura nospiedums, nevis apmācība.
Q2Vai varam pašiem uzturēt? — Jā. Apache 2.0 + Docker. Strādā tikai Jūsu tīklā.
Q3Kā ar ES datu uzglabāšanu? — Pro+ pieejams api.eu.noplag.com. Atbilst GDPR noklusēti.
Q4Vai atskaites ir reproducējamas? — Katra pārbaude atzīmē X-Engine-Commit un korpusa zīmogu. Reproducējams arī pēc mēnešiem.
Q5Masveida cenu politika? — Pro līmenī apmaksājiet pēc raksta, Enterprise — pēc korpusa licences un infrastruktūras.
Q6Avotu norādes? — Katra sakritība ar avota URL, canonical tagu, datumu, engine commit.
FAQ

Kas patiesībā interesē standartu nodaļu pirms iepirkuma.

Vai mūsu raksti tiks izmantoti Jūsu AI modeļa apmācībai?
Nē. Iesniegtie raksti tiek nospiedumoti (tikai winnowing hashes) un indeksēti nomnieka datubāzē. Teksts pats tiek dzēsts pēc 30 dienām, ja vien Jūs neizvēlaties saglabāt ilgāk. AI noteikšanas modelis — Binoculars-based (Hans et al. 2024), drīzumā — tiks apmācīts tikai uz publiskām kopām; klientu saturs netiek pievienots. Tas ir skaidri noteikts DPA.
Kā AI lēmums pa paragrāfiem būs izmantojams reportiera iebildumu gadījumā?
AI satura atpazīšana drīzumā — tā ir v1.2 izstrādes plānā, bet nebūs pieejama uzreiz. Kad tā būs pieejama, katra atzīmētā rindkopa būs ar dzinēja commit un korpusa momentuzņēmuma zīmogu. Atkārtoti pārbaudot to pašu rindkopu ar to pašu commit, rezultāts būs identisks. Algoritms ir pieejams github.com/NoplagLabs/noplag-engine (Apache 2.0), norādīts uz perplexity slieksni, dokumentēta ESL pielāgotā kalibrācija. Mums nav režīma “uzticieties rezultātam”.
Kā ar ārštata autoru iesniegumiem vietās ar vāju interneta ātrumu?
Atpazīšana sākotnēji kalibrēta angļu, spāņu, portugāļu, poļu un ukraiņu valodām, ar papildu valodām vēlāk. Atpazīšanas kvalitāte salīdzināta ar PAN-PC-11; novērtējums katrai valodai ir izstrādes plānā. AI atzinums, pielāgots ESL, atzīmē nenatīvu angļu valodu kā ESL ADJ, nevis LIKELY-AI, ja leksiskais paraksts to norāda.
Vai varam darbināt uz iekšējās infrastruktūras?
Jā — Apache 2.0 dzinējs + Docker. Pilnībā darbojas lokālā tīklā. Var pārot ar savu Postgres + Redis uz Jūsu infrastruktūras; dati ārpus Jūsu VPC nenonāk. Noder, ja nepieciešama stingra avotu aizsardzība vai pirms-publicēšanas konfidencialitāte.
Vai integrējas ar mūsu CMS?
WordPress (oficiālais spraudnis), Ghost (Admin API + webhooks), Drupal (contrib modulis). Pārējām — custom CMS, headless, pašu — REST + OpenAPI 3.0 specifikācija ļauj uztaisīt pirmspublicēšanas pieslēgumu mazāk kā dienā. Python un Node SDK no specifikācijas.
Ko īsti dara sindikācijas audita funkcija?
Pievienojiet savus izplatīšanas domēnus baltajam sarakstam (medium.com/@you, partneri). Nedēļas pārmeklēšana pārbauda canonical tag statusu: ORIGIN (uzrāda uz Jums), SYND OK (uzrāda no partnera), LEAK (nav canonical vai uz citu — SEO reitinga risks), SCRAPED (kopija, nav canonical, ārpus baltā saraksta). Katram scraper variantam ir datēts momentuzņēmums DMCA vajadzībai.
Kāda cenu politika 30 žurnālistu redakcijai?
Premium par $79/mēnesī dod 5000 vārdu/pārbaudi, 5000 rakstu/mēnesī, pilnu API + CMS integrāciju. Lielām organizācijām (10 000+ rakstu/mēn.) Enterprise līgumi pēc apjoma par korpusu + infrastruktūru. Cena ir pēc apjoma, nevis 'vietas uz žurnālistu'.
Kā ar viedokļrakstiem, sindikāciju, grāmatu fragmentiem, kur sagaidāma atkārtota izmantošana?
Pro+ ļauj sliekšņus pēc sadaļas — atšķirīgas jutības ziņām, viedokļiem, pārskatām vai sindikātiem. Viedokļraksts ar Saeimas sēdes stenogrammu nav tāds pats kā ziņu raksts ar paņemtu virkni no kolēģiem. Citātu klasifikators atdala likumīgos citātus no atkārtotās izmantošanas.
Vai tas palēninās publicēšanas procesu?
Vidēji 47 s uz 1 500–4 000 vārdu rakstu. CMS integrācijas pieslēgums ir asinhrons — aktivizējas pie saglabāšanas, redaktors redz lēmumu līdz korekciju beigām. Garajiem rakstiem (8 000+ vārdi) ap 90 s, var palaist kā atsevišķu uzdevumu, nevis sinhrono procesu.
Vai varam pievienot iepriekšējos rakstus kā privāto korpusu?
Jā — Enterprise līmenī. Masveida ielāde arhīvā privātajā korpusā, lai katrs jauns iesniegums tiktu pārbaudīts arī pret Jūsu vēsturi. Atrod gan pašplagiātu, gan apzinātu atkārtotu izmantošanu ar citu autorību.

Palaidiet melnrakstu cauri rindai. Skatiet pārskatu pa rakstam.

Ielādējiet Word dokumentu, Google Doc vai CMS eksportētu rakstu. Atskaites pa paragrāfiem 47 sekundēs. Bez maksas līdz 2 500 vārdiem, Pro plāns apjomam, Enterprise — korpusam un infrastruktūrai.

Plaģiāta pārbaude izdevējiem – pirmspublicēšanas un audits