Plaģiāta pārbaude izdevējiem – pirmspublicēšanas un audits
Pārbaudes pirms publicēšanas ārštata autoru materiāliem, sindikācijas audits pārepublicētam saturam un REST API, ko Jūsu inženierija var integrēt esošajā CMS. Dzinējs — Apache 2.0. Lasāms pirms ieviešanas, ne pēc.
Četras nodaļas. Viens process.
Izvērtējiet ārštata piedāvājumu pirms uzdevuma izsniegšanas
10 minūtes uz iesniegumu, pirms budžeta piešķiršanas rediģēšanai.
- Ielīmējiet melnrakstu vai fragmentu, skatiet iepriekšējās publikācijas
- AI varbūtība pa paragrāfiem (drīzumā), ņem vērā ESL
- Nav jāatkārtojas ar jautājumu 'vai tas ir oriģināls?'
Aizvadiet dienas rindas pirms preses
Masveida pārbaude visiem dienas rakstiem pirms CMS publicēšanas rindas.
- Rindas skats pēc līdzības un AI rezultāta
- Sliekšņi pa sadaļām (viedokļraksti, ziņas, recenzijas)
- Audita pēdas pēc autora (standartu nodaļai)
Izmeklējiet apstrīdētu iesniegumu
Lasiet algoritma darbību, tad saskaņotos fragmentus.
- X-Engine-Commit reproducējamība
- Pārrakstiet rezultātu ar dokumentētu iemeslu
- Apache 2.0 — aizstāvams korekciju pārskatā
Auditējiet partneru pārpublicēšanu
Sekojiet canonical tag stāvoklim sindikācijas tīklā.
- Canonical-atpazīšanas pārbaude (ORIGIN / SYND OK / LEAK)
- Nedēļas atšķirību atskaite pēc partnera
- DMCA-klases pierādījumu pakotne pēc pieprasījuma
Trīs soļi pirms raksta nonākšanas CMS rindā.
Iebūvēts Jūsu redakcionālajā plūsmā caur API, izpildāms masveidā pirms preses vai atsevišķi panelī. Tas pats dzinējs, tā pati atskaites forma, pielāgojas vietai.
01 · Saņemšana
Iesniegums nonāk Jūsu CMS rindā — ievelciet .docx / .gdoc, ielīmējiet vai CMS nosūta caur webhook. Autora, sadaļas un redaktora metadati nonāk kopā ar dokumentu uz audita žurnālu.
02 · Skatīt un klasificēt
Pārbaude notiek pret atvērto tīmekli, Common Crawl un (pēc izvēles) Jūsu pašu arhīva korpusu. Citātu klasifikācija atdala tiešas citācijas (ar norādi) no necitēta pārrakstījuma. AI iespējamība pa paragrāfiem drīzumā, ņem vērā ESL. Vidēji 42 sekundes uz rakstu.
03 · Lēmums un publicēšana
Redaktors redz: virsrakstu līdzību, sadalījumu pa kategorijām, šķirojamu avotu sarakstu (AI rezultāts ar ESL atzīmi drīzumā). Trīs rīcības: publicēt, atgriezt ar piezīmēm, pārsūtīt uz standartu nodaļu. Lēmums tiek reģistrēts ar engine commit un korpusa momentuzņēmumu.
Četras CMS vides. Viens REST līgums.
Pievienojiet Noplag CMS sistēmā, ko jau lieto Jūsu žurnālisti. API saskarne nemainās — atšķiras tikai integrācijas slānis (WordPress hooks, Ghost actions, Drupal notikumi vai Jūsu webhooks).
Oficiālais spraudnis no WordPress.org Plugins Directory. Savietojams ar Gutenberg.
- Pirmspublicēšanas meta-logs katram ieraksta tipam
- Izcelšana blokos redaktorā
- Audita žurnāls caur WP REST API
Webhook integrācija + Admin API. Atbalsta dalībnieku saturu.
- Webhook pirms publicēšanas aktivizējas saglabājot melnrakstu
- Tagu līmeņa pārbaudes politika pēc satura veida
- Savietojams pašpārvaldītām instalācijām (Noplag + Ghost self-host)
Contrib modulis no drupal.org. Lauku-API piesaiste.
- Plaģiātisma lauks pēc satura veida
- Workflou integrācija ar Content Moderation
- Multi-vietņu konfigurācija atbalstīta
Webhooks + OpenAPI 3.0 specifikācija. Priekš headless CMS, pašu sistēmām vai jebkam citam.
- POST /v1/checks no jebkura CMS hook
- HMAC-parakstīti webhook zvani
- Python + Node SDK pieejami no OpenAPI specifikācijas
Šodienas publicēšanas rinda. Šķirojama, auditēta.
Katra raksta rinda ar autoru, sadaļu, līdzības procentu, AI rezultātu, ar iespēju atvērt izcelto atskaiti. Šķirojama. Masveida apstiprināšana drošiem rakstiem, pārējos — pārsūtīšana tālāk.
Redziet, kas Jūs pārpublicē — un vai canonical tag norāda uz Jūsu lapu.
Uzraugiet savu izplatīšanas tīklu
Pievienojiet domēnus, kuros veicat sindikāciju (Medium, LinkedIn, Substack, partneri) baltajam sarakstam. Nedēļas pārmeklēšana atskaita, kuri partneri izmanto rel=canonical uz Jūsu lapu (ORIGIN), kuriem tas nav (SEO noplūde), kuri pārpublicē bez atļaujas (SCRAPED).
No kura bloga Jūsu vārds pazudis?
Atvērtā tīmekļa ikmēneša pārbaudes atrod ārpus baltā saraksta domēnus, kas publicē Jūsu rakstu fragmentus. Katrā sakritībā ir datēts momentuzņēmums — DMCA līmeņa pierādījums ar datumu, kad raksts parādījies. Mēs DMCA nepārvaldām (tas ir juridisks lēmums); mēs piedāvājam pierādījumu kopu.
Iekšējā dublēšanās Jūsu pašu lapās
Pro līmeņa pārbaude pa mapēm: ielādējiet savu publicēto rakstu kolekciju mapē; dzinējs izveido līdzības matricu pārī starp visiem. Atklāj 47 pilsētu lapas ar vienu un to pašu ievadrindkopu — risks 'Helpful-Content-Update', par ko būtu jāzina pirms Google pamanījis.
Trīs politikas, ko standartu nodaļa prasīs pirms līguma slēgšanas.
Pirmkārt — iesniegtie raksti nekad netiek izmantoti modeļa apmācībai. Ne mūsu, ne citu. Iesniegtais teksts tiek pirkstu nospiedumu veidā indeksēts jūsu nomnieka vidē un dzēsts pēc 30 dienām, ja vien nav norādīta ilgāka saglabāšana. Otrkārt — AI satura atpazīšana (drīzumā, izstrādes plānā) būs pa rindkopām, nevis visam rakstam, un katrs rezultāts būs marķēts ar dzinēja commit un korpusa momentuzņēmuma laika zīmogu. Ja AI atzīme tiek apstrīdēta, to varēs atkārtot pēc vairākiem mēnešiem ar to pašu commit. Klusa pārapmācība nenotiek. Treškārt — Apache 2.0 licence ļauj jūsu inženieriem klonēt github.com/NoplagLabs/noplag-engine, darbināt to savā infrastruktūrā, auditēt datu plūsmu un pārbaudīt dzēšanas tiesību ceļu pilnā apjomā. Lielākā daļa institucionālo iepirkumu pārskatu par plaģiāta pārbaudēm apstājas pie šiem trim jautājumiem; mēs centāmies uz tiem atbildēt jau sākumā.
Izlasiet standartu nodaļas rokasgrāmatuKas patiesībā interesē standartu nodaļu pirms iepirkuma.
- Vai mūsu raksti tiks izmantoti Jūsu AI modeļa apmācībai?
- Nē. Iesniegtie raksti tiek nospiedumoti (tikai winnowing hashes) un indeksēti nomnieka datubāzē. Teksts pats tiek dzēsts pēc 30 dienām, ja vien Jūs neizvēlaties saglabāt ilgāk. AI noteikšanas modelis — Binoculars-based (Hans et al. 2024), drīzumā — tiks apmācīts tikai uz publiskām kopām; klientu saturs netiek pievienots. Tas ir skaidri noteikts DPA.
- Kā AI lēmums pa paragrāfiem būs izmantojams reportiera iebildumu gadījumā?
- AI satura atpazīšana drīzumā — tā ir v1.2 izstrādes plānā, bet nebūs pieejama uzreiz. Kad tā būs pieejama, katra atzīmētā rindkopa būs ar dzinēja commit un korpusa momentuzņēmuma zīmogu. Atkārtoti pārbaudot to pašu rindkopu ar to pašu commit, rezultāts būs identisks. Algoritms ir pieejams github.com/NoplagLabs/noplag-engine (Apache 2.0), norādīts uz perplexity slieksni, dokumentēta ESL pielāgotā kalibrācija. Mums nav režīma “uzticieties rezultātam”.
- Kā ar ārštata autoru iesniegumiem vietās ar vāju interneta ātrumu?
- Atpazīšana sākotnēji kalibrēta angļu, spāņu, portugāļu, poļu un ukraiņu valodām, ar papildu valodām vēlāk. Atpazīšanas kvalitāte salīdzināta ar PAN-PC-11; novērtējums katrai valodai ir izstrādes plānā. AI atzinums, pielāgots ESL, atzīmē nenatīvu angļu valodu kā ESL ADJ, nevis LIKELY-AI, ja leksiskais paraksts to norāda.
- Vai varam darbināt uz iekšējās infrastruktūras?
- Jā — Apache 2.0 dzinējs + Docker. Pilnībā darbojas lokālā tīklā. Var pārot ar savu Postgres + Redis uz Jūsu infrastruktūras; dati ārpus Jūsu VPC nenonāk. Noder, ja nepieciešama stingra avotu aizsardzība vai pirms-publicēšanas konfidencialitāte.
- Vai integrējas ar mūsu CMS?
- WordPress (oficiālais spraudnis), Ghost (Admin API + webhooks), Drupal (contrib modulis). Pārējām — custom CMS, headless, pašu — REST + OpenAPI 3.0 specifikācija ļauj uztaisīt pirmspublicēšanas pieslēgumu mazāk kā dienā. Python un Node SDK no specifikācijas.
- Ko īsti dara sindikācijas audita funkcija?
- Pievienojiet savus izplatīšanas domēnus baltajam sarakstam (medium.com/@you, partneri). Nedēļas pārmeklēšana pārbauda canonical tag statusu: ORIGIN (uzrāda uz Jums), SYND OK (uzrāda no partnera), LEAK (nav canonical vai uz citu — SEO reitinga risks), SCRAPED (kopija, nav canonical, ārpus baltā saraksta). Katram scraper variantam ir datēts momentuzņēmums DMCA vajadzībai.
- Kāda cenu politika 30 žurnālistu redakcijai?
- Premium par $79/mēnesī dod 5000 vārdu/pārbaudi, 5000 rakstu/mēnesī, pilnu API + CMS integrāciju. Lielām organizācijām (10 000+ rakstu/mēn.) Enterprise līgumi pēc apjoma par korpusu + infrastruktūru. Cena ir pēc apjoma, nevis 'vietas uz žurnālistu'.
- Kā ar viedokļrakstiem, sindikāciju, grāmatu fragmentiem, kur sagaidāma atkārtota izmantošana?
- Pro+ ļauj sliekšņus pēc sadaļas — atšķirīgas jutības ziņām, viedokļiem, pārskatām vai sindikātiem. Viedokļraksts ar Saeimas sēdes stenogrammu nav tāds pats kā ziņu raksts ar paņemtu virkni no kolēģiem. Citātu klasifikators atdala likumīgos citātus no atkārtotās izmantošanas.
- Vai tas palēninās publicēšanas procesu?
- Vidēji 47 s uz 1 500–4 000 vārdu rakstu. CMS integrācijas pieslēgums ir asinhrons — aktivizējas pie saglabāšanas, redaktors redz lēmumu līdz korekciju beigām. Garajiem rakstiem (8 000+ vārdi) ap 90 s, var palaist kā atsevišķu uzdevumu, nevis sinhrono procesu.
- Vai varam pievienot iepriekšējos rakstus kā privāto korpusu?
- Jā — Enterprise līmenī. Masveida ielāde arhīvā privātajā korpusā, lai katrs jauns iesniegums tiktu pārbaudīts arī pret Jūsu vēsturi. Atrod gan pašplagiātu, gan apzinātu atkārtotu izmantošanu ar citu autorību.
Palaidiet melnrakstu cauri rindai. Skatiet pārskatu pa rakstam.
Ielādējiet Word dokumentu, Google Doc vai CMS eksportētu rakstu. Atskaites pa paragrāfiem 47 sekundēs. Bez maksas līdz 2 500 vārdiem, Pro plāns apjomam, Enterprise — korpusam un infrastruktūrai.