Antyplagiat dla wydawców pre-publikacja i audyt
Sprawdzenie przed publikacją dla zgłoszeń od freelancerów, audyt syndykacji dla publikowanych ponownie treści oraz REST API, które zespół techniczny doda do CMS. Silnik Apache 2.0 — czytelny przed wdrożeniem, nie po.
Cztery zespoły. Jeden workflow.
Ocena zgłoszenia od freelancera przed zleceniem
10 minut na zgłoszenie — zanim budżet edytorski zostanie przydzielony.
- Wklej wersję roboczą lub fragment, zobacz poprzednie publikacje
- Prawdopodobieństwo AI dla akapitu (wkrótce), z uwzględnieniem ESL
- Bez wymiany zdań typu “czy to jest oryginalne?”
Skanowanie bieżącej kolejki przed publikacją
Skany zbiorcze wszystkich dzisiejszych tekstów przed umieszczeniem ich w kolejce publikacji CMS.
- Widok kolejki sortowany po podobieństwie + wynik AI
- Progi dla sekcji (felieton, news, recenzja)
- Ślad audytowy według autora dla standardów redakcji
Analiza spornego zgłoszenia
Najpierw odczytaj algorytm, potem sprawdź odebrane fragmenty.
- Odtwarzalność dzięki X-Engine-Commit
- Możliwość zmiany werdyktu z uzasadnieniem
- Apache 2.0 — z możliwością obrony przy korektach
Audyt partnerów, którzy przedrukowują
Monitoring tagów kanonicznych w sieci syndykacyjnej.
- Wykrywanie tagu kanonicznego (ORIGIN / SYND OK / LEAK)
- Cotygodniowy raport różnic dla partnera
- Pakiet dowodowy klasy DMCA na żądanie
Trzy kroki przed dopuszczeniem tekstu do publikacji w CMS.
Wbudowane w przepływ pracy przez API, uruchamiane zbiorczo przed publikacją lub jednorazowo w panelu. Ten sam silnik, ten sam raport, dopasowanie do procesu.
01 · Przyjęcie
Tekst trafia do kolejki CMS — przeciągnij i upuść .docx / .gdoc / wklej, lub CMS przesyła przez webhook. Dane autora, sekcji i przydzielonego redaktora zapisują się z dokumentem w dzienniku audytów.
02 · Skan + klasyfikacja
Kaskada porównuje do otwartego webu, Common Crawl i (opcjonalnie) własnego archiwum. Klasyfikacja cytatów rozróżnia cytaty (ze źródłem) od parafraz niepodanych w przypisach. Prawdopodobieństwo AI per akapit — wkrótce; z uwzględnieniem ESL. Mediana czasu: 42 s na tekst.
03 · Decyzja + publikacja
Redaktor widzi: podobieństwo nagłówka, podział na kategorie, listę źródeł (wynik AI z oznaczeniem ESL — wkrótce). Trzy akcje: publikuj, odeślij z notatkami, eskaluj do działu standardów. Decyzja logowana z engine commit + snapshotem korpusu.
Cztery platformy CMS. Jeden REST API.
Podłącz Noplag do CMS używanego przez reporterów. API pozostaje takie samo — różni się tylko warstwa integracji (WordPress hooks, Ghost actions, Drupal events, albo własne webhooks).
Oficjalna wtyczka z WordPress.org Plugins Directory. Kompatybilna z Gutenbergiem.
- Metabox prepublikacyjny dla każdego typu posta
- Podświetlanie bloków w edytorze
- Log audytowy przez WP REST API
Integracja przez webhook i Admin API. Zgodność z treściami dla subskrybentów.
- Webhook prepublikacyjny wywoływany przy save_draft
- Polityka skanowania na poziomie tagu dla typu treści
- Możliwość samodzielnego hostowania (Noplag self-host + Ghost self-host)
Moduł pomocniczy z drupal.org. Montaż przez Field API.
- Pole do wykrywania plagiatu dla każdego typu treści
- Integracja z workflow Content Moderation
- Obsługa konfiguracji multisite
Webhooks + specyfikacja OpenAPI 3.0. Dla headless CMS, systemów własnych, czy innych.
- POST /v1/checks z dowolnego webhooka CMS
- Webhooki podpisane HMAC
- SDK dla Pythona i Node na bazie OpenAPI spec
Dzisiejsza kolejka publikacji. Sortowalna, z dziennikiem audytu.
Wiersz na każdy artykuł: autor, sekcja, podobieństwo, AI-score i klik do zaznaczonego raportu. Sortowalne. Można hurtowo zatwierdzać bezpieczne teksty, resztę eskalować.
Zobacz, kto publikuje Twoje treści — i czy rel=canonical wskazuje do oryginału.
Monitoring sieci dystrybucji
Podaj domeny, do których syndykujesz (Medium, LinkedIn, Substack, partnerzy sieci) jako allowlist. Cotygodniowy crawl raportuje, który partner ma rel=canonical kierujący na oryginał (ORIGIN), który nie — (LEAK) lub odtwarza bez pozwolenia (SCRAPED).
Na czyim blogu brakuje Twojego nazwiska?
Miesięczne skany open-web ujawniają niezastrzeżone domeny publikujące te same fragmenty. Match ze stemplem czasowym — dowód DMCA, datowany na dzień pojawienia się kopii. Nie zgłaszamy DMCA (to decyzja prawna); dostarczamy dokumentację.
Duplikaty własnych treści
Skanowanie na poziomie folderu: wrzuć archiwum. Silnik tworzy macierz podobieństw dla każdej pary. Wychwyci np. 47 stron-miast z tym samym akapitem — ryzyko Helpful-Content-Update przed Google.
Trzy polityki, jakich dział standardów wymaga przed zakupem oprogramowania.
Po pierwsze — przesłane artykuły nigdy nie służą do trenowania modeli. Ani naszych, ani żadnych innych. Przesłany tekst jest oznaczany odciskiem, indeksowany w ramach Twojego tenant'a i usuwany po 30 dniach, chyba że zostanie wyraźnie zachowany. Po drugie — werdykt AI (wkrótce, w planach rozwoju) będzie wydawany dla każdego akapitu osobno, a nie dla całego artykułu, i opatrzony oznaczeniem commita silnika oraz znacznikiem czasu migawki korpusu. Sporny flag AI będzie można odtworzyć po miesiącach na tym samym commicie. Bez cichego ponownego trenowania. Po trzecie — licencja Apache 2.0 pozwala Twojemu zespołowi technicznemu sklonować github.com/NoplagLabs/noplag-engine, uruchomić go na własnej infrastrukturze, przeanalizować przepływ danych i zweryfikować ścieżkę usuwania danych end-to-end. Większość przetargów instytucjonalnych na oprogramowanie antyplagiatowe zatrzymuje się na tych trzech kwestiach; staraliśmy się odpowiedzieć na nie z góry.
Przeczytaj przewodnik standardówNa co dział standardów pyta przed wyborem.
- Czy nasze artykuły będą trenować wasz model AI?
- Nie. Zgłoszone teksty są fingerprintowane (tylko winnowing hash) i indeksowane w wydzielonej bazie. Sam tekst jest kasowany po 30 dniach, jeśli nie wybiorą Państwo opcji zatrzymania. Model AI — oparty o Binoculars (Hans et al. 2024), na roadmapie — będzie trenowany publicznie. Nie włączamy żadnych danych klientów. Wyraźnie opisane w DPA.
- Jak przetrwa decyzja AI na poziomie akapitu przy sporze z autorem?
- Wykrywanie AI pojawi się wkrótce — jest na roadmapie v1.2, nie będzie dostępne na starcie. Po wdrożeniu każdy oznaczony akapit będzie opatrzony commitem silnika i migawką korpusu. Ponowne sprawdzenie tego samego akapitu na tym commicie da identyczny wynik. Algorytm jest dostępny na github.com/NoplagLabs/noplag-engine (Apache 2.0), można wskazać próg perplexity i udokumentować kalibrację z uwzględnieniem ESL. Nie oferujemy trybu „zaufaj wynikowi”.
- Freelancerzy z rynków niskopasmowych — obsługiwani?
- Wykrywanie jest skalibrowane dla języka angielskiego, hiszpańskiego, portugalskiego, polskiego i ukraińskiego na starcie; kolejne języki będą dodawane. Jakość wykrywania jest porównywana z PAN-PC-11; ocena jakości dla poszczególnych języków jest w planach. Werdykt AI z korektą ESL oznacza tekst pisany przez osobę niebędącą native speakerem angielskiego jako ESL ADJ zamiast LIKELY-AI, jeśli sygnatura leksykalna na to wskazuje.
- Self-host w infrastrukturze redakcji?
- Tak — silnik Apache 2.0 + Docker. Wszystko wewnątrz sieci. Możliwe z własną bazą Postgres + Redis; nie wypływa żadna treść. Dla redakcji chroniących źródła lub objętych klauzulami poufności.
- Integruje się z naszym CMS?
- WordPress (oficjalna wtyczka), Ghost (Admin API + webhooks), Drupal (moduł społeczności). Pozostałe — własny CMS, headless, w środowisku — REST + OpenAPI 3.0 umożliwia podłączenie prepublikacyjne w jeden dzień. SDK Python/Node na bazie spec.
- Co daje funkcja audytu przedruków?
- Dodaj domeny do allowlisty (medium.com/@ty, domeny partnerów). Cotygodniowy crawl — zdrowie canonical-tag: ORIGIN (do Ciebie), SYND OK (do Ciebie przez partnera), LEAK (brak, inny — split SEO), SCRAPED (kopia dosłowna, bez canonical, domena nie na liście). SCRAPED — snapshot DMCA.
- Jak rozliczane ceny dla redakcji 30-osobowej?
- Premium: 79$/mies., 5 000 słów/skan, 5 000 artykułów/mies., pełne API + CMS. Dla większych (10 000+ artykułów/mies.) — Enterprise, wycena wg korpusu i infrastruktury. Nie na liczbę użytkowników; liczy się wolumen.
- Co z tekstami typu felieton, syndykacja, fragment książki, gdzie „reuse” jest naturalny?
- Pro+ pozwala ustawić progi na sekcje — osobny dla news, felieton, recenzja, przedruk. Op-ed cytujący dosłownie wystąpienie Senatu nie wzbudzi takiej samej reakcji jak news kopiuąjący frazy konkurencji. Klasyfikacja cytatów oddziela cytat legitny od nieświadomego zapożyczenia.
- Zwollni pipeline publikacji?
- Mediana: 47 s na tekst 1 500–4 000 słów. Integracja z CMS async — wywołanie na save_draft, werdykt widoczny po korekcie. Długie (8 000+ słów) ok. 90 s i można puścić przed publikacją jako osobny job.
- Możemy podpiąć archiwum jako prywatny korpus?
- Tak, Enterprise. Bulk-ingest archiwum do wydzielonego korpusu, każdy nowy tekst sprawdzany względem własnego archiwum. Wyłapuje self-recycling (czasem uzasadniony, czasem nie) i celowe powtórzenia pod nowym nazwiskiem.
Wrzuć wersję roboczą do kolejki. Zobacz widok artykułu.
Dodaj plik Word, Google Doc lub tekst wyeksportowany z CMS. Raport per akapit w 47 sekund. Do 2 500 słów bez opłat; Pro dla większych wolumenów; Enterprise — własny korpus i infrastruktura.