Antyplagiat dla dziennikarzy – narzędzie przed publikacją
Samosprawdzenie materiału przed wysłaniem do redaktora. Wykrywa parafrazy i fragmenty komunikatów prasowych — wykrywanie AI wkrótce. Możesz też śledzić kto publikuje Twój podpis. Bezpłatnie do 2 500 słów; REST API do integracji, jeśli publikują Państwo przez CMS.
Cztery ścieżki dziennikarskie. Jedno autosprawdzenie.
Codzienne materiały na deadline
Redaktor zobaczy to jako kolejny — sprawdź najpierw samodzielnie.
- 30-sekundowe autosprawdzenie przy 900 słowach
- Fragmenty press-release oznaczone automatycznie
- Nakładki wire-service wykrywane przed publikacją
Długi format z własnymi badaniami
5 000 słów — cytaty z wywiadów i wcześniejszych tekstów.
- Autocytowanie: własne teksty oznaczone jako SELF-CITE
- Klasyfikacja cytatów (odróżnianie cytatu i parafrazy)
- Obsługa embarga: sprawdzanie tylko wobec nieembargowanych materiałów
Miesiące materiałów źródłowych w jednym tekście
Wykrywa przypadkowe powtórzenia cytatu bez przypisu w redakcji.
- Atrybucja źródła dla każdego akapitu
- Skan folderu dokumentów źródłowych
- DMCA-grade snapshot gdy Twój tekst zostanie przedrukowany
Wysyłka do kilku redakcji, brak własnej kontroli QA
Jesteś redaktorem; autosprawdzanie to jedyna kontrola przed wysyłką.
- Kontrola mobilna na telefonie (z terenu)
- Powtórki przez kilka redakcji oznaczone przez allowlistę
- Bezpłatny limit dla typowego pliku 2 500 słów
Trzy kroki przed naciśnięciem "wyślij".
Wpięte przez API w proces składania lub jednorazowo w panelu. Ten sam silnik. Ten sam raport. Te same 47 sekund.
01 · Sprawdź wersję roboczą
Wklej lub załaduj tekst do sprawdzenia. Dodaj allowlistę własnych tekstów i listę syndykowanych przez wire. Silnik oddziela przypadkową parafrazę własnego tekstu (dozwolona) od cudzej (nie).
02 · Weryfikuj źródła
Raport pokazuje każdy dopasowany fragment ze źródłem, statusem canonical-tag i datą snapshotu. Fragmenty press-release oznaczane jako REPRINT (w części mediów dozwolone cytowanie wprost z przypisem, w innych nie). Klasyfikacja AI na poziomie akapitu z dostosowaniem ESL wkrótce.
03 · Decyzja przed wysyłką
Sprawdź klasyfikację: cytaty z poprawną atrybucją (nie liczą się do wyniku headline), parafraza z przypisem (niska waga), parafraza bez cytowania (to poprawiasz). Po wdrożeniu AI detection — akapity uznane za AI będą wymagały adnotacji lub ręcznego przepisania wg polityki redakcji. Gdy czysto — wyślij. Raport dołączony jako ślad audytowy.
Sześć rzeczy do sprawdzenia w każdym akapicie przed publikacją.
Każda kategoria wyświetlana przy dopasowanym fragmencie. Oznacz tam, gdzie wymaga tego polityka twojej redakcji. Kryterium to „czy akceptuje to desk standardów?”.
01 · CYTAT DOSŁOWNY
Cudzysłów + przypis źródła w tym samym zdaniu. Liczone jako cytat, wykluczone z similarity score. Wykrywane również w folderze z nagraniami wywiadów, jeśli załadowane.
02 · PRESS RELEASE
Tekst zgodny z komunikatem prasowym. Tagowane jako REPRINT. W części redakcji cytowanie dozwolone z przypisem; inne (większość w USA) wymagają przepisania. Ustalaj politykę osobno w Ustawieniach.
03 · WIRE COPY
Porównanie z feedami AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA (pakiet Premium). Wire zwykle może być przetworzone zgodnie z licencją twojej redakcji; silnik oznacza źródło, żeby było jasne co jest na licencji a co jest przejęte.
04 · EMBARGO HOLDS
Dodaj embargo do tymczasowego zakresu. Rozpoznawanie embarga: dopasowanie oznaczone jako EMBARGO-OK do upływu daty, potem zwykła klasyfikacja. Praktyczne w dziennikarstwie naukowym.
05 · WYGENEROWANE PRZEZ AI (WKRÓTCE)
Prawdopodobieństwo AI na poziomie akapitu z poprawką ESL, w planie rozwoju. Z myślą o weryfikacji tekstów od freelancerów — AI-generated submissions są już częste, a ten etap wychwytuje je, zanim zobaczy je desk standardów. Metodologia otwarta (Binoculars, Hans et al. 2024).
06 · WŁASNE WCZEŚNIEJSZE TEKSTY
Allowlista historii autorstwa: wcześniejsze publikacje, adresy portfolio, Substack, archiwum Medium. Samorecykling tagowany jako SELF-CITE — typowe w longformach. Nie zawyża similarity score; zgłoszenie pojawi się do weryfikacji.
Co widzisz po 47 sekundach na pliku 1 500 słów.
Klasyfikacja po akapicie ze źródłami, statusem atrybucji, kliknięciem do fragmentu. Do obrony przed desk standardów; wyniki odtwarzalne na podstawie wersji silnika z raportu.
Trzy rzeczy gdy Twój materiał ukazuje się pod cudzym nazwiskiem.
Ustaw swój podpis jako zapytanie watch
Wklej swoje opublikowane teksty (lub listę) na watchlistę. Codzienny skan sieci wyłapie każdy nie-autoryzowany serwis publikujący fragmenty Twojego materiału — kopie 1:1, lekkie przeróbki, wersje AI. Powiadomienie zawiera link, fragmenty i znacznik czasu scrape'u.
DMCA-grade snapshot, z datą i hash
Każdy zgłoszony scrape otrzymuje snapshot HTML strony, z datą crawl, z hashem zabezpieczającym. Połączone ze znacznikem czasu oryginału (data publikacji w CMS, tweet, archiwum z Wayback Machine) daje ciąg pierwszeństwa.
Twój podpis w legalnej syndykacji
Jeśli syndykujesz do Medium, LinkedIn, Substack lub partnerów, silnik śledzi, czy tag kanoniczny wskazuje na oryginał. ORIGIN oznacza, że ranking SEO zostaje u Ciebie; LEAK to rozdzielenie rankingu. Powszechny problem LinkedIn: domyślnie kasują tag canonical.
Dwa wymogi dziennikarza, których narzędzia akademickie nie rozwiązują.
Większość wykrywaczy plagiatów stworzono nie z myślą o newsroomie. Oznaczają kopie wire jako plagiat, choć każda redakcja używa feedu AP na licencji — fałszywie wysokie wyniki, nieużyteczne przy dużej ilości tekstu. Kompletnie pomijają przypadki kradzieży podpisu, bo sprawdzają tylko zadany tekst, nie web z powielonymi Twoimi materiałami. Subskrypcja korpusu wire-service Noplag (AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA) oznacza kopie wire jako WIRE, nie PLAGIAT. Monitorowanie podpisów sprawdza sieć pod kątem przedruków z Twoim podpisem. Obie funkcje domyślnie wyłączone — to warstwa dla dziennikarzy, z którą wychodzisz poza standardowy check.
Przeczytaj przewodnik po klasyfikacji wirePytania, które naprawdę zadają dziennikarze.
- Czy projekt jest przechowywany lub wykorzystywany do trenowania modeli?
- Nie. Drafty są haszowane (winnowing hashes, nieodwracalnie) i trzymane w odizolowanej bazie tenantowej. Tekst kasowany po 30 dniach, chyba że wybrana retencja. Modele detekcji (Binoculars) trenowane wyłącznie na publicznych zbiorach; nie używamy szkiców dziennikarskich do uczenia. Jasno w DPA.
- Jak działa klasyfikacja wire?
- Pakiet Premium z subskrypcją korpusu wire-service (AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA). Dopasowania 1:1 z feedem oznaczane jako WIRE, nie PLAGIAT — każda redakcja używa feedu na licencji. Ustawiaj politykę wg outletu: jedni pozwalają na cytaty wire bez limitu, inni wymagają przypisu. Klasyfikacja widoczna przy każdym fragmencie.
- Jak obsługiwane są komunikaty prasowe?
- Sprawdzane z publicznym indeksem press-release (PR Newswire, Business Wire, EurekAlert, PRWeb). Tagowane jako REPRINT. Niektóre redakcje pozwalają cytować wortatim z przypisem; inne (gł. USA) wymagają przepisania. Ustaw politykę w Ustawieniach; raport wskaże wymaganą akcję.
- Jak detekcja AI obsłuży teksty od freelancerów?
- Wykrywanie AI pojawi się wkrótce (na roadmapie v1.2). Po wdrożeniu będzie wskazywać prawdopodobieństwo AI dla każdego akapitu, z werdyktem uwzględniającym cechy pisania przez osoby z ESL — rozwiązanie dla redakcji sprawdzających teksty od freelancerów, bo zgłoszenia generowane przez AI są coraz częstsze. Skala ESL jest istotna, bo wzorce pisania osób niebędących native speakerami pokrywają się z sygnaturami AI (Stanford 2023 wykazał 61,3% FPR dla naiwnych detektorów); nasza kalibracja ma znacząco obniżyć ten wskaźnik, a pozostały poziom błędów zostanie opublikowany po zakończeniu ewaluacji funkcji.
- Czy mogę monitorować publikacje pod własnym nazwiskiem?
- Pakiet Premium z byline-watch. Dodaj publikacje do listy watch; codzienny skan sieci sprawdza nieautoryzowane domeny powielające Twoje materiały. Każdy alert to snapshot HTML z datą scrape, z hashem — dowód DMCA. Nie wysyłamy DMCA (to decyzja prawnika); dajemy tylko dokumentację.
- Jak działa obsługa embarga?
- Dodaj materiały pod embargo do zakresu tymczasowego z datą. Do daty dopasowanie tagowane EMBARGO-OK, po upływie wraca do normalnej klasyfikacji. Przydatne w nauce (rutynowe embargo NIH/EurekAlert) czy polityce (transkrypty po posiedzeniach Kongresu).
- Czy działa w innych językach niż angielski?
- Wykrywanie jest skalibrowane dla języka angielskiego, hiszpańskiego, portugalskiego, polskiego i ukraińskiego na start; kolejne języki będą dodawane. Jakość wykrywania jest porównywana z PAN-PC-11; ocena jakości dla poszczególnych języków jest w planach. Przydatne dla korespondentów międzynarodowych piszących w kilku językach.
- Co oferuje API do integracji z newsroomowym CMS?
- REST + specyfikacja OpenAPI 3.0. SDK dla Pythona i Node generowane ze specyfikacji. Webhooki do asynchronicznych sprawdzeń dłuższych tekstów. POST /v1/checks z poziomu CMS przy save_draft; raport dołączany do artykułu jako metadane audytowe. Przykładowe integracje z WordPress, Ghost i Drupal na github.com/NoplagLabs/noplag-engine.
- Co jeśli jestem freelancerem bez wsparcia newsroomu?
- Bezpłatnie: 2 500 słów na check, bez limitu liczby checków, bez rejestracji. Możliwy check na telefonie z terenu. Premium (79 $/mc) z wire-classification, byline-watch, folder-level. Self-host też Apache 2.0 free — do uruchomienia lokalnie.
- Co, jeśli źródłowy cytat okazuje się wygenerowany przez AI?
- Gdy ruszy AI detection (wkrótce), przy każdym akapicie AI-poziom z poprawką ESL. Jeśli cytat przypisany do źródła wyjdzie jako AI-likely, to flaga edytorska — źródło mogło wygenerować cytat przez AI, mogło parafrazować AI, lub to fałszywy alarm. Traktuj jako sygnał do dodatkowej weryfikacji cytatu, nie automatyczne wykluczenie.
Sprawdź, zanim zrobi to redaktor.
Wklej materiał do sprawdzenia. Raport po akapicie w 47 sekund: cytaty, overlaye wire, autocytowanie, wkrótce AI-likelihood. Bezpłatnie do 2 500 słów. Premium — korpus wire i byline-watch.