Antyplagiat online do sprawdzania duplikatów treści
Znajdź powieloną treść w internecie, własnych folderach i bibliotece zespołu. Obsługuje canonical — odróżnia legalną syndykację od kopii. Za darmo do 2 500 słów; skanowanie folderów w wersji Pro.
Cztery typy duplikatów. Inna diagnoza, inne rozwiązanie.
Większość “wykrywaczy duplikatów” łapie tylko identyczne fragmenty. My klasyfikujemy każdy wynik do jednej z czterech kategorii, żeby wiadomo było, co można pominąć (legalny cytat), co skanonizować (syndykacja), a co przepisać (kopie lub spinner).
Słowo w słowo
Identyczny ciąg znaków (30+). Obejmuje wklejone boilerplate, artykuły publikowane na kilku stronach, kopie ze scraperów.
Lekkie przeredagowanie
Zachowany kształt zdania, zamienione synonimy lub przestawione przymiotniki. Klasyczny “spin”. Wyłapuje to, czego Copyscape celowo nie wykrywa.
Agresywna parafraza
Przestawianie składni na poziomie zdania, zamiana czasów, wstawianie wypełniaczy. Typowe dla narzędzi AI do parafrazowania i content-mill.
Stały fragment na wielu stronach
Ta sama klauzula, bio autora lub opis produktu powielone na setkach własnych podstron — prawdziwy problem Google z duplikatami.
To nie tylko „kopiuj-wklej z innej strony”.
Rzeczywiste zasady Google (z dokumentacji Search Central): trzy wzorce uruchamiają filtr na duplikaty i większość dotyczy własnej strony, nie skopiowanych konkurentów.
Kopie między domenami bez canonical
Ten sam artykuł na wielu stronach bez rel=canonical wskazującego oryginał. Obejmuje syndykację źle skonfigurowaną, niezgłoszone kopie konkurencji i przypadkowe duplikowanie gdy autor publikuje w dwóch miejscach.
Ta sama treść pod wieloma adresami na własnej stronie
/product/foo i /product/foo?utm_source=email i /product/foo/ ze slashem. Facetowana nawigacja (filtry tworzące identyczne strony), wersje do druku bez canonical, osobne adresy mobile i desktop. Google grupuje, wybiera jedną stronę, resztę pomija.
Boilerplate udający treść
Strona kategorii e-commerce z pięcioma identycznymi akapitami opisu w 1 200 produktach. Strona 'lokalizacje', gdzie 'Nasz zespół ma 20 lat doświadczenia' powtarza się w 47 podstronach. Thin-content duplikat — Google’s Helpful Content Update oznacza to agresywnie.
Sześć zespołów robi te testy co tydzień.
To samo narzędzie, sześć różnych scenariuszy — od blogera przed publikacją po audyt agencji treści kupowanych na zewnątrz.
Bloger — sprawdzenie przed publikacją
Porównaj szkic z aktualną siecią przed publikacją. Wychwyci nieświadome powtarzanie fraz z własnych tekstów archiwalnych, artykułów konkurencji oraz błędy AI-rewriterów.
Wykrywanie kopiowania przez konkurencję
Wklej swój artykuł i zobacz, kto jeszcze go publikuje. Przydatne przy dokumentacji DMCA — każdy duplikat daje link źródłowy, zakres dopasowania i snapshot z datą do folderu.
Porządkowanie biblioteki treści
Funkcja Pro — skan folderów. Wrzucasz całą bibliotekę zespołu; narzędzie wykrywa powielenia między artykułami — ten sam akapit w trzech tekstach, boilerplate do przeniesienia do szablonu.
Audyt syndykacji
Przekazałeś tekst na Medium, LinkedIn, Substack. Czy wszędzie wskazane rel=canonical do źródła? Narzędzie sprawdza każdy adres, tag canonical i mówi, gdzie wycieka SEO.
Kontrola jakości tekstów zleconych
Treść od freelancera w jednym panelu. Sprawdź zanim zapłacisz. Wyłapuje częste wzorce — kopia i spin, ślad AI, cytaty bez źródła.
AI — pochodzenie treści
Asystenci AI pobierają teksty z realnych stron. Narzędzie wyłapuje te fragmenty — Ty decydujesz: cytować, przepisać, wyrzucić. Minimalizuje ryzyko pod Helpful Content Update.
Wrzuć bibliotekę. Zobacz co się powiela.
Funkcja Pro. Wybierz folder z publikacjami; silnik tworzy macierz podobieństwa dla każdej pary. Do sortowania po nakładaniu fragmentów, przejście do kolidujących akapitów po kliknięciu.
- 150M+zindeksowane strony
- 30dczęstotliwość aktualizacji indeksu
- 94%skuteczność wykrycia canonical
- 4poziomy klasyfikacji duplikatu
- 2014indeksowanie Common Crawl
Trzy rzeczy, których nie wykryje przeglądarkowy checker lub pakiet SEO.
Tylko ścisłe dopasowanie (standard Copyscape). Przestawione zdanie przechodzi jako “unikatowe” — spinowany tekst czysty. Przydatne przy prostym kopiowaniu; nieprzydatne przy audycie treści.
Noplag: 4-poziomowa klasyfikacja (Identyczny / Prawie-dup / Parafraza / Boilerplate) z wskazaniem intencji — fakty do działania, nie tylko flaga 0/1.
Oferują narzędzie do unikatowości za 99–499 USD/m-c. Ograniczone do prostych n-gramów; brak indeksu Common Crawl; brak skanu między dokumentami.
Noplag: osobna wersja Free (2 500 słów). Pro (23 USD/m-c) to skanowanie folderów i pełny indeks 150M+ — bez spinania tego z kosztownym pakietem SEO.
Czarna skrzynka. Nie widać, który tekst się dopasował — tylko liczba podobieństwa. Zwykle limit 1 000 słów. Indeks często stary — testujesz na snapshot sprzed kilku lat.
Noplag: każdy duplikat pokazuje URL + canonical + zakres + datę snapshotu. Apache 2.0 — można zajrzeć w algorytm.
Artykuł z rel=canonical nie jest „duplikatem”. Tak go klasyfikujemy.
Gdy artykuł pojawia się pod wieloma adresami, w SEO liczy się nie 'czy identyczne', tylko 'czy wszystkie wskazują canonical'. Jeśli Twój gościnny post na Medium ma rel=canonical do źródłowego URL, Google grupuje je, przypisuje ranking do oryginału, a resztę traktuje jako legalną syndykację. Jeśli nie — konkurujesz z własną powieloną treścią. Narzędzie pobiera każdy wynik, parsuje tag <link rel="canonical"> i oznacza każdy wynik: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK albo SCRAPED.
Pytania, które padają przed wdrożeniem.
Jaka jest skala indeksu w porównaniu z Copyscape lub SEMrush?
Indeksuje 150M+ stron z Common Crawl i kluczowych domen SEO, aktualizowany co 30 dni. Szerszy niż dokładny-tylko indeks Copyscape (~120M, skupiony na plagiatach i boilerplate), węższy niż pełny crawl Google, ale z wykazem pokrycia i publicznym planem aktualizacji. W wersji Pro możesz dodać własny folder jako prywatny korpus.
Jak dokładnie działa wykrywanie canonical?
Dla każdej dobranej strony silnik pobiera URL (z cache lub na żywo), parsuje <head> i wyciąga rel=canonical. Wyniki to ORIGIN (canonical do siebie), SYND-OK (canonical do innej własnej strony), LEAK (canonical brak/lub gdzie indziej), SCRAPED (brak canonical poza siecią dystrybucji). Typ pokazywany przy każdym wyniku, więc Twój procent duplikatów jest uczciwy.
Czy wykryje powtórki tekstu generowanego przez AI?
Tak — asystenty AI pobierają fragmenty z realnych stron. Te fragmenty pojawią się jako Prawie-dup lub Parafraza z URL źródła. Możesz je cytować, przetworzyć lub usunąć. Wykrywanie generowanej treści (osobny sygnał) to inne narzędzie — na roadmapie, jeszcze niedostępne — tutaj tylko skan duplikatów.
Jaki jest maksymalny rozmiar skanowanego dokumentu?
2 500 słów w wersji Free, 50 000 w Premium, 250 000+ w Enterprise (lub bez limitu na self-host). Przy skanowaniu folderów — folder do 2 000 dokumentów; cała macierz par skanowana w <5 min przy takim rozmiarze.
Czy znajdzie kopiujących konkurentów?
Jeśli skopiowana treść jest w indeksie (publiczna, crawlable), tak — URL pojawi się na liście ze snapshotem z datą. Snapshot to dowód DMCA: oznaczona data, hashowana treść, podświetlone fragmenty. DMCA nie składamy — to decyzja prawna — dokumentację masz od nas.
Czy można wykluczyć własną sieć syndykacji z wykrywania?
Funkcja Pro — możesz dodać allowlist domen pod kontrolą (medium.com/@you, linkedin.com/in/you, substack.com/p/you). Dopasowania na allowlist są oznaczane jako SYND-OK i nie liczą się do wyniku duplikatów. Wynik pokazuje 'nieoczekiwane', a nie 'wszystkie' duplikaty.
Jak działa skan par w folderze z 500 artykułami?
Retrieval cascade to O(n log n) na każdą parę — fingerprinty filtrują kandydatów 60-bitowym hashem, pełne dopasowanie tylko na finalistach. 500 artykułów = 124 750 par w ok. 4 min na 4 rdzeniowym CPU. Macierz eksportowana do CSV pod dalsze przetwarzanie.
Czy silnik jest rzeczywiście open source?
Tak — github.com/NoplagLabs/noplag-engine, Apache 2.0. Repozytorium zawiera moduły: dzielenie tekstu, odcisk palca, kaskadę wyszukiwania, dopasowanie i klasyfikację duplikatów. W chmurze dostępny jest korpus, Common Crawl i mirror Wikipedii; w wersji self-host musisz dostarczyć własny korpus. Zweryfikuj algorytm przed zaufaniem wynikowi.
Jaki jest API do integracji pipeline’u?
REST endpoint pod /v1/checks (SDK dla Pythona i Node). Prześlij dokument, otrzymasz raport o duplikatach synchronicznie do 8 sekund; powyżej tego czasu — callback webhookiem. Przydatne do automatycznych kontroli przed publikacją — odrzuć merge, jeśli duplikacja przekracza ustalony próg. Pełna dokumentacja: /docs/developers/api.
Co z treściami za paywallem lub logowaniem?
Indeksujemy tylko publicznie dostępne strony — Common Crawl, strony w sitemap, domeny z robots-allow. Paywalle (NYT, FT, zamknięte czasopisma) nie są w indeksie; nawet jeśli powtórzysz ich tekst, wynik nie pojawi się na liście. Zasoby naukowe — indeksy OpenAlex / CORE (osobny korpus) obejmują tylko open-access.
Skanuj szkic. Albo całą bibliotekę treści.
Wersja Free — 2 500 słów porównane z 150M+ stronami. Pro (23 USD/m-c) daje skan par w folderach dla twojej biblioteki. Apache 2.0 — możesz wdrożyć własny serwer corpus.