WEB150M+ stron · obsługa canonical

Antyplagiat online do sprawdzania duplikatów treści

Znajdź powieloną treść w internecie, własnych folderach i bibliotece zespołu. Obsługuje canonical — odróżnia legalną syndykację od kopii. Za darmo do 2 500 słów; skanowanie folderów w wersji Pro.

0 / 1,500 words
Web + Common Crawl zindeksowaneWykrywanie duplikatów i tekstów parafrazowanychSkanowanie biblioteki (folderów)
RODZAJE DUPLIKATÓW

Cztery typy duplikatów. Inna diagnoza, inne rozwiązanie.

Większość “wykrywaczy duplikatów” łapie tylko identyczne fragmenty. My klasyfikujemy każdy wynik do jednej z czterech kategorii, żeby wiadomo było, co można pominąć (legalny cytat), co skanonizować (syndykacja), a co przepisać (kopie lub spinner).

01 · IDENTYCZNY

Słowo w słowo

Identyczny ciąg znaków (30+). Obejmuje wklejone boilerplate, artykuły publikowane na kilku stronach, kopie ze scraperów.

Rozwiązanie: dodać canonical, przeredagować lub zostawić (jeśli to własny, legalny duplikat).
02 · PRAWIE-DUPLIKAT

Lekkie przeredagowanie

Zachowany kształt zdania, zamienione synonimy lub przestawione przymiotniki. Klasyczny “spin”. Wyłapuje to, czego Copyscape celowo nie wykrywa.

Rozwiązanie: pełne przepisanie — argument musi być twój.
03 · PARAFRAZA

Agresywna parafraza

Przestawianie składni na poziomie zdania, zamiana czasów, wstawianie wypełniaczy. Typowe dla narzędzi AI do parafrazowania i content-mill.

Rozwiązanie: sprawdzić intencję. Czy to własna parafraza czy ukryta kopia?
04 · BOILERPLATE

Stały fragment na wielu stronach

Ta sama klauzula, bio autora lub opis produktu powielone na setkach własnych podstron — prawdziwy problem Google z duplikatami.

Rozwiązanie: przerzuć do wspólnego szablonu; nie pozwól, by Google indeksował 800 kopii.
CO W GOOGLE RZECZYWIŚCIE JEST DUPLIKATEM

To nie tylko „kopiuj-wklej z innej strony”.

Rzeczywiste zasady Google (z dokumentacji Search Central): trzy wzorce uruchamiają filtr na duplikaty i większość dotyczy własnej strony, nie skopiowanych konkurentów.

01

Kopie między domenami bez canonical

Ten sam artykuł na wielu stronach bez rel=canonical wskazującego oryginał. Obejmuje syndykację źle skonfigurowaną, niezgłoszone kopie konkurencji i przypadkowe duplikowanie gdy autor publikuje w dwóch miejscach.

02

Ta sama treść pod wieloma adresami na własnej stronie

/product/foo i /product/foo?utm_source=email i /product/foo/ ze slashem. Facetowana nawigacja (filtry tworzące identyczne strony), wersje do druku bez canonical, osobne adresy mobile i desktop. Google grupuje, wybiera jedną stronę, resztę pomija.

03

Boilerplate udający treść

Strona kategorii e-commerce z pięcioma identycznymi akapitami opisu w 1 200 produktach. Strona 'lokalizacje', gdzie 'Nasz zespół ma 20 lat doświadczenia' powtarza się w 47 podstronach. Thin-content duplikat — Google’s Helpful Content Update oznacza to agresywnie.

SEO — PRZYKŁADOWE ZASTOSOWANIA

Sześć zespołów robi te testy co tydzień.

To samo narzędzie, sześć różnych scenariuszy — od blogera przed publikacją po audyt agencji treści kupowanych na zewnątrz.

Bloger — sprawdzenie przed publikacją

Porównaj szkic z aktualną siecią przed publikacją. Wychwyci nieświadome powtarzanie fraz z własnych tekstów archiwalnych, artykułów konkurencji oraz błędy AI-rewriterów.

Wykrywanie kopiowania przez konkurencję

Wklej swój artykuł i zobacz, kto jeszcze go publikuje. Przydatne przy dokumentacji DMCA — każdy duplikat daje link źródłowy, zakres dopasowania i snapshot z datą do folderu.

Porządkowanie biblioteki treści

Funkcja Pro — skan folderów. Wrzucasz całą bibliotekę zespołu; narzędzie wykrywa powielenia między artykułami — ten sam akapit w trzech tekstach, boilerplate do przeniesienia do szablonu.

Audyt syndykacji

Przekazałeś tekst na Medium, LinkedIn, Substack. Czy wszędzie wskazane rel=canonical do źródła? Narzędzie sprawdza każdy adres, tag canonical i mówi, gdzie wycieka SEO.

Kontrola jakości tekstów zleconych

Treść od freelancera w jednym panelu. Sprawdź zanim zapłacisz. Wyłapuje częste wzorce — kopia i spin, ślad AI, cytaty bez źródła.

AI — pochodzenie treści

Asystenci AI pobierają teksty z realnych stron. Narzędzie wyłapuje te fragmenty — Ty decydujesz: cytować, przepisać, wyrzucić. Minimalizuje ryzyko pod Helpful Content Update.

SKAN DUPLIKATÓW NA POZIOMIE FOLDERU

Wrzuć bibliotekę. Zobacz co się powiela.

Funkcja Pro. Wybierz folder z publikacjami; silnik tworzy macierz podobieństwa dla każdej pary. Do sortowania po nakładaniu fragmentów, przejście do kolidujących akapitów po kliknięciu.

FOLDER / blog-2026-q16 artykułów · macierz podobieństwa par
3 nakładki > 10%Eksportuj macierz
ARTYKUŁA1A2A3A4A5A6
A1 — Pięć modeli cen SaaS·4%3%38%6%2%
A2 — Jak pisać cenniki SaaS4%·5%12%7%3%
A3 — Przewodnik po pricingu produktowym3%5%·8%6%4%
A4 — Playbook cen dla SaaS38%12%8%·9%5%
A5 — Wybór ceny SaaS6%7%6%9%·4%
A6 — Ceny SaaS dla founderów2%3%4%5%4%·
Kliknij komórkę, by zobaczyć nakładające się fragmenty między artykułami
  • 150M+zindeksowane strony
  • 30dczęstotliwość aktualizacji indeksu
  • 94%skuteczność wykrycia canonical
  • 4poziomy klasyfikacji duplikatu
  • 2014indeksowanie Common Crawl
VS PODSTAWOWE NARZĘDZIA DUPE

Trzy rzeczy, których nie wykryje przeglądarkowy checker lub pakiet SEO.

NARZĘDZIA TYPU COPYSCAPE

Tylko ścisłe dopasowanie (standard Copyscape). Przestawione zdanie przechodzi jako “unikatowe” — spinowany tekst czysty. Przydatne przy prostym kopiowaniu; nieprzydatne przy audycie treści.

Noplag: 4-poziomowa klasyfikacja (Identyczny / Prawie-dup / Parafraza / Boilerplate) z wskazaniem intencji — fakty do działania, nie tylko flaga 0/1.

PAKIETY SEO

Oferują narzędzie do unikatowości za 99–499 USD/m-c. Ograniczone do prostych n-gramów; brak indeksu Common Crawl; brak skanu między dokumentami.

Noplag: osobna wersja Free (2 500 słów). Pro (23 USD/m-c) to skanowanie folderów i pełny indeks 150M+ — bez spinania tego z kosztownym pakietem SEO.

DARMOWE CHECKERY ONLINE

Czarna skrzynka. Nie widać, który tekst się dopasował — tylko liczba podobieństwa. Zwykle limit 1 000 słów. Indeks często stary — testujesz na snapshot sprzed kilku lat.

Noplag: każdy duplikat pokazuje URL + canonical + zakres + datę snapshotu. Apache 2.0 — można zajrzeć w algorytm.

WYKRYWANIE Z UWZGLĘDNIENIEM CANONICAL

Artykuł z rel=canonical nie jest „duplikatem”. Tak go klasyfikujemy.

Gdy artykuł pojawia się pod wieloma adresami, w SEO liczy się nie 'czy identyczne', tylko 'czy wszystkie wskazują canonical'. Jeśli Twój gościnny post na Medium ma rel=canonical do źródłowego URL, Google grupuje je, przypisuje ranking do oryginału, a resztę traktuje jako legalną syndykację. Jeśli nie — konkurujesz z własną powieloną treścią. Narzędzie pobiera każdy wynik, parsuje tag <link rel="canonical"> i oznacza każdy wynik: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK albo SCRAPED.

Przeczytaj logikę canonical
FAQ

Pytania, które padają przed wdrożeniem.

Jaka jest skala indeksu w porównaniu z Copyscape lub SEMrush?

Indeksuje 150M+ stron z Common Crawl i kluczowych domen SEO, aktualizowany co 30 dni. Szerszy niż dokładny-tylko indeks Copyscape (~120M, skupiony na plagiatach i boilerplate), węższy niż pełny crawl Google, ale z wykazem pokrycia i publicznym planem aktualizacji. W wersji Pro możesz dodać własny folder jako prywatny korpus.

Jak dokładnie działa wykrywanie canonical?

Dla każdej dobranej strony silnik pobiera URL (z cache lub na żywo), parsuje <head> i wyciąga rel=canonical. Wyniki to ORIGIN (canonical do siebie), SYND-OK (canonical do innej własnej strony), LEAK (canonical brak/lub gdzie indziej), SCRAPED (brak canonical poza siecią dystrybucji). Typ pokazywany przy każdym wyniku, więc Twój procent duplikatów jest uczciwy.

Czy wykryje powtórki tekstu generowanego przez AI?

Tak — asystenty AI pobierają fragmenty z realnych stron. Te fragmenty pojawią się jako Prawie-dup lub Parafraza z URL źródła. Możesz je cytować, przetworzyć lub usunąć. Wykrywanie generowanej treści (osobny sygnał) to inne narzędzie — na roadmapie, jeszcze niedostępne — tutaj tylko skan duplikatów.

Jaki jest maksymalny rozmiar skanowanego dokumentu?

2 500 słów w wersji Free, 50 000 w Premium, 250 000+ w Enterprise (lub bez limitu na self-host). Przy skanowaniu folderów — folder do 2 000 dokumentów; cała macierz par skanowana w <5 min przy takim rozmiarze.

Czy znajdzie kopiujących konkurentów?

Jeśli skopiowana treść jest w indeksie (publiczna, crawlable), tak — URL pojawi się na liście ze snapshotem z datą. Snapshot to dowód DMCA: oznaczona data, hashowana treść, podświetlone fragmenty. DMCA nie składamy — to decyzja prawna — dokumentację masz od nas.

Czy można wykluczyć własną sieć syndykacji z wykrywania?

Funkcja Pro — możesz dodać allowlist domen pod kontrolą (medium.com/@you, linkedin.com/in/you, substack.com/p/you). Dopasowania na allowlist są oznaczane jako SYND-OK i nie liczą się do wyniku duplikatów. Wynik pokazuje 'nieoczekiwane', a nie 'wszystkie' duplikaty.

Jak działa skan par w folderze z 500 artykułami?

Retrieval cascade to O(n log n) na każdą parę — fingerprinty filtrują kandydatów 60-bitowym hashem, pełne dopasowanie tylko na finalistach. 500 artykułów = 124 750 par w ok. 4 min na 4 rdzeniowym CPU. Macierz eksportowana do CSV pod dalsze przetwarzanie.

Czy silnik jest rzeczywiście open source?

Tak — github.com/NoplagLabs/noplag-engine, Apache 2.0. Repozytorium zawiera moduły: dzielenie tekstu, odcisk palca, kaskadę wyszukiwania, dopasowanie i klasyfikację duplikatów. W chmurze dostępny jest korpus, Common Crawl i mirror Wikipedii; w wersji self-host musisz dostarczyć własny korpus. Zweryfikuj algorytm przed zaufaniem wynikowi.

Jaki jest API do integracji pipeline’u?

REST endpoint pod /v1/checks (SDK dla Pythona i Node). Prześlij dokument, otrzymasz raport o duplikatach synchronicznie do 8 sekund; powyżej tego czasu — callback webhookiem. Przydatne do automatycznych kontroli przed publikacją — odrzuć merge, jeśli duplikacja przekracza ustalony próg. Pełna dokumentacja: /docs/developers/api.

Co z treściami za paywallem lub logowaniem?

Indeksujemy tylko publicznie dostępne strony — Common Crawl, strony w sitemap, domeny z robots-allow. Paywalle (NYT, FT, zamknięte czasopisma) nie są w indeksie; nawet jeśli powtórzysz ich tekst, wynik nie pojawi się na liście. Zasoby naukowe — indeksy OpenAlex / CORE (osobny korpus) obejmują tylko open-access.

Skanuj szkic. Albo całą bibliotekę treści.

Wersja Free — 2 500 słów porównane z 150M+ stronami. Pro (23 USD/m-c) daje skan par w folderach dla twojej biblioteki. Apache 2.0 — możesz wdrożyć własny serwer corpus.

Antyplagiat online do wykrywania duplikatów treści