Verificare plagiat pentru conținut duplicat online
Detectați conținut duplicat pe web, în folderele proprii sau în biblioteca echipei. Recunoaște canonical — face diferența între partajare legitimă și copii neautorizate. Gratuit până la 2.500 de cuvinte; scanare la nivel de folder pe Pro.
Patru tipuri de duplicat. Tratament diferit, soluție diferită.
Majoritatea „verificatoarelor de duplicat” găsesc doar potrivirile exacte. Noi clasificăm fiecare potrivire în patru categorii: știți ce puteți ignora (citat legitim), ce trebuie canonicalizat (partajare), și ce trebuie rescris (conținut copiat sau parafrazat).
Potrivire cuvânt cu cuvânt
Șiruri identice de peste 30 caractere. Include pasaje copiate, articole distribuite identic, pagini copiate.
Rescris ușor
Forma frazei se păstrează, dar cu sinonime sau adjective schimbate. Clasic output de „spin”. Prinde ce scapă Copyscape intenționat.
Parafrazare agresivă
Parafrazare la nivel de propoziție, cu ordonare schimbată, timpuri diferite, adăugare de umplutură. Frecvent la unelte AI și conținut externalizat.
Recursiv pe pagini multiple
Același disclaimer, bio autor sau descriere produs pe sute de pagini proprii — problema reală de duplicate în Google.
Nu e doar „copiază-l de pe alt site”.
Regulile efective Google (din documentația Search Central): trei tipare activează tratamentul duplicate, majoritatea pentru pagini proprii, nu pentru competitori care copiază.
Copii între site-uri fără canonical
Același articol apare pe mai multe site-uri fără rel=canonical spre original. Include partajarea greșită, conținut extra deteriorat și duplicare accidentală între site-uri când un autor publică pe două platforme.
Același conținut sub mai multe URL-uri pe site-ul propriu
/product/foo și /product/foo?utm_source=email și /product/foo/ cu slash final. Navigare filtrată, versiuni pentru imprimare fără canonical, URL-uri separate mobile/desktop. Google le grupează, alege una, ignoră restul.
Boilerplate prezentat ca și conținut
Pagină e-commerce categorie cu 5 paragrafe copiate peste 1.200 de produse. Pagină locații cu același „Avem 20 de ani experiență” pe 47 orașe. Conținut subțire duplicat — actualizarea Helpful Content semnalează asta.
Șase echipe care rulează săptămânal acest check.
Același instrument, șase fluxuri diferite — de la blogger solo care verifică înainte de publicare până la agenția care validează articole externalizate.
Verificare articol blog — pre-publicare
Rulați draftul pe web înainte de publicare. Prinde refolosirea accidentală a fragmentelor din postări vechi (auto-cannibalizare), articole concurente folosite la documentare și orice scăpare de la AI-rewriter.
Detectare scraping de la competitori
Lipiți articolul, vedeți cine mai publică. Util pentru dosare DMCA — fiecare potrivire include sursa URL, intervalele, și un snapshot datat ce poate fi salvat ca dovadă.
Igienă bibliotecă de conținut
Scanare folder Pro. Puneți întreaga bibliotecă într-un folder; instrumentul marchează duplicatele între documente — același paragraf în trei articole diferite, boilerplate care ar trebui șablonizat.
Audit partajare (syndication)
Ați publicat articolul pe Medium, LinkedIn și Substack. Toate au rel=canonical către sursa originală? Instrumentul verifică fiecare, inspectează tag-ul canonical și raportează partajările neconforme.
QA articol scris extern
Livrabilul freelancer-ului, tot în fereastră. Scanați înainte de plată. Prinde tiparul răspândit „copiat-și-parafrazat”, semnătura AI-rewriter și citate fără sursa obligatorie.
De unde provine textul generat AI
Asistenții AI culeg fragmente de pe web în lookup-ul de context. Instrumentul marchează acele pasaje utilizate ca atare, ca să decideți: citați sursa, rescrieți sau eliminați. Curăță riscul semnalat de Helpful Content Update.
Puneți biblioteca. Vedeți ce se suprapune.
Funcție pentru Pro. Selectați un folder cu articole; motorul construiește o matrice de similaritate pentru fiecare pereche. Se poate sorta după suprapunere, click pentru detaliu pe intervale.
- 150M+pagini web indexate
- 30zfrecvență actualizare corpus
- 94%rata detectare canonical
- 4niveluri clasificare duplicat
- 2014indexare Common Crawl
Trei lucruri pe care dupe-checkerele din browser și suitele SEO nu le găsesc.
Doar potrivire exactă (Copyscape standard). O propoziție reformulată trece ca „unică” — iar output-ul parafrazat scapă. Util la texte copiate prin clipboard; inutil la QA conținut.
Noplag: clasificare pe 4 niveluri (Exact / Aproape-duplicat / Parafrazat / Boilerplate) cu indicii de intenție — utilizabil, nu doar indicator Boolean.
Unelte pentru unicitatea conținutului incluse la abonament $99-499/lună. Limitate la potrivire n-gram la suprafață; fără Common Crawl; fără scanare cross-document pe folder.
Noplag: variantă gratuită standalone (2.500 cuvinte). Pro ($23/lună) adaugă matrice pe folder și index complet — fără să fixeze unealta la un pachet SEO de $400.
Cutie neagră. Nu arată sursa, doar un scor. De obicei limitat la 1.000 de cuvinte. Majoritatea nu își actualizează indexul — verificarea se face pe web-ul din 2021.
Noplag: fiecare potrivire arată URL sursă + canonical + intervale + data snapshot corpus. Apache 2.0 — puteți citi algoritmul de potrivire.
Un articol repostat cu rel=canonical nu e „conținut duplicat”. Îl tratăm ca atare.
Când un articol apare pe mai multe URL-uri, întrebarea SEO nu e „sunt identice?” — ci „au toate același canonical?”. Dacă postarea originală pe Medium are rel=canonical către adresa sursă, Google le grupează și atribuie scor rădăcinii; restul sunt partajare legitimă. Dacă nu, concurați cu propria versiune repostată. Instrumentul extrage fiecare potrivire, citește tag-ul <link rel="canonical"> și etichetează: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK sau SCRAPED.
Întrebări înainte de integrare.
Care este acoperirea web față de Copyscape sau SEMrush?
Peste 250M pagini indexate, din Common Crawl și domenii SEO relevante, actualizat la 30 de zile. Mai larg decât indexul Copyscape (doar potriviri exacte, ~120M, focus pe boilerplate), mai restrâns decât crawl-ul complet Google, dar cu acoperire documentată și update previzibil. Pro adaugă folderele proprii ca set privat.
Cum funcționează detecția canonical?
Pentru fiecare pagină potrivită, motorul preia URL (cache sau live), parsează <head> și extrage rel=canonical. Se marchează ORIGIN (canonical se referă la sine), SYND-OK (canonical spre altă pagină controlată), LEAK (canonical lipsă/greșit la redistribuire), sau SCRAPED (fără canonical + domeniu extern). Clasificarea e vizibilă pentru fiecare potrivire, deci scorul reflectă realitatea.
Găsește conținut AI reutilizat din surse?
Da — asistenții AI iau texte reale din web în lookup-ul de context, și acele pasaje apar ca Aproape-duplicat sau Parafrazat. Le arătăm împreună cu URL sursă pentru a decide: citare, rescriere, eliminare. Detecția (separată) de conținut AI e alt instrument — pe roadmap, nu activă încă — aici se discută doar scanarea duplicatelor.
Care e dimensiunea maximă document pentru scanare?
2.500 cuvinte pe Free, 50.000 pe Premium, 250.000+ pe Enterprise (sau nelimitat pe self-host). Pe Pro, folderul poate conține până la 2.000 documente; matricea pereche calculată sub 5 minute pentru acest volum.
Găsește competitori care au copiat conținutul meu?
Dacă copia este în index (site public accesibil crawl-ului), da — URL-ul apare în lista de potriviri, împreună cu snapshot datat. Snapshotul e dovada practică DMCA: datat, cu hash, cu intervale potrivite evidențiate. Nu generăm DMCAs automat (decizie legală), doar oferim documentația.
Pot exclude propria rețea de partajare din scanare?
Funcție Pro — adăugați o listă de domenii proprii (medium.com/@dumneavoastră, linkedin.com/in/dvs, substack.com/p/dvs). Potrivirile la aceste domenii se marchează SYND-OK și nu influențează scorul. Scorul reflectă „duplicat neașteptat” nu „orice duplicat”.
Cum funcționează scanarea pe folder pentru o bibliotecă de 500 articole?
Retragerea e O(n log n) per pereche practic; amprentarea filtrează perechi candidate cu hash-uri 60-bit, apoi alinierea completă doar la cele rămase. 500 articole → 124.750 perechi în ~4 min pe 4-core. Matricea poate fi exportată CSV pentru orice flux ulterior.
Motorul este într-adevăr open source?
Da — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker-ul, modulul de amprentare, cascada de regăsire, alinierea și logica de clasificare a duplicatelor sunt toate în acest repo. Nivelul cloud adaugă corpusul + Common Crawl + copia Wikipedia; în regim self-host folosești propriile tale date. Verifică algoritmul înainte să ai încredere în scor.
Există API pentru integrarea în pipeline de conținut?
Endpoint REST la /v1/checks (SDK-uri Python + Node). Trimiți un document, primești raportul de duplicate sincron până la 8 secunde, peste acest timp răspunsul vine prin webhook. Util pentru verificări CI înainte de publicare — respinge merge-ul dacă procentul de duplicate depășește pragul echipei. Documentație completă la /docs/developers/api.
Ce e cu conținutul după paywall sau login?
Scanăm doar ce e public — Common Crawl, pagini din sitemap, domenii permise robots. Conținutul plătit (NYT, FT, reviste academice) nu e în index; motorul nu marchează potriviri nici dacă reusește fragmente. Pentru lucrări academice, OpenAlex / CORE acoperă zona open-access.
Scanați un draft. Sau toată biblioteca.
Variantele Free acoperă 2.500 cuvinte pe 150M+ pagini web. Pro ($23/lună) deblochează scanări pe folder pentru biblioteca publicată. Referință Apache 2.0 dacă doriți corpusul pe server propriu.