Перевірка на плагіат для дублікатів онлайн
Знайдіть дублікати контенту в живому вебі, у власних теках і бібліотеці команди. З урахуванням canonical — розрізняє легітимну синдикацію та скопійований текст. Безкоштовно до 2 500 слів; перевірка тек — у Pro.
Чотири види дублікату. Різна обробка, різне рішення.
Більшість "перевірок на дублікати" фіксують тільки ідентичні збіги. Ми класифікуємо кожний збіг у одну з чотирьох категорій, щоб знати — що ігнорувати (легітимна цитата), що оформити canonical (синдикація), що переписати (скопійоване чи синонімізоване).
Дослівний збіг
Ідентичні фрагменти на 30+ символів. Включно з копіпастом, синдикованими статтями дослівно, скребованими сторінками.
Легке переформулювання
Збережена структура речень, підставлені синоніми чи переставлені прикметники. Класичний "спін". Виявляє те, що Copyscape ігнорує навмисно.
Агресивний парафраз
Парафразування на рівні речень із перестановкою частин, зміною часів, додаванням води. Часто зустрічається від AI-переписувачів та контент-ферм.
Повторюваність між сторінками
Однаковий дисклеймер, біографія автора чи опис продукту на сотнях власних сторінок — реальна проблема дублікатів для Google.
Це не просто "копіпаст з іншого сайту".
Актуальні правила Google (з Search Central): три шаблони запускають обробку як дублікат, і більшість із них — це власні сторінки, а не копії конкурентів.
Копії на різних доменах без canonical
Одна стаття з'являється на кількох сайтах без rel=canonical, що вказує на оригінал. Включно з неправильно оформленою синдикацією, конкурентами-скреберами і випадковими дублями, якщо один автор публікує в різних каналах.
Той самий контент під різними URL на вашому сайті
/product/foo і /product/foo?utm_source=email і /product/foo/ зі слешем. Фасетна навігація (фільтри з однаковим вмістом), версії для друку без canonical, окремі URL для мобільної й десктопної версій. Google групує, обирає одну, решту виключає.
Шаблон замість унікального тексту
Наприклад, у категорії інтернет-магазину — п'ять однакових абзаців опису товару на 1 200 сторінках. На сторінці з локаціями один і той же "Наша команда має 20 років досвіду" на 47 сторінках міст. Тонкий дублікат — підпадає під оновлення Google Helpful Content.
Шість команд регулярно запускають цю перевірку.
Один і той же інструмент — шість різних сценаріїв: від перевірки блогера до агентського QA-аутсорсу.
Передпублікаційна перевірка блогу
Прогонити чернетку по живому вебу перед публікацією. Фіксує випадкове повторення фраз із власних матеріалів (самоповтор), статей конкурентів, з якими ознайомлювалися, і можливі збої AI-переписувача.
Виявлення скрейпінгу конкурентами
Вставте свою статтю, побачите хто ще її публікує. Корисно для документування під DMCA — кожен збіг супроводжується джерелом, інтервалами збігів і збереженим знімком для доказу.
Гігієна бібліотеки контенту
Pro-рівень: перевірка на рівні тек. Занесіть усю бібліотеку команди до теки; інструмент виділить дублікати між документами — ті самі абзаци у різних статтях чи шаблонний текст.
Аудит синдикації
Ви синдикували статтю на Medium, LinkedIn та Substack. Чи всі проставили rel=canonical на вашу адресу? Інструмент перевіряє тег і показує, які репости втрачають рейтинг.
QA для аутсорс-автора
Результат вашого фриланс-райтера — в одному вікні. Запустіть перевірку до оплати. Виявляє і скрейпінг, і AI-спін, і цитати без належного посилання.
Виявлення джерела AI-контенту
AI-асистенти іноді беруть текст зі справжніх сайтів під час контекстного аналізу. Інструмент показує ці фрагменти — далі Ви вирішуєте: цитувати, переписати чи видалити. Знижує ризик під Helpful Content Update.
Завантажте бібліотеку. Побачите — що перетинається з чим.
Функція професійного рівня. Оберіть теку з опублікованими статтями — система створить матрицю схожості для кожної пари. Можна сортувати за ступенем збігу та переходити до відповідних фрагментів одним кліком.
- 150M+проіндексовано сторінок
- 30dкаденція оновлення корпусу
- 94%точність виявлення canonical
- 4рівні класифікації дублікатів
- 2014індексація Common Crawl
Три речі, які не знайде браузерний чекер чи SEO-комбайн.
Тільки ідентичні збіги (стандарт Copyscape). А перефразоване речення читає як "унікальне" — спін проходить чисто. Корисно для копіпасту з буфера, марно для контролю якості.
Noplag: 4-рівнева класифікація (Точний / Майже-дублік / Спін / Шаблон) з підказкою наміру. Дієві пояснення, не просто Boolean.
Інструмент у складі пакета за $99-499/міс. Лише поверхнева перевірка n-грам; без Common Crawl; без попарної перевірки бібліотек.
Noplag: повноцінний безкоштовний рівень (2 500 слів). Pro ($23/міс) — додає парну матрицю і повний індекс 150M+, без прив'язки до $400 SEO-комбайну.
Чорний ящик. Не видно, з яким джерелом був збіг, лише коефіцієнт подібності. Ліміт 1 000 слів. Більшість не оновлюють індекс — перевіряють за знімком вебу 2021 року.
Noplag: кожен збіг показує URL-джерело + canonical + інтервали + дату знімка. Apache 2.0 — логіка пошуку у відкритому доступі.
Репост з rel=canonical — це не "дублікат". Але ми це показуємо.
Коли стаття з'являється під кількома URL — SEO-питання не в "ідентичності тексту", а в "чи всі вказують однаковий canonical?" Якщо гостьовий пост на Medium проставляє rel=canonical на вашу адресу, Google об'єднає ці сторінки й покаже рейтинг оригіналу. Якщо ні — конкуруєте самі з собою. Інструмент за кожним збігом перевіряє, яку адресу містить <link rel="canonical"> та маркує кожен результат: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK або SCRAPED.
Питання, які ставить контент-лід до інтеграції.
Яке покриття в порівнянні з Copyscape чи SEMrush?
150M+ сторінок із Common Crawl плюс ручно добрані SEO-домени високого трафіку; оновлення кожні 30 днів. Охоплення ширше, ніж у Copyscape (~120M, фокус на шаблонний плагіат), але вужче ніж у Google, проте з відомою документацією й частотою оновлення. Pro дає можливість додати свою теку як приватний корпус.
Як насправді працює перевірка на canonical?
На кожній сторінці зі збігом завантажуємо URL (кеш чи live), парситься <head> і витягується rel=canonical. Далі маркуємо: ORIGIN (canonical на себе), SYND-OK (canonical на іншу вашу сторінку), LEAK (canonical немає чи інший на вашому розповсюдженні), або SCRAPED (canonical немає + не ваш сайт). Кожен збіг підписано прозоро.
Виявляє чи інструмент AI-контент, взятий з інших джерел?
Так — AI-асистент під час роботи бере текст зі справжнього вебу, і такі фрагменти з'являються як майже-дублікати чи спін. Ми показуємо URL джерела — вирішуйте, цитувати, переписати чи видалити. Детектор AI-контенту — це інший сигнал, окремий інструмент, поки у розробці, не запущено. Тут лише перевірка на дублікат.
Який максимальний розмір документа для перевірки?
Free — до 2 500 слів, Premium — 50 000, Enterprise — 250 000+ (без обмежень у self-host). Для Pro-перевірки теки: до 2 000 документів, вся попарна матриця буде порахована за 5 хвилин.
Виявить конкурентів, які скопіювали мій контент?
Якщо копія на crawlable сайті і є в індексі — так, URL показується у списку збігів із збереженим знімком. Знімок — доказ під DMCA: дата, hash, виділення інтервалів. Ми не відправляємо DMCA (юридичне питання), але даємо весь пакет.
Можна виключити свої синдиковані домени з дублікат-скану?
Pro дає allowlist доменів (medium.com/@you, linkedin.com/in/you, substack.com/p/you). Збіги з allowlist позначаються як SYND-OK і не враховуються у вашому дублікат-скору. Скор показує лише НЕочікувану дублікацію.
Як працює попарна перевірка для бібліотеки на 500 статей?
Каскад відбору: O(n log n) для кожної пари на практиці — фільтруємо кандидати відбитками за 60-бітними hash, повна звірка лише для них. Для 500 статей — 124 750 пар сканується за ~4 хвилини на 4 ядрах. Матриця експортується у CSV — далі як треба.
Чи дійсно рушій є програмним забезпеченням з відкритим вихідним кодом?
Так — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, fingerprinter, retrieval cascade, alignment і логіка класифікації дублікатів доступні у репозиторії. У хмарному рівні додається корпус + Common Crawl + дзеркало Wikipedia; при self-host ви підключаєте власний корпус. Перевірте алгоритм перед тим, як довіряти оцінці схожості.
Який API для інтеграції у контент-пайплайн?
REST-ендпоінт на /v1/checks (SDK для Python і Node). Надішліть документ — отримаєте звіт про дублікати синхронно до 8 секунд, вище — через webhook callback. Корисно для CI-перевірок перед публікацією: злиття блокується, якщо % схожості перевищує поріг вашої команди. Повна документація — /docs/developers/api.
Що з контентом за paywall або auth?
Індекс лише по публічно доступному — Common Crawl, сторінки із sitemap, домени з robots-allow. Paywall-матеріали (NYT, FT, академічні журнали за оплату) не індексуються, інструмент їх не покаже, навіть якщо текст співпав. Для наукових робіт OpenAlex / CORE покриває open-access.
Сканувати чернетку. Або всю бібліотеку.
Безкоштовний рівень — 2 500 слів проти 150M+ сторінок. Pro ($23/міс) — попарна перевірка бібліотеки. Apache 2.0 — для самостійного серверу.