WEB150M+ сторінок · з урахуванням canonical

Перевірка на плагіат для дублікатів онлайн

Знайдіть дублікати контенту в живому вебі, у власних теках і бібліотеці команди. З урахуванням canonical — розрізняє легітимну синдикацію та скопійований текст. Безкоштовно до 2 500 слів; перевірка тек — у Pro.

0 / 1,500 words
Веб + індекс Common CrawlВиявлення майже-дублікатів і синонімізованого текстуПеревірка бібліотеки на рівні тек
ТИПИ ДУБЛІКАТІВ

Чотири види дублікату. Різна обробка, різне рішення.

Більшість "перевірок на дублікати" фіксують тільки ідентичні збіги. Ми класифікуємо кожний збіг у одну з чотирьох категорій, щоб знати — що ігнорувати (легітимна цитата), що оформити canonical (синдикація), що переписати (скопійоване чи синонімізоване).

01 · ТОЧНИЙ

Дослівний збіг

Ідентичні фрагменти на 30+ символів. Включно з копіпастом, синдикованими статтями дослівно, скребованими сторінками.

Що робити: canonical, переписати або залишити (якщо це ваш синдикований текст).
02 · МАЙЖЕ-ДУБЛІКАТ

Легке переформулювання

Збережена структура речень, підставлені синоніми чи переставлені прикметники. Класичний "спін". Виявляє те, що Copyscape ігнорує навмисно.

Що робити: повністю переписати — основна ідея має бути ваша.
03 · СПІН

Агресивний парафраз

Парафразування на рівні речень із перестановкою частин, зміною часів, додаванням води. Часто зустрічається від AI-переписувачів та контент-ферм.

Що робити: перевірте намір. Це власний парафраз автора чи прихована копія?
04 · ШАБЛОН

Повторюваність між сторінками

Однаковий дисклеймер, біографія автора чи опис продукту на сотнях власних сторінок — реальна проблема дублікатів для Google.

Що робити: винести у спільний шаблон; не індексувати це 800 разів.
ЩО GOOGLE ВВАЖАЄ ДУБЛІКАТОМ

Це не просто "копіпаст з іншого сайту".

Актуальні правила Google (з Search Central): три шаблони запускають обробку як дублікат, і більшість із них — це власні сторінки, а не копії конкурентів.

01

Копії на різних доменах без canonical

Одна стаття з'являється на кількох сайтах без rel=canonical, що вказує на оригінал. Включно з неправильно оформленою синдикацією, конкурентами-скреберами і випадковими дублями, якщо один автор публікує в різних каналах.

02

Той самий контент під різними URL на вашому сайті

/product/foo і /product/foo?utm_source=email і /product/foo/ зі слешем. Фасетна навігація (фільтри з однаковим вмістом), версії для друку без canonical, окремі URL для мобільної й десктопної версій. Google групує, обирає одну, решту виключає.

03

Шаблон замість унікального тексту

Наприклад, у категорії інтернет-магазину — п'ять однакових абзаців опису товару на 1 200 сторінках. На сторінці з локаціями один і той же "Наша команда має 20 років досвіду" на 47 сторінках міст. Тонкий дублікат — підпадає під оновлення Google Helpful Content.

SEO-КЕЙСИ

Шість команд регулярно запускають цю перевірку.

Один і той же інструмент — шість різних сценаріїв: від перевірки блогера до агентського QA-аутсорсу.

Передпублікаційна перевірка блогу

Прогонити чернетку по живому вебу перед публікацією. Фіксує випадкове повторення фраз із власних матеріалів (самоповтор), статей конкурентів, з якими ознайомлювалися, і можливі збої AI-переписувача.

Виявлення скрейпінгу конкурентами

Вставте свою статтю, побачите хто ще її публікує. Корисно для документування під DMCA — кожен збіг супроводжується джерелом, інтервалами збігів і збереженим знімком для доказу.

Гігієна бібліотеки контенту

Pro-рівень: перевірка на рівні тек. Занесіть усю бібліотеку команди до теки; інструмент виділить дублікати між документами — ті самі абзаци у різних статтях чи шаблонний текст.

Аудит синдикації

Ви синдикували статтю на Medium, LinkedIn та Substack. Чи всі проставили rel=canonical на вашу адресу? Інструмент перевіряє тег і показує, які репости втрачають рейтинг.

QA для аутсорс-автора

Результат вашого фриланс-райтера — в одному вікні. Запустіть перевірку до оплати. Виявляє і скрейпінг, і AI-спін, і цитати без належного посилання.

Виявлення джерела AI-контенту

AI-асистенти іноді беруть текст зі справжніх сайтів під час контекстного аналізу. Інструмент показує ці фрагменти — далі Ви вирішуєте: цитувати, переписати чи видалити. Знижує ризик під Helpful Content Update.

ПЕРЕВІРКА НА РІВНІ ТЕКИ

Завантажте бібліотеку. Побачите — що перетинається з чим.

Функція професійного рівня. Оберіть теку з опублікованими статтями — система створить матрицю схожості для кожної пари. Можна сортувати за ступенем збігу та переходити до відповідних фрагментів одним кліком.

ТЕКА / blog-2026-q16 статей · матриця попарної подібності
3 перетини > 10%Експортувати матрицю
СТАТТЯA1A2A3A4A5A6
A1 — Пʼять моделей SaaS-ціноутворення·4%3%38%6%2%
A2 — Як писати про SaaS-ціни4%·5%12%7%3%
A3 — Гайд по продукт-орієнтованому ціноутворенню3%5%·8%6%4%
A4 — План ціноутворення SaaS38%12%8%·9%5%
A5 — Як обрати ціну для SaaS6%7%6%9%·4%
A6 — Ціноутворення SaaS для засновників2%3%4%5%4%·
Клікніть на будь-яку клітинку, щоб побачити перетини між цими статтями
  • 150M+проіндексовано сторінок
  • 30dкаденція оновлення корпусу
  • 94%точність виявлення canonical
  • 4рівні класифікації дублікатів
  • 2014індексація Common Crawl
vs БАЗОВІ ДУПЛІКАТ-ІНСТРУМЕНТИ

Три речі, які не знайде браузерний чекер чи SEO-комбайн.

ІНСТРУМЕНТИ НА ЗРАЗОК COPYSCAPE

Тільки ідентичні збіги (стандарт Copyscape). А перефразоване речення читає як "унікальне" — спін проходить чисто. Корисно для копіпасту з буфера, марно для контролю якості.

Noplag: 4-рівнева класифікація (Точний / Майже-дублік / Спін / Шаблон) з підказкою наміру. Дієві пояснення, не просто Boolean.

SEO-КОМБАЙНИ

Інструмент у складі пакета за $99-499/міс. Лише поверхнева перевірка n-грам; без Common Crawl; без попарної перевірки бібліотек.

Noplag: повноцінний безкоштовний рівень (2 500 слів). Pro ($23/міс) — додає парну матрицю і повний індекс 150M+, без прив'язки до $400 SEO-комбайну.

БЕЗКОШТОВНІ ОНЛАЙН-ЧЕКЕРИ

Чорний ящик. Не видно, з яким джерелом був збіг, лише коефіцієнт подібності. Ліміт 1 000 слів. Більшість не оновлюють індекс — перевіряють за знімком вебу 2021 року.

Noplag: кожен збіг показує URL-джерело + canonical + інтервали + дату знімка. Apache 2.0 — логіка пошуку у відкритому доступі.

ВИЯВЛЕННЯ З УРАХУВАННЯМ CANONICAL

Репост з rel=canonical — це не "дублікат". Але ми це показуємо.

Коли стаття з'являється під кількома URL — SEO-питання не в "ідентичності тексту", а в "чи всі вказують однаковий canonical?" Якщо гостьовий пост на Medium проставляє rel=canonical на вашу адресу, Google об'єднає ці сторінки й покаже рейтинг оригіналу. Якщо ні — конкуруєте самі з собою. Інструмент за кожним збігом перевіряє, яку адресу містить <link rel="canonical"> та маркує кожен результат: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK або SCRAPED.

Почитати логіку canonical
FAQ

Питання, які ставить контент-лід до інтеграції.

Яке покриття в порівнянні з Copyscape чи SEMrush?

150M+ сторінок із Common Crawl плюс ручно добрані SEO-домени високого трафіку; оновлення кожні 30 днів. Охоплення ширше, ніж у Copyscape (~120M, фокус на шаблонний плагіат), але вужче ніж у Google, проте з відомою документацією й частотою оновлення. Pro дає можливість додати свою теку як приватний корпус.

Як насправді працює перевірка на canonical?

На кожній сторінці зі збігом завантажуємо URL (кеш чи live), парситься <head> і витягується rel=canonical. Далі маркуємо: ORIGIN (canonical на себе), SYND-OK (canonical на іншу вашу сторінку), LEAK (canonical немає чи інший на вашому розповсюдженні), або SCRAPED (canonical немає + не ваш сайт). Кожен збіг підписано прозоро.

Виявляє чи інструмент AI-контент, взятий з інших джерел?

Так — AI-асистент під час роботи бере текст зі справжнього вебу, і такі фрагменти з'являються як майже-дублікати чи спін. Ми показуємо URL джерела — вирішуйте, цитувати, переписати чи видалити. Детектор AI-контенту — це інший сигнал, окремий інструмент, поки у розробці, не запущено. Тут лише перевірка на дублікат.

Який максимальний розмір документа для перевірки?

Free — до 2 500 слів, Premium — 50 000, Enterprise — 250 000+ (без обмежень у self-host). Для Pro-перевірки теки: до 2 000 документів, вся попарна матриця буде порахована за 5 хвилин.

Виявить конкурентів, які скопіювали мій контент?

Якщо копія на crawlable сайті і є в індексі — так, URL показується у списку збігів із збереженим знімком. Знімок — доказ під DMCA: дата, hash, виділення інтервалів. Ми не відправляємо DMCA (юридичне питання), але даємо весь пакет.

Можна виключити свої синдиковані домени з дублікат-скану?

Pro дає allowlist доменів (medium.com/@you, linkedin.com/in/you, substack.com/p/you). Збіги з allowlist позначаються як SYND-OK і не враховуються у вашому дублікат-скору. Скор показує лише НЕочікувану дублікацію.

Як працює попарна перевірка для бібліотеки на 500 статей?

Каскад відбору: O(n log n) для кожної пари на практиці — фільтруємо кандидати відбитками за 60-бітними hash, повна звірка лише для них. Для 500 статей — 124 750 пар сканується за ~4 хвилини на 4 ядрах. Матриця експортується у CSV — далі як треба.

Чи дійсно рушій є програмним забезпеченням з відкритим вихідним кодом?

Так — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, fingerprinter, retrieval cascade, alignment і логіка класифікації дублікатів доступні у репозиторії. У хмарному рівні додається корпус + Common Crawl + дзеркало Wikipedia; при self-host ви підключаєте власний корпус. Перевірте алгоритм перед тим, як довіряти оцінці схожості.

Який API для інтеграції у контент-пайплайн?

REST-ендпоінт на /v1/checks (SDK для Python і Node). Надішліть документ — отримаєте звіт про дублікати синхронно до 8 секунд, вище — через webhook callback. Корисно для CI-перевірок перед публікацією: злиття блокується, якщо % схожості перевищує поріг вашої команди. Повна документація — /docs/developers/api.

Що з контентом за paywall або auth?

Індекс лише по публічно доступному — Common Crawl, сторінки із sitemap, домени з robots-allow. Paywall-матеріали (NYT, FT, академічні журнали за оплату) не індексуються, інструмент їх не покаже, навіть якщо текст співпав. Для наукових робіт OpenAlex / CORE покриває open-access.

Сканувати чернетку. Або всю бібліотеку.

Безкоштовний рівень — 2 500 слів проти 150M+ сторінок. Pro ($23/міс) — попарна перевірка бібліотеки. Apache 2.0 — для самостійного серверу.

Перевірка на плагіат для дублікатів онлайн безкоштовно