Перевірка на плагіат для видавців перед публікацією
Передпублікаційна перевірка матеріалів від фрилансерів, аудит синдикації для повторно опублікованого контенту та REST API, який ваша інженерна команда може інтегрувати у вашу CMS. Ядро виявлення — Apache 2.0: код доступний для ознайомлення до впровадження, а не після.
Чотири відділи. Одна схема роботи.
Оцінити фриланс-пропозицію до завдання
10 хвилин на подання перед розподілом бюджету на редагування.
- Вставте драфт-пропозицію / вирізку — побачите раніше опубліковані версії
- Ймовірність ШІ для кожного абзацу (скоро), з урахуванням ESL
- Уникайте повернень на тему «чи це оригінал?»
Запустіть сьогоднішню чергу до публікації
Пакетна перевірка статей перед потраплянням у публікаційну чергу CMS.
- Вигляд черги із сортуванням за схожістю + ШІ бал
- Порогові значення по розділах (op-ed / новини / огляди)
- Аудит за журналістом для відділу стандартів
Розслідувати оскаржене подання
Прочитайте алгоритм, потім перегляньте знайдені інтервали.
- Відтворення за X-Engine-Commit
- Перевизначити вердикт із зазначенням причини
- Apache 2.0 — аргументовано на сторінці виправлень
Аудит партнерів, які перепубліковують вас
Відстежуйте стан canonical-тегів у мережі синдикації.
- Виявлення з урахуванням canonical (ORIGIN / SYND OK / LEAK)
- Щотижневий diff-звіт по партнеру
- Пакет доказів для DMCA — за запитом
Три кроки до потрапляння статті у публікаційну чергу CMS.
Інтегрується у ваш редакційний процес через API, запускається пакетно перед публікацією або разово через дашборд. Той самий механізм, той самий формат звіту, працює там, де потрібно.
01 · Отримання
Матеріал потрапляє у чергу CMS — drag-drop .docx / .gdoc / вставка, або CMS надсилає через webhook. Мета-дані автора, розділу, призначеного редактора йдуть із документом в аудит-лог.
02 · Сканування + кваліфікація
Каскад перевірки працює з відкритим вебом + Common Crawl + (опціонально) власним корусом попередніх матеріалів. Класифікує прямі цитати (з атрибуцією) окремо від нецитованих перефразувань. Ймовірність ШІ по абзацу — скоро, ESL-aware. Медіана — 42 сек. на статтю.
03 · Рішення + публікація
Редактор бачить: схожість заголовків, розподіл за категоріями, список джерел із можливістю сортування (незабаром з’явиться AI-оцінка з позначкою для ESL). Три дії: опублікувати, повернути з коментарями, передати на розгляд відділу стандартів. Рішення фіксується разом із комітом ядра та знімком корпусу.
Чотири CMS-платформи. Один REST контракт.
Підключайте Noplag до використовуваної CMS. API ідентичний — різна тільки інтеграція (WordPress hooks, Ghost actions, Drupal events, або власні webhooks).
Офіційний плагін із WordPress.org Plugins Directory. Сумісний із Gutenberg.
- Мета-блок перед публікацією для всіх типів постів
- Підсвічування блоків у редакторі
- Аудит-лог через WP REST API
Інтеграція через webhook + використання Admin API. Працює з платним контентом.
- Webhook перед публікацією спрацьовує на save_draft
- Політика сканування по тегу для кожного типу контенту
- Підходить для self-host (Noplag та Ghost на власних серверах)
Contrib-модуль із drupal.org. Підключення на базі Field API.
- Поле плагіату для кожного типу контенту
- Інтеграція в робочий процес через Content Moderation
- Підтримка налаштувань для мультисайту
Webhooks + OpenAPI 3.0. Для headless CMS, внутрішніх систем, будь-чого іншого.
- POST /v1/checks з будь-якого CMS hook
- Webhook з HMAC-підписом
- Python та Node SDK — на основі OpenAPI spec
Черга публікації за сьогодні. Сортується, з аудит-логом.
По статті в рядку: журналіст, розділ, схожість, ШІ-бал, з переходом на звіт із виділеним текстом. Можна сортувати. Пакетно схвалювати безпечні матеріали, ескалювати решту.
Дивіться, хто перепубліковує вас — і чи canonical тег веде назад.
Відстежуйте свою мережу дистрибуції
Додавайте домени, куди ви синдикуєте (Medium, LinkedIn, Substack, партнери) у біллист. Щотижневий краул показує, які партнери мають rel=canonical на вас (ORIGIN), де його немає (SEO витік), а де репостять без дозволу (SCRAPED).
На чийому блозі ваша авторство зникло?
Щомісячне сканування відкритого вебу виявляє не у біллисті домени, що публікують фрагменти ваших матеріалів. Збіг надходить із позначкою дати — доказ для DMCA, прив’язаний до дня появи копії. Ми не подаємо DMCA (це вже юр.питання); ми допомагаємо з паперами.
Внутрішні дублі на власних сторінках
Професійне сканування на рівні папки: завантажте корпус опублікованих статей у папку — ядро будує матрицю схожості для кожної пари. Виявляє 47 міських сторінок із однаковим шаблонним абзацом — ризик Helpful-Content-Update, про який варто дізнатися до того, як це зробить Google.
Три політики, які відділ стандартів захоче до підписання контракту.
Перше — подані статті ніколи не використовуються для навчання моделей. Ні наших, ні сторонніх. Текст проходить фіксацію відбитка, індексується у вашому середовищі та видаляється через 30 днів, якщо не вказано інше. Друге — AI-висновок (незабаром, у плані розвитку) буде для кожного абзацу окремо, а не для всієї статті, із зазначенням коміту ядра та часу знімка корпусу. Якщо AI-позначка оскаржується, її можна відтворити через місяці за тим самим комітом. Жодного прихованого перенавчання. Третє — Apache 2.0 дозволяє вашій технічній команді клонувати github.com/NoplagLabs/noplag-engine, запускати на власній інфраструктурі, перевіряти потік даних і контролювати повний шлях видалення даних. Більшість закупівельних аудитів у закладах освіти щодо програм для перевірки плагіату зупиняються саме на цих трьох питаннях; ми надаємо відповіді одразу.
Читати гайд відділу стандартівЩо реально питають у відділі стандартів перед закупівлею.
- Чи будуть наші статті тренувати вашу ШІ-модель?
- Ні. Подане фіксується відбитком (лише winnowing-хеші), індексується окремо у вашій базі. Текст видаляється через 30 днів, якщо не зберігаєте явно. ШІ-модель (на Binoculars, Hans et al. 2024; невдовзі) буде готова заздалегідь, з відкритих джерел; клієнтський контент не додається. Закріплено у DPA.
- Як поабзацний ШІ-вердикт відстоє в спірній ситуації?
- AI-виявлення з’явиться незабаром — у плані v1.2, не при запуску. Коли функція стане доступною, кожен позначений абзац міститиме коміт ядра та знімок корпусу. Повторна перевірка того ж абзацу за цим комітом дає ідентичний результат. Алгоритм відкритий на github.com/NoplagLabs/noplag-engine (Apache 2.0): можна переглянути поріг perplexity, документацію по калібруванню для ESL. Режиму «довіряйте балу» немає.
- Що з фрилансерами із країн із повільним інтернетом?
- Виявлення налаштовано для англійської, іспанської, португальської, польської та української мов на старті; підтримка інших мов з’являтиметься поступово. Якість виявлення перевіряється на PAN-PC-11; окрема оцінка для кожної мови — у плані розвитку. AI-висновок з урахуванням ESL позначає текст, написаний не носієм англійської, як ESL ADJ, а не LIKELY-AI, якщо лексичний підпис це підтверджує.
- Можна розгортати у своїй редакції?
- Так — ядро на Apache 2.0 + Docker. Працює повністю у вашій мережі. Можна використовувати з вашим Postgres і Redis на власній інфраструктурі; жоден трафік подачі не виходить за межі вашого VPC. Актуально для редакцій із жорсткими вимогами до захисту джерел або конфіденційності до публікації.
- Чи інтегрується з нашим CMS?
- WordPress (офіційний плагін), Ghost (Admin API + webhooks), Drupal (contrib-модуль). Інші: REST + OpenAPI 3.0 для самописних, headless, in-house — усе для pre-publish hook за день. Python та Node SDK — на базі spec.
- Що реально робить функція аудиту синдикації?
- Додаєте свої домени у біллист (medium.com/@you, партнери). Щотижневий звіт щодо canonical: ORIGIN (ваш), SYND OK (ваш у партнера), LEAK (canonical нема або на іншого — SEO спліт), SCRAPED (копія без атрибуції, не у біллисті). SCRAPED має дату й снапшот — доказ для DMCA.
- Як рахується тарифікація для редакції у 30 журналістів?
- Преміум $79/міс — 5 000 слів/перевірка, 5 000 статей/місяць, повний API + інтеграції із CMS. Високі обсяги (10 000+ статей/міс) — Enterprise з тарифами по обсягу корпусу + інфраструктурі. Тариф не по журналістах, а по кількості статей.
- А як щодо op-ed, синдикації та уривків книг, де часткове «запозичення» нормальне?
- Pro+ дозволяє виставляти пороги по розділах — для новин, op-ed, оглядів, синдикованих уривків різна чутливість. Op-ed з цитатою промови — це не копія новинної статті конкурента. Класифікація цитувань відділяє легітимні цитати від випадкового збігу.
- Чи сповільнить це публікацію?
- Медіана — 47 секунд на статтю 1 500–4 000 слів. CMS-hook — асинхронний: спрацює на save_draft, редактор бачить вердикт, доки вичитує. Довгі репортажі (8 000+ слів) — близько 90 сек, ліпше у pre-publish job, не у sync hook.
- Можна додати архів як приватний корпус?
- Так — корпоративний рівень. Масове завантаження вашого архівного контенту у приватний корпус тенанта, щоб ядро перевіряло кожну нову подачу на збіг із вашими попередніми матеріалами. Виявляє самоповтори журналістів (іноді виправдані, іноді ні) та навмисне повторне використання старого контенту під новим авторством.
Пропустіть драфт через чергу. Бачте вигляд по статті.
Вставте Word, Google Doc, або експорт з CMS. Звіт по абзацах за 47 сек. До 2 500 слів — безкоштовно; Pro — для обсягів; Enterprise — для корпусу + інфраструктури.