NEWSROOMРедакційний процес · API для CMS · аудит синдикації

Перевірка на плагіат для видавців перед публікацією

Передпублікаційна перевірка матеріалів від фрилансерів, аудит синдикації для повторно опублікованого контенту та REST API, який ваша інженерна команда може інтегрувати у вашу CMS. Ядро виявлення — Apache 2.0: код доступний для ознайомлення до впровадження, а не після.

Робочий процес перед публікацієюАудит синдикаціїREST API для CMS
ДЛЯ ТИХ, ХТО ЗАТВЕРДЖУЄ ПУБЛІКАЦІЮ

Чотири відділи. Одна схема роботи.

РЕДАКТОР

Оцінити фриланс-пропозицію до завдання

10 хвилин на подання перед розподілом бюджету на редагування.

  • Вставте драфт-пропозицію / вирізку — побачите раніше опубліковані версії
  • Ймовірність ШІ для кожного абзацу (скоро), з урахуванням ESL
  • Уникайте повернень на тему «чи це оригінал?»
ВІДПОВІДАЛЬНИЙ РЕДАКТОР

Запустіть сьогоднішню чергу до публікації

Пакетна перевірка статей перед потраплянням у публікаційну чергу CMS.

  • Вигляд черги із сортуванням за схожістю + ШІ бал
  • Порогові значення по розділах (op-ed / новини / огляди)
  • Аудит за журналістом для відділу стандартів
ВІДДІЛ СТАНДАРТІВ

Розслідувати оскаржене подання

Прочитайте алгоритм, потім перегляньте знайдені інтервали.

  • Відтворення за X-Engine-Commit
  • Перевизначити вердикт із зазначенням причини
  • Apache 2.0 — аргументовано на сторінці виправлень
СИНДИКАЦІЯ

Аудит партнерів, які перепубліковують вас

Відстежуйте стан canonical-тегів у мережі синдикації.

  • Виявлення з урахуванням canonical (ORIGIN / SYND OK / LEAK)
  • Щотижневий diff-звіт по партнеру
  • Пакет доказів для DMCA — за запитом
РОБОЧИЙ ПРОЦЕС ПЕРЕД ПУБЛІКАЦІЄЮ

Три кроки до потрапляння статті у публікаційну чергу CMS.

Інтегрується у ваш редакційний процес через API, запускається пакетно перед публікацією або разово через дашборд. Той самий механізм, той самий формат звіту, працює там, де потрібно.

01

01 · Отримання

Матеріал потрапляє у чергу CMS — drag-drop .docx / .gdoc / вставка, або CMS надсилає через webhook. Мета-дані автора, розділу, призначеного редактора йдуть із документом в аудит-лог.

02

02 · Сканування + кваліфікація

Каскад перевірки працює з відкритим вебом + Common Crawl + (опціонально) власним корусом попередніх матеріалів. Класифікує прямі цитати (з атрибуцією) окремо від нецитованих перефразувань. Ймовірність ШІ по абзацу — скоро, ESL-aware. Медіана — 42 сек. на статтю.

03

03 · Рішення + публікація

Редактор бачить: схожість заголовків, розподіл за категоріями, список джерел із можливістю сортування (незабаром з’явиться AI-оцінка з позначкою для ESL). Три дії: опублікувати, повернути з коментарями, передати на розгляд відділу стандартів. Рішення фіксується разом із комітом ядра та знімком корпусу.

ІНТЕГРАЦІЇ З CMS

Чотири CMS-платформи. Один REST контракт.

Підключайте Noplag до використовуваної CMS. API ідентичний — різна тільки інтеграція (WordPress hooks, Ghost actions, Drupal events, або власні webhooks).

WordPress5.5+

Офіційний плагін із WordPress.org Plugins Directory. Сумісний із Gutenberg.

  • Мета-блок перед публікацією для всіх типів постів
  • Підсвічування блоків у редакторі
  • Аудит-лог через WP REST API
Ghost4.0+

Інтеграція через webhook + використання Admin API. Працює з платним контентом.

  • Webhook перед публікацією спрацьовує на save_draft
  • Політика сканування по тегу для кожного типу контенту
  • Підходить для self-host (Noplag та Ghost на власних серверах)
Drupal9+ / 10

Contrib-модуль із drupal.org. Підключення на базі Field API.

  • Поле плагіату для кожного типу контенту
  • Інтеграція в робочий процес через Content Moderation
  • Підтримка налаштувань для мультисайту
CustomREST

Webhooks + OpenAPI 3.0. Для headless CMS, внутрішніх систем, будь-чого іншого.

  • POST /v1/checks з будь-якого CMS hook
  • Webhook з HMAC-підписом
  • Python та Node SDK — на основі OpenAPI spec
ВИД РЕДАКТОРА

Черга публікації за сьогодні. Сортується, з аудит-логом.

По статті в рядку: журналіст, розділ, схожість, ШІ-бал, з переходом на звіт із виділеним текстом. Можна сортувати. Пакетно схвалювати безпечні матеріали, ескалювати решту.

ЧЕРГА ПУБЛІКАЦІЙ · Вівторок, 21 травня7 статей у черзі · 2 ескаловані
Розділ: всіПакетна публікація OK
СТАТТЯАВТОРРОЗДІЛСХОЖІСТЬШІ %ВЕРДИКТДІЯ
Міськрада ухвалила новий закон про зонування для центручернетка · 1 840 слівMarisol ChenМІСЦЕВІ6%0.04OKОпублікувати
Всередині перебудови: уроки після фіаско в Q1чернетка · 1 840 слівTobias ReinhartТЕХНОЛОГІЇ12%0.08OKОпублікувати
Як ШІ змінив нашу редакцію за 18 місяцівчернетка · 1 840 слівPriya AnandДУМКИ38%0.62HOLDРозглянути
Модерністські романи й питання голосучернетка · 1 840 слівSara BeltranКУЛЬТУРА22%0.18OKОпублікувати
Зіткнення у Сенаті штату по бюджету — що далічернетка · 1 840 слівMarcus AdekunleПОЛІТИКА67%0.41ESCALATEРозглянути
Кліматичні біженці: п’ятирічний фолоу-апчернетка · 1 840 слівYuki HiranoСПЕЦІАЛЬНИЙ РЕПОРТАЖ14%0.06OKОпублікувати
Дохід тех-компаній: хто перевищив прогноз, хто не вийшовчернетка · 1 840 слівDiego MoralesБІЗНЕС51%0.28HOLDРозглянути
Показано 7 із 7 · сортується по розділу, далі по часу подачіаудит-лог: 47 рішень сьогодні · 2 ескаловано
47 секмедіанний час перевірки статті
4інтеграції з CMS
RESTOpenAPI 3.0 · для self-host
0кількість перевірених матеріалів (по політиці)
5мови для виявлення, розширюються
АУДИТ СИНДИКАЦІЇ

Дивіться, хто перепубліковує вас — і чи canonical тег веде назад.

01 · СТАН CANONICAL

Відстежуйте свою мережу дистрибуції

Додавайте домени, куди ви синдикуєте (Medium, LinkedIn, Substack, партнери) у біллист. Щотижневий краул показує, які партнери мають rel=canonical на вас (ORIGIN), де його немає (SEO витік), а де репостять без дозволу (SCRAPED).

Виявіть репост на LinkedIn, який втратив canonical через платформу.
02 · ВИЯВЛЕННЯ СКРЕЙПЕРІВ

На чийому блозі ваша авторство зникло?

Щомісячне сканування відкритого вебу виявляє не у біллисті домени, що публікують фрагменти ваших матеріалів. Збіг надходить із позначкою дати — доказ для DMCA, прив’язаний до дня появи копії. Ми не подаємо DMCA (це вже юр.питання); ми допомагаємо з паперами.

Експортуйте пакет доказів у PDF для юриста.
03 · АУДИТ БОЙЛЕРПЛЕЙТУ

Внутрішні дублі на власних сторінках

Професійне сканування на рівні папки: завантажте корпус опублікованих статей у папку — ядро будує матрицю схожості для кожної пари. Виявляє 47 міських сторінок із однаковим шаблонним абзацом — ризик Helpful-Content-Update, про який варто дізнатися до того, як це зробить Google.

Запускайте щотижня; експортуйте матрицю у CSV.
ПРИНЦИПИ РЕДАКЦІЇ

Три політики, які відділ стандартів захоче до підписання контракту.

Перше — подані статті ніколи не використовуються для навчання моделей. Ні наших, ні сторонніх. Текст проходить фіксацію відбитка, індексується у вашому середовищі та видаляється через 30 днів, якщо не вказано інше. Друге — AI-висновок (незабаром, у плані розвитку) буде для кожного абзацу окремо, а не для всієї статті, із зазначенням коміту ядра та часу знімка корпусу. Якщо AI-позначка оскаржується, її можна відтворити через місяці за тим самим комітом. Жодного прихованого перенавчання. Третє — Apache 2.0 дозволяє вашій технічній команді клонувати github.com/NoplagLabs/noplag-engine, запускати на власній інфраструктурі, перевіряти потік даних і контролювати повний шлях видалення даних. Більшість закупівельних аудитів у закладах освіти щодо програм для перевірки плагіату зупиняються саме на цих трьох питаннях; ми надаємо відповіді одразу.

Читати гайд відділу стандартів
Q&A ДЛЯ РЕДАКЦІЇ
Q1Чи навчається ядро на наших статтях? — Ні. Поданий контент лише фіксується відбитком; для навчання не використовується.
Q2Можна розгортати на своїй інфраструктурі? — Так. Apache 2.0 + Docker. Працює повністю у вашій мережі.
Q3Що з ЄС-резидентністю? — Pro+ розгортається на api.eu.noplag.com. GDPR за замовчуванням.
Q4Звіти відтворювані? — Кожна перевірка — відбиток X-Engine-Commit і знімок корпусу. Відтворюється згодом.
Q5Bulk-тарифи? — Обсяг по статті у Pro, Enterprise — ліцензія на корпус + виділена інфраструктура.
Q6Атрибуція джерела? — Кожен знайдений фрагмент містить URL джерела, canonical-тег, дату знімка, коміт ядра.
FAQ

Що реально питають у відділі стандартів перед закупівлею.

Чи будуть наші статті тренувати вашу ШІ-модель?
Ні. Подане фіксується відбитком (лише winnowing-хеші), індексується окремо у вашій базі. Текст видаляється через 30 днів, якщо не зберігаєте явно. ШІ-модель (на Binoculars, Hans et al. 2024; невдовзі) буде готова заздалегідь, з відкритих джерел; клієнтський контент не додається. Закріплено у DPA.
Як поабзацний ШІ-вердикт відстоє в спірній ситуації?
AI-виявлення з’явиться незабаром — у плані v1.2, не при запуску. Коли функція стане доступною, кожен позначений абзац міститиме коміт ядра та знімок корпусу. Повторна перевірка того ж абзацу за цим комітом дає ідентичний результат. Алгоритм відкритий на github.com/NoplagLabs/noplag-engine (Apache 2.0): можна переглянути поріг perplexity, документацію по калібруванню для ESL. Режиму «довіряйте балу» немає.
Що з фрилансерами із країн із повільним інтернетом?
Виявлення налаштовано для англійської, іспанської, португальської, польської та української мов на старті; підтримка інших мов з’являтиметься поступово. Якість виявлення перевіряється на PAN-PC-11; окрема оцінка для кожної мови — у плані розвитку. AI-висновок з урахуванням ESL позначає текст, написаний не носієм англійської, як ESL ADJ, а не LIKELY-AI, якщо лексичний підпис це підтверджує.
Можна розгортати у своїй редакції?
Так — ядро на Apache 2.0 + Docker. Працює повністю у вашій мережі. Можна використовувати з вашим Postgres і Redis на власній інфраструктурі; жоден трафік подачі не виходить за межі вашого VPC. Актуально для редакцій із жорсткими вимогами до захисту джерел або конфіденційності до публікації.
Чи інтегрується з нашим CMS?
WordPress (офіційний плагін), Ghost (Admin API + webhooks), Drupal (contrib-модуль). Інші: REST + OpenAPI 3.0 для самописних, headless, in-house — усе для pre-publish hook за день. Python та Node SDK — на базі spec.
Що реально робить функція аудиту синдикації?
Додаєте свої домени у біллист (medium.com/@you, партнери). Щотижневий звіт щодо canonical: ORIGIN (ваш), SYND OK (ваш у партнера), LEAK (canonical нема або на іншого — SEO спліт), SCRAPED (копія без атрибуції, не у біллисті). SCRAPED має дату й снапшот — доказ для DMCA.
Як рахується тарифікація для редакції у 30 журналістів?
Преміум $79/міс — 5 000 слів/перевірка, 5 000 статей/місяць, повний API + інтеграції із CMS. Високі обсяги (10 000+ статей/міс) — Enterprise з тарифами по обсягу корпусу + інфраструктурі. Тариф не по журналістах, а по кількості статей.
А як щодо op-ed, синдикації та уривків книг, де часткове «запозичення» нормальне?
Pro+ дозволяє виставляти пороги по розділах — для новин, op-ed, оглядів, синдикованих уривків різна чутливість. Op-ed з цитатою промови — це не копія новинної статті конкурента. Класифікація цитувань відділяє легітимні цитати від випадкового збігу.
Чи сповільнить це публікацію?
Медіана — 47 секунд на статтю 1 500–4 000 слів. CMS-hook — асинхронний: спрацює на save_draft, редактор бачить вердикт, доки вичитує. Довгі репортажі (8 000+ слів) — близько 90 сек, ліпше у pre-publish job, не у sync hook.
Можна додати архів як приватний корпус?
Так — корпоративний рівень. Масове завантаження вашого архівного контенту у приватний корпус тенанта, щоб ядро перевіряло кожну нову подачу на збіг із вашими попередніми матеріалами. Виявляє самоповтори журналістів (іноді виправдані, іноді ні) та навмисне повторне використання старого контенту під новим авторством.

Пропустіть драфт через чергу. Бачте вигляд по статті.

Вставте Word, Google Doc, або експорт з CMS. Звіт по абзацах за 47 сек. До 2 500 слів — безкоштовно; Pro — для обсягів; Enterprise — для корпусу + інфраструктури.

Перевірка на плагіат для видавців — перед публікацією