Перевірка на плагіат для дослідників перед подачею
Перевірка рукопису перед поданням на відповідність понад 700 млн наукових публікацій. My Folders відстежує ваші попередні роботи, щоб коректне самоцитування не впливало на підсумковий бал. Для чутливих неопублікованих досліджень доступна кінцева точка з розміщенням у ЄС. Ядро на Apache 2.0 — придатне для експертизи етичними комітетами.
Чотири дослідницькі ролі. Одинаковий self-check воркфлоу.
Перед поданням розділу дисертації
Працюйте з чернетками. Відслідковуйте самопосилання через версії.
- Перевірка по розділу + історія версій
- Allowlist самопосилань (ваші ORCID + DOI)
- Бібліографія автоматично виключена
Рукопис до подання в журнал
iThenticate перевіряє під час подання; ми — до цього.
- 700+ млн публікацій у відкритому доступі
- Класифікація цитувань (з цитатою чи без)
- Pro з фіксованою платою · ітерації без додаткової оплати за кожну перевірку
Vetting літогляду + заявки
Використання власного тексту з минулих грантів очікуване — сервіс це позначає.
- Визнає власні попередні публікації та гранти
- Allowlist співавторів (їхні попередні роботи)
- Експорт класифікаційного звіту у PDF для співавторів
QA для всієї лабораторії перед публікацією
Відловлюйте проблеми у всіх подачах лабораторії в одному черзі.
- Папка на проект або на постдока
- Зберігання у ЄС для клінічних / чутливих даних
- Ядро на Apache 2.0 — придатне для розгляду етичним комітетом
Три етапи до подання рукопису у журнал.
Запускайте кілька разів. Відловлюйте сегменти з самопосиланнями, щоб вони не підвищували ваш бал у iThenticate / Crossref під час подання. Визначення штучного інтелекту з'явиться скоро — можливість побачити попередження ще до того, як це підніме рецензент 2.
01 · Чернетка + allowlist
Завантажте розділ або чернетку рукопису. Додайте свій ORCID і перелік своїх DOI (дозволений список) — ваші попередні публікації будуть позначені як SELF-CITE, а не як плагіат. Якщо ви співпрацювали з іншими, додайте DOI співавторів; ядро розпізнає коректне академічне повторне використання.
02 · Запустіть каскад
L1 winnowing → перевірка по живому вебу вже зараз, далі — L2 MinHash (v1.1) та L3 векторні ембедінги (v1.2). Виявляє дослівне та майже дослівне копіювання; перевірка на перефразування з’явиться на етапах L2 та L3. Класифікація цитувань відокремлює цитати від нецитованого перефразування. Підтримка кількох мов: на старті калібровано для англійської, іспанської, португальської, польської та української; поступово додаються нові мови. Медіана часу перевірки — 47 секунд на рукопис.
03 · Перевірте + повторіть
Звіт позначає сегменти за категоріями: SELF-CITE (ваші, очікувані), CITED (з атрибуцією, очікувані), CITED-PARA (перефразовано з цитатою, мала вага), UNCITED-PARA (ті, що потребують уваги), AI-LIKELY (із поправкою на ESL) скоро з'явиться. Репродуктивний — commit движка + снапшот корпусу на кожному звіті.
Шість категорій легітимного reuse — жодна не підвищує ваш бал.
Black-box checker-и позначають будь-який збіг як плагіат. Дослідники регулярно повторно використовують власний текст. Ось як це класифікує наш сервіс.
01 · ВЛАСНІ ПОПЕРЕДНІ РОБОТИ
Allowlist ORCID + DOI. Ваша раніше опублікована стаття позначена як SELF-CITE, а не плагіат, якщо є збіг. Типово для літоглядів (“як я стверджував у Chen 2023…”) і грантових заявок.
02 · СПІВАВТОРСТВО
Додавайте ORCID співавторів у allowlist. Співавторські статті позначаються CO-CITE. Корисно, коли використовуються спільні розділи, наприклад із методами.
03 · ЛАБОРАТОРНИЙ СПАДОК
Спільний корпус у папці PI: стандартні методи, протоколи, текст з етики, що переходить із роботи в роботу. Позначається LAB-CITE й виключається із балу. IRB-затверджений текст не треба переписувати щоразу.
04 · EMBARGOED PRE-PRINTS
Ваш pre-print у arXiv / bioRxiv на поточний рукопис. Класифікатор розпізнає еволюцію від препринту до журнал-версії, відмічає як PREPRINT-SELF. У бал не рахується. Для журналів, які цього не дозволяють, можна увімкнути суворіше налаштування.
05 · РЕТРАКТОВАНІ ПОСИЛАННЯ
Crossref інтеграція з Retraction Watch позначає збіги з ретрактованими роботами. На бал не впливає — але корисно знати до подання. Захоплює ситуацію “я процитував статтю, яку відкликали минулого місяця” до того, як це помітить рецензент.
06 · IRB / ЧУТЛИВІ ДАНІ
Endpoint з резидентністю у ЄС (api.eu.noplag.com) зберігає рукопис у межах інфраструктури ЄС. Повністю самостійний запуск для HIPAA / GDPR / пацієнтських рукописів. Apache 2.0 + Docker, без трафіку поза VPC.
За проектами. Audit-trail по датах.
Групуйте рукописи за проектом, лабораторним роком чи грантом. Повторні перевірки на тому ж commit — звіти відтворювані через місяці.
Три речі, які потрібні чутливим рукописам від перевірки.
Рукописи не залишають інфраструктуру ЄС
Pro+ на api.eu.noplag.com. Розміщено на ЄС-орієнтованих дата-центрах Hetzner (Falkenstein + Гельсінкі). Подана робота, відбитки та звіт лишаються у ЄС. За замовчуванням GDPR-сумісно; DPA на запит.
Працюйте у власній інституції
Apache 2.0 + Docker compose. Повний pipeline перевірки на вашій інфраструктурі. Потрібні власні Postgres + Redis; корпус постачається як bundle для Enterprise. Жоден трафік не виходить з VPC. Це правильний вибір для клінічних, patient або комерційних досліджень.
Видалити всі відбитки, які ми маємо на вас
Один клік у Налаштуваннях. Протягом 24 годин видаляються всі відбитки, дозволені списки, звіти, метадані акаунту. Відповідає GDPR ст. 17. Для self-host — прямий доступ до БД, для cloud — documented endpoint API для видалення.
Ядро на Apache 2.0, яке ваш етичний комітет може реально перевірити перед затвердженням.
Більшість інституційних перевірок програм для виявлення плагіату зупиняються на одних і тих самих питаннях: куди потрапляє рукопис після подання, як працює алгоритм пошуку збігів, чи передаються пацієнтські/чутливі дані, як реалізовано право на видалення, і чи можна відтворити заявлену точність. У закритих рішень відповіді дають на дзвінку з відділом продажу. З Apache 2.0 ваш етичний комітет може клонувати репозиторій, запустити ядро в ізольованому середовищі, перевірити потоки даних, переконатися у повній реалізації права на видалення та відтворити заявлені F1-метрики для різних мов на власному тестовому наборі. Ми не пропонуємо дешевший аудит — ми пропонуємо аудит, який ваш етичний комітет реально може завершити. Саме тому офіси дослідницьких даних, які раніше відмовляли новим постачальникам систем перевірки плагіату, погоджуються на це рішення.
Читати IRB review guideПитання, які задає дослідницький офіс.
- Чому бал схожості змінюється, якщо я додаю ORCID + DOI?
- Тому що ядро ретроспективно класифікує кожен інтервал, що збігся з публікацією з вашого дозволеного списку, як SELF-CITE, а не UNCITED-PARA. Збіги не зникають — вони просто позначаються інакше. Інтервали SELF-CITE мають майже нульову вагу у підсумковому балу. Математика: якщо у розділі дисертації двічі процитовано ваш препринт і один раз — попередню роботу співавтора, це три інтервали, які переходять із «зарахованих» у «очікуване академічне повторне використання».
- Чи навчається ядро на поданих рукописах?
- Ні. Завантажений текст тільки відбиткується (лише winnowing-хеші, це не відновлюваний підпис) та зберігається у ізольованій базі вашого tenant. Сам текст видаляють через 30 днів, якщо не увімкнуто зберігання. AI-детектор на базі Binoculars (незабаром) натренований лише на відкритих корпусах; тексти клієнтів не додаємо у навчання. Це прямо прописано у DPA.
- Що з моїм препринтом на arXiv / bioRxiv?
- Якщо ви додасте DOI препринту до дозволеного списку, збіги з ним позначаються як PREPRINT-SELF і не враховуються у вашому показнику схожості. Ядро розпізнає, що перехід від препринту до журнальної версії є очікуваним. Журнали, які прямо забороняють препринти (деякі ще існують), можуть мати суворіші налаштування дозволеного списку — але більшість провідних журналів (Nature, Cell, NEJM, PLOS) приймають препринти, і маркування SELF відповідає цій політиці.
- Як AI-детектор буде працювати з співавторами ESL?
- AI detection з’явиться незабаром — у планах на v1.2. Після запуску буде калібрування для кожної мови з урахуванням ESL у висновках. Якщо лексичний профіль вказує на не-носія англійської (типово для міжнародних співавторів), результат позначається як ESL ADJ із задокументованою залишковою похибкою, а не як нульова. У статті Liang та ін., 2023, для наївних детекторів FPR на TOEFL-есе склав 61,3%; нашу методику зниження хибнопозитивних результатів публікуємо на /docs/developers/benchmarks. ESL-співавтори не отримують необґрунтованих позначок.
- Чи можу я запускати ядро на кластері Slurm для пакетних перевірок?
- Так — Apache 2.0 + Docker. Запускайте контейнер рушія на обчислювальних вузлах вашого кластера; дані беріть із вашої спільної файлової системи; звіти у форматі JSON — туди, звідки їх читає ваш пайплайн. Підходить для пакетної перевірки річного обсягу лабораторних робіт на актуальному знімку корпусу. Приклад скрипта Slurm sbatch — на github.com/NoplagLabs/noplag-engine.
- Як щодо рукописів із клінічними або пацієнтськими даними?
- Запускати self-host тільки у VPC. Жоден трафік не йде в інтернет. Для перевірки на проіндексованому корпусі доступу до зовнішньої мережі не потрібно (каскад live-web не буде доступний, але це необов'язковий шар). Сумісно з HIPAA, якщо середовище налаштовано правильно; адміністратор запускає як будь-який інший internal service.
- Чим це відрізняється від iThenticate на момент подання?
- iThenticate перевіряє під час подання, і це бачить редактор — немає можливості внести зміни. Noplag — це самоперевірка до подання. Каскад співвідносний для відкритого контенту (навіть ширший після Plan-S); вже для замкненого контенту (передплата), де у iThenticate є ліцензії. Самоопрацювання — те, що більшість дослідників насправді потребують, але iThenticate не враховує.
- Чи інтегрується з reference manager (Zotero / Mendeley / EndNote)?
- Імпорт дозволених списків підтримує BibTeX, RIS, прямий ORCID API. Завантажте Zotero-експорт або вставте ORCID, і allowlist автоматично додасть ваші DOI. Синхронізація з Mendeley + EndNote у real-time — на v1.2 roadmap; наразі шлях — через експорт.
- Яке покриття для багатомовних наукових публікацій?
- Калібрування перевірки для англійської, іспанської, португальської, польської та української на старті; поступово додаються нові мови. Найкраща якість — для європейських мов (тривала історія калібрування). Якість перевірки виміряна на PAN-PC-11; оцінка для кожної мови — у планах. Особливо корисно для академічного середовища Європи та Південної Америки.
- Що буде, якщо цитовану статтю відкликають після мого подання?
- Інтеграція Crossref з Retraction Watch позначить це при кожній перевірці рукопису. Якщо вже подали — повідомте редактора (деякі журнали цього вимагають). Це не змінює оцінку схожості, але ви дізнаєтеся про це раніше рецензента.
Запустіть розділ у каскаді. Дивіться розподіл самопосилань.
Завантажте чернетку рукопису, розділ дисертації або літогляд для гранту. Додайте свій ORCID. Дивіться, які сегменти — SELF-CITE, CITED, UNCITED-PARA, з AI-LIKELY скоро. До 2 500 слів — безкоштовно. Pro+ з резидентністю у ЄС для чутливих препублікацій.