Перевірка на плагіат для академічних текстів
Перевірка на плагіат для наукових текстів — звіряє з 700 млн+ академічних робіт у OpenAlex, CORE, arXiv, PubMed Central та Crossref. Класифікація з урахуванням цитувань. Рушій Apache 2.0, який може бути перевірений будь-якою ІТ-службою установи.
П’ять джерел. 700+ млн робіт. Усе — відкритий доступ чи DOI.
Жодного закритого контенту — ми працюємо тільки з відкритими індексами. Охоплення ширше для робіт після Plan-S; вужче — для старих закритих журналів.
OpenAlex
250+ млн робітВідкритий науковий індекс — замінює старий Microsoft Academic Graph. Охоплює статті, тези, датасети, книги з усіх дисциплін.
CORE
290+ млн робітНайбільший агрегатор наукових публікацій відкритого доступу. Повні тексти індексуються з 11 000+ репозиторіїв. Найкраще охоплює Європу та Британію.
arXiv
2,4+ млн препринтівФізика, математика, інформатика, кількісна біологія, статистика, економіка. Перевіряє версію, яку міг бачити рецензент на arXiv.
PubMed Central
10+ млн робітВідкритий архів біомедицини/наук про життя. Індексуються повні тексти та метадані. Дослідження, внесені NIH, та журнальні потоки.
Три сценарії. Один продукт.
Складаєте статтю для журналу, захищаєте розділ дисертації чи фіналізуєте грантову заявку — перевіряльник підлаштовується під ваш етап, а не навпаки.
01 · Перевірка перед поданням у журнал
Прогоніть рукопис по відкритих джерелах до подачі у журнал. iThenticate / Crossref Similarity Check все одно проганяють його при поданні — краще побачити результат, який побачить редактор. Єдина ціна Pro дозволяє перевіряти кілька версій без ліміту на документи.
02 · Розділ дисертації / дипломної
Можна перевіряти по розділах або вставити всю дисертацію. Самоцитування між розділами буде позначене окремо (це припустимо на рівні дисертації). Бібліографія автоматично виключається з рахунку. Історія версій дозволяє порівняти, що змінилося між січнем і травнем — що було переписано, що стало чистіше, що додано.
03 · Грантова заявка / огляд літератури
Типові фрагменти з минулих заявок, які ви писали разом з іншими, не будуть хибно визначені як плагіат. Правильно процитований літературний огляд також не позначиться як проблема. Модель різнить типове наукове «переписування з посиланням» (ваші роботи з посиланням) і випадкове копіювання. У підсумковий бал входить лише те, що дійсно проблемне, а не структурно неминуче.
Шість категорій. Кожний збіг — у одну.
28% подібності у багатоцитованому огляді літератури — не те саме, що 28% на нецитованому переказі. Тут працює класифікація.
01 · Пряма цитата (з посиланням)
Лапки + посилання у дужках АБО зноска. Вважається очікуваним; виключається з рахунку подібності. Кілька стилів цитування визначаються автоматично (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Блок-цитата
Відступ ізліва 40+ слів із кінцевим посиланням. Вважається очікуваним. Візерунок з відступом + посиланням розпізнається; без відступу — сигнал формальної помилки цитування.
03 · Переказ (з посиланням)
Збіг форми речення з атрибуцією десь у навколишньому абзаці. За мінімальною вагою у підсумковому балі. Фраза “Smith (2023) стверджує...” визнається коректною атрибуцією для переказу.
04 · Загальновідоме
Фрази з 2 000+ незалежних джерел («Вода кипить при 100°C», стандартні технічні визначення, відомі формули). Виключено з подібності. Поріг налаштовується для вузьких дисциплін.
05 · Бібліографія
Список літератури визначається автоматично за заголовком і форматом. Повністю виключений з рахунку. Посилання на джерела апріорі не є унікальними — їх враховувати у підсумковому балу некоректно.
06 · Переказ без посилання
Збіг форми речення без посилання у контексті, без лапок чи форматування блоку. Саме ця категорія впливає на підсумковий відсоток. Її вага — повна; інші категорії не рахуються у результат.
Класифікація по діапазонах. URL джерела. Повна аудитність.
Для кожного знайденого збігу надається DOI / URL джерела, категорія класифікації, мітка часу знімка корпусу та коміт рушія. Можна обґрунтувати на засіданні рецензентів, комісії з академічної доброчесності або під час ІТ-аудиту закупівель.
Модернізм — радше сукупність заперечень, ніж цілісний рух: проти реалізму, прогресу, ідеї єдиної особистості... (Eysteinsson, 1990, с.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990Наголос Еліота на безособовості переосмислює лірику як сконструйований артефакт, а не вилив почуттів.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…Роман виник з буржуазного світогляду XVIII сторіччя.
openalex.org/W12345678 · Watt (1957) — збіг без цитуванняСтрім свідомості у Джойса має корені у психології «внутрішньої тривалості» Вільяма Джеймса.
James, W. (1890). The Principles of Psychology, ch.IX (асоційовано у списку літератури)Власна раніше надрукована докторська дисертація автора, Розділ 1.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · самоцитування, без пояснення в цьому абзаціУсі джерела — Eysteinsson, Eliot, Joyce, James, Watt та ще 32.
Список літератури, с. 38–41- 700+ млнпроіндексовано наукових робіт
- 6стилі цитування визначаються авто
- 5мови, для яких проведено калібрування на старті
- 3%залишкове упередження до ESL (задокументовано)
- Apache2.0 · IRB-аудит доведено
Три речі, які чорний ящик не витримує на засіданні кафедри.
Повторіть перевірку того ж тексту на тій же версії
Кожен звіт містить X-Engine-Commit і мітку часу корпусу. Через місяці можна повторно перевірити той самий рукопис на тій же версії — той самий вхід, той самий алгоритм, той самий результат. У закритих системах алгоритм міняють без попередження, і результат з січня не відтвориться у травні.
Apache 2.0 з відкритим кодом на GitHub — несіть на засідання
Коли буде доступне визначення AI (незабаром, у плані v1.2) і студент оскаржить свій AI-висновок на комісії з доброчесності, ви зможете послатися на коміт рушія, вказати рядок коду, що визначив порогове рішення, і показати документацію з калібрування ESL для кожної мови. Не скріншот відповіді служби підтримки.
Liang та ін., 2023 задокументовано; заходи з мінімізації ризиків у плані розвитку
У дослідженні Stanford 2023 зафіксовано 61,3% хибнопозитивних результатів на TOEFL-есе для наївних детекторів. Коли в Noplag з’явиться AI detection (незабаром, у плані v1.2), висновок міститиме окрему шкалу для ESL, якщо лексичний профіль вказує на не-носія англійської. Залишкову похибку буде задокументовано, нульовий рівень не заявляється. Випадки ручного втручання фіксуються з комітом рушія та причиною.
Рушій Apache 2.0, який ІТ вашої установи дійсно може перевірити до підписання договору.
Більшість ІТ-перевірок програм для виявлення плагіату зупиняються на одних і тих самих питаннях: куди потрапляє документ після завантаження, який алгоритм пошуку збігів, хто має доступ до даних, що відбувається при реалізації права на видалення, чи можна перевірити заявлену точність. У закритих постачальників відповіді дають на дзвінку з продажів. З Apache 2.0 ІТ може клонувати репозиторій, запустити рушій у тестовому середовищі, проаналізувати потік даних, перевірити реалізацію права на видалення та відтворити опубліковані F1-метрики на власному тестовому наборі. Ми не пропонуємо дешевший аудит — ми пропонуємо аудит, який ІТ-команда дійсно може завершити. Саме тому університети, які раніше відмовлялися додавати нових постачальників перевірки на плагіат, підписують контракт із цим рішенням.
Читати гайд для закупівліПитання, які дійсно цікавлять науковців.
Чи заміняє це iThenticate для підготовки до публікації?
Зазвичай ні — якщо журнал вимагає iThenticate (Elsevier, Springer, Wiley, IEEE тощо), перевірка буде незалежно. Noplag потрібен для самоперевірки між версіями до подання. iThenticate по $125 за документ стає невигідно вже на четвертій версії; Pro без ліміту — ні. Порівняння з iThenticate: noplag.com/vs-ithenticate.
А як щодо дисертацій ProQuest? Їх у вас немає?
Вірно — цей пропуск реальний. База ProQuest закрита, платна, у OpenAlex/CORE її немає. Ми покриваємо ~700 млн відкритих наукових робіт, це ширше за ProQuest для після-Plan-S (з 2018 року); вужче — саме для старих дисертацій. Якщо пріоритет — перевірка саме з дисертаціями США, iThenticate краще впорається з цим вузьким завданням.
А якщо інший стиль цитування, не з шести основних?
MLA, APA, Chicago/Turabian, Harvard, Vancouver і IEEE визначаються автоматично за форматом списку. Для рідкісних (ACS, AMA, ASA, Bluebook, Oxford) — інтервали визначаються за лапками й дужками, але точний валідатор на v1.2 у roadmap. Для self-host можна додати нові стилі у alignment/.
Який рівень хибних спрацьовувань на оглядах із багатьма цитатами?
Нижчий, ніж очікують рецензенти, бо модель виключає процитовані ділянки з головного балу. ~3,4% хибних спрацьовувань по PAN-PC-11 (там майже всі збіги легітимні цитати). Закриті конкуренти, які не класифікують цитати, отримують 12–18% на тих самих даних.
Чи можна виключити мої попередні публікації?
Pro-тариф — внесіть allowlist самоцитувань (ORCID, попередні DOI, інституційний репозиторій). Збіги з allowlist позначаються як САМОЦИТ і у бал не йдуть. Зручно, якщо грантова заявка базується на ваших ранніх статтях: переробка із вказаним джерелом — не плагіат.
Як насправді працює багатомовність?
На старті калібрування виконано для англійської, іспанської, португальської, польської та української; інші мови додаються поступово. Якість перевірки вимірюється за PAN-PC-11; окремі оцінки для кожної мови — у планах. Найвища точність для європейських мов із найдовшою історією валідації; нові мови додаються після завершення калібрування.
Що означає «Apache 2.0» для тендеру?
Ваш IT / DPO / IRB може клонувати github.com/NoplagLabs/noplag-engine, запустити рушій у тестовому середовищі, перевірити потік даних, переконатися, що право на видалення працює повністю, і відтворити наші опубліковані результати на власному тестовому корпусі. Без підписання документів, без NDA, без довіри до маркетингу. Для установ, у яких закупівля вимагає такого рівня перевірки, це і є рішення.
Чи AI-детектор буде для Claude-3, Gemini, або лише для GPT?
AI detection з’явиться незабаром — це у плані v1.2, на старті не доступно. Використовується підхід Binoculars (Hans та ін., 2024), який не залежить від конкретної моделі: не навчається під кожен LLM, а порівнює перплексію невеликої еталонної моделі з тестовим текстом, що забезпечує універсальність. Показники точності будуть опубліковані після проходження оцінювання, а не наперед, на змішаному LLM-контенті (проти ~70% для Claude-3 у GPT-детекторів). У методологічній статті описані всі відомі обмеження; ми їх не приховуємо.
Що, якщо науковий керівник заперечує складення флагу?
Для кожного позначеного фрагмента надається DOI джерела, мітка часу знімка корпусу, коміт рушія та причина класифікації. Повторіть перевірку на цьому ж коміті рушія — і отримаєте ідентичний результат. Надрукований звіт можна взяти на засідання; шляхи цитування клікабельні. У нас немає режиму «довіртеся балу», як у закритих системах.
Як бути із self-host в медицині чи з HIPAA?
Apache 2.0 + Docker — повністю локально. PostgreSQL + Redis теж у вашій інфраструктурі, дані не йдуть поза VPC. Зручно для клінічних рукописів, кейс-репортів або досліджень перед публікацією, які не можна завантажувати у хмару. Для корпоративних клієнтів корпус можна отримати як файл для індексації.
Перевірте розділ по 700+ млн наукових робіт.
Вставте розділ з дисертації, грантову заявку чи рукопис. Звіт з урахуванням цитування окремо покаже, що очікувано, що вимагає джерела, а що ваше. Безкоштовно — до 2 500 слів. Apache 2.0, якщо алгоритм має побачити IRB.