Antyplagiat dla naukowców przed złożeniem pracy
Przed-wysyłkowa kontrola manuskryptu względem 700 mln+ prac naukowych. Moje Foldery śledzą Twoje wcześniejsze publikacje, więc prawidłowe autocytowanie nie zawyża wyniku. Końcówka rezydująca w UE dla wrażliwych badań przed publikacją. Silnik Apache 2.0 — podlega przeglądowi komisji bioetycznej.
Cztery role badawcze. Jedna ścieżka sprawdzenia.
Rozdział do pracy doktorskiej - przed wysyłką
Pracuj nad kolejnymi rozdziałami. Śledź autocytowania między wersjami.
- Sprawdzenie każdego rozdziału + historia wersji
- Lista autocytowań (ORCID + lista DOI)
- Bibliografia automatycznie wyłączona
Manuskrypt przed wysłaniem do czasopisma
iThenticate sprawdza przy wysyłce; my robimy to wcześniej.
- 700 mln+ otwartych publikacji naukowych
- Klasyfikacja cytowań (cytowane vs parafraza bez cytowania)
- Pro w stałej cenie · Bez kosztu za kolejne kredyty
Przegląd literatury + weryfikacja wniosku
Ponowne używanie własnych tekstów grantowych to standard — wykrywamy to.
- Rozpoznaje wcześniejsze publikacje + granty
- Lista dozwolonych cytowań współautorów
- Eksport raportu klasyfikacji do PDF dla współpracowników
QA przed publikacją dla całego laboratorium
Wyłapanie problemów w jednym miejscu dla wszystkich zgłoszeń z laboratorium.
- Folder na projekt + na postdoka
- Rezydencja UE dla danych klinicznych/wrażliwych
- Silnik Apache 2.0 — podlega przeglądowi komisji
Trzy kroki przed wysłaniem manuskryptu do czasopisma.
Można powtarzać. Wychwytuje własne autocytowania, więc nie zawyżysz wyniku iThenticate / Crossref przy wysyłce. Oceny detekcji AI już wkrótce — sprawdzisz przed recenzją.
01 · Szkic + lista dozwolonych
Prześlij szkic rozdziału lub manuskryptu. Dodaj swój ORCID + listę DOI (lista dozwolonych) — Twoje wcześniejsze publikacje zostaną oznaczone jako SELF-CITE, nie jako plagiat. Współautorskie DOI też; silnik rozpoznaje prawidłowe powtórzenia tekstów naukowych.
02 · Uruchom analizę
L1 winnowing → obecnie na żywo-web, wkrótce L2 MinHash (v1.1) i L3 osadzenia wektorowe (v1.2). Wykrywa kopiowanie dosłowne i prawie dosłowne; wykrywanie parafraz pojawi się w L2 i L3. Klasyfikacja cytowań oddziela materiał cytowany od niecytowanych parafraz. Obsługa wielu języków; detekcja skalibrowana dla angielskiego, hiszpańskiego, portugalskiego, polskiego i ukraińskiego na start, kolejne języki w przygotowaniu. Mediana czasu analizy: 47 sekund na tekst.
03 · Przejrzyj + powtórz
Raport oznacza fragmenty wg kategorii: SELF-CITE (Twoje własne, spodziewane), CITED (z cytatem, spodziewane), CITED-PARA (parafraza z cytatem, niska waga), UNCITED-PARA (to wymaga uwagi) i AI-LIKELY (z paskiem ESL) już wkrótce. Powtarzalność — commit silnika + snapshot korpusu na każdym raporcie.
Sześć kategorii prawidłowego powtórzenia tekstu naukowego — żadna nie powinna podnosić wyniku.
Automatyczne narzędzia oznaczają dowolne podobieństwo jako plagiat. Naukowcy regularnie powtarzają własny tekst legalnie. Tak to rozróżnia klasyfikator.
01 · WŁASNA WCZEŚNIEJSZA PRACA
Lista ORCID + DOI. Publikacje z tej listy oznaczamy jako SELF-CITE — nie jako plagiat. Typowe w przeglądach literatury („jak twierdziłem: Chen 2023…”) i nowych wnioskach na bazie wcześniejszych wyników.
02 · PRACA WSPÓŁAUTORSKA
Dodaj ORCID-y współautorów do listy. Prace współautorskie oznaczamy jako CO-CITE. Przydatne, gdy rozbudowujesz tekst oparty o wcześniejszą współpracę — sekcja metod może być powtarzana w kilku publikacjach.
03 · LABORATORYJNE DZIEDZICTWO
Wspólny folder PI: standardowe metody, protokoły, teksty etyczne powtarzane w pracach z laboratorium. Oznaczenie LAB-CITE i wykluczone z wyniku. Teksty zaakceptowane przez komisję nie wymagają nowego pisania za każdym razem.
04 · ZASTRZEŻONE PREPRINTY
Własny preprint z arXiv / bioRxiv odpowiadający manuskryptowi przesyłanemu teraz. Klasyfikator rozpoznaje relację preprint → wersja czasopismowa i oznacza jako PREPRINT-SELF. Nie liczy się do wyniku. Czasopisma zakazujące preprintów mogą wymagać ostrzejszych ustawień.
05 · WYCOFANE CYTOWANIA
Integracja Crossref z Retraction Watch oznacza fragmenty cytujące wycofane prace. Nie zmienia wyniku — ale lepiej wiedzieć przed wysłaniem. Chroni przed sytuacją: „cytowałem pracę, która została wycofana miesiąc temu”.
06 · DANE WRAŻLIWE / KOMISJA
Końcówka rezydująca w UE (api.eu.noplag.com) trzyma manuskrypt na infrastrukturze w UE. Można postawić silnik całkowicie we własnej sieci do publikacji z danymi pacjentów/HIPAA/GDPR. Apache 2.0 + Docker; żadny ruch nie wychodzi poza VPC.
Porządek wg projektu. Ślad audytowy wg daty.
Przyporządkuj manuskrypty wg projektu, roku pracy lub cyklu grantu. Możesz powtórzyć analizę na późniejszych szkicach — raporty są powtarzalne przez miesiące.
Trzy rzeczy, których wymaga wrażliwe badanie przed publikacją od narzędzia.
Manuskrypty nie opuszczają infrastruktury UE
Pro+ kierowane do api.eu.noplag.com. Hostowane na centrach danych Hetzner w UE (Falkenstein + Helsinki). Zgłoszenie, odcisk palca i raport pozostają w UE. Zgodne z RODO domyślnie; DPA na życzenie.
Silnik uruchomiony w instytucji
Apache 2.0 + Docker compose. Cały pipeline detekcji działa na własnej infrastrukturze. Można użyć własnego Postgresa + Redis; korpus jako indeksowalna paczka na wersji Enterprise. Nic nie wychodzi poza VPC. To właściwy wybór dla danych klinicznych, opisów przypadków pacjentów, czy badań poufnych.
Usuwanie wszystkich Twoich danych odcisków
Jeden klik w Ustawieniach. W 24 godziny usuwamy każdy odcisk, raport, pozycję z listy dozwolonych i metadane. Zgodne z art. 17 RODO. Użytkownik samodzielny ma własną bazę — w chmurze API do usuwania jest udokumentowane.
Silnik Apache 2.0 możliwy do przeglądu przez komisję przed akceptacją.
Większość przeglądów narzędzi do wykrywania plagiatu przez instytucje rozbija się o te same pytania: gdzie trafia manuskrypt, jak działa algorytm porównania, czy dane pacjentów wychodzą poza instytucję, jak wygląda ścieżka usuwania, czy można powtórzyć publ. deklarację skuteczności. Zamknięte narzędzia odpowiadają na to podczas rozmowy sprzedażowej. W Apache 2.0 komisja może sklonować repozytorium, uruchomić silnik na sandboxie, prześledzić przepływ danych, sprawdzić usuwanie end-to-end i powtórzyć metryki F1 na własnych danych. Nie chodzi o niższą poprzeczkę, tylko o przegląd, który instytucja naprawdę może skończyć. Dlatego biura danych naukowych, które zwykle odrzucały nowych dostawców plagiatu, podpisują właśnie to narzędzie.
Przeczytaj przewodnik dla komisjiPytania, które padają w biurze badań.
- Dlaczego wynik podobieństwa zmienia się po dodaniu mojego ORCID + listy DOI?
- Bo silnik oznacza każdą sekwencję, która pasuje do pracy z listy, jako SELF-CITE zamiast UNCITED-PARA. Dobrane fragmenty nie znikają — są klasyfikowane inaczej. Autocytaty ważą prawie nic w głównym wyniku. Przykład: jeśli rozdział rozprawy cytuje dwa razy Twój preprint i raz artykuł współautora, trzy fragmenty zmieniają kategorię z „zaliczony” na „prawidłowe powtórzenie naukowe”.
- Czy silnik jest trenowany na przesłanych manuskryptach?
- Nie. Tekst jest odciskowany (wyłącznie hash — sygnatura nieodwracalna) i zapisywany w wydzielonej bazie. Tekst usuwamy po 30 dniach, chyba że włączona retencja. Planowany detektor AI Binoculars (wkrótce) będzie trenowany wyłącznie na korpusach publicznych; nie dodajemy przesłanych manuskryptów do zbioru treningowego. Zapisane w DPA.
- A co z moim preprintem na arXiv / bioRxiv?
- Jeśli podasz DOI preprintu na liście, dopasowania oznaczane są jako PREPRINT-SELF i nie liczą się do wyniku podobieństwa. Silnik rozpoznaje ewolucję wersji czasopismowej z preprintu jako oczekiwaną. Czasopisma jawnie zakazujące preprintów (niektóre nadal to robią) mogą wymagać ostrzejszych ustawień — ale większość głównych tytułów (Nature, Cell, NEJM, PLOS) akceptuje preprinty, a tagowanie SELF jest zgodne z tą polityką.
- Jak detektor AI potraktuje współautorów z ESL?
- Wykrywanie AI wkrótce dostępne — na roadmapie v1.2. Po wdrożeniu będzie stosować kalibrację dla każdego języka i werdykt dostosowany do poziomu ESL. Gdy sygnatura leksykalna wskazuje na nie-native English (częste w międzynarodowych zespołach), werdykt to ESL ADJ z udokumentowanym błędem resztkowym, a nie deklaracja zera. W pracy Liang i in. 2023 wykazano 61,3% FPR na esejach TOEFL dla naiwnych detektorów; naszą metodologię ograniczania tego zjawiska publikujemy na /docs/developers/benchmarks. Współautorzy ESL nie są niesprawiedliwie oznaczani.
- Czy mogę uruchomić silnik na klastrze Slurm do wsadowych sprawdzeń?
- Tak — Apache 2.0 + Docker. Uruchom kontener silnika na węzłach obliczeniowych swojego klastra; pobieraj dane z współdzielonego systemu plików; generuj raporty jako JSON tam, skąd czyta je Twój pipeline. Przydatne do masowego sprawdzania rocznego dorobku laboratorium względem najnowszego snapshotu korpusu. Przykładowy skrypt Slurm sbatch na github.com/NoplagLabs/noplag-engine.
- A co z manuskryptami z danymi klinicznymi/pacjentów?
- Silnik na miejscu w VPC. Nic nie wychodzi poza Twoją sieć. Silnik nie wymaga internetu do sprawdzania w korpusie (warstwa live-web jest wtedy wyłączona — to opcja). Zgodność z HIPAA jeśli system IT jest poprawnie skonfigurowany; obsługiwane jak dowolny wewnętrzny serwis.
- Czym to się różni od iThenticate przy wysyłce?
- iThenticate sprawdza przy wysyłce i widzi to redaktor — nie można poprawiać. Noplag to własne sprawdzenie przed tym etapem. Nasz algorytm pokrywa się na treściach open access (nawet szerzej po Plan-S); jest węższy jeśli chodzi o subskrypcyjne/za paywallem, do których iThenticate ma umowy licencyjne. Obsługa autocytowań to najczęstsza potrzeba, której iThenticate nie rozwiązuje dobrze.
- Czy integruje się z moim menedżerem literatury (Zotero / Mendeley / EndNote)?
- Lista dozwolonych można zaimportować z BibTeX, RIS i przez bezpośrednie API ORCID. Wrzuć eksport bibliotek z Zotero lub podaj ORCID — lista dozwolonych DOI wypełni się w kilka sekund. Synchronizacja czasu rzeczywistego z Mendeley + EndNote będzie w wersji v1.2; na razie działa eksport.
- Jak wygląda obsługa wielu języków dla prac z nieanglojęzycznych czasopism?
- Detekcja skalibrowana dla angielskiego, hiszpańskiego, portugalskiego, polskiego i ukraińskiego na start; kolejne języki w przygotowaniu. Najlepsza jakość dla języków europejskich (długa historia kalibracji). Jakość detekcji weryfikowana na PAN-PC-11; ocena dla poszczególnych języków na roadmapie. Szczególnie przydatne w środowiskach akademickich Europy i Ameryki Południowej.
- Co jeśli cytowana praca zostanie wycofana po zgłoszeniu?
- Integracja Crossref Retraction Watch oznacza wycofanie przy każdym ponownym sprawdzeniu manuskryptu. Jeśli już wysłałeś, zgłoś to redaktorowi (niektóre czasopisma wymagają osobnego procesu po wycofaniu). Nie zmienia to wyniku podobieństwa, ale będziesz wiedział jeszcze przed recenzją.
Przepuść rozdział przez analizę. Zobacz podział autocytowań.
Prześlij szkic manuskryptu, rozdział rozprawy albo przegląd literatury do grantu. Dodaj swój ORCID. Zobacz które fragmenty są SELF-CITE, CITED i UNCITED-PARA; AI-LIKELY już wkrótce. Gratis do 2 500 słów. Rezydencja UE w Pro+ dla wrażliwych danych przed publikacją.