Antyplagiat akademicki z obsługą cytowań
Wykrywanie plagiatów przygotowane dla tekstów naukowych — porównuje z ponad 700 mln prac z OpenAlex, CORE, arXiv, PubMed Central i Crossref. Klasyfikacja rozpoznająca cytowania. Silnik Apache 2.0 do audytu przez dowolny dział IT.
Pięć źródeł. 700 mln+ prac. Tylko otwarte lub z DOI.
Brak płatnych treści na subskrypcji — pracujemy wyłącznie na otwartych indeksach. Szeroki zasięg dla badań po Plan-S; węższy dla starszych zasobów płatnych.
OpenAlex
250 mln+ pracOtwarty indeks naukowy — zastępuje dawny Microsoft Academic Graph. Obejmuje artykuły, konferencje, dane, książki we wszystkich dziedzinach.
CORE
290 mln+ pracNajwiększy światowy agregator badań open-access. Pełne teksty z 11 000+ repozytoriów. Silny w publikacjach z Europy i Wielkiej Brytanii.
arXiv
2,4 mln+ preprintówFizyka, matematyka, informatyka, biologia ilościowa, statystyka, ekonomia. Porównanie z tą samą wersją, którą widział recenzent na arXiv.
PubMed Central
10 mln+ pracOtwarty zasób nauk o życiu. Zindeksowane pełne teksty i metadane. Prace zgłoszone do NIH i mirrory czasopism.
Trzy scenariusze. Jeden produkt.
Niezależnie czy przygotowują Państwo artykuł, broniony rozdział doktorskiej czy wniosek grantowy — narzędzie dopasowuje się do etapu, nie odwrotnie.
01 · Sprawdzenie przed wysłaniem do czasopisma
Uruchom ręczną kontrolę względem zbioru otwartych publikacji — zanim czasopismo zrobi to samo. iThenticate / Crossref Similarity Check i tak będzie w użyciu przy składaniu — warto zobaczyć to samo, co redakcja, zanim zobaczy to ona. Stała opłata Pro pozwala powtarzać kontrolę na każdym szkicu, bez limitu liczby dokumentów.
02 · Rozdział rozprawy / pracy doktorskiej
Można sprawdzać osobno rozdział lub cały tekst. Samo-cytowanie między rozdziałami jest wykrywane, ale klasyfikowane osobno (w pracach tej długości to normalne). Bibliografia automatycznie wyłączona ze zliczania. Historia wersji pozwala porównać styczniową wersję rozdziału z poprawioną w maju — widać co zmieniono, co poprawiono, co nowe.
03 · Wniosek grantowy / przegląd literatury
Fragmenty z poprzednich wspólnie tworzonych wniosków nie będą oznaczone jako plagiat. Rzetelnie cytowany przegląd nie będzie też. Model klasyfikacji rozróżnia dozwoloną recyklingowaną część naukową (własne publikacje z cytowaniem) od przypadkowego powtórzenia. Wynik uwzględnia tylko realnie problematyczne fragmenty.
Sześć kategorii. Każdy fragment przypisany do jednej.
28% podobieństwa w silnie cytowanym przeglądzie literatury ma inną wagę niż 28% przy parafrazowaniu bez odniesień. Klasyfikacja robi różnicę.
01 · Cytat dosłowny (z cytowaniem)
Cudzysłów + cytowanie w nawiasie lub przypis. Oczekiwane; wykluczone z wyniku podobieństwa. Kilka stylów cytowań wykrywanych automatycznie (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Cytat blokowy
Wcięty fragment 40+ słów z cytowaniem na końcu. Oczekiwane. Wzór: lewy margines 0,5 cala + cytowanie. Brak wcięcia — oznaczone jako błąd formatowania cytatu.
03 · Parafraza (z cytowaniem)
Podobny kształt zdania z odniesieniem w sąsiednim akapicie. Liczone z niższą wagą. Klasyfikacja uznaje np. “Smith (2023) twierdzi...” jako poprawne odniesienie poprzedzające parafrazę.
04 · Wiedza powszechna
Frazy z 2 000+ niezależnych źródeł („Woda wrze w 100°C”, standardowe definicje techniczne, znane wzory). Wyłączone z podobieństwa. Próg regulowany pod terminologię danego obszaru.
05 · Bibliografia
Bibliografia rozpoznawana po nagłówku i formacie. Wykluczona całkowicie z wyniku podobieństwa. Tych pozycji nie wymaga się oryginalnych — ich flagowanie fałszywie podnosi wynik.
06 · Parafraza bez odniesienia
Podobny kształt zdania, brak cytowania, brak cudzysłowu, brak formatowania cytatu blokowego. Kategoria, która powinna mieć wpływ na końcowy wynik. Liczone w pełni; pozostałe kategorie nie.
Klasyfikacja dla każdego fragmentu. Źródło z URL. Audyt od źródła do wyniku.
Każdy znaleziony fragment ma DOI/URL źródła, kategorię klasyfikacji, datę indeksu i wersję silnika. Można bronić na spotkaniu, przed komisją, w audycie IT.
Modernizm to raczej zbiór odrzucań — realizmu, postępu, spójnego „ja”... (Eysteinsson, 1990, s.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990Nacisk Eliota na bezosobowość pokazuje lirykę jako konstrukcję, nie wylew uczuć.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…Powstanie powieści wynika z mieszczańskiego światopoglądu XVIII wieku.
openalex.org/W12345678 · Watt (1957) — brak odniesieniaStrumień świadomości Joyce’a opiera się na psychologii czasu Wiliama Jamesa.
James, W. (1890). The Principles of Psychology, rozdz. IX (w bibliografii)Autorska wcześniej opublikowana dysertacja doktorska, Rozdział 1.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · autocytowanie, brak odniesienia w tym paragrafieWszystkie odniesienia — Eysteinsson, Eliot, Joyce, James, Watt i 32 innych.
Sekcja bibliografii, s. 38–41- 700 mln+prac naukowych zindeksowanych
- 6style cytowań wykrywane automatycznie
- 5języki skalibrowane na start
- 3%pozostałość błędów ESL (udokumentowana)
- Apache2.0 · audyt IRB
Trzy rzeczy, których zamknięty sprawdzacz nie przejdzie na posiedzeniu wydziału.
Ponów analizę na tym samym kodzie
Każdy raport zawiera X-Engine-Commit i czas indeksu. Po miesiącach można sprawdzić ten sam tekst na tej samej wersji silnika i uzyskać ten sam wynik. Zamknięte systemy mogą zmienić model bez ostrzeżenia — Twój wynik ze stycznia w maju już się nie powtórzy.
Kod źródłowy Apache 2.0 na GitHub — pokaż na spotkaniu
Gdy pojawi się wykrywanie AI (wkrótce, w v1.2), rozstrzygnięcie można udowodnić: wskaż commit silnika, linię kodu odpowiadającą decyzji i dokumentację kalibracji ESL. Nie zrzut ekranu z systemu wsparcia.
Liang i in. 2023 udokumentowali; działania ograniczające ryzyko na roadmapie
Stanford 2023 wykazał 61,3% fałszywie pozytywnych wyników na esejach TOEFL dla naiwnych detektorów. Gdy Noplag wprowadzi wykrywanie AI (wkrótce, na roadmapie v1.2), wynik będzie zawierał zakres dostosowany do osób uczących się angielskiego jako obcego, jeśli sygnatura leksykalna wskazuje na nie-native speakerów. Pozostały błąd zostanie udokumentowany, nie deklarujemy jego braku. Ścieżka nadpisania jest rejestrowana z commitem silnika i powodem.
Silnik Apache 2.0 do realnego audytu przez IT uczelni przed podpisaniem.
W większości przetargów na oprogramowanie do plagiatów padają wciąż te same pytania: gdzie trafia dokument, jaki jest algorytm, kto ma dostęp, jak usunąć dane i czy można powielić deklarowany wynik. U zamkniętych dostawców to wszystko pada na demo-sprzedaży. W Apache 2.0 dział IT może sklonować repozytorium, uruchomić silnik na własnej maszynie, prześledzić dane, sprawdzić proces usuwania i powtórzyć F1 na własnych dokumentach. To nie prościej — to naprawdę audytowalne. Dlatego uczelnie, które wcześniej odmawiały nowych dostawców, wybierają tę opcję.
Zobacz przewodnik zakupowyPytania faktycznie zadawane przez naukowców.
Czy to zastępuje iThenticate przy wstępnym sprawdzeniu dla czasopisma?
Zwykle nie — jeśli czasopismo wymaga iThenticate (Elsevier, Springer, Wiley, IEEE), zrobi to przy złożeniu tekstu. Noplag służy do iteracyjnej kontroli wersji przed złożeniem. iThenticate po $125 za dokument staje się barierą po 4 wersji; stała opłata Pro nie. Pełne porównanie z iThenticate: noplag.com/vs-ithenticate.
A co z dysertacjami ProQuest? Czy ich tam nie macie?
Prawda — luka jest realna. ProQuest to płatna baza, której nie ma w OpenAlex/CORE. Pokrywamy ~700 mln otwartych prac naukowych, to szerszy zbiór dla współczesnych badań (po Plan-S), węższy dla starszych amerykańskich dysertacji. Jeśli głównym wymogiem są amerykańskie prace doktorskie, iThenticate będzie właściwym narzędziem dla tego celu.
Jak silnik radzi sobie z innymi stylami cytowań?
Wykrywamy MLA, APA, Chicago / Turabian, Harvard, Vancouver, IEEE po formacie bibliografii. Mniej popularne (ACS, AMA, ASA, Bluebook, Oxford): klasyfikacja działa głównie po cudzysłowie + nawiasach w pobliżu, walidator stylu w roadmapie v1.2. Użytkownicy self-host mogą samodzielnie dodać obsługę w alignment/.
Jaki jest odsetek fałszywie pozytywnych w cytowanych przeglądach literatury?
Niższy niż przy ocenie parafraz bez cytowania, bo klasyfikacja wyklucza poprawnie cytowane fragmenty z wyniku. Nasz wynik: ~3,4% fałszywych alarmów na PAN-PC-11 (gdzie dużo cytatów). Zamknięte narzędzia nieklasyfikujące cytowań pokazują 12–18% na tym samym korpusie.
Czy mogę wykluczyć własne prace z porównań?
Plan Pro — można dodać listę dozwolonych autocytowań (ORCID, DOI, instytucjonalne URL). Znalezione tam fragmenty oznaczone jako AUTOCYTAT, nie liczą się do wyniku. Dla naukowców opierających nowe wnioski grantowe na wcześniejszych publikacjach — to normalne, nie plagiat.
Jak w praktyce z wielojęzycznością?
Wykrywanie jest skalibrowane dla angielskiego, hiszpańskiego, portugalskiego, polskiego i ukraińskiego na start, kolejne języki będą dodawane. Jakość wykrywania jest testowana na PAN-PC-11; ocena dla poszczególnych języków jest w planach. Najlepsze wyniki dla języków europejskich z najdłuższą historią walidacji; nowe języki pojawiają się wraz z ukończeniem kalibracji.
Co znaczy “Apache 2.0” dla działu IT?
Twój dział IT / DPO / IRB może sklonować github.com/NoplagLabs/noplag-engine, uruchomić silnik w piaskownicy, przeanalizować przepływ danych, sprawdzić działanie prawa do usunięcia danych oraz odtworzyć nasze opublikowane wyniki testów na własnym korpusie testowym. Bez podpisywania czegokolwiek, bez NDA, bez zaufania do naszego marketingu. Dla instytucji, które wymagają takiej głębokości weryfikacji w procesie zakupowym, to jest rozwiązanie.
Czy detekcja AI obejmie teksty Claude-3 + Gemini, czy wyłącznie GPT?
Wykrywanie AI pojawi się wkrótce — jest na roadmapie v1.2, nie jest dostępne na start. Podejście to Binoculars (Hans i in. 2024), niezależne od modelu: nie wymaga trenowania pod konkretne LLM, porównuje perplexity małego modelu referencyjnego z testowanym tekstem, co daje uogólnienie. Wyniki dokładności zostaną opublikowane po zakończeniu ewaluacji funkcji, a nie przed nią, na mieszanych treściach LLM (dla detektorów trenowanych na GPT to ok. 70% na Claude-3). Publikacja metodologii opisuje przypadki błędów; nie ukrywamy ich.
A jeśli promotor podważy wynik?
Każdy fragment z flagą: DOI źródła, data indeksu, commit silnika, powód. Sprawdzenie na tym commicie powtórzy ten sam wynik. Raport można pokazać na spotkaniu — ścieżki cytowań są klikalne. Nie mamy trybu "zaufać wynikowi" — to domena zamkniętych narzędzi.
A self-host przy badaniach medycznych / klinicznych z HIPAA?
Apache 2.0 + Docker — całość działa lokalnie w sieci uczelni. PostgreSQL + Redis na własnym serwerze, żaden ruch nie opuszcza VPC. Przydatne do tekstów klinicznych, studiów przypadków, prac przed publikacją, które nie mogą wyjść poza chmurę uczelni. Klienci instytucjonalni dostają korpus jako paczkę do własnego indeksowania.
Sprawdź rozdział wśród 700 mln+ publikacji naukowych.
Wklej fragment pracy, wniosek grantowy lub szkic artykułu. Raport z rozpoznaniem cytowań wskaże co jest oczywiste, co wymaga cytatu, a co własne. Do 2 500 słów bez opłat. Apache 2.0 jeśli dział IT ma sprawdzić algorytm najpierw.