AKADEMICKI700 mln+ publikacji naukowych · Apache 2.0

Antyplagiat akademicki z obsługą cytowań

Wykrywanie plagiatów przygotowane dla tekstów naukowych — porównuje z ponad 700 mln prac z OpenAlex, CORE, arXiv, PubMed Central i Crossref. Klasyfikacja rozpoznająca cytowania. Silnik Apache 2.0 do audytu przez dowolny dział IT.

0 / 1,500 words
700 mln+ publikacji naukowychKlasyfikacja cytowańApache 2.0 · gotowy do audytu
KORPUS NAUKOWY

Pięć źródeł. 700 mln+ prac. Tylko otwarte lub z DOI.

Brak płatnych treści na subskrypcji — pracujemy wyłącznie na otwartych indeksach. Szeroki zasięg dla badań po Plan-S; węższy dla starszych zasobów płatnych.

01 · INDEKSmiesięcznie

OpenAlex

250 mln+ prac

Otwarty indeks naukowy — zastępuje dawny Microsoft Academic Graph. Obejmuje artykuły, konferencje, dane, książki we wszystkich dziedzinach.

02 · OPEN ACCESStygodniowo

CORE

290 mln+ prac

Największy światowy agregator badań open-access. Pełne teksty z 11 000+ repozytoriów. Silny w publikacjach z Europy i Wielkiej Brytanii.

03 · PREPRINTcodziennie

arXiv

2,4 mln+ preprintów

Fizyka, matematyka, informatyka, biologia ilościowa, statystyka, ekonomia. Porównanie z tą samą wersją, którą widział recenzent na arXiv.

04 · BIOMEDtygodniowo

PubMed Central

10 mln+ prac

Otwarty zasób nauk o życiu. Zindeksowane pełne teksty i metadane. Prace zgłoszone do NIH i mirrory czasopism.

Crossref · 150 mln+ prac z DOI · do rozstrzygania i śledzenia cytowań
NAUKOWE SCENARIUSZE

Trzy scenariusze. Jeden produkt.

Niezależnie czy przygotowują Państwo artykuł, broniony rozdział doktorskiej czy wniosek grantowy — narzędzie dopasowuje się do etapu, nie odwrotnie.

01

01 · Sprawdzenie przed wysłaniem do czasopisma

Uruchom ręczną kontrolę względem zbioru otwartych publikacji — zanim czasopismo zrobi to samo. iThenticate / Crossref Similarity Check i tak będzie w użyciu przy składaniu — warto zobaczyć to samo, co redakcja, zanim zobaczy to ona. Stała opłata Pro pozwala powtarzać kontrolę na każdym szkicu, bez limitu liczby dokumentów.

02

02 · Rozdział rozprawy / pracy doktorskiej

Można sprawdzać osobno rozdział lub cały tekst. Samo-cytowanie między rozdziałami jest wykrywane, ale klasyfikowane osobno (w pracach tej długości to normalne). Bibliografia automatycznie wyłączona ze zliczania. Historia wersji pozwala porównać styczniową wersję rozdziału z poprawioną w maju — widać co zmieniono, co poprawiono, co nowe.

03

03 · Wniosek grantowy / przegląd literatury

Fragmenty z poprzednich wspólnie tworzonych wniosków nie będą oznaczone jako plagiat. Rzetelnie cytowany przegląd nie będzie też. Model klasyfikacji rozróżnia dozwoloną recyklingowaną część naukową (własne publikacje z cytowaniem) od przypadkowego powtórzenia. Wynik uwzględnia tylko realnie problematyczne fragmenty.

KLASYFIKACJA CYTOWAŃ

Sześć kategorii. Każdy fragment przypisany do jednej.

28% podobieństwa w silnie cytowanym przeglądzie literatury ma inną wagę niż 28% przy parafrazowaniu bez odniesień. Klasyfikacja robi różnicę.

01 · Cytat dosłowny (z cytowaniem)

Cudzysłów + cytowanie w nawiasie lub przypis. Oczekiwane; wykluczone z wyniku podobieństwa. Kilka stylów cytowań wykrywanych automatycznie (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Cytat blokowy

Wcięty fragment 40+ słów z cytowaniem na końcu. Oczekiwane. Wzór: lewy margines 0,5 cala + cytowanie. Brak wcięcia — oznaczone jako błąd formatowania cytatu.

03 · Parafraza (z cytowaniem)

Podobny kształt zdania z odniesieniem w sąsiednim akapicie. Liczone z niższą wagą. Klasyfikacja uznaje np. “Smith (2023) twierdzi...” jako poprawne odniesienie poprzedzające parafrazę.

04 · Wiedza powszechna

Frazy z 2 000+ niezależnych źródeł („Woda wrze w 100°C”, standardowe definicje techniczne, znane wzory). Wyłączone z podobieństwa. Próg regulowany pod terminologię danego obszaru.

05 · Bibliografia

Bibliografia rozpoznawana po nagłówku i formacie. Wykluczona całkowicie z wyniku podobieństwa. Tych pozycji nie wymaga się oryginalnych — ich flagowanie fałszywie podnosi wynik.

06 · Parafraza bez odniesienia

Podobny kształt zdania, brak cytowania, brak cudzysłowu, brak formatowania cytatu blokowego. Kategoria, która powinna mieć wpływ na końcowy wynik. Liczone w pełni; pozostałe kategorie nie.

RAPORT NAUKOWY

Klasyfikacja dla każdego fragmentu. Źródło z URL. Audyt od źródła do wyniku.

Każdy znaleziony fragment ma DOI/URL źródła, kategorię klasyfikacji, datę indeksu i wersję silnika. Można bronić na spotkaniu, przed komisją, w audycie IT.

RAPORT · 4 217 słów · 47 fragmentów skategoryzowanychThe Modernist Novel: A Reassessment · Rozdział 3
Nagłówek · 8,2%Silnik · v0.4.2
#FRAGMENT · ŹRÓDŁOKLASYFIKACJA
12

Modernizm to raczej zbiór odrzucań — realizmu, postępu, spójnego „ja”... (Eysteinsson, 1990, s.117).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
CYTAT · Z CYTOWANIEM
18

Nacisk Eliota na bezosobowość pokazuje lirykę jako konstrukcję, nie wylew uczuć.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARAFRAZA · Z CYTOWANIEM
23

Powstanie powieści wynika z mieszczańskiego światopoglądu XVIII wieku.

openalex.org/W12345678 · Watt (1957) — brak odniesienia
BRAK ODNOŚNIKA
31

Strumień świadomości Joyce’a opiera się na psychologii czasu Wiliama Jamesa.

James, W. (1890). The Principles of Psychology, rozdz. IX (w bibliografii)
PARAFRAZA · Z CYTOWANIEM
34

Autorska wcześniej opublikowana dysertacja doktorska, Rozdział 1.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · autocytowanie, brak odniesienia w tym paragrafie
AUTOCYTAT
41

Wszystkie odniesienia — Eysteinsson, Eliot, Joyce, James, Watt i 32 innych.

Sekcja bibliografii, s. 38–41
BIBLIOGRAFIA · WYKLUCZONA
Nagłówek 8,2% = parafraza bez cytowania + waga autocytatu; cytowane fragmenty i bibliografia wykluczone.
  • 700 mln+prac naukowych zindeksowanych
  • 6style cytowań wykrywane automatycznie
  • 5języki skalibrowane na start
  • 3%pozostałość błędów ESL (udokumentowana)
  • Apache2.0 · audyt IRB
OBRONA PRZED RECENZJĄ

Trzy rzeczy, których zamknięty sprawdzacz nie przejdzie na posiedzeniu wydziału.

01 · POWTARZALNY WYNIK

Ponów analizę na tym samym kodzie

Każdy raport zawiera X-Engine-Commit i czas indeksu. Po miesiącach można sprawdzić ten sam tekst na tej samej wersji silnika i uzyskać ten sam wynik. Zamknięte systemy mogą zmienić model bez ostrzeżenia — Twój wynik ze stycznia w maju już się nie powtórzy.

Powtarzalność — podstawa rzetelności, od której zaczynaliśmy.
02 · AUDYTOWALNY ALGORYTM

Kod źródłowy Apache 2.0 na GitHub — pokaż na spotkaniu

Gdy pojawi się wykrywanie AI (wkrótce, w v1.2), rozstrzygnięcie można udowodnić: wskaż commit silnika, linię kodu odpowiadającą decyzji i dokumentację kalibracji ESL. Nie zrzut ekranu z systemu wsparcia.

github.com/NoplagLabs/noplag-engine — publiczne, indeksowane przez Google Scholar.
03 · WYROK ESL-AWARE

Liang i in. 2023 udokumentowali; działania ograniczające ryzyko na roadmapie

Stanford 2023 wykazał 61,3% fałszywie pozytywnych wyników na esejach TOEFL dla naiwnych detektorów. Gdy Noplag wprowadzi wykrywanie AI (wkrótce, na roadmapie v1.2), wynik będzie zawierał zakres dostosowany do osób uczących się angielskiego jako obcego, jeśli sygnatura leksykalna wskazuje na nie-native speakerów. Pozostały błąd zostanie udokumentowany, nie deklarujemy jego braku. Ścieżka nadpisania jest rejestrowana z commitem silnika i powodem.

/docs/developers/benchmarks — metodologia i wyniki PAN-PC-11.
DLA DZIAŁU ZAKUPÓW

Silnik Apache 2.0 do realnego audytu przez IT uczelni przed podpisaniem.

W większości przetargów na oprogramowanie do plagiatów padają wciąż te same pytania: gdzie trafia dokument, jaki jest algorytm, kto ma dostęp, jak usunąć dane i czy można powielić deklarowany wynik. U zamkniętych dostawców to wszystko pada na demo-sprzedaży. W Apache 2.0 dział IT może sklonować repozytorium, uruchomić silnik na własnej maszynie, prześledzić dane, sprawdzić proces usuwania i powtórzyć F1 na własnych dokumentach. To nie prościej — to naprawdę audytowalne. Dlatego uczelnie, które wcześniej odmawiały nowych dostawców, wybierają tę opcję.

Zobacz przewodnik zakupowy
FAQ

Pytania faktycznie zadawane przez naukowców.

Czy to zastępuje iThenticate przy wstępnym sprawdzeniu dla czasopisma?

Zwykle nie — jeśli czasopismo wymaga iThenticate (Elsevier, Springer, Wiley, IEEE), zrobi to przy złożeniu tekstu. Noplag służy do iteracyjnej kontroli wersji przed złożeniem. iThenticate po $125 za dokument staje się barierą po 4 wersji; stała opłata Pro nie. Pełne porównanie z iThenticate: noplag.com/vs-ithenticate.

A co z dysertacjami ProQuest? Czy ich tam nie macie?

Prawda — luka jest realna. ProQuest to płatna baza, której nie ma w OpenAlex/CORE. Pokrywamy ~700 mln otwartych prac naukowych, to szerszy zbiór dla współczesnych badań (po Plan-S), węższy dla starszych amerykańskich dysertacji. Jeśli głównym wymogiem są amerykańskie prace doktorskie, iThenticate będzie właściwym narzędziem dla tego celu.

Jak silnik radzi sobie z innymi stylami cytowań?

Wykrywamy MLA, APA, Chicago / Turabian, Harvard, Vancouver, IEEE po formacie bibliografii. Mniej popularne (ACS, AMA, ASA, Bluebook, Oxford): klasyfikacja działa głównie po cudzysłowie + nawiasach w pobliżu, walidator stylu w roadmapie v1.2. Użytkownicy self-host mogą samodzielnie dodać obsługę w alignment/.

Jaki jest odsetek fałszywie pozytywnych w cytowanych przeglądach literatury?

Niższy niż przy ocenie parafraz bez cytowania, bo klasyfikacja wyklucza poprawnie cytowane fragmenty z wyniku. Nasz wynik: ~3,4% fałszywych alarmów na PAN-PC-11 (gdzie dużo cytatów). Zamknięte narzędzia nieklasyfikujące cytowań pokazują 12–18% na tym samym korpusie.

Czy mogę wykluczyć własne prace z porównań?

Plan Pro — można dodać listę dozwolonych autocytowań (ORCID, DOI, instytucjonalne URL). Znalezione tam fragmenty oznaczone jako AUTOCYTAT, nie liczą się do wyniku. Dla naukowców opierających nowe wnioski grantowe na wcześniejszych publikacjach — to normalne, nie plagiat.

Jak w praktyce z wielojęzycznością?

Wykrywanie jest skalibrowane dla angielskiego, hiszpańskiego, portugalskiego, polskiego i ukraińskiego na start, kolejne języki będą dodawane. Jakość wykrywania jest testowana na PAN-PC-11; ocena dla poszczególnych języków jest w planach. Najlepsze wyniki dla języków europejskich z najdłuższą historią walidacji; nowe języki pojawiają się wraz z ukończeniem kalibracji.

Co znaczy “Apache 2.0” dla działu IT?

Twój dział IT / DPO / IRB może sklonować github.com/NoplagLabs/noplag-engine, uruchomić silnik w piaskownicy, przeanalizować przepływ danych, sprawdzić działanie prawa do usunięcia danych oraz odtworzyć nasze opublikowane wyniki testów na własnym korpusie testowym. Bez podpisywania czegokolwiek, bez NDA, bez zaufania do naszego marketingu. Dla instytucji, które wymagają takiej głębokości weryfikacji w procesie zakupowym, to jest rozwiązanie.

Czy detekcja AI obejmie teksty Claude-3 + Gemini, czy wyłącznie GPT?

Wykrywanie AI pojawi się wkrótce — jest na roadmapie v1.2, nie jest dostępne na start. Podejście to Binoculars (Hans i in. 2024), niezależne od modelu: nie wymaga trenowania pod konkretne LLM, porównuje perplexity małego modelu referencyjnego z testowanym tekstem, co daje uogólnienie. Wyniki dokładności zostaną opublikowane po zakończeniu ewaluacji funkcji, a nie przed nią, na mieszanych treściach LLM (dla detektorów trenowanych na GPT to ok. 70% na Claude-3). Publikacja metodologii opisuje przypadki błędów; nie ukrywamy ich.

A jeśli promotor podważy wynik?

Każdy fragment z flagą: DOI źródła, data indeksu, commit silnika, powód. Sprawdzenie na tym commicie powtórzy ten sam wynik. Raport można pokazać na spotkaniu — ścieżki cytowań są klikalne. Nie mamy trybu "zaufać wynikowi" — to domena zamkniętych narzędzi.

A self-host przy badaniach medycznych / klinicznych z HIPAA?

Apache 2.0 + Docker — całość działa lokalnie w sieci uczelni. PostgreSQL + Redis na własnym serwerze, żaden ruch nie opuszcza VPC. Przydatne do tekstów klinicznych, studiów przypadków, prac przed publikacją, które nie mogą wyjść poza chmurę uczelni. Klienci instytucjonalni dostają korpus jako paczkę do własnego indeksowania.

Sprawdź rozdział wśród 700 mln+ publikacji naukowych.

Wklej fragment pracy, wniosek grantowy lub szkic artykułu. Raport z rozpoznaniem cytowań wskaże co jest oczywiste, co wymaga cytatu, a co własne. Do 2 500 słów bez opłat. Apache 2.0 jeśli dział IT ma sprawdzić algorytm najpierw.

Antyplagiat akademicki z obsługą cytowań