AKADEMISKT700M+ verk · Apache 2.0

Akademisk plagiatkontroll för forskning

Plagiatdetektion för vetenskapligt skrivande — söker bland 700M+ akademiska verk via OpenAlex, CORE, arXiv, PubMed Central och Crossref. Klassificering med citeringsmedvetenhet. Apache 2.0-motor auditerbar av institutionens IT.

0 / 1,500 words
700M+ vetenskapliga verkKlassificering med citeringsmedvetenhetApache 2.0 · auditerbar av institution
DET AKADEMISKA KORPUSET

Fem källor. 700M+ verk. Alla öppet tillgängliga eller DOI-registrerade.

Ingen betalmurad prenumerationsdata — allt bygger på öppet tillgängliga index. Bredare täckning för forskning efter Plan S; smalare för äldre material bakom betalvägg.

01 · INDEXmånatlig

OpenAlex

250M+ verk

Öppet index för vetenskapliga verk — ersätter tidigare Microsoft Academic Graph. Täckning för tidskriftsartiklar, konferensbidrag, dataset, böcker i alla discipliner.

02 · OPEN ACCESSvarje vecka

CORE

290M+ artiklar

Världens största aggregator för öppet tillgänglig forskning. Fulltext från 11 000+ repositorier. Stark täckning för europeisk och brittisk forskning.

03 · PREPRINTdagligen

arXiv

2,4M+ preprints

Fysik, matematik, datavetenskap, kvantitativ biologi, statistik, ekonomi. Jämför mot den version granskaren såg på arXiv.

04 · BIOMEDvarje vecka

PubMed Central

10M+ artiklar

Öppen biomedicinsk/livsvetenskaplig arkiv. Indexerad fulltext + metadata. NIH-insatt forskning och journalflöden.

Crossref · 150M+ DOI-registrerade verk · används för kanonisk upplösning + citeringsgraftraversering
AKADEMISKA ARBETSSÄTT

Tre arbetsflöden. En produkt.

Oavsett om De förbereder en tidskriftsartikel, försvarar ett avhandlingskapitel eller färdigställer en ansökan – kontrollen anpassar sig till ert steg, inte tvärtom.

01

01 · Förgranskning inför tidskriftsinlämning

Kör manus mot det öppet tillgängliga universumet innan tidskriften gör det. iThenticate / Crossref Similarity Check körs ändå vid inlämning — De vill se vad redaktören ser innan det. Pro-version med fast pris tillåter iteration över utkast utan att bränna dokumentkrediter.

02

02 · Avhandlings- eller examensarbete

Dela upp kapitelvis eller klistra in hela avhandlingen. Självcitering mellan kapitel flaggas men klassas separat (förväntat i stora texter). Bibliografin utesluts automatiskt från poängen. Versionshistorik jämför kapitel mellan månader — se ändringar, förbättringar, nytt.

03

03 · Ansökan eller litteraturöversikt

Standardformulär från tidigare ansökningar flaggas inte som plagiat. Korrekt citerad översikt flaggas inte heller. Modellen klassar legitimt återanvänd akademiskt material (eget med citering) annorlunda än oavsiktlig kopiering. Poängen återspeglar faktiska problem, inte det strukturellt oundvikliga.

KLASSIFICERING MED CITATIONSANALYS

Sex kategorier. Varje träff landar i en.

En 28%-rapport på en högt citerad översiktstekst betyder något annat än 28% på ociterad omformulering. Klassificeringen gör skillnaden.

01 · Direktcitat (citerat)

Citattecken + föräldracitering ELLER fotnot. Räknas som väntat; utesluts från poäng. Flera citeringsstilar upptäcks automatiskt (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Blockcitat

Indraget stycke om 40+ ord med efterföljande citat. Räknas som väntat. 1,3 cm indrag + citatmönster känns igen; saknat indrag flaggas som formateringsglidning.

03 · Parafras (citerad)

Match på meningens struktur med attribution någonstans i omgivande stycke. Räknas med reducerad vikt. Klassificeringen accepterar “Smith (2023) hävdar ...” som legitim attribution före parafras.

04 · Allmän kunskap

Uttryck som förekommer i 2 000+ oberoende källor (“Vatten kokar vid 100°C”, standarddefinitioner, kända formler). Utesluts från likhetsgrad. Tröskel kan justeras för fält med tätare terminologi.

05 · Bibliografi

Referenslista upptäcks automatiskt genom rubrik + format. Utesluts helt från likhetsgrad. Referenserna i sig behöver inte vara originella — att flagga dem höjer poängen utan relevans.

06 · Oattributerad parafras

Match på meningens struktur utan citat i närheten, inga citattecken, ingen blockcitatsformatering. Kategorin som driver er likhetsgrad. Räknas med full vikt; övriga träffar inte.

DEN AKADEMISKA RAPPORTEN

Klassificering per träff. Per källa. Auditerbar från början till slut.

Varje träff medföljer DOI/URL till källa, klassificeringskategori, tidsstämpel från korpus och motorns commit. Går att försvara vid peer review, integritetsnämnd eller IT-upphandling.

RAPPORT · 4 217 ord · 47 träffar klassificeradeThe Modernist Novel: A Reassessment · Kapitel 3
Rubrik · 8,2%Motor · v0.4.2
#TRÄFF · KÄLLAKLASSIFICERING
12

Modernismen är snarare en samling av avvisanden än en tydlig rörelse — mot realism, framsteg, det enhetliga jaget... (Eysteinsson, 1990, s.117).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
CITAT · CITERAD
18

Eliots betoning på opersonlighet omformar lyriken som konstruerat objekt snarare än bekännelse.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARAFRAS · CITERAD
23

Romanen växer ur ett grundläggande borgerligt världsperspektiv från 1700-talet.

openalex.org/W12345678 · Watt (1957) — ociterad träff
OATTRIB
31

Joyces tankeström har mycket gemensamt med William James psykologi om inre varaktighet.

James, W. (1890). The Principles of Psychology, ch.IX (omnämnd i referenslistan)
PARAFRAS · CITERAD
34

Författarens egen tidigare publicerade doktorsavhandling, kapitel 1.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · självcitering, ingen attribution i detta stycke
SJÄLVCITAT
41

Alla referenser — Eysteinsson, Eliot, Joyce, James, Watt och 32 andra.

Referenslistan, s. 38–41
REFERENSER · UTESLUTEN
Rubrik 8,2% = vikt för oattribuerad parafras + självcitat; citerade träffar och referenslistor exkluderas.
  • 700M+vetenskapliga verk indexerade
  • 6citeringsstilar upptäcks automatiskt
  • 5språk kalibrerade vid lansering
  • 3%ESL-bias kvarstående (dokumenterat)
  • Apache2.0 · IRB-granskbar
FÖRSVARSBAR I PEER REVIEW

Tre saker en svart låda inte överlever vid fakultetsprövning.

01 · REPRODUCERBAR POÄNG

Kör samma text mot samma commit

Varje rapport stämplas med X-Engine-Commit och korpusets tidsstämpel. Månader senare kan De omkontrollera samma manus mot den motversion som genererade ursprungspoängen — samma indata, samma algoritm, samma resultat. Slutna system kan uppdateras i det tysta och januaris poäng återskapas inte i maj.

Reproducerbarhet är miniminivån för akademisk integritet vi byggt mot.
02 · AUDITERBAR ALGORITM

Apache 2.0-källkod på GitHub — ta med till mötet

När AI-detektion rullas ut (inom kort, på v1.2-planen) och en student ifrågasätter sitt AI-besked i integritetsnämnd, kan De citera engine-commit, peka på kodraden som gav tröskelbeslutet, och visa ESL-dokumentationen per språk. Inte bara en skärmdump på ett supportmeddelande.

github.com/NoplagLabs/noplag-engine — publik, indexerad av Google Scholar.
03 · ESL-MEDVETET BESKED

Liang et al. 2023 dokumenterade; åtgärder för riskreducering finns på planeringslistan

Stanford 2023 uppmätte 61,3 % FPR mot TOEFL-uppsatser på naiva detektorer. När Noplags AI-detektion lanseras (kommer snart, v1.2-plan), kommer utlåtandet att innehålla ett ESL-justerat intervall om den lexikala profilen tyder på icke-modersmålstalande engelska. Kvarvarande fel dokumenteras, inte påstås vara noll. Åsidosättande loggas med engine-commit och orsak.

/docs/developers/benchmarks — PAN-PC-11-metodik och resultat.
UPPHANDLINGSVÄNLIG

En Apache 2.0-motor ert IT kan faktiskt granska före avtal.

De flesta upphandlingar av plagiatmjukvara fastnar på samma frågor: var hamnar dokumentet efter inlämning, hur matchas det, vem får tillgång till data, hur hanteras rätten att bli raderad, och kan De själv verifiera leverantörens träffsäkerhet. Hos slutna leverantörer besvaras det över säljsamtal. Med Apache 2.0 kan IT klona repo, köra motorn på egen VM, granska dataflödet, testa radering och verifiera publicerade F1 på egna texter. Vi argumenterar inte för billigare prövning – vi argumenterar för en prövning IT faktiskt kan slutföra. Därför godkänner även universitet som tidigare vägrat nya plagiatverktyg just denna.

Läs upphandlingsguiden
FAQ

Frågor forskare faktiskt ställer.

Ersätter detta iThenticate för tidskriftsinlämning?

I de flesta fall nej — om er mål-tidskrift kräver iThenticate (Elsevier, Springer, Wiley, IEEE), används det ändå vid inlämning. Det Noplag ersätter är iterativ självkoll före inlämning. iThenticate för $125/dokument blir snabbt dyrt efter fjärde versionen; fastpris Pro blir det inte. Se hela vs-iThenticate-jämförelsen på noplag.com/vs-ithenticate.

Vad gäller för ProQuest-avhandlingar? Ingår de?

Korrekt – det gapet är verkligt. ProQuests avhandlingsdatabas är proprietär, inlåst, och inte i OpenAlex/CORE. Vi täcker ~700M öppet tillgängliga akademiska arbeten, bredare än ProQuest för post-Plan S-forskning (majoriteten från 2018 och framåt); smalare för äldre avhandlingar bakom betalvägg. Om jämförelse mot USA-doktorsavhandlingar är viktigast bör De använda iThenticate för just det.

Hur hanterar motorn andra citeringsstilar än de sex vanliga?

MLA, APA, Chicago/Turabian, Harvard, Vancouver och IEEE upptäcks från bibliografi-format. För mindre vanliga stilar (ACS, AMA, ASA, Bluebook, Oxford) klassas träffar fortfarande via citattecken + föräldrastilsmönster, men specialvalidering per stil är på v1.2-planen. De som självhostar kan lägga till fler via alignment/-modulen.

Hur är falskpositiv på starkt citerade översikter?

Lägre än väntat bland recensenter som letar efter ociterad parafras. Klassificeringsmodellen exkluderar korrekt citerade träffar från huvudpoängen. Vi mäter ~3,4% falsk positiva på PAN-PC-11 med akademisk prosa (där de flesta träffar är legitim citering). Slutna konkurrenter som inte särskiljer citerat rapporterar 12–18% på samma korpus.

Kan jag exkludera egna publikationer?

Pro-nivån — lägg till en självciteringslista (ert ORCID, gamla DOIs, universitetets repositorium). Träffar i dessa flaggas som SJÄLVCITAT och räknas inte in. Bra för akademiker vars ansökningar bygger på eget tidigare publicerat; återanvändning med citat är förväntat, inte plagiat.

Hur ser flerspråkig täckning faktiskt ut?

Detektionen är kalibrerad för engelska, spanska, portugisiska, polska och ukrainska vid lansering. Fler språk tillkommer löpande. Kvaliteten mäts mot PAN-PC-11; utvärdering per språk är planerad. Störst träffsäkerhet på de europeiska språk med längst valideringshistorik; nyare språk tillkommer när kalibreringen är klar.

Vad betyder “Apache 2.0” i upphandling?

Er IT / DPO / IRB kan klona github.com/NoplagLabs/noplag-engine, köra mot en sandlåda, granska datavägar, verifiera att rätten till radering fungerar hela vägen och återskapa våra publicerade benchmarkresultat mot eget testcorpus. Utan avtal, NDA eller beroende av vår marknadsföring. För institutioner där upphandlingen kräver denna nivå av granskning är det detta som möjliggör processen.

Fungerar AI-detektionen på Claude-3 + Gemini eller bara GPT?

AI-detektion kommer snart — finns på v1.2-planen, inte tillgänglig vid lansering. Metoden är Binoculars (Hans et al. 2024), som är modelloberoende: den tränas inte per LLM, utan jämför en liten referensmodells perplexitet mot testtexten, vilket ger generell tillämpning. Noggrannhet publiceras först när funktionen är utvärderad, inte i förväg, på blandat LLM-innehåll (jämfört med ~70 % på Claude-3 för GPT-tränade detektorer). Metodikartikeln dokumenterar felkällor; vi döljer dem inte.

Vad om min handledare invänder mot en flagga?

Varje flaggad träff medför DOI, korpus-tidsstämpel, commit och klassificeringsorsak. Kör om kontrollen mot samma commit och resultatet blir identiskt. Ta med rapporten på mötet; citatvägar är klickbara. Vi har inget “lita på poängen”-läge — sånt har bara slutna kontrollverktyg.

Självhost för medicinsk/klinisk forskning med HIPAA?

Apache 2.0 + Docker — körs helt i eget nätverk. Koppla till PostgreSQL + Redis på egen infrastruktur; ingen trafik lämnar VPC. Bra för kliniktexter, patientfall eller förpublicerad forskning som inte får delas externt. Företagskunder kan få hela korpuset som indexerbar bunt.

Kör ett kapitel mot 700M+ vetenskapliga verk.

Lägg in ett avhandlingskapitel, ansökan eller manusutkast. Den citeringsmedvetna rapporten visar vad som är förväntat, vad som behöver citering och vad som är ert eget. Gratis upp till 2 500 ord. Apache 2.0 om IRB kräver granskning av algoritmen först.

Akademisk plagiatkontroll med källhänvisning