표절 검사 연구자용 사전 제출
700M+ 학술 논문과 비교하여 제출 전 원고를 검사합니다. My Folders는 이전 본인 논문을 추적하여 셀프인용으로 인한 점수 상승을 막아줍니다. 민감한 논문은 EU 내 엔드포인트 사용 가능. Apache 2.0 엔진 — IRB 검토용.
네 가지 연구 역할. 하나의 셀프 체크 워크플로우.
논문 장별 제출 전 검사
각 장별 반복 점검. 초안 간 셀프인용 이력 추적.
- 장별 검사 + 버전 이력
- 셀프인용 허용목록(본인 ORCID + DOI 목록)
- 참고 문헌 자동 제외
학술지 제출 전 원고 확인
iThenticate는 제출 때 점검; 우리는 제출 전에 실행합니다.
- 700M+ 오픈액세스 학술 색인
- 인용 분류(인용 vs 비인용 재구성)
- 고정 요금 Pro · 크레딧 제한 없이 반복
문헌 리뷰 + 제안서 점검
이전 그랜트 초안을 재사용하는 것은 관례 — 감지해서 표시합니다.
- 본인 이전 논문 및 그랜트 인식
- 공저자 허용목록 (협업 논문 이력 포함)
- 분류 리포트 PDF 내보내기
연구실 전체 논문 사전 검사
연구실 내 다수 제출물 문제 한 큐에서 체크.
- 프로젝트·포스트닥별 폴더
- 임상/민감 데이터의 EU 데이터 처리
- Apache 2.0 엔진 — IRB 근거 제출 가능
저널 포털 제출 전, 세 단계.
반복적으로 실행. 셀프인용 구간 미리 지정하여 제출 시 iThenticate / Crossref 점수 상승 방지. AI 감지 판정은 곧 지원 — reviewer 2가 지적하기 전 미리 볼 수 있습니다.
01 · 초안 + 허용목록
장/원고 초안 업로드. ORCID와 DOI 목록(허용목록) 추가 — 본인 논문은 SELF-CITE 태그, 표절로 표시되지 않습니다. 협업 논문 DOIs도 포함; 엔진이 적법 재사용을 인식합니다.
02 · 검출 순차 실행
L1 위노잉은 현재 라이브 웹에서 동작하며, L2 MinHash(v1.1)와 L3 벡터 임베딩(v1.2)이 순차적으로 추가될 예정입니다. 원문 복사 및 유사 복사 탐지에 대응하며, 패러프레이즈 탐지는 L2와 L3에서 지원됩니다. 인용 구분 기능으로 인용된 부분과 인용 없는 패러프레이즈를 분리합니다. 다국어 지원하며, 출시 시점에는 영어, 스페인어, 포르투갈어, 폴란드어, 우크라이나어에 대해 탐지 기준이 맞춰져 있습니다. 추후 더 많은 언어가 추가됩니다. 원고 1건당 중간 처리 시간은 47초입니다.
03 · 리뷰 + 반복
리포트는 각 구간을 다음과 같이 표시합니다: SELF-CITE(본인, 기대됨), CITED(인용 포함, 기대됨), CITED-PARA(재구성+인용, 낮은 가중치), UNCITED-PARA(주목 필요), AI-LIKELY(ESL 보정 예정) 곧 추가. 재현 가능 — 엔진 커밋 + 데이터 스냅샷이 리포트에 표시.
적법한 학술 문장 재사용, 여섯 범주 — 점수에 반영되지 않아야 함.
블랙박스 검사기는 텍스트 일치만으로 표절 표시. 연구자는 합법적으로 텍스트 재사용 자주 함. 분류기가 처리하는 방식은 다음과 같습니다.
01 · 본인 기존 논문
ORCID + DOI 허용목록. 기존 발표 논문은 SELF-CITE로 태그되어 표절로 간주하지 않습니다. 문헌리뷰/그랜트 제안서 등에서 자주 발생(“Chen 2023에서 주장했듯이…”).
02 · 공저 논문
협업자 ORCID 허용목록 추가. 공저 논문은 CO-CITE로 태그. 공저자와 쓴 논문에서 메소드 등 공통 부분 적법 재사용하는 경우 유용.
03 · 실험실 표준 문장
PI-폴더 공유 코퍼스: 메소드·윤리문구 등 연구실 전체 논문에서 반복. LAB-CITE로 태그, 점수에서 제외. IRB 승인 문장 매번 새로 쓸 필요 없음.
04 · 엠바고 중인 프리프린트
비교 대상 논문의 arXiv/bioRxiv 사전 공개본. 분류기가 pre-print→저널 논문 변화를 인식, PREPRINT-SELF로 태그. 점수에 반영되지 않음. 프리프린트 금지 저널은 더 엄격 관리 가능.
05 · 철회된 논문 인용
Crossref Retraction Watch 연동: 철회 논문 인용 시 해당 구간 표시. 점수 변화 없음 — 제출 전 미리 확인할 수 있음. “지난달 철회된 논문을 인용했어요” 문제 대비.
06 · IRB/민감 데이터
EU 엔드포인트 (api.eu.noplag.com)이 원고를 EU 인프라에만 저장. 자체 엔진 배포로 HIPAA/GDPR/환자 데이터 처리. Apache 2.0 + Docker; VPC 내 트래픽만 사용.
프로젝트별 정리. 날짜별 추적.
프로젝트·실험실 연도·그랜트별로 원고 묶어 관리. 동일 엔진 커밋 기준 초안 반복 검사 — 리포트는 수개월 후에도 재현 가능.
민감한 논문에 필요한 세 가지 조건.
원고가 EU 외부로 나가지 않음
Pro+는 api.eu.noplag.com으로 제공. EU 내 Hetzner 데이터센터(팔켄슈타인·헬싱키) 기반. 제출·지문·리포트 모두 EU 내 보관. 기본 GDPR 준수; DPA 요청 가능.
기관 내 자체 엔진 실행
Apache 2.0 + Docker compose. 전체 감지 파이프라인이 귀 기관 인프라 내에서만 동작. Postgres+Redis 본인 준비; 데이터 코퍼스 번들로 제공. VPC 외부 트래픽 없음. 임상시험, 환자 케이스 등 민감/상업 데이터에 적합.
귀하의 지문 전부 삭제 지원
설정에서 원클릭 삭제. 24시간 이내 지문, 리포트, 허용목록, 모든 메타데이터 삭제. GDPR 제17조 준수. 자체 배포자는 DB 직접 접근, 클라우드 사용자는 API 엔드포인트 제공.
귀하의 IRB도 검토 가능한 Apache 2.0 엔진.
기관 표절 검사기 검토에서 늘 나오는 질문: 제출 후 원고 저장 위치, 매칭 알고리즘 동작 방식, 환자/민감 데이터 전송 여부, 삭제 청구권, 그리고 검증 가능한 정확도 주장. 상용 서비스는 이런 질문 답변을 영업 전화에서 처리. Apache 2.0는 IRB가 직접 레포를 클론해 샌드박스에서 엔진 실행, 데이터 흐름 감시, 삭제 경로 전과정 검수, 다국어별 F1 점수 재현 가능. '간편 검토'를 주장하지 않음 — 'IRB가 실제로 끝낼 수 있는 검토'를 제시. 이 때문에 기존 표절 서비스 거부하던 기관들도 이 엔진을 수용.
IRB 검토 가이드 읽기연구 관리 부서가 진짜로 묻는 질문.
- ORCID + DOI 목록 추가 시 유사도 점수가 달라지는 이유는?
- 허용목록에 등록된 논문과 일치하는 구간을 엔진이 SELF-CITE로 재분류하기 때문. 매칭 구간이 사라지는 게 아니라 태그가 바뀝니다. SELF-CITE 구간 가중치는 점수에 거의 반영되지 않습니다. 수식: 본인 프리프린트 2회·공저자 논문 1회 인용 시, '점수로 반영'에서 '학술적 재사용'으로 전환되는 구간 3개.
- 제출 논문으로 엔진이 학습하나요?
- 아니오. 제출 텍스트는 지문(가역 불가 해시)만 남기며, 원문은 테넌트 독립 DB에 저장. 30일 뒤 본문 삭제(보존 설정 시 연장). Binoculars 기반 AI 감지기는 공개 코퍼스 선학습 — 고객 원고로 학습하지 않음. DPA에 명시.
- arXiv / bioRxiv 프리프린트는 어떻게 처리되나요?
- 프리프린트 DOI를 허용목록에 추가하면, 일치 구간은 PREPRINT-SELF로 태그되어 점수 산정에 반영되지 않음. 엔진은 프리프린트→저널 논문 진화를 인식함. 일부 프리프린트 금지 저널은 별도로 관리 가능하나, 주요 저널(Nature, Cell, NEJM, PLOS)은 다수 허용, SELF 태그 처리로 정책 반영.
- AI 감지기는 ESL 공저자를 어떻게 처리하나요?
- AI 탐지 기능은 곧 제공 예정이며, v1.2 로드맵에 포함되어 있습니다. 출시 시 언어별 기준과 ESL(비원어민 영어) 조정 판정이 적용됩니다. 어휘적 특징이 비원어민 영어로 판단될 경우, 판정 결과는 ESL ADJ로 제공되며, 잔여 오차가 문서화되어 안내됩니다. Liang 외(2023) 논문에 따르면, 단순 탐지기는 TOEFL 에세이에서 61.3%의 FPR을 보였습니다. Noplag은 /docs/developers/benchmarks에서 자체 완화 방법론을 공개합니다. ESL 공동저자는 부당하게 표시되지 않습니다.
- Slurm 클러스터로 대량 검사 가능한가요?
- 네 — Apache 2.0 및 Docker 지원. 엔진 컨테이너를 클러스터 컴퓨트 노드에서 실행하고, 공유 파일시스템에서 데이터 입력, 파이프라인이 읽을 위치로 JSON 형식의 리포트 출력이 가능합니다. 1년치 연구실 산출물을 최신 코퍼스 스냅샷과 일괄 비교하는 데 적합합니다. Slurm sbatch 스크립트 예시는 github.com/NoplagLabs/noplag-engine에서 확인할 수 있습니다.
- 임상/환자 데이터 논문은?
- VPC 내부에 자체 배포. 네트워크 외부 트래픽 없음. 색인 코퍼스 검사는 인터넷 필요 없음(웹 검증 레이어는 제외, 필수 아님). HIPAA 호환 환경에서 IT부가 운영.
- 제출 시 iThenticate와의 차이는?
- iThenticate는 제출 시점에 점검해 편집자가 바로 봅니다 — 자신만의 반복 점검 불가. Noplag은 그 전 자기점검용. 오픈액세스 콘텐츠에서 범위 비슷(Plan-S 이후 더 넓음); 유료/구독 콘텐츠는 iThenticate가 더 넓음. 셀프인용 처리 방식이 실제 연구자 수요에 부합하지만, iThenticate는 이를 제대로 지원하지 않음.
- 레퍼런스 매니저(Zotero/Mendeley/EndNote) 연동 지원은?
- 허용목록 불러오기는 BibTeX, RIS, ORCID API 지원. Zotero 내보내기나 ORCID 붙여넣기로 DOIs 일괄 입력. Mendeley+EndNote 실시간 연동은 v1.2 로드맵, 현재는 내보내기 방식.
- 비영어권 논문도 감지 가능한가요?
- 출시 시점에는 영어, 스페인어, 포르투갈어, 폴란드어, 우크라이나어에 대해 탐지 기준이 맞춰져 있으며, 추가 언어가 순차적으로 지원됩니다. 유럽 언어에서 가장 정확도가 높으며(장기간 기준 데이터 보유), 탐지 품질은 PAN-PC-11에서 벤치마크되었습니다. 언어별 평가도 로드맵에 포함되어 있습니다. 특히 유럽 및 남미 학술 환경에 적합합니다.
- 제출 후 인용 논문이 철회되면?
- Crossref Retraction Watch 연동이 미래 모든 제출 재점검 때 표시. 제출 후라면 편집자에 직접 알려야 함(저널 별도 조치 필요 시 있음). 점수는 변동 없음. 리뷰어보다 먼저 알 수 있습니다.
챕터 하나만 검사해보세요. 셀프인용 분포를 바로 확인.
원고 초안, 논문 챕터, 그랜트 문헌리뷰 파일을 업로드만 하시면 됩니다. ORCID만 입력. 어느 구간이 SELF-CITE, CITED, UNCITED-PARA인지 확인할 수 있습니다. 곧 AI-LIKELY도 지원. 2,500단어 무료. 민감 데이터는 Pro+에서 EU 데이터 처리.