논문 표절 검사 자기 인용 인식
논문 방어 전에 검사하세요. 프리미엄은 5만 단어를 한 번에 처리합니다. 챕터 전반의 자기 인용은 SELF-CITE로 태깅(이 길이에서는 허용, 문제 없음). 이미 학술지 논문 제출한 누적-박사 챕터는 보류 기간 인식. 민감한 원자료 연구는 EU 거주지 처리.
6만 단어 논문에서 1,500단어 에세이 도구가 놓치는 4가지.
이 분류기는 장편 학술 작업에 맞게 조정됨: 챕터 간 자기 인용 예상, 참고문헌 자동 제외 필수, 보고서는 수개월 후 구두심사에서도 재현되어야 함.
한 번에 5만 단어 검사
프리미엄에서 전형적 논문(6만~8만 단어) 분량을 5만 단위로 검사 — 통상 두 번이면 전체 커버. 집필 중엔 챕터별 검사가 더 일반적. 무료는 2,500단어로 한 구간만 되며 빠른 점검용, 전체 논문용 아님.
본인 기존 연구는 포함이 당연
누적식 박사는 이미 게재된 학술 논문을 챕터로 포함시킴. ORCID + DOI 리스트를 허용 리스트에 추가; 해당 구간은 SELF-CITE로 태깅, 최종 점수에서 제외. 석사 논문이나 예비 시험에서 재사용된 부분도 동일하게 처리.
100+ 참고문헌이 점수에 반영되지 않음
참고문헌 목록을 제목+형식으로 자동 인식해 제외. 논문 길이면 150~400개 인용 가능; 참고문헌 자체가 점수에 반영되면 18~22% 부풀려짐. 우리는 그렇게 하지 않음.
초안 작성은 3–5년에 걸침
보고서마다 엔진 커밋 + 말뭉치 스냅샷이 각인됨. 2년 후 같은 챕터 같은 커밋에 재검사해도 결과 동일. 2024년 1월 자체 검사와 2026년 10월 구두심사 대비용 검사는 그대로 재현 — 보고서는 월 단위·연 단위로 검증 가능.
세 가지 이정표. 검사마다 의미가 다름.
대부분 박사는 유사한 흐름: 챕터 작성 → 전체 논문 조립 → 방어 준비. 검사 용도는 각 단계별로 다름.
01 · 챕터 초안(1–24개월)
챕터 완료마다 자체 검사. 인용 누락된 패러프레이즈를 지도교수 3번째 읽기 전에 잡기. 허용 리스트(ORCID + 공동저자 DOI)로 적법한 자기 인용이 점수에 안 잡힘. 문서 건당 크레딧 소진 없이 반복 가능 — 프리미엄은 여러 번 검사해도 요금 추가 없음.
02 · 전체 논문 조립(24–32개월)
논문 전체 실행(프리미엄: 5만 단어씩; 8만 단어 논문은 두 번에 커버). 참고문헌 자동 제외. 챕터 간 자기 인용은 2장에서 썼던 구절이 5장에 다시 나타난 것도 잡음 — 적법일 때도, 초안 오류일 때도 있음.
03 · 방어 준비(33–36개월)
최종본을 이전 보고서와 같은 엔진 커밋에 재실행 — 결과 그대로 나옴. 구간별 보고서 인쇄, 구두심사에 지참. 패널이 “이 부분 2022년 논문 아닌가?” 하면 이미 SELF-CITE, DOI 링크 있음. 사후 검토 때도 보고서 재현.
"본인 연구 재활용" 여섯 가지 — 구두심사에서 실격 사유가 아님.
박사 과정은 전공 논문, 학회 논문, 예비 시험, 석사 논문에서 텍스트를 정당하게 재활용함. 분류기는 예상 범주와 실제 주의가 필요한 부분을 구분함.
01 · 기존 출간 논문
본인 학술논문(ORCID + DOI 허용 리스트). 누적형 박사는 명시적으로 챕터에 포함 — SELF-CITE로 태깅, 점수에서 제외. 학회지 저작권 요구 사항으로 출처 표시 필요할 수 있음; 분류기가 어느 부분에 “본 챕터는 ... 기반” 서문이 필요한지 명시.
02 · 학회 발표 논문
학회 논문 DOI(또는 ACM/IEEE/ACL URL) 허용 리스트에 추가. 박사 과정에서 흔함 — 학회 논문이 챕터가 됨. SELF-CITE-CONF로 태깅; 일부 기관은 출처 표시만으로 허용, 일부는 재작성 요구. 보고서에 위치 명확히 표기.
03 · 석사 논문
석사 논문 URL 허용 리스트에 추가(주로 ProQuest나 대학 도서관). 배경/선행연구 챕터가 석사-박사 기간 구조 공유하는 경우 많음. SELF-CITE-MASTERS로 태그; 일부 기관은 허용, 일부는 서문에 명시 요구.
04 · 예비시험/종합시험
일부 기관은 예비 시험/연구계획서의 본 논문 반영 허용, 일부는 완전 재작성 요구. 분류기가 해당 재활용 구간 별도 표시; 정책은 대학원장이 가름. 엔진은 결정하지 않음.
05 · 공동저자 챕터
박사 논문에 공동저자 논문을 챕터로 넣는 경우 있음. 공동저자 ORCID 허용 리스트 등록; 매칭 시 CO-SELF-CITE로 태깅. 표준 요건은 챕터별 본인 기여도 명확 기술(주로 CRediT 명세). 보고서에 공동저자 출처 부분 명시.
06 · 출처 없는 재활용
문제가 되는 유형: 본인 과거 연구(미공개 초안 포함)에서 출처 없이 구간 사용. 최상단 점수에 전부 반영. 자기 재활용도 신고 필요; 대부분 기관은 미신고 자기표절도 위반으로 침.
초안 작성 중 챕터 보고서는 이런 모습.
패러그래프별 분류 + 출처 DOI. 최상단 점수는 출처 없는 부분만 반영. 수개월 후 같은 엔진 커밋으로 재현 가능.
박사 과정에 대한 두 가지 솔직한 한계.
분야에서 기대하는 논문 데이터베이스
iThenticate는 ProQuest 논문 데이터베이스(~미국 500만 편 논문) 포함; 우리는 접근 못함. 위원회에서 미국 박사 논문과 교차검증을 필수로 한다면 iThenticate가 그 목적에 맞는 도구임. 우리는 약 7억 건의 오픈 액세스 학술 자료 커버(저널 기사엔 더 넓고, 논문 백카탈로그엔 더 좁음). 솔직한 한계.
iThenticate 비교 읽기투고시 iThenticate가 요구될 때
일부 저널(Nature, Cell, NEJM, Elsevier)에서는 iThenticate가 Crossref Similarity Check로 제출시 자동 실행됨. 귀하가 사전에 어느 도구를 써도 대체 불가. Noplag은 제출 전 초안별 반복 자체 점검에 맞음 — iThenticate는 문서당 크레딧이 있어(120~130달러/파일) 수십 회 반복엔 현실적으로 부적합. 둘을 병행 사용.
작성 워크플로우 가이드 읽기몇 달 후에도 재현 가능. 인쇄 보고서로 구두심사 대비.
모든 보고서에는 엔진 커밋(예: v0.4.2)과 코퍼스 스냅샷 타임스탬프가 명시됩니다. 2년 후 같은 커밋에서 동일한 챕터를 다시 검사해도 결과는 정확히 재현됩니다. 엔진이 조용히 재학습되거나, 알고리즘이 바뀌어 방어 중에 결과가 달라지는 일은 없습니다. 각 구간의 분류 근거는 검토할 수 있습니다: SELF-CITE 태그는 소스 DOI로 연결되고, CITED 태그는 일치한 단락으로, UNATTRIBUTED 태그는 원본 소스 URL로 연결됩니다. 엔진은 Apache 2.0 라이선스이며, github.com/NoplagLabs/noplag-engine에서 소스 코드를 확인할 수 있습니다. 심사위원은 임계값 로직, AI 보정, 중복 제거 규칙을 직접 검토할 수 있습니다. 소스가 공개되지 않은 표절 검사기는 검사 당시의 알고리즘에 따라 보고서가 달라지므로, 모델이 업데이트되면 방어에 제출한 보고서가 재현되지 않을 수 있습니다. Noplag은 재현됩니다.
구두심사 준비 가이드 읽기박사 후보가 실제로 묻는 질문.
- 전체 논문 한 번에 검사 가능? 쪼개야 하나요?
- 프리미엄은 검사마다 최대 5만 단어 처리. 전형적 6~8만 단어 논문은 두 번(1~4장, 5~8장) 또는 챕터별 검사가 더 일반적. 집필 중엔 챕터별, 최종 제출/방어 전엔 전체 검사가 많은 편.
- 자기 인용 허용 리스트는 실제로 어떻게 동작하나요?
- ORCID를 허용 리스트에 추가하면 엔진이 ORCID API로 DOI 자동 불러옴. 학회 논문/석사 논문/공동저자 논문 DOI는 수동 추가. 매칭 구간은 SELF-CITE, CO-SELF-CITE, SELF-CITE-MASTERS로 태깅 — 점수 제외. "본인 연구 아닌가" 논쟁 불필요.
- ProQuest 논문은? 우리 쪽에는 없음?
- 네, 공식적으로 빠집니다. ProQuest 논문 데이터베이스(미국 논문 500만 편)는 독점·유료이고 OpenAlex/CORE에 없음. 미국 박사 논문 교차검사가 기관 요구라면 iThenticate에 해당 데이터셋 있음. 우리는 약 7억 건의 공개 학술 자료를 커버(저널에선 더 넓고, 오래된 논문에선 좁음).
- 초안 챕터가 AI 학습에 쓰이거나 저장됨?
- 아니오. 초안은 핑거프린트(비가역적 해시)로 처리되어, 분리된 데이터베이스에 저장됨. 원문은 30일 후 삭제, 잔류 선택 가능(대부분 논문은 장기 보관 선택). 탐지 모델은 공개 말뭉치로 미리 학습됨; 지원자가 투고한 원문은 학습에 사용되지 않음. DPA에 명시됨.
- 구두심사에서의 재현성, 실제론 무슨 의미?
- 각 보고서마다 엔진 커밋(v0.4.2 등)·말뭉치 스냅샷 타임스탬프가 각인됨. 2024년 1월 점검을 2026년 10월 같은 커밋에 재실행하면 결과 동일. 모든 구간 분류 근거는 검증 가능: SELF-CITE는 DOI, CITED는 패러그래프, UNATTRIBUTED는 원문 URL. 폐쇄형 점검기는 알고리즘이 바뀌면 보고서가 달라지는 한계.
- 논문에 환자데이터/기밀연구 포함시 셀프호스팅 가능?
- 네. Apache 2.0 + Docker로, 기관내 네트워크에서만 구동. 외부 트래픽 없음. 임상, IRB 자료, 보호 명령/기밀 논문에 적합. 인덱싱 기반 검사는 엔진이 인터넷 없이도 작동; 실시간 웹 확인 기능은 선택 사항.
- AI 감지는 6만 단어 혼합 AI/인간 문서에 어떻게 동작?
- AI 감지 기능은 곧 도입 예정 — 출시시엔 미탑재. 출시되면 패러그래프별 AI 가능성(예) Binoculars, Hans 등 2024)을 표시 예정. 전체가 아니라 패러별로 분류; 예를 들어 Grammarly로 초안 후 자필로 다시 쓴 챕터는 패러그래프별로 다른 판정. 비원어민 어휘시 ESL 조정 밴드 작동. 방법론은 공개; 구두심사에서도 방어 가능.
- 누적 박사는 논문 챕터에 학술지 논문 포함 가능?
- 여러 기관이 명확히 허용(독일·네덜란드·스칸디나비아 자주, 영국·미국도 점증). 학술지 저작권 정책이 출처 명시하에 논문에 재사용 허용. 출판된 DOI를 허용 리스트에 추가하면 엔진이 해당 구간을 SELF-CITE로 태깅. 최종 허용 여부는 기관 + 저널 재사용 정책이 정함.
- 지도교수/위원회가 플래그에 이의 제기하면?
- 모든 표시된 구간에는 소스 DOI, 표준 URL, 스냅샷 타임스탬프, 엔진 커밋이 함께 제공됩니다. 원본 소스를 나란히 띄워 각 구간별 분류 근거를 확인할 수 있습니다. 엔진은 Apache 2.0 라이선스이며, github.com/NoplagLabs/noplag-engine에서 소스 코드를 직접 볼 수 있습니다. 심사위원은 임계값 로직을 한 줄씩 검토할 수 있습니다. 이것이 바로 '방어 가능성'의 의미입니다: 방법론 인용, 재현 가능한 판정, 공개된 알고리즘.
- 3–5년간 비용은?
- 프리미엄 $79/월, 작성 기간 동안 무제한 검사; 언제든 중지·재개 가능(폴더 보존). 대다수는 4년간 6–12개월 프리미엄 사용, 논문 작성기에만 활용. 정액은 개별 문서 크레딧(iThenticate $125/파일)이 수백 번 반복 사용시 비현실적이기 때문.
챕터 실행. 구두심사에서 보고서 재현.
초안 챕터를 Noplag에 넣고 ORCID 추가. SELF-CITE, CITED, UNATTRIBUTED 분류 확인. 무료는 단일 구간 2,500단어까지; 프리미엄 $79/월은 5만 단어까지 전체 논문 커버.