논문5만 단어 검사 · 자기 인용 인식

논문 표절 검사 자기 인용 인식

논문 방어 전에 검사하세요. 프리미엄은 5만 단어를 한 번에 처리합니다. 챕터 전반의 자기 인용은 SELF-CITE로 태깅(이 길이에서는 허용, 문제 없음). 이미 학술지 논문 제출한 누적-박사 챕터는 보류 기간 인식. 민감한 원자료 연구는 EU 거주지 처리.

0 / 1,500 words
최대 5만 단어챕터별 자기 인용EU 거주 · IRB 검토 가능
왜 논문은 별도 처리가 필요한가

6만 단어 논문에서 1,500단어 에세이 도구가 놓치는 4가지.

이 분류기는 장편 학술 작업에 맞게 조정됨: 챕터 간 자기 인용 예상, 참고문헌 자동 제외 필수, 보고서는 수개월 후 구두심사에서도 재현되어야 함.

01 · 길이

한 번에 5만 단어 검사

프리미엄에서 전형적 논문(6만~8만 단어) 분량을 5만 단위로 검사 — 통상 두 번이면 전체 커버. 집필 중엔 챕터별 검사가 더 일반적. 무료는 2,500단어로 한 구간만 되며 빠른 점검용, 전체 논문용 아님.

02 · 자기 인용

본인 기존 연구는 포함이 당연

누적식 박사는 이미 게재된 학술 논문을 챕터로 포함시킴. ORCID + DOI 리스트를 허용 리스트에 추가; 해당 구간은 SELF-CITE로 태깅, 최종 점수에서 제외. 석사 논문이나 예비 시험에서 재사용된 부분도 동일하게 처리.

03 · 참고문헌 제외

100+ 참고문헌이 점수에 반영되지 않음

참고문헌 목록을 제목+형식으로 자동 인식해 제외. 논문 길이면 150~400개 인용 가능; 참고문헌 자체가 점수에 반영되면 18~22% 부풀려짐. 우리는 그렇게 하지 않음.

04 · 다년 작성

초안 작성은 3–5년에 걸침

보고서마다 엔진 커밋 + 말뭉치 스냅샷이 각인됨. 2년 후 같은 챕터 같은 커밋에 재검사해도 결과 동일. 2024년 1월 자체 검사와 2026년 10월 구두심사 대비용 검사는 그대로 재현 — 보고서는 월 단위·연 단위로 검증 가능.

작성 주기

세 가지 이정표. 검사마다 의미가 다름.

대부분 박사는 유사한 흐름: 챕터 작성 → 전체 논문 조립 → 방어 준비. 검사 용도는 각 단계별로 다름.

01

01 · 챕터 초안(1–24개월)

챕터 완료마다 자체 검사. 인용 누락된 패러프레이즈를 지도교수 3번째 읽기 전에 잡기. 허용 리스트(ORCID + 공동저자 DOI)로 적법한 자기 인용이 점수에 안 잡힘. 문서 건당 크레딧 소진 없이 반복 가능 — 프리미엄은 여러 번 검사해도 요금 추가 없음.

02

02 · 전체 논문 조립(24–32개월)

논문 전체 실행(프리미엄: 5만 단어씩; 8만 단어 논문은 두 번에 커버). 참고문헌 자동 제외. 챕터 간 자기 인용은 2장에서 썼던 구절이 5장에 다시 나타난 것도 잡음 — 적법일 때도, 초안 오류일 때도 있음.

03

03 · 방어 준비(33–36개월)

최종본을 이전 보고서와 같은 엔진 커밋에 재실행 — 결과 그대로 나옴. 구간별 보고서 인쇄, 구두심사에 지참. 패널이 “이 부분 2022년 논문 아닌가?” 하면 이미 SELF-CITE, DOI 링크 있음. 사후 검토 때도 보고서 재현.

자기표절 처리

"본인 연구 재활용" 여섯 가지 — 구두심사에서 실격 사유가 아님.

박사 과정은 전공 논문, 학회 논문, 예비 시험, 석사 논문에서 텍스트를 정당하게 재활용함. 분류기는 예상 범주와 실제 주의가 필요한 부분을 구분함.

01 · 기존 출간 논문

본인 학술논문(ORCID + DOI 허용 리스트). 누적형 박사는 명시적으로 챕터에 포함 — SELF-CITE로 태깅, 점수에서 제외. 학회지 저작권 요구 사항으로 출처 표시 필요할 수 있음; 분류기가 어느 부분에 “본 챕터는 ... 기반” 서문이 필요한지 명시.

02 · 학회 발표 논문

학회 논문 DOI(또는 ACM/IEEE/ACL URL) 허용 리스트에 추가. 박사 과정에서 흔함 — 학회 논문이 챕터가 됨. SELF-CITE-CONF로 태깅; 일부 기관은 출처 표시만으로 허용, 일부는 재작성 요구. 보고서에 위치 명확히 표기.

03 · 석사 논문

석사 논문 URL 허용 리스트에 추가(주로 ProQuest나 대학 도서관). 배경/선행연구 챕터가 석사-박사 기간 구조 공유하는 경우 많음. SELF-CITE-MASTERS로 태그; 일부 기관은 허용, 일부는 서문에 명시 요구.

04 · 예비시험/종합시험

일부 기관은 예비 시험/연구계획서의 본 논문 반영 허용, 일부는 완전 재작성 요구. 분류기가 해당 재활용 구간 별도 표시; 정책은 대학원장이 가름. 엔진은 결정하지 않음.

05 · 공동저자 챕터

박사 논문에 공동저자 논문을 챕터로 넣는 경우 있음. 공동저자 ORCID 허용 리스트 등록; 매칭 시 CO-SELF-CITE로 태깅. 표준 요건은 챕터별 본인 기여도 명확 기술(주로 CRediT 명세). 보고서에 공동저자 출처 부분 명시.

06 · 출처 없는 재활용

문제가 되는 유형: 본인 과거 연구(미공개 초안 포함)에서 출처 없이 구간 사용. 최상단 점수에 전부 반영. 자기 재활용도 신고 필요; 대부분 기관은 미신고 자기표절도 위반으로 침.

챕터별 보고서

초안 작성 중 챕터 보고서는 이런 모습.

패러그래프별 분류 + 출처 DOI. 최상단 점수는 출처 없는 부분만 반영. 수개월 후 같은 엔진 커밋으로 재현 가능.

논문 · 4장 · 8,420단어 · 64구간 · 허용 리스트 활성4장: 노이즈 그래프 기반 통계학습
최상단 · 3.2%SELF-CITE · 24%v0.4.2
#구간 · 출처분류
08
노이즈 그래프란 (V, E, p) 튜플로 정의하며, p는 각 엣지에 독립적 오염 확률을 할당합니다.귀하의 NeurIPS 2023 논문, §2.1 · ORCID + DOI 허용 리스트 · 누적-박사 챕터 출처
SELF-CITE
12
최근 그래프 신경망 연구는 구조적 교란에 대한 안정성에 집중 중(Kim 등 2022).openalex.org/W93b · 인용문 present (Kim 등 2022)
PARA·CITED
14
Laplacian spectral gap은 네트워크 내 정보 확산 속도를 제어합니다.Hammond 등(2011), p.142 — 4패러 앞 인용, 분류기 인식
PARA·CITED
19
엣지 가중치는 0 이상, 그래프는 무방향형임을 전제함.형식 안내문 · 2,300+ 그래프 논문과 일치 — 통용 문구
COMMON-KNOWLEDGE
23
레이블 노이즈에 대한 강인성은 실제 반지도 학습기 적용의 핵심.공동저자 Zhang의 ACL 2023 논문 · 공동저자 ORCID 허용 리스트 · 공동저자 챕터 출처
CO-SELF-CITE
28
알고리즘은 본 가정하에 O(n log n) 단계에서 지역 최소로 수렴.본인 미공개 기술 보고서 (2024년 2월) — 허용 리스트 없음, 해당 섹션 인용 없음
UNATTRIBUTED
41
참고문헌 — Kim, Hammond, Zhang 외 187명.참고문헌 섹션, p.240–248
REFS · EXCLUDED
최상단 3.2% = 출처 없는 부분만. SELF-CITE, CO-SELF-CITE, CITED, COMMON, REFS는 제외.엔진 v0.4.2 · PDF 내보내기 · 구두심사 재현 가능
50,000한 번 검사 단어수(프리미엄)
700M+인덱스된 학술 자료
6자기 인용 분류
5출시시 탐지 언어
EU거주 · IRB 검토가능
ITHENTICATE보다 좁은 부분

박사 과정에 대한 두 가지 솔직한 한계.

01 · PROQUEST 누락

분야에서 기대하는 논문 데이터베이스

iThenticate는 ProQuest 논문 데이터베이스(~미국 500만 편 논문) 포함; 우리는 접근 못함. 위원회에서 미국 박사 논문과 교차검증을 필수로 한다면 iThenticate가 그 목적에 맞는 도구임. 우리는 약 7억 건의 오픈 액세스 학술 자료 커버(저널 기사엔 더 넓고, 논문 백카탈로그엔 더 좁음). 솔직한 한계.

iThenticate 비교 읽기
02 · 학술지 제출 규정

투고시 iThenticate가 요구될 때

일부 저널(Nature, Cell, NEJM, Elsevier)에서는 iThenticate가 Crossref Similarity Check로 제출시 자동 실행됨. 귀하가 사전에 어느 도구를 써도 대체 불가. Noplag은 제출 전 초안별 반복 자체 점검에 맞음 — iThenticate는 문서당 크레딧이 있어(120~130달러/파일) 수십 회 반복엔 현실적으로 부적합. 둘을 병행 사용.

작성 워크플로우 가이드 읽기
방어 대비

몇 달 후에도 재현 가능. 인쇄 보고서로 구두심사 대비.

모든 보고서에는 엔진 커밋(예: v0.4.2)과 코퍼스 스냅샷 타임스탬프가 명시됩니다. 2년 후 같은 커밋에서 동일한 챕터를 다시 검사해도 결과는 정확히 재현됩니다. 엔진이 조용히 재학습되거나, 알고리즘이 바뀌어 방어 중에 결과가 달라지는 일은 없습니다. 각 구간의 분류 근거는 검토할 수 있습니다: SELF-CITE 태그는 소스 DOI로 연결되고, CITED 태그는 일치한 단락으로, UNATTRIBUTED 태그는 원본 소스 URL로 연결됩니다. 엔진은 Apache 2.0 라이선스이며, github.com/NoplagLabs/noplag-engine에서 소스 코드를 확인할 수 있습니다. 심사위원은 임계값 로직, AI 보정, 중복 제거 규칙을 직접 검토할 수 있습니다. 소스가 공개되지 않은 표절 검사기는 검사 당시의 알고리즘에 따라 보고서가 달라지므로, 모델이 업데이트되면 방어에 제출한 보고서가 재현되지 않을 수 있습니다. Noplag은 재현됩니다.

구두심사 준비 가이드 읽기
논문 점검 체크리스트
허용 리스트기존 본인 논문 ORCID + DOI · 학회 논문 · 석사 논문 · 공동저자 ORCID 등록
참고문헌참고문헌은 제목+형식으로 자동 탐지. 전면 제외. 참고문헌은 점수에 반영 안 됨.
챕터작성 중엔 챕터별 검사. 조립 때 전체 검사. 방어 준비 때 최종 검사. 같은 엔진, 같은 보고서 형식.
커밋보고서마다 엔진 커밋 + 말뭉치 스냅샷 포함. 구두심사 수개월·수년 후에도 재현.
EU민감한 원자료 연구는 EU 거주지 서버 지원. IRB요구시 기관내 셀프호스팅 가능.
DOI모든 매칭 구간은 출처 DOI · 표준 URL · 스냅샷 타임스탬프 포함. 패널 리뷰시 클릭해서 확인.
FAQ

박사 후보가 실제로 묻는 질문.

전체 논문 한 번에 검사 가능? 쪼개야 하나요?
프리미엄은 검사마다 최대 5만 단어 처리. 전형적 6~8만 단어 논문은 두 번(1~4장, 5~8장) 또는 챕터별 검사가 더 일반적. 집필 중엔 챕터별, 최종 제출/방어 전엔 전체 검사가 많은 편.
자기 인용 허용 리스트는 실제로 어떻게 동작하나요?
ORCID를 허용 리스트에 추가하면 엔진이 ORCID API로 DOI 자동 불러옴. 학회 논문/석사 논문/공동저자 논문 DOI는 수동 추가. 매칭 구간은 SELF-CITE, CO-SELF-CITE, SELF-CITE-MASTERS로 태깅 — 점수 제외. "본인 연구 아닌가" 논쟁 불필요.
ProQuest 논문은? 우리 쪽에는 없음?
네, 공식적으로 빠집니다. ProQuest 논문 데이터베이스(미국 논문 500만 편)는 독점·유료이고 OpenAlex/CORE에 없음. 미국 박사 논문 교차검사가 기관 요구라면 iThenticate에 해당 데이터셋 있음. 우리는 약 7억 건의 공개 학술 자료를 커버(저널에선 더 넓고, 오래된 논문에선 좁음).
초안 챕터가 AI 학습에 쓰이거나 저장됨?
아니오. 초안은 핑거프린트(비가역적 해시)로 처리되어, 분리된 데이터베이스에 저장됨. 원문은 30일 후 삭제, 잔류 선택 가능(대부분 논문은 장기 보관 선택). 탐지 모델은 공개 말뭉치로 미리 학습됨; 지원자가 투고한 원문은 학습에 사용되지 않음. DPA에 명시됨.
구두심사에서의 재현성, 실제론 무슨 의미?
각 보고서마다 엔진 커밋(v0.4.2 등)·말뭉치 스냅샷 타임스탬프가 각인됨. 2024년 1월 점검을 2026년 10월 같은 커밋에 재실행하면 결과 동일. 모든 구간 분류 근거는 검증 가능: SELF-CITE는 DOI, CITED는 패러그래프, UNATTRIBUTED는 원문 URL. 폐쇄형 점검기는 알고리즘이 바뀌면 보고서가 달라지는 한계.
논문에 환자데이터/기밀연구 포함시 셀프호스팅 가능?
네. Apache 2.0 + Docker로, 기관내 네트워크에서만 구동. 외부 트래픽 없음. 임상, IRB 자료, 보호 명령/기밀 논문에 적합. 인덱싱 기반 검사는 엔진이 인터넷 없이도 작동; 실시간 웹 확인 기능은 선택 사항.
AI 감지는 6만 단어 혼합 AI/인간 문서에 어떻게 동작?
AI 감지 기능은 곧 도입 예정 — 출시시엔 미탑재. 출시되면 패러그래프별 AI 가능성(예) Binoculars, Hans 등 2024)을 표시 예정. 전체가 아니라 패러별로 분류; 예를 들어 Grammarly로 초안 후 자필로 다시 쓴 챕터는 패러그래프별로 다른 판정. 비원어민 어휘시 ESL 조정 밴드 작동. 방법론은 공개; 구두심사에서도 방어 가능.
누적 박사는 논문 챕터에 학술지 논문 포함 가능?
여러 기관이 명확히 허용(독일·네덜란드·스칸디나비아 자주, 영국·미국도 점증). 학술지 저작권 정책이 출처 명시하에 논문에 재사용 허용. 출판된 DOI를 허용 리스트에 추가하면 엔진이 해당 구간을 SELF-CITE로 태깅. 최종 허용 여부는 기관 + 저널 재사용 정책이 정함.
지도교수/위원회가 플래그에 이의 제기하면?
모든 표시된 구간에는 소스 DOI, 표준 URL, 스냅샷 타임스탬프, 엔진 커밋이 함께 제공됩니다. 원본 소스를 나란히 띄워 각 구간별 분류 근거를 확인할 수 있습니다. 엔진은 Apache 2.0 라이선스이며, github.com/NoplagLabs/noplag-engine에서 소스 코드를 직접 볼 수 있습니다. 심사위원은 임계값 로직을 한 줄씩 검토할 수 있습니다. 이것이 바로 '방어 가능성'의 의미입니다: 방법론 인용, 재현 가능한 판정, 공개된 알고리즘.
3–5년간 비용은?
프리미엄 $79/월, 작성 기간 동안 무제한 검사; 언제든 중지·재개 가능(폴더 보존). 대다수는 4년간 6–12개월 프리미엄 사용, 논문 작성기에만 활용. 정액은 개별 문서 크레딧(iThenticate $125/파일)이 수백 번 반복 사용시 비현실적이기 때문.

챕터 실행. 구두심사에서 보고서 재현.

초안 챕터를 Noplag에 넣고 ORCID 추가. SELF-CITE, CITED, UNATTRIBUTED 분류 확인. 무료는 단일 구간 2,500단어까지; 프리미엄 $79/월은 5만 단어까지 전체 논문 커버.

논문 표절 검사 자기 인용 인식