표절 통계
방법론

이 수치를 어떻게 산출하는지 설명합니다.

이 사이트의 모든 수치는 표절 논문 철회율입니다. 즉, 한 국가, 기관, 또는 학문 분야가 표절로 인해 받은 논문 철회 건수를 해당 기간 내 발표 논문 수로 나눈 값입니다. 이 페이지에서는 각 수치가 어떻게 산출되는지, 신뢰 수준, 인용 시 유의해야 할 편향을 상세히 설명합니다.

1단계

집계 방식

분자는 Retraction Watch 데이터베이스(Crossref에서 호스팅, 약 70 000건)에서 가져옵니다. 표절 사유가 엄격하게 plagiarism of/in 코드로 명시된 기록만 포함하며, '표절의 완곡어법'이나 단순 중복 등은 제외합니다. 2015–2024 기간 동안 1,879건의 고유 기록이 해당됩니다.

중요한 매칭

기관 및 학문 분야 정보는 논문 DOI를 통해 OpenAlex에서 매칭합니다. Retraction Watch의 자유 입력 소속 필드는 사용하지 않습니다. OpenAlex는 각 논문의 소속을 표준 ROR 식별자로 정규화하고 학문 분야를 태깅하므로, DOI 조회 시 정확한 기관과 분야가 반환됩니다. 자유 입력 소속 문자열을 해석하면 학과명 등으로 시작해 잘못된 기관에 매칭될 수 있으므로, 이는 명시적으로 허용하지 않습니다.

~91% of plagiarism records carry a DOI; ~90% of those resolve to a ROR institution, so roughly four in five records attribute to a canonical institution.

데이터 출처Retraction Watch(철회 사건 및 사유), OpenAlex(논문, 소속, 학문 분야), Crossref(DOI 메타데이터), ROR(기관 식별). 모두 무료 및 오픈 라이선스 제공.
분모동일한 기관 및 기간에 대한 OpenAlex 논문 발표 건수를 사용합니다. 국가별 집계는 저자 소속 국가를, 기관별 집계는 ROR 식별자를 기준으로 합니다.
2단계

정규화 방식

Raw counts mislead: high-output research systems accumulate more retractions simply because they publish more. By raw count China leads with 564; by rate it sits at 7.0 per 100k. We therefore report rates, and the system is built so it cannot rank entities by absolute count.

100 000건당 비율모든 기관에 적용되는 대표 지표입니다. 규모가 매우 다른 기관 간에도 비교가 가능합니다.
Wilson 95% 신뢰구간모든 비율에는 신뢰구간이 포함됩니다. 분자가 작을수록 신뢰구간이 넓어지므로, 점 추정치가 아닌 신중한 해석이 필요함을 의미합니다.
단일 연도가 아닌 이동 창 사용논문 철회는 원 논문 발표 후 수년이 지나 발생하는 경우가 많으므로, 단일 연도 데이터는 분석에 충분하지 않습니다. 기본 단위는 여러 해를 포함하는 이동 창입니다.
최소 집계 기준해당 기간 내 100 000건 미만의 논문을 발표한 기관은 제외됩니다. 표본이 너무 적으면 비율이 통계적 잡음에 불과하기 때문입니다.
3단계

모든 수치에 대한 출처 신뢰도

각 통계는 산출 방식을 명시하여 인용 전 신뢰도를 평가할 수 있도록 했습니다.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

먼저 읽어야 할 내용

알려진 편향 및 한계

측정 대상은 적발된 표절 사례입니다. 실제 발생 건수와는 다릅니다.여기에 제시된 수치는 적발되어 기록된 논문 철회만을 포함합니다. 적발된 비율과 실제 비율 간에는 측정되지 않은 차이가 존재하며, 본 수치를 전체 표절 비율로 제시하지 않습니다.
영어권 색인 편향Retraction Watch와 OpenAlex는 영어권 학술지를 과대표집하는 경향이 있습니다. 감독이 엄격한 국가는 더 많은 사례를 적발·기록할 수 있으나, 실제로 더 많이 발생한다는 의미는 아닙니다.
불균등한 커버리지출처 커버리지는 지역별로 다르며, 신뢰할 만한 비율 산출이 어려울 정도로 데이터가 부족한 기관은 제외합니다.
분모는 모든 연구성과(임시 기준)현재 분모는 OpenAlex의 모든 연구성과를 포함하며, 저널 논문만을 대상으로 하지 않아 비율이 다소 낮게 산출됩니다. 향후 논문만을 분모로 삼는 개선이 예정되어 있습니다.
연구자를 위한 안내

직접 재현하기

전체 파이프라인은 무료이면서 인증키가 필요 없는 HTTP 요청 두 번과 조인 연산만으로 구성됩니다. API 키나 유료 등급이 필요하지 않습니다.

# 1. Retraction Watch 데이터베이스 (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. OpenAlex 국가별 연구성과, 2015–2024 (분모)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. 'plagiarism of/in' 사유가 명확히 기재된 건만 유지, DOI로 매칭,
#    논문 수로 나누고, 100,000을 곱함. 신뢰구간은 Wilson 구간 사용.

참고 구현 코드는 프로젝트의 stats/ 파이프라인에 있습니다.

인용 및 재사용

데이터는 CC-BY 4.0 라이선스 하에 공개되어 있어, Noplag Plagiarism Statistics를 출처로 명시하면 상업적 이용을 포함해 자유롭게 재사용할 수 있습니다.

데이터로 돌아가기
표절 통계 산출 방법 — 방법론