표절 검사 온라인 중복 콘텐츠 확인
실시간 웹, 내 폴더, 팀 콘텐츠 라이브러리에서 중복 콘텐츠 확인. 정규화 인식 — 정당한 동시게시와 스크랩본 구분. 2,500단어까지 무료, 폴더 단위 검사는 Pro.
중복, 네 가지. 대응법 다 다름.
대부분의 “중복 검사기”는 완전 일치만 잡습니다. 저희는 네 가지 유형으로 분류합니다. 인용은 무시, 동시게시는 정규화, 스크랩/스핀은 다시 써야 함.
단어 단위 일치
30자 이상 동일한 문자열. 복붙한 문구, 그대로 옮긴 기사, 스크랩된 페이지 포함.
약간 바꿈
문장 구조 유지, 동의어나 형용사 순서만 교체. 전형적 ‘스핀’ 패턴. Copyscape가 의도적으로 놓치는 유형.
강하게 바꾼 문장
절 순서 뒤집고, 시제 바꾸며, 군더더기 삽입 등. AI 리라이팅 도구, 외주 원고에서 흔함.
페이지에 반복
수백 페이지에 반복되는 고지, 저자소개, 상품설명 등 — 구글이 실제로 문제 삼는 중복.
단순 ‘타 사이트 복붙’이 아니다.
구글 공식 문서 기준: 세 가지 패턴이 중복으로 처리됩니다. 대부분은 내 사이트의 문제이지 경쟁자 스크랩이 아님.
정규화 태그 없는 도메인간 복사
여러 사이트에 동일 기사 게시, rel=canonical 없이 원문 연결 불가. 잘못된 동시게시, 노출 부적합 스크랩, 여러 매체 동시 송고 시 실수 포함.
내 사이트 내 여러 URL에 같은 내용
/product/foo, /product/foo?utm_source=email, /product/foo/ (슬래시). 필터링 조합, 프린트 전용, 모바일/데스크톱 이원화 등. 구글은 묶어서 하나만 남기고 나머지는 제외.
컨텐츠인 척하는 고정문구
1200개 상품에 동일 카테고리 설명, 47개 지점 페이지에 똑같은 “20년 경력” 문구. 얇은 중복 컨텐츠 — 구글 Helpful Content Update에서 민감하게 체크.
이 검사를 매주 돌리는 여섯 팀.
하나의 도구, 여섯 가지 워크플로 — 개인 블로거 사전검사부터, 에이전시 외주 QA까지.
블로그 글 사전 검사
게시 전 실시간 웹과 비교. 본인 글 반복(자기잠식), 조사한 경쟁 글, AI 리라이터 실수까지 잡음.
경쟁사 스크랩 탐지
글을 붙여넣으면, 어디에 게시됐는지 확인. DMCA 문서화에 유용 — 매치된 소스 URL, 해당 구간, 타임스탬프 스냅샷 제공.
콘텐츠 라이브러리 관리
Pro 등급 폴더 단위 검사. 팀 전체 글 폴더 업로드시, 문서간 중복 — 여러 글에 동일 문단, 템플릿화해야 할 고정문구까지 표시.
동시게시 점검
Medium, LinkedIn, Substack에 동시게재. rel=canonical이 원문을 가리키는가? 각 버전을 호출, 정규화 태그 검사, 누락된 경우만 표시.
외주 작가 QA
프리랜서 원고 QA. 지불 전 검사. 복사-스핀 패턴, AI 리라이터 흔적, 미인용 인용문까지 탐지.
AI 콘텐츠 출처 확인
AI가 외부 텍스트를 가져올 때, 재사용 문구도 표시. 출처 인용, 재작성, 삭제 중 선택 가능. Helpful-Content-Update 리스크 줄임.
라이브러리 폴더 넣고, 어디가 어디와 겹치는지 보기.
Pro 기능. 게시 글 폴더 선택, 모든 쌍 간 유사행렬 생성. 겹침 기준 정렬, 겹친 구간 바로가기.
- 2억 5천만+색인된 웹페이지
- 30d코퍼스 갱신 주기
- 94%정규화 감지율
- 4중복 분류 등급
- 2014Common Crawl 색인 중
브라우저 중복 검사/SEO 툴이 못 잡는 3가지.
완전 일치만 감지 (Copyscape 표준). 약간만 바꾼 문장은 ‘고유’ 판정 — 스핀본은 통과. 복붙 탐지만 유용, 콘텐츠 QA엔 무용지물.
Noplag: 4등급 분류(완전/유사/스핀/고정문구), 목적별 힌트 — 단순 일치 플래그가 아님.
$99-499/월 콘텐츠 고유성 도구 포함형. 표면 n-gram 매칭에 한정, Common Crawl 미지원, 폴더 단위 검사 없음.
Noplag: 독립 무료 버전(2,500단어). Pro($23/월)은 폴더 행렬/전체 웹 색인 포함 — 중복 도구로 $400 SEO 패키지 강제 X.
블랙박스. 어떤 소스에서 걸렸는지 않보임, 유사 점수만 제공. 대부분 1,000단어 제한. 색인을 잘 갱신하지 않음 — 2021년 웹 기준으로 비교하는 경우 많음.
Noplag: 매치마다 소스 URL + 정규화 태그 + 구간 + 색인 날짜 표시. Apache 2.0 — 알고리즘 공개.
rel=canonical 포함 재게시 글은 ‘중복 콘텐츠’가 아닙니다. 본 도구는 다르게 처리합니다.
하나의 글이 여러 URL에 노출될 때, SEO 관점의 질문은 ‘둘이 같은가’가 아니라 ‘모두 정규화가 연결됐는가’입니다. Medium 게스트 글이 원문(rel=canonical)으로 연결되어 있으면 구글이 원본에 순위를 주고 나머지는 동시게시로 처리합니다. 없으면 내 재게시글이 서로 경쟁합니다. 본 도구는 모든 매치의 정규화 태그를 분석해<link rel="canonical"> 태그를 파싱, 각 결과를 구분합니다: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK, SCRAPED.
콘텐츠팀이 통합 전 묻는 질문.
웹 색인 범위: Copyscape, SEMrush와 비교하면?
Common Crawl, SEO 중점 도메인에서 모은 2억 5천만+ 페이지. 매 30일 갱신. Copyscape(완전일치 1억2천만, 표절 부문 한정)보다 넓고, 구글 전체 크롤보다 좁음. 범위 문서화, 갱신 주기 공개. Pro 등급은 내 폴더도 별도 색인 가능.
정규화 탐지는 실제로 어떻게 동작합니까?
매치된 각 페이지의 원본 URL(캐시/실시간) 호출, <head>에서 rel=canonical 추출. ORIGIN(자기 자신), SYND-OK(내가 운영하는 다른 정규화 지정), LEAK(정규화 누락/잘못 지정), SCRAPED(정규화 및 배포처 아닌 도메인 없음)으로 라벨링. 각 매치별 분류값이 명확히 표시.
AI가 외부 텍스트 활용 시, 이것도 잡을 수 있나요?
네 — AI 작문 도구도 실제 웹페이지에서 문구를 가져오기에 유사/스핀본 매치에 노출. 소스 URL 함께 제공, 인용/재작성/삭제 중 선택 가능. AI-콘텐츠 탐지는 별도 기능, 도입 예정이나 아직 미탑재 — 본 도구는 표절/중복 검사에 집중.
최대 문서 크기는?
무료 2,500단어, 프리미엄 5만, 엔터프라이즈(혹은 셀프호스트) 25만+. Pro 폴더 스캔은 폴더당 최대 2,000문서, 페어와이즈 행렬 5분 이내 연산.
경쟁사가 내 글을 스크랩한 걸 잡을 수 있나요?
공개, 크롤가능한 사이트에 뜬 스크랩이라면 — URL, 타임스탬프 스냅샷이 매치리스트에 표시. 스냅샷은 DMCA용 증거: 날짜, 해싱, 매치 구간 하이라이트 포함. DMCA 직접 신고는 제공 안 하나, 관련 서류는 발급.
내 동시게시 네트워크는 검사에서 제외할 수 있나요?
Pro 등급 — 운영 도메인 allowlist 설정 권한(medium.com/@you, linkedin.com/in/you, substack.com/p/you 등). 허용된 도메인 매치는 SYND-OK 라벨로 점수에서 제외. ‘예상 못한 중복’만 점수에 반영.
폴더 단위, 500개 문서 라이브러리는 어떻게 처리합니까?
실제 쌍별 검사는 O(n log n): 60비트 해시 기반 페어후보 간소화, 정렬 후 완전정렬. 500문서 = 124,750쌍, 4코어 서버서 약 4분 소요. 행렬은 CSV로 추출해 외부 파이프라인 연동 가능.
엔진이 실제로 오픈 소스인가요?
네 — github.com/NoplagLabs/noplag-engine, Apache 2.0. 청킹, 핑거프린팅, 검색 단계, 정렬, 중복 분류 로직이 모두 저장소에 포함되어 있습니다. 클라우드 버전은 코퍼스와 Common Crawl, Wikipedia 미러를 추가로 제공합니다. 셀프호스팅 시에는 직접 코퍼스를 준비해야 합니다. 유사도 점수를 신뢰하기 전에 알고리즘을 직접 검증하세요.
콘텐츠 파이프라인 연동용 API 제공하나요?
REST 엔드포인트는 /v1/checks (Python 및 Node SDK 지원). 문서를 제출하면 최대 8초 이내에 중복 보고서를 동기적으로 반환합니다. 그 이상 소요 시에는 웹훅 콜백으로 결과를 전달합니다. 사전 게시 CI 검사에 적합 — 팀 기준치보다 중복률이 높으면 병합을 차단할 수 있습니다. 전체 참조는 /docs/developers/api에서 확인하세요.
유료/인증 벽 뒤 콘텐츠는 검사 대상입니까?
공개 접근 가능한 페이지만 크롤: Common Crawl, sitemap, robots 허용 도메인. 유료벽/로그인 뒤(예: NYT, FT, 학술지)는 색인 미포함 — 인용 구문 있어도 매치 불가. 학술 논문은 OpenAlex/CORE 별도 지식베이스가 오픈액세스 범주만 포함.