표절 검사 출판사용
프리랜서 원고 사전 검사, 전재 콘텐츠 감사, CMS에 바로 연결할 수 있는 REST API. 탐지 엔진은 Apache 2.0 — 도입 전에 직접 확인 가능.
네 개 데스크. 한 번의 워크플로.
프리랜서 피치를 배정 전 검토
원고마다 10분, 예산 투입 전에.
- 피치/클립 초안 붙여넣기, 기존 게재물 바로 확인
- 문단별 AI 가능성 표시(예정), ESL 인식
- ‘원본이 맞나’ 확인용 반복 문의 불필요
당일 큐 전체 검토 후 출고
오늘 기사, CMS 발행 대기 큐에 올라가기 전에 일괄 검사.
- 유사도·AI 점수로 정렬된 큐 뷰
- 섹션별 임계값 설정(오피니언/뉴스/리뷰 등)
- 리포터별 감사 이력 남기기
이의제기 원고 탐사 검사
알고리즘 공개, 일치 구간 직접 확인.
- X-Engine-Commit 결과 재현성 확보
- 판정 변경 시 사유 기록
- Apache 2.0 — 정정란 리뷰 대응 가능
전재 파트너 감사
전재 네트워크의 캐노니컬 태그 상태 추적.
- 캐노니컬 인식 감지(원본/정상 전재/누락)
- 파트너별 주간 변경 보고서
- 요청 시 DMCA 대응 증빙팩 지원
기사 CMS 업로드 전 3단계.
API로 기사 편집 프로세스에 삽입, 프레스 전 일괄 실행 또는 대시보드에서 개별로 실행. 엔진과 보고서 포맷은 동일, 필요한 곳에 사용.
01 · 인테이크
원고가 CMS 큐에 등록 — .docx / .gdoc 드래그앤드롭, 붙여넣기 또는 CMS의 webhook. 저자, 섹션, 배정 에디터 메타데이터는 감시 로그와 함께 전송.
02 · 검사 + 분류
공개 웹 + Common Crawl + (선택 시) 독자적 백카탈로그 코퍼스에 대해 계단식 검사. 인용 분류로 직접 인용(출처명시)과 비인용 바꿔쓰기 구분. 문단별 AI 가능성은 곧 추가, ESL 인식. 기사당 중간값 42초.
03 · 판정 + 발행
에디터가 보는 정보: 제목 유사도, 카테고리별 분포, 정렬 가능한 출처 목록(AI 점수, ESL 표시 예정). 세 가지 조치: 발행, 메모 달아 반려, 표준 데스크에 상신. 엔진 커밋·코퍼스 스냅샷과 함께 기록됨.
네 가지 CMS, 하나의 REST API.
Noplag을 기존 CMS에 연결. API 스펙은 동일, 통합 레이어만 다름(WordPress hook, Ghost action, Drupal event, 커스텀 webhook 등).
WordPress.org 공식 플러그인. Gutenberg 호환.
- 모든 게시물 타입에 사전 검사 메타박스
- 에디터 내 블록 단위 하이라이트
- WP REST API 통한 감사 로그
Webhook 연동 + Admin API 사용가능. 멤버 전용 콘텐츠 지원.
- save_draft 저장 시 사전 검사 webhook 실행
- 콘텐츠 타입별 태그 단위 정책
- 자가 호스팅 지원(Noplag/자체 Ghost)
drupal.org 제공 모듈, Field-API로 연결.
- 콘텐츠 타입별 표절 필드
- Content Moderation 연동
- 멀티사이트 구성 지원
Webhook + OpenAPI 3.0 스펙. 헤드리스/자체/CMS 등.
- POST /v1/checks: 어떤 CMS hook에서든 호출
- HMAC 서명 webhook 콜백
- OpenAPI 스펙에서 Python + Node SDK 제공
오늘의 발행 큐. 정렬, 감사 이력 지원.
기사별 리포터, 섹션, 유사도, AI 점수, 하이라이트 보고서 링크 제공. 정렬 가능. 안전 기사 일괄 승인, 나머지는 상신.
누가 내 글을 전재하는지 — 캐노니컬이 본사로 가리키는지 확인.
배포 네트워크 추적
허용 도메인(미디엄, LinkedIn, Substack 등) 리스트 등록. 주간 크롤링으로 어떤 파트너가 rel=canonical을 본사로 설정했는지(원본 인정), 빠졌는지(SEO 누수), 무단 전재인지(SCRAPED) 리포트.
내 필명, 어디 블로그에 없는가?
공개 웹, 월별 차이 검사로 허용되지 않은 도메인의 일치 구간 전재 탐지. 일치시 타임스탬프 스냅샷이 함께 제공 — 위조 방지 DMCA 증빙 자료 제공. DMCA 직접 접수는 하지 않음(법적 판단 필요). 준비 서류만 제공.
내부 페이지 간 중복 문단
상용: 발행 기사 모음 폴더 업로드 → 전체쌍 유사도 매트릭스 생성. 47개 도시 페이지에 동일 boilerplate 단락 있다면 적발 — Google Helpful-Content-Update 전에 인지 가능.
구매 검토 전 표준 데스크가 반드시 묻는 정책 세 가지.
첫째, 제출된 글은 어떤 모델도 학습시키지 않습니다. 저희 모델뿐 아니라 타사의 모델도 마찬가지입니다. 제출된 텍스트는 지문화되어 귀하의 테넌트에 색인되고, 별도의 보관 요청이 없으면 30일 후 삭제됩니다. 둘째, AI 판정 기능은 곧 제공 예정이며, 로드맵에 포함되어 있습니다. 문서 단위가 아니라 단락 단위로 판정하며, 엔진 커밋과 코퍼스 스냅샷 타임스탬프가 함께 표시됩니다. 논란이 된 AI 플래그는 동일 커밋 기준으로 수개월 후에도 동일하게 재현됩니다. 무단 재학습은 없습니다. 셋째, Apache 2.0 라이선스이므로 귀하의 엔지니어링 팀이 github.com/NoplagLabs/noplag-engine를 복제해 자체 인프라에서 실행하고, 데이터 흐름을 점검하며, 삭제 요청 처리 과정을 처음부터 끝까지 검증할 수 있습니다. 기관의 표절 검사 소프트웨어 도입 심사에서 가장 많이 제기되는 세 가지 질문에 대해 미리 답변했습니다.
표준 데스크 가이드 읽기실제 구매 검토시 표준 데스크 질문들.
- 우리 기사로 AI 모델이 학습되나요?
- 아니요. 제출 기사에는 지문 해시만 생성, 분리된 테넌트 DB에 색인. 원문은 30일 후 자동 삭제(원하면 보존 선택). AI 판별 모델(곧 출시, Hans et al. 2024)도 공개 코퍼스만 사용, 고객 데이터 미사용. DPA에 명시.
- 문단별 AI 판정, 기자 재검토엔 문제가 없을까요?
- AI 탐지 기능은 곧 제공 예정입니다. v1.2 로드맵에 포함되어 있으며, 출시 시점에는 제공되지 않습니다. 출시 후에는 플래그된 각 단락마다 엔진 커밋과 코퍼스 스냅샷이 기록됩니다. 동일 커밋에서 같은 단락을 다시 검사하면 판정 결과가 정확히 재현됩니다. 알고리즘은 github.com/NoplagLabs/noplag-engine(Apache 2.0)에서 공개되어 있으며, perplexity 임계값과 ESL 보정 기준이 문서화되어 있습니다. '점수를 신뢰하세요'와 같은 모드는 제공하지 않습니다.
- 저대역폭 지역에서 프리랜서가 제출해도 되나요?
- 탐지 기능은 출시 시점에 영어, 스페인어, 포르투갈어, 폴란드어, 우크라이나어에 대해 보정되어 있습니다. 추가 언어는 순차적으로 지원될 예정입니다. 탐지 품질은 PAN-PC-11 기준으로 벤치마크되었으며, 언어별 평가도 로드맵에 포함되어 있습니다. 비원어민 영어 글쓰기는 어휘적 특징이 해당될 경우 LIKELY-AI 대신 ESL ADJ로 AI 판정 플래그가 표시됩니다.
- 내부망에 완전히 자체 구동 가능합니까?
- 네 — Apache 2.0 엔진+Docker. 전량 사내망 내 구동. 기존 Postgres, Redis에 연결, 제출 데이터 외부 전송 없음. 소스 보호·출고 전 보안용 필요시 적합.
- 우리 CMS와 연동됩니까?
- WordPress(공식 플러그인), Ghost(Admin API+webhook), Drupal(공식 모듈) 지원. 기타 커스텀/헤드리스/자체 CMS도 REST+OpenAPI 3.0 스펙 기반으로 당일 프리훅 구현 가능. Python, Node SDK 제공.
- 전재 감사 기능, 실제로 어떤가요?
- 배포 도메인(예: medium.com/@you, 파트너 도메인) 허용 리스트 등록. 주간 크롤링으로 canonical 상태 리포트: ORIGIN(본사), SYND OK(파트너에서 본사 가리킴), LEAK(빠지거나 엉뚱하게 연결 — SEO 급락), SCRAPED(무단 복제, canonical 없음, 미등록 도메인). 스크랩은 스냅샷, DMCA 증빙 포함.
- 30명 기자 규모, 요금 체계는?
- 프리미엄 $79/월이면 5,000단어/검사, 월 5,000 기사, 풀 API+CMS 연동 제공. 1만 기사/월 이상은 엔터프라이즈: 코퍼스+인프라 기준 대량가격. 기자 수 개별 책정 아닌 전체 기사량 기준.
- 오피니언·전재·책 발췌처럼 일부 '재사용' 허용 되는 경우는?
- Pro+는 섹션별 임계값 지원 — 뉴스/오피니언/리뷰/전재 등 구분, 오피니언의 상임위 발언 인용이 뉴스 기사의 경쟁사 인용과 동일하게 걸리지 않음. 인용 분류 단계서 인용구와 무의도적 재사용 구분.
- 발행 속도 느려지지 않을까요?
- 1,500–4,000단어 기준 기사당 중간 47초. CMS 연동 훅은 비동기 — 저장시점에 검사, 최종교정 중 판정 확인 가능. 장문(8,000+단어)은 약 90초로, 동기 연동 대신 사전작업 권장.
- 과거 기사 백카탈로그도 사설 코퍼스로 추가할 수 있나요?
- 엔터프라이즈 버전에서 제공. 아카이브 기사 일괄 업로드하면, 모든 신규 제출물에 대해 백카탈로그까지 검사. 자기복제 리포팅(정당한 경우도 일부 있음), 기존 콘텐츠의 의도적 재활용 등 탐지.
큐로 초안을 돌려보세요. 기사별 결과 확인.
Word 파일, Google Doc, CMS 내보낸 기사 등 업로드. 47초 후 문단별 리포트 확인. 2,500단어 무료; 대량은 Pro, 코퍼스·별도 인프라는 엔터프라이즈.