REPORTER사전 파일 자기점검 · 소스 검증 · 바이라인 도용 추적

표절 검사 기자용 사전 점검

편집자가 보기 전에 사전 자기점검. 의역 인용, 보도자료, AI 생성글(곧 지원) 탐지. 바이라인 재게재 추적 가능. 2,500단어 무료. CMS 연동 위한 REST API 제공.

사전 파일 자기점검소스 검증바이라인 도용 탐지
무엇을 제출하시든

아웃풋 네 가지. 셀프체크 하나.

현장 기자

데일리 마감 기사 제출

다음은 편집자가 봅니다 — 먼저 정리 상태를 확인하세요.

  • 900단어 기사 30초 만에 자기점검
  • 보도자료 원문 자동 표시
  • 통신사 중복 기사 사전 확인
특집 필자

재사용 리서치 활용 장문 기사

5,000단어 특집 기사는 인터뷰 원문+이전 기사 활용.

  • 자기사 이전 기사 ‘SELF-CITE’ 태그
  • 인용문(명시 vs 의역) 분류
  • 엠바고 인지 기능: 엠바고 해제 이전 자료 제외
탐사 기자

수개월 문서자료 → 한 기사

드래프트 중 실수로 인용 누락 감지.

  • 단락별 소스 명시 여부 점검
  • 내 소스폴더와 문서 캐시 전체 대조
  • 내 단독기사 도용시 DMCA 스냅샷 제공
프리랜서

여러 매체 제출, 사내 QA 없음

편집자도 직접, 실제 자기점검만이 유일점검.

  • 현장 핸드폰으로 빠른 점검 가능
  • 타 매체 재활용은 허용리스트로 관리
  • 무료 구간 기준 2,500단어 기사 커버
사전 파일 프로세스

전송 전 3단계.

API 파이프라인/대시보드 단일 사용. 동일 엔진. 동일 리포트. 동일 47초.

01

01 · 드래프트 자기점검

붙여넣거나 파일 업로드. 바이라인 허용리스트(이전 기사, 통신사 제공기사) 추가. 자동으로 자기사 이전글(정상)과 타인글(문제)의 의역/중복 구분.

02

02 · 소스 검증

리포트는 구간별로 소스 URL, canonical-tag 상태, 스냅샷 날짜 표시. 보도자료는 REPRINT로 자동 태그. 매체별 정책(직접인용 허용여부) 따라 처리 설정. 단락별 AI생성 분류(ESL보정) 곧 지원.

03

03 · 제출 전 결정

분류별로 확인: 인용문(점수 제외), 인용명시 의역(낮은 가중치), 무표기 의역(수정 필요). AI 탐지 출시 후엔 AI 가능성 단락 표시 — 매체정책 따라 Disclosure나 수정 필요. 문제 없으면 파일 제출. 리포트는 파일에 첨부.

소스 검증

기사 단락마다 확인해야 할 6가지.

모든 분류는 매칭 구간 옆에 표시. 매체 정책상 인용필요 항목(자동 표시 가능). 기준점: '윤리 데스크는 이걸 승인할까?'

01 · 직접 인용

따옴표+화자표기 한 문장 내 포함. 인용으로 간주, 점수에서 제외. 인터뷰 녹음 업로드시 transcript 폴더와 비교해 인용탐지.

02 · 보도자료

보도자료 원문 대조시 REPRINT 태그. 일부 매체는 직접인용 허용, 미국 일간 대부분은 재작성 필요. 매체별 정책 Settings에서 설정.

03 · 통신사

AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA 통신사 기사(Premium 구독시). 매체 라이선스 하라면 재작성 가능. 출처 구분, 라이선스 확보 여부 확인.

04 · 엠바고 자료

엠바고 보도자료는 임시 범위로 추가. 엠바고 전엔 EMBARGO-OK, 이후엔 기본 분류 전환. 과학기사 등 루틴 엠바고에 유용.

05 · AI생성(곧 지원)

단락별 AI 판별+ESL 보정. 프리랜서 제출기사용 — AI생성 빈번. 제출 전 AI탐지로 윤리팀 선제검증. 오픈 메소드(Binoculars, Hans et al. 2024).

06 · 자기사

바이라인 허용리스트: 이전 기사, 포트폴리오 사이트, Substack, Medium 아카이브. 자기기사 반복은 SELF-CITE — 특집 기사 재활용 많음. 유사성 점수 반영X. 검토표시만.

STORY-CHECK 화면

1,500단어 기사 47초 후 보는 화면.

단락별 분류, 소스 URL, 인용상태, 매칭구간 클릭확인 가능. 윤리데스크 미팅시 근거 가능. 리포트의 엔진 commit 기준 재현 가능.

사전파일체크 · 1,632단어 · 18구간 분류주상원 예산 대립 — 다음은?
헤드라인 · 11.4%AI · 0.07
#매칭 구간 · 소스분류
04
“현 예산안은 지역 현실과 맞지 않습니다.” — Hadley 상원의원(5/19 발표)Hadley 보도자료 · 2026-05-19 · 인용표기 있음
인용 · 출처표기
07
예산 삭감안은 K-12 교육예산을 2년간 3억4천만달러 줄일 예정.ap.org · 주상원 예산정리 · 2026-05-20
통신사 · AP
11
비판자들은 '공교육에 대한 세대적 투자 축소'라고 표현.Marisol Chen(자기사) · 전주 상원교육위원회 기사
SELF-CITE
13
Hadley: 예산안은 필수 서비스 우선, '재정 건전성' 달성 의지.Hadley 보도자료 · 인용표시 있음
인용 · 출처표기
14
교육단체, 5주째 매주 화요일 의사당 집회.드래프트 · 원본취재 · 소스 일치 없음
원본
16
Hadley, 예산안을 '정치적으론 어렵지만 재정적으로 신중'하다고 설명.TIMES 통신 · Hadley 인터뷰 녹취 · 2026-05-19 · 동일 발언 타매체
통신사 · TIMES
헤드라인 11.4% = 통신사+SELF-CITE 합산. 인용+원본 제외.Engine v0.4.2 · 파일 제출 준비 · 리포트 첨부
47s사전파일 평균 체크
6통신사 피드(AP/Reuters/AFP/Bloomberg/dpa/Kyodo)
0훈련에 사용된 기사 수
5초기 지원 언어, 확장 중
Apache2.0 · 검증가능 방법론
바이라인 도용

내 단독이 타사 바이라인으로 뜰 때 할 세 가지.

01 · 모니터

바이라인을 감시 쿼리로 등록

내 기사(또는 기사 목록)를 감시목록 등록. 비허용 도메인에서 내 기사 일치구간(복붙, 의역, AI 변형) 출판시 매일 감지. 알림엔 URL, 일치 단락, 스크랩 시각 포함.

스팸 집계 사이트 24시간 이내 감지. 경쟁매체 의역버전은 1주 이내.
02 · 증거팩

DMCA급 스냅샷(날짜, 해시 포함)

도용 감지시 크롤링 시점의 해당 페이지 HTML 스냅샷+해시 제공. 내 오리지널 게시(기사, 트윗, Wayback)와 조합하면 우선권 입증.

DMCA 제출은 법적 판단 필요. 자료만 제공, 대리 제출X.
03 · canonical 태그 상태

정상 제휴사에 내 바이라인 유지여부

Medium, LinkedIn, Substack, 제휴송고시 원본 canonical 연결 추적. ORIGIN이면 SEO 신용 귀속. LEAK이면 SEO 분산. LinkedIn에서 canonical 기본 비활성됨.

canonical만 불가 시 본문 ‘This piece first appeared at…’ 링크 추가 권장.
통신 & 제휴

언론이 표절 검사기에서 꼭 필요한 2가지, 학술 검사는 안 보는 것.

대부분 표절검사기는 언론용이 아님. 통신기사 원문도 무조건 표절로 분류 — 모든 언론이 같은 AP 기사를 라이선스 사용하는 데도 과탐지됨. 반면 바이라인 도용은 제출된 기사만 보고, 웹 재게재는 탐지 못함. Noplag 통신사(article) 구독은 통신기사를 WIRE로 분류, 표절로 안 봄. 바이라인 모니터는 실시간 재게재 탐지. 두 기능 모두 기본 꺼짐 — 언론 상황에서 필요시 직접 활성화.

통신사 분류 가이드 읽기
언론 워크플로우 참고
WIREAP/Reuters/AFP/Bloomberg/dpa/Kyodo/PA는 WIRE 분류 — 표절 아님. 매체별 라이선스 설정 필요.
PRESS보도자료는 공용 배포본과 일치시 REPRINT. 매체정책별 처리.
EMBARGO엠바고 자료는 엠바고일까지 EMBARGO-OK, 이후는 기본 분류 전환.
AI단락별 AI 판별+ESL 보정 곧 지원. 편집자 보기도 전에 AI생성 탐지.
BYLINE바이라인 허용리스트: 자기사는 SELF-CITE. 특집에서 크로스퍼블리싱 보통 발생.
WATCH게시글 감시쿼리 등록, 스크래퍼/의역기 감지됨. DMCA 증거팩 제공.
자주 묻는 질문

실제 기자가 자주 묻는 것들.

내 드래프트가 저장되거나 모델 훈련에 쓰이나요?
아니오. 초안은 해시화(역추적 불가) 후, 테넌트 별 DB에 저장. 원본 텍스트는 30일 후 삭제(보존 옵션 제외시). 탐지 모델(Binoculars)은 공개 코퍼스만 이용 — 기자 원문은 학습집합 미포함. DPA에 명시.
통신사 분류는 어떻게 동작하나요?
Premium 구독+통신 코퍼스(AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA). 통신사와 원문 일치시 WIRE로 태그 — 표절 아님 — 라이선스 근거. 매체별로 통신인용 범위 설정(무제한/출처명시 등). 분류는 구간마다 표시.
보도자료 처리 기준은?
공개 배포자료(PR Newswire, Business Wire, EurekAlert, PRWeb)와 대조. 일치시 REPRINT 태그. 일부 매체는 본문 인용 허용, 미국 일간 대부분은 재작성 필요. 매체 정책은 Settings에서, 리포트에 지침 표시됨.
AI생성 탐지로 프리랜서 기사 어떻게 검증하나요?
AI detection 기능은 곧 제공될 예정입니다(v1.2 로드맵에 포함). 출시 시, 각 문단별로 AI 생성 가능성을 평가하고, 영어 비원어민(ESL) 특성을 반영한 판정을 제공합니다. 이는 AI로 작성된 원고가 늘어나는 상황에서, 뉴스룸이 외부 필진의 투고를 검증할 때 사용할 수 있도록 설계되었습니다. ESL 조정이 중요한 이유는, 영어 비원어민의 글쓰기 패턴이 AI 생성 텍스트와 유사해 오탐률이 높기 때문입니다(Stanford 2023 연구 기준, 단순 탐지기의 오탐률 61.3%). 저희는 이 오탐률을 크게 낮추도록 보정할 예정이며, 실제 남은 오탐률은 기능 평가 완료 후 공개합니다.
내 기사 바이라인, 표절/스크래핑 모니터링 가능?
Premium+바이라인 감시기능. 내 기사 목록 등록, 비허용 도메인 일치구간 매일 감지. 감지시 해시된 HTML스냅샷 제공 — DMCA 등 법적 증거. DMCA 제출은 직접(법적 판단)
엠바고 자료 처리도 되나요?
엠바고자료는 엠바고일 포함 임시범위로 추가. 엠바고 전엔 EMBARGO-OK, 이후 표준 처리 전환. 과학(NIH/EurekAlert 등)·정책(의회 속기록) 기사에 적합.
비영어 기사도 지원하나요?
탐지 엔진은 출시 시 영어, 스페인어, 포르투갈어, 폴란드어, 우크라이나어에 맞춰 보정되어 있습니다. 추가 언어는 순차적으로 지원됩니다. 탐지 품질은 PAN-PC-11 벤치마크로 검증되며, 언어별 평가는 로드맵에 포함되어 있습니다. 여러 언어로 기사 송고하는 국제 특파원에게 유용합니다.
뉴스룸 CMS 연동용 API는?
REST + OpenAPI 3.0 명세 지원. Python 및 Node SDK는 해당 명세에서 제공합니다. 장문 기사 비동기 검사를 위한 Webhook 지원. CMS의 save_draft 시점에 POST /v1/checks 호출; 보고서는 기사에 감사 추적 메타데이터로 첨부됩니다. WordPress, Ghost, Drupal 연동 예시는 github.com/NoplagLabs/noplag-engine에서 확인할 수 있습니다.
개인 프리랜서는 어떻게 활용 가능?
무료 구간은 2,500단어/회, 무제한 체크, 가입 불필요. 모바일에서도 체크 지원. Premium은 $79/월(통신/바이라인/폴더 기능 포함). 로컬 셀프호스트는 Apache 2.0 무료.
만약 인용문이 AI 생성 등 판명되면?
AI탐지 출시 후, 단락별 AI가능성+ESL보정 제공. 인용문이 AI 가능성시 편집자 검증필요 — 화자가 AI로 생산했거나 AI의역일 수도, 오탐일 수도 있음. 확정 배제 아님, 출처 재확인 신호.

편집자 보기 전 점검하세요.

제출본 붙여넣고 47초 내 단락별 리포트: 인용/통신/자기사/Ai탐지(곧 지원). 최대 2,500단어 무료. 통신+바이라인+코퍼스 구독은 유료.

표절 검사 기자용 사전 점검