WEB150M+ sayfa · kanonik-etkili

İntihal kontrolü ile çevrimiçi kopya içerik denetimi

Canlı webde, kendi klasörlerinizde ve ekip içi içerik kitaplığınızda yinelenen içeriği bulun. Kanonik-etkili — yasal aktarımı kopyalanan sürümden ayırır. 2.500 kelimeye kadar ücretsiz; Pro’da klasör seviyesi tarama.

0 / 1,500 words
Web + Common Crawl endeksliNeredeyse-aynı + döndürülmüş içerik tespitiKlasör seviyesi kütüphane taraması
YİNELENEN TİPLERİ

Dört tür tekrar. Farklı işlem, farklı çözüm.

Çoğu “tekrar denetleyici” yalnızca tam eşleşmeyi bulur. Her eşleşmeyi dört kategoriden birine ayırıyoruz. Böylece hangisini görmezden gelmeli (yasal alıntı), hangisini kanonik yapmalı (aktarılmış), hangisini yeniden yazmalı (kopyalanmış ya da döndürülmüş) olduğunu bilirsiniz.

01 · TAM

Kelimesi kelimesine eşleşme

30+ karakterlik özdeş dizi. Kopyala-yapıştır klişe, değiştirilmeden yayınlanan aktarılan makaleler, taranmış sayfalar.

Çözüm: kanonik yapın, yeniden yazın ya da kabul edin (eğer kendi aktarımınızsa).
02 · YAKIN-KOPYA

Hafifçe yeniden yazılmış

Cümle yapısı aynı, eşanlamlı değişimi veya sıfat yer değişimi var. Tipik “spin” çıktısı. Tasarımla Layer W'nin kaçırdığı türden farklar.

Çözüm: tam yeniden yazma — ana sav sizin olmalı.
03 · DÖNDÜRÜLMÜŞ

Yoğun şekilde yeniden yazılmış

Cümle düzeyinde özet, cümlecik değiştirme, zaman kipi kaydırma, dolgu ekleme. Sıkça AI-araçları ve dış içerik üretimi kaynaklı.

Çözüm: amacı kontrol edin. Yazarın kendi özetlemesi mi, gizli kopya mı?
04 · KALIP METİN

Sayfalar-arası tekrarlanan

Aynı uyarı/yazar biyografisi/ürün açıklaması yüzlerce kendi sayfanızda — Google’ın gerçek tekrar içerik kriteri bu.

Çözüm: ortak bir şablona çıkarın; Google’ın 800 kez endekslemesine izin vermeyin.
GOOGLE NEYİ YİNELENEN SAYIYOR?

"Farklı siteden kopyala-yapıştır" ile sınırlı değil.

Google’ın gerçek kriterleri (Search Central belgelerinde yazılı): üç desen tekrar içerik olarak tetikleniyor ve çoğu kendi sitenizdeki sayfalarla ilgili, kopya rakiplerle değil.

01

Kanonik olmayan alanlar arası kopya

Aynı makale birden çok sitede, rel=canonical orijinale işaret etmiyor. Hatalı dağıtılmış aktarımlar, kanonik olmayan rakipler, iki yayında aynı yazarın yanlışlıkla aynı metni paylaşması.

02

Kendi sitenizde farklı URL’ler altında aynı içerik

/product/foo ve /product/foo?utm_source=email ve /product/foo/ son taksimli haller. Faceted navigation, yazıcı dostu sürümlerde kanonik olmaması, mobil/masaüstü için ayrı URL. Google bunları gruplar, birini seçer, geri kalanını atar.

03

İçeriğe benzeyen şablon metinler

Bir e-ticaret kategorisinde, 1.200 SKU boyunca tekrarlanan beş paragraf açıklama. 47 şehir sayfasında aynı "20 yıllık deneyim" metni. İnce-öz içerik — Google’ın Güncel İçerik Güncellemesi bunu yakalıyor.

SEO KULLANIM ALANLARI

Bu denetimi haftalık çalışan altı ekip.

Aynı araç, altı farklı iş akışı — tek blogcu ön incelemesinden ajansın dış makale kontrolüne kadar.

Blog yazısı ön yayım kontrolü

Yayınlamadan önce taslağı canlı webde tarayın. Geçmişteki kendi yazılarınızdan yanlışlıkla alınan ifadeleri, araştırırken okuduğunuz rakip yazılarını ve AI-yeniden yazıcı hatalarını bulur.

Rakip tarafından kopyalama tespiti

Makalenizi yapıştırın, başka kimlerin yayınladığını görün. DMCA kayıtları için kullanışlı — her eşleşmede kaynak URL, eşleşme aralıkları ve zaman damgalı ekran görüntüsü döner.

İçerik kütüphanesi hijyeni

Pro seviyesi klasör tarama. Tüm ekibin yayımlanmış makalelerini bir klasöre atın; araç belge arası tekrarları işaretler — aynı paragraf üç farklı yazıda, şablon olması gereken kalıp metin.

Aktarma denetimi

Bir makalenizi Medium, LinkedIn ve Substack’te aktardınız. Hepsi rel=canonical orijine mi işaretliyor? Araç tümünü çekip, kanonik etiketi kontrol eder ve SEO kaybı olabilecek sürümleri size gösterir.

Dış yazar kontrolü

Dış yazarınızdan gelen metin tek panelde. Ödeme yapmadan önce çalıştırın. Sık rastlanan kopyala-ardından-döndür paterni, AI imzası ve atıfı olmayan alıntıları yakalar.

AI içerik kaynağı takibi

AI asistanları, içerik oluştururken gerçek web sayfalarından metin çeker. Araç yeniden kullanılan bu bölümleri gösterir, böylece kaynak belirtip belirtmeyeceğinize, yeniden yazıp silmeye karar verebilirsiniz. Güncel İçerik riski azaltılır.

KLASÖR SEVİYESİ TEKRAR TARAMASI

Kütüphanenizi bırakın. Hangi metinler üst üste biniyor, görün.

Pro seviyesine özel. Yayınlanmış makale klasörünü seçin; motor her çifti için benzerlik matrisi kurar. Üzerine tıklanabilir, üst üste binmeye göre sıralanır.

KLASÖR / blog-2026-q16 makale · çiftler arası benzerlik matrisi
3 üst üste binme > %10Matrisi dışa aktar
MAKALEA1A2A3A4A5A6
A1 — Beş SaaS fiyat modeli·4%3%38%6%2%
A2 — SaaS fiyatı nasıl yazılır4%·5%12%7%3%
A3 — Ürün-odaklı fiyat kılavuzu3%5%·8%6%4%
A4 — SaaS fiyat yol haritası38%12%8%·9%5%
A5 — SaaS fiyatınızı seçmek6%7%6%9%·4%
A6 — Kurucular için SaaS fiyatı2%3%4%5%4%·
İki makale arasındaki çakışan aralıkları görmek için herhangi bir hücreye tıklayın
  • 150M+web sayfası endekslendi
  • 30gkorpus yenileme sıklığı
  • 94%kanonik tespit oranı
  • 4tekrar sınıflandırma katmanı
  • 2014endeksleme Common Crawl
TEMEL TEKRAR ARAÇLARIYLA KARŞILAŞTIRMA

Tarayıcı tabanlı ve SEO paketleriyle yakalanamayan üç şey.

Layer W-TİPİ ARAÇLAR

Sadece tam eşleşme (Layer W standardı gibi). Yeniden yazılmış bir cümle “benzersiz” olarak işaretlenir — döndürülmüş içerik temiz çıkar. Panodan yapıştırmalar için yararlı; içerik kontrolünde yetersiz.

Noplag: 4 katmanlı sınıflandırma (Tam / Yakın / Döndürülmüş / Kalıp Metin) ve niyet ipuçları — sadece Boolean eşleşmesi değil, eyleme geçirilebilir veri.

SEO SÜITLERİ

$99-499/ay koltukla içerik-benzersizlik aracı satar. Sadece yüzeysel n-gram eşleşmesi; Common Crawl yok; belgeler arası tarama da yok.

Noplag: tek başına Ücretsiz katman (2.500 kelime). Pro ($23/ay) klasör matrisi ve tam 150M+ web kapsamı ekler — aracı $400'lık SEO paketine kilitlemeden.

ÜCRETSİZ ÇEVRİMİÇİ KONTROL ARAÇLARI

Kara kutu. Hangi kaynakla eşleştiği görünmez, sadece benzerlik oranı verir. Çoğu 1.000 kelime sınırı koyar. Endeks yenilemesi genellikle yok — genellikle 2021 web görüntüsüne bakıyor.

Noplag: her eşleşmede kaynak URL + kanonik + aralık + korpus tarihi görünür. Apache 2.0 — algoritmayı bizzat görebilirsiniz.

KANONİK-ETKİLİ TESPİT

rel=canonical etiketiyle aktarılan makale “yinelenen içerik” değildir. Biz öyle ele alırız.

Bir makale birden fazla URL’deyse SEO açısından soru “aynen mi” değil, “hepsi aynı kanoniği mi bildiriyor?” Medium’daki yazınız rel=canonical orijine işaret ediyorsa Google hepsini gruplar, sıralama değerini orijine atar, kalanları yasal aktarım sayar. Etiket yoksa tekrar yayınladığınız içerikle kendiniz rekabet edersiniz. Araç her eşleşmeyi çeker, <link rel="canonical"> etiketini ayrıştırır ve şu şekilde etiketler: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK veya SCRAPED.

Kanonik mantığını okuyun
SSS

Bir içerik yöneticisinin entegrasyon öncesi sorduğu sorular.

Layer W veya SEO paketiyle web kapsamı nasıl karşılaştırılır?

150M+ sayfa, Common Crawl + seçilmiş SEO-önemli yüksek trafikli alanlardan, her 30 günde bir yenileniyor. Layer W'nin yalnızca tam eşleşme endeksinden (yaklaşık 120M, intihal kalıbı odaklı) geniş kapsamlı, Google’ın tam taramasından dar ama güncel veri ve dökümantasyon ile. Pro, kendi klasörünüzü özel korpus olarak ekler.

Kanonik tespit gerçekten nasıl çalışıyor?

Her eşleşen sayfa için motor kaynak URL’yi (önbellekli ya da canlı) çeker, <head>’i ayrıştırır, rel=canonical değeri alır. Sonra eşleşmeler ORIGIN (kanonik kendini gösteriyor), SYND-OK (kanonik size ait başka bir sayfayı işaretliyor), LEAK (kanonik eksik/başka yerde), SCRAPED (kanonik yok, dağıtıma ait olmayan alan) olarak etiketlenir. Sınıflandırma her eşleşme yanında gösterilir, böylece tekrar skorunuz net olur.

AI'nın kaynaklardan aldığı tekrar içerik yakalanıyor mu?

Evet — AI yazım asistanları, içerik üretirken gerçek web sayfalarından metin alabilir, bunlar Yakın-dup veya Döndürülmüş olarak görünür. Kaynak URL ile gösteririz: dilediğiniz gibi atıf, yeniden yazma veya kaldırma kararı verebilirsiniz. AI-tespit aracı (farklı bir sinyal) ayrıca geliyor — yol haritasında, henüz canlı değil — bu sayfa sadece tekrar taraması odaklı.

En büyük belge boyutu nedir?

Ücretsizde 2.500 kelime, Premium’da 50.000, Enterprise’da 250.000+ (ya da self-host’a sınır yok). Pro’da klasör taraması: bir klasöre 2.000 belgeye kadar; tüm çiftlerde matris 5 dakikanın altında hazırlanır.

İçeriklerimi kopyalayan rakipleri bulur mu?

Kopya açık ve taranabilir bir sitedeyse evet — URL eşleşme listesinde, zaman damgalı ekran görüntüsü ile çıkar. Kayıt DMCA seviyesi delildir: tarihli, içerik hash’li, eşleşme aralığı vurgulu. Otomatik DMCA göndermiyoruz (hukuk sizinle), sadece belgeleri hazırlarız.

Kendi aktarma ağımı tekrar taramasından hariç tutabilir miyim?

Pro — kontrolünüzdeki alanlardan (medium.com/@siz, linkedin.com/in/siz, substack.com/p/siz) oluşan bir izin listesi ekleyin. İzinli alanlardan gelen eşleşmeler SYND-OK olarak etiketlenir, tekrar skorunuza eklenmez. Skor “beklenmedik tekrar”ı yansıtır, “her tekrarı” değil.

500 makalelik klasör taraması nasıl çalışır?

Çekme dizisi pratikte çifti başına O(n log n): benzerlik adayları 60-bit hash ile süzülür, tam hizalama sadece adaylarda çalışır. 500 makale → 124.750 çift, 4 çekirdekli makinede ~4 dakikada taranır. Matris CSV olarak dışa aktarılır, hangi alt akışa besleyecekseniz.

Motor gerçekten açık kaynak kodlu mı?

Evet — github.com/NoplagLabs/noplag-engine, Apache 2.0. Bölücü, parmak izi oluşturucu, sorgu zinciri, hizalama ve kopya sınıflandırma mantığının tamamı repoda mevcut. Bulut katmanı, corpus + Common Crawl + Wikipedia yedeği ekler; self-host ile kendi corpus'unuzu getirirsiniz. Skora güvenmeden önce algoritmayı doğrulayın.

API ile entegrasyon nasıl?

/v1/checks adresinde REST endpoint (Python + Node SDK'ları). Bir doküman gönderin, 8 saniyeye kadar eş zamanlı olarak kopya raporu alın; daha uzun işlemlerde webhook ile dönüş yapılır. Yayın öncesi CI kontrolleri için uygundur — ekibinizin belirlediği dupe% eşiği aşılırsa birleştirmeyi engeller. Tüm referans için /docs/developers/api adresine bakın.

Paralı ya da oturumlu içerik ne olacak?

Sadece herkese açık olanı tarıyoruz — Common Crawl, sitemap’te bildirilen sayfalar, robots izinli alanlar. Paralı (NYT, FT, akademik dergiler) yok — motor bunlarla eşleşme bulmaz, metniniz oradan gelse bile. Akademik için, OpenAlex / CORE indeksleri (ayrı korpus) açık erişimli evreni kapsar.

Bir taslak tarayın. Ya da tüm içerik kütüphanenizi.

Ücretsizde 2.500 kelime + 150M+ web sayfası ile karşılaştırılır. Pro ($23/ay) yayınlanmış kütüphaneniz için klasör seviyesi tarama açar. Kendi sunucunuzda saklamak isterseniz Apache 2.0 referansı var.

İntihal kontrolü ile çevrimiçi kopya içerik bulucu