Yapay zeka dedektörü: Bir sinyal, kesin karar değil
Yapay zeka tespiti yakında geliyor — yol haritamızda, henüz yayında değil. Yayına girdiğinde, tüm yapay zeka tespit araçları — bizimkisi dahil — bazen hatalı olacak. Noplag evet/hayır kararı yerine ayarlanmış olasılık puanı döndürecek ve İngilizce'yi anadili olarak kullanmayanlar için yanlış-pozitif oranını yayınlayacak. ChatGPT, Claude, Gemini, GPT-5 ve Llama kapsamı sağlıyoruz. Puanın ne ifade ettiğini görmeden harekete geçmeyin — özellikle bir öğrenci veya iş başvurusunu değerlendiriyorsanız. Tespit, birçok sinyalden yalnızca biri. Tek başına kullanılmamalı.
Her ana LLM için tespit imzası.
Her model farklı bir istatistiksel iz bırakır. Sürüme göre takip ediyoruz ve model bazında kalibrasyon yayınlıyoruz; böylece kontrol ettiğiniz metni hangi modelin yazdığına dair puanın neyi gösterdiğini biliyorsunuz.
ChatGPT
gpt-4o, o1, o3 aileleri. Sürüm geçişlerinde çıktı kaymasını izliyoruz; her sürümden sonraki 30 gün içinde model bazında kalibrasyonu yeniden eğitiyoruz. Rapor, sinyali en çok andıran model ailesini belirtir.
Claude
Sonnet, Opus, Haiku katmanları; 3.x ve 4.x. Tespit sinyali moda (düşünme vs. hızlı) göre değişir; her raporda moda özel kalibrasyon belirtilir.
Gemini
1.5 Pro, 2.0 Flash, 2.5 Pro. İngilizce dışı metinlerde çok dilli sinyal zayıf; raporda 'düşük kaynak güveni' olarak açıkça belirtilir, gizlenmez.
GPT-5
OpenAI’nin Ağustos 2025 sürümü. Davranışsal imza, gpt-4o'dan farklı; sürümden sonraki 30 gün içinde model kartı referans çıktılarıyla karşılaştırarak yeniden eğitiyoruz.
Llama
3, 3.1, 3.3 ailesi. Kendi sunucunuza kurulan varyantlar daha zor — ince ayar sinyali kaydırıyor. Rapor, belirli bir sürümü belirtmek yerine 'muhtemelen LLM-üretilmiş, aile: Llama' der.
Tüm yapay zeka tespit araçları, İngilizce'yi anadili olarak konuşmayanları fazla işaretler. Bizim yaklaşımımız bu.
Liang ve diğ. (Stanford, 2023) TOEFL denemelerinde %61 yanlış-pozitif oranı ölçtü — ana dili İngilizce olanlara göre altı kat fazla. Tüm tespitçiler. Bizimkisi de, düzeltmeden önce.
Stanford çalışması
Liang ve diğ. (2023), tüm ticari tespitçileri anadili İngilizce olmayanların TOEFL kompozisyonları üzerinde test etti. Karşılaştırma tespitçisi, %61 oranında AI-üretilmiş olarak işaretledi — ana dili İngilizce olanlara göre altı kat fazla. Aynı metinler, aynı görev.
Neyi yeniden kalibre ettik
Sınıflandırıcıyı, ESL'ye özgü stil işaretleri (eşit cümle uzunluğu, basit kelime dağarcığı, az deyim) çıkarılarak yeniden eğittik — bu özellikleri AI sinyali olarak saymıyoruz. Yalnızca stilden bağımsız özellikler. Biçimden değil, yapıdan tahmin ediyoruz.
Kalan hata oranı
Düzeltmeden sonra: tek bir genel oran yerine, her dil için belgelenmiş bir güven aralığı. Her dil için tablolar, özellik değerlendirmeyi geçtiğinde yayımlanır — kurumsal bir denetimin talep edeceği tam şeffaflık.
Ne zaman geçersiz kılınmalı
ESL yazarını değerlendiriyorsanız ve skor %20–80 aralığındaysa yalnızca tavsiye olarak ele alın. Rapor, kullanıcıya 'düşük güven — dikkatle yorumlayın' mesajını açıkça gösterir.
Hala kaçırdıklarımız
Hibrit yazım — LLM taslak, ana dil editörüyle cilalı — hem saf insan hem tamamen LLM'den daha zor. Rapor, 'karışık sinyal, muhtemelen hibrit' diye işaretler; tahminde bulunmaz. Kalan hatanın bir kısmı bu grupta.
Nerede ölçüyoruz
Kamuya açık TOEFL deneme setleri, Pan-Hispano akademik gönderileri ve CEFR seviyelerine göre derecelendirilmiş çok dilli yazılar. Liang ve diğerlerinin kullandığı veriyle aynı, ayrıca 2024-2026 arasında toplanan 8 yeni korpus. Referanslar, özellik yayımlandığında metodolojiyle birlikte paylaşılır.
Bir olasılık, karar değil.
Puan, %0 ile %100 arasında bir olasılıktır. %80 üzeri: yüksek güvenle AI-üretilmiş. %20 altı: yüksek güvenle insan. %20–80 arası: yalnızca bir sinyal; kanıt değil. Tespiti, bir konuşma başlatmak için kullanın — hiçbir zaman nihai karar olarak değil.
Metnin insan tarafından yazıldığına dair yüksek güven. Bu aralık için yanlış pozitif oranı, özellik değerlendirmeyi geçtiğinde her dil için yayımlanır.
Model emin değil. Skoru birçok girdiden biri olarak değerlendirin — son yazı örnekleri, önceki taslaklar, sınıf içi çıktılar. Yalnızca bu bandı referans alarak işlem yapmayın.
Metnin büyük dil modeliyle üretildiğine yüksek güven. Yine de karar değil. Bir karara varmadan önce bağlam (komutlar, tarama geçmişi, sözlü savunma) ekleyin.
- 5Çıkışta hedeflenen LLM aileleri
- 61%ESL yanlış-pozitif oranı, Stanford '23
- 30gHer model sürümünden sonra planlanan yeniden eğitme sıklığı
- v1.2AI içerik tespiti için hedeflenen sürüm
- 2024tespit Ar-Ge’si başlıyor
Biz tarafımızı seçtik: dürüstlük. Tespiti yanıltacak araç sunmuyoruz.
Bir insanlaştırıcı, AI tespitinden kaçmayı hedefler — LLM çıktısını yeniden yazar, tespit skorunu düşürür. Yapabiliriz. Yapmıyoruz. Bu ürünün amacı AI kullanımını ortaya çıkarmak, gizlemeye yardımcı olmak değil. Tespit kullanışlı olacaksa, tespit yapanlarla insanlaştırıcı yazanlar aynı satıcı olmamalı. Tarafımızı seçtik. İnsanlaştırıcıları bu üründe anarsak, var olduklarını ve metne gelmeden önce kullanılabileceğini belirtmek için — satmak için değil.
Tam açıklamayı okuyunGPTZero, Originality.ai ve Winston ile karşılaştırma.
Eğitime odaklı, intihal katmanı yok, kalibrasyon açık değil. Sadece AI tespiti; tespit + intihal istiyorsanız iki ayrı araç.
Tespit + intihal + açık kaynaklı motor. Model başına kalibrasyon verileri yayımlanır. Aynı rapor, aynı sağlayıcı, uçtan uca denetlenebilir.
'%97 doğruluk' pazarlaması. Yanlış-pozitif oranı gizli. Sadece İngilizce kalibrasyonu. Kapalı kaynak — arka plandaki skoru denetleyemezsiniz.
ESL yanlılığı konusunda açık (Liang 2023'ü doğrudan kaynak gösteriyoruz). Çok dilli kalibrasyon. Açık kaynaklı bir motor; metodoloji, özellikle birlikte yayımlanır.
ChatGPT tespitinde güçlü. Claude ve Gemini'de sinyal zayıf. Yüksek hacimde pahalı; 10 bin kelime/ay üstü fiyat kademeli.
Her ana model ailesi eşit kalibrasyon çabasıyla kapsanıyor. Pro'ya kadar sabit fiyat. Uyum gereksinimi olanlar için kendi sunucuna kurulum.
On iki soru, dürüst cevap.
Bilmiyorsak, cevabı 'bilmiyoruz' der. Kalibrasyon değiştikçe listeyi güncelliyoruz.
- Yapay zeka tespiti kesin mi?
- Dürüst yanıt: Hiçbir dedektör ~200 kelimenin altındaki metinlerde güvenilir değildir ve tüm dedektörlerin yanlış pozitif oranları yazı tarzına, dile ve metni üreten LLM'ye göre değişir. Noplag, kalibrasyon verilerini yayımlama taahhüdü verir; böylece 'doğruluk' sizin kullanım senaryonuzda ne anlama geliyor, görebilirsiniz. Bu veriler özellikle birlikte yayımlanır.
- Noplag, İngilizce'yi anadili olarak konuşmayan yazımı AI-üretilmiş olarak işaretleyecek mi?
- İşaretleyebilir — bu konuda şeffafız. Liang ve diğ. (Stanford 2023), tüm ticari AI tespitçilerinin ESL yazarlarını fazla işaretlediğini gösterdi. Bizim önlemlerimiz, bilinen ESL kalıplarında yanlış-pozitif oranını sınırlar ve kalan hata oranını yayınlarız. Sinyal belirsizse, raporda açıkça belirtilir.
- Noplag hangi AI modellerini tespit edecek?
- İlk yayında, ChatGPT (gpt-4o, o1, o3), Claude (Sonnet / Opus / Haiku, 3.x ve 4.x), Gemini (1.5 / 2.0 / 2.5), GPT-5 ve Llama 3.x tespit edilir. Tespit yakında yayında; tespit kalitesi modele göre değişir ve raporda hangi model imzasını yansıttığı belirtilir.
- GPTZero veya Originality.ai’dan farkı ne?
- Yapay zeka tespiti ile intihal kontrolünü bir arada sunuyor, motoru açık kaynak olarak yayımlıyoruz. GPTZero yalnızca tespit yapar. Originality.ai kapalı kaynaklıdır ve ESL yanlılığı verilerini açıklamaz. Satır satır karşılaştırmalar için /vs-gptzero ve /vs-originality-ai adreslerine bakın.
- Öğrenciler insanlaştırıcı ile bu tespitçiyi aşabilir mi?
- Evet — insanlaştırıcılar mevcut, dürüst olmak gerek. Taslaktan sonra yoğun yeniden yazım tespit sinyalini düşürür. İnsanlaştırıcı sunmuyoruz (bu misyonumuzun tersine). Yapay zeka tespitini bir girdi olarak ele alın, asla kesin kanıt olarak değil.
- 'Yanlış pozitif' burada ne demek?
- İnsan tarafından yazılmış metnin AI tarafından üretilmiş olarak puanlanması. Oranı, her dil ve yazı tarzı kümesi için ölçüp yayımlayacağız. Hiçbir dedektörde bu oran sıfır değildir — yüksek bir puanı kanıt olarak değil, araştırılması gereken bir işaret olarak görmek gerekir; bu sayfa, yanlış kullanımı önlemek için hazırlandı.
- %99 doğruluk garantisi satıyor musunuz?
- Hayır. Yazı tarzları, diller ve LLM'ler arasında %85'in üzerinde sürekli doğruluk iddia edenler, matematiğin izin verdiğinden fazlasını iddia ediyor. Gerçek güven aralığını, özellik değerlendirmeyi geçtiğinde her dil için yayımlıyoruz. Kesinlik satmıyoruz.
- Yapay zeka tespiti ücretsiz mi?
- Yakında. Yayına girdiğinde, ücretsiz pakette de ücretsiz olacak — intihal kontrolündeki gibi 2.500 kelime limiti. Ücretli paketler limiti artırır; AI tespiti ek ücretli olmayacak.
- Model kapsamı ne kadar güncel?
- Yeni yayımlanan LLM'lere karşı tespiti 30 gün içinde yeniden eğitiyoruz. Kalibrasyon setimize dahil olmayan bir modelse, rapor 'muhtemelen LLM-üretilmiş, model bilinmiyor' der; aile tahmini vermez.
- Çok dilli AI tespiti yapabiliyor musunuz?
- İngilizce, İspanyolca, Fransızca, Almanca, Portekizce için doğrulanmış kalibrasyonumuz var — sinyal İngilizce'de en güçlü. Diğer dillerde sonuç 'düşük kaynak — dikkatle yorumlayın' olarak işaretlenir. Rapor, gönderdiğiniz metne hangi kalibrasyonun uygulandığını belirtir.
- API ile AI tespiti entegre edebiliyor muyum?
- Yakında. Yol haritasında var; yayına girince /v1/checks uç noktası hem intihal hem AI tespiti puanı döndürecek. Ayrıntılı bilgi için /plagiarism-checker-api ve /docs/api.
- Bir puana katılmıyorsam ne yapmalıyım?
- Bize bildirin. Düzeltmeleri kaydediyoruz, her model sürümünden sonraki 30 gün içinde tekrar eğitiyoruz ve sürümler arası model davranışını yayımlıyoruz. Tespit mükemmel değil; hataları duymak isteriz, yokmuş gibi davranmak istemeyiz.
Yapay zeka tespiti — yakında, 2.500 kelimeye kadar ücretsiz.
Kalibrasyon verileri, yanlış-pozitif oranları ve model bazındaki imzalar yayınlanacak. Puanın arkasında ne olduğuna bakmadan karar vermeyin.
Canlıya alındığında haber ver