Detektor parafrase — temukan penyalinan yang disamarkan
Detektor parafrase menemukan teks yang diubah kata untuk menyamarkan sumbernya. Noplag saat ini dapat mendeteksi bagian ringan: pengeditan yang masih menyisakan lima kata berurutan tetap terdeteksi, sehingga penggantian sinonim dan perubahan urutan kecil ditemukan dengan sidik jari winnowing dan dicek silang dengan pencarian web langsung. Penulisan ulang menyeluruh per kalimat adalah masalah berbeda dan belum terdeteksi — pencocokan hampir duplikat (v1.1) dan pencocokan semantik (v1.2) adalah solusi untuk itu, dan akan tersedia setelah evaluasi publik selesai.
Kami mendeteksi. Kami tidak membantu mengelabui.
Humanizer adalah alat yang menulis ulang teks buatan AI atau manusia secara khusus untuk menghindari deteksi. Kami bisa saja membuatnya. Kami tidak melakukannya. Tujuan produk ini adalah menampilkan penyalinan tanpa atribusi, bukan membantu menyembunyikannya. Jika deteksi ingin tetap berguna, pihak yang menjalankan detektor dan pihak yang membuat humanizer tidak boleh vendor yang sama. Kami sudah memilih posisi.
Jika kami menyebut humanizer dalam laporan, itu untuk memberi tahu bahwa alat tersebut ada dan mungkin telah digunakan sebelum teks ini diperiksa — bukan untuk menjualnya.
Empat lapisan. Dua sudah tersedia, dua lagi masih dikembangkan.
Proses ini dirancang untuk mempersempit dari pencocokan persis, duplikat dekat, hingga kesetaraan semantik, lalu memeriksa silang ke web terbuka. Dua lapisan tersedia di v1.0; dua lapisan yang mendeteksi parafrase sebenarnya masih dalam pengembangan, dan kami memilih untuk menyampaikan ini secara langsung.
Winnowing fingerprints — sudah tersedia
Pencocokan substring persis. Pergantian sinonim ringan dan sedikit perubahan urutan yang tetap mempertahankan lima kata berurutan.
Semua yang diubah urutan atau diparafrase.
MinHash LSH — roadmap v1.1
Akan mendeteksi perubahan urutan kalimat dan pengacakan kata. Saat ini belum terdeteksi.
Sinonim nyata dan penulisan ulang semantik, yang akan ditangani oleh L3.
Sentence embeddings — roadmap v1.2
Akan mendeteksi penggantian sinonim dan parafrase semantik. Saat ini belum terdeteksi.
Penulisan ulang yang cukup jauh dari sumber sehingga tidak ada sinyal statistik yang tersisa.
Pemeriksaan silang web langsung — sudah tersedia
Sumber yang muncul setelah snapshot korpus.
Konten berbayar atau tidak terindeks.
Cakupan deteksi saat ini — berdasarkan tingkat intensitas parafrase.
Ini adalah perilaku v1.0, bukan proyeksi. Penyuntingan ringan masih menyisakan bagian teks yang dapat dicocokkan; penulisan ulang menyeluruh tidak, dan tidak ada teknik fingerprinting yang dapat mengembalikannya. Kami membahas batasannya secara rinci di artikel tentang batas deteksi verbatim yang jujur: /blog/the-honest-limits-of-verbatim-detection.
Penggantian sinonim dan sedikit perubahan urutan. Sebagian besar kata asli masih tersisa sehingga fingerprint dapat mencocokkan.
Kucing duduk di atas tikar.
Si kucing duduk di atas tikar.
Struktur kalimat diubah, kata kerja diganti. Hanya terdeteksi jika masih ada bagian yang tidak diubah. Pencocokan near-duplicate (v1.1) ditujukan untuk tingkat ini.
Kucing duduk di atas tikar.
Di atas tikar, kucing itu telah duduk.
Penulisan ulang secara menyeluruh, struktur dan kosakata baru. Saat ini skornya nol; pencocokan semantik (v1.2) ditujukan untuk tingkat ini.
Kucing duduk di atas tikar.
Seekor mamalia kecil berada di permukaan kain.
Sepuluh pertanyaan tentang deteksi parafrase.
Sebagian besar membahas di mana deteksi gagal. Kami jelaskan batas minimumnya; yang perlu tahu adalah mereka yang akan mengambil keputusan berdasarkan skor.
- Apa perbedaan antara deteksi parafrase dan deteksi plagiarisme?
- Plagiarisme adalah kategori yang lebih luas — menyalin teks tanpa atribusi. Deteksi parafrase adalah tantangan khusus untuk menemukan plagiarisme setelah teks diubah susunannya agar asalnya tidak terlihat. Noplag melakukan keduanya dalam satu laporan; proses deteksi parafrase berjalan saat lapisan L1 (pencocokan persis) tidak menemukan hasil.
- Mengapa parafrase berat sulit dideteksi?
- Deteksi bekerja dengan mencari sinyal statistik — urutan kata yang sama, lalu struktur dan makna yang serupa. Suntingan ringan masih menyisakan urutan tersebut, sehingga tetap terdeteksi. Jika sebuah bagian diubah kalimat demi kalimat, urutan yang sama hilang sepenuhnya: parafrase menyeluruh akan mendapat skor nol pada mesin fingerprint, seperti di v1.0. Ini memang sifat metodenya, bukan bug, dan itulah alasan pencocokan near-duplicate (v1.1) dan semantik (v1.2) dibuat sebagai lapisan terpisah, bukan sekadar pengaturan sensitivitas. Penjelasan lengkap ada di blog kami: /blog/the-honest-limits-of-verbatim-detection.
- Apakah Noplag menyediakan alat untuk menghumanisasi teks AI?
- Tidak. Kami tidak menyediakan humanizer. Humanizer dirancang untuk menghindari deteksi — itu bertentangan dengan misi kami. Kami di sisi integritas; kami mendeteksi, bukan membantu menyembunyikan. Lihat penjelasan posisi di atas.
- Bagaimana perbandingannya dengan alat parafrase Quillbot?
- Quillbot mengubah teks untuk menghindari deteksi. Kami mendeteksi teks yang diubah agar lolos deteksi. Kami berada di sisi yang berlawanan dari masalah yang sama. Jika hasil Quillbot muncul dalam pemeriksaan Anda, laporan akan menandai 'kemungkinan penggunaan alat parafrase' saat kami mendeteksi cirinya.
- Apa itu 'four-layer cascade', dan berapa banyak yang sudah berjalan?
- Empat tahap deteksi, masing-masing semakin tidak literal. L1 winnowing mendeteksi kecocokan persis dan suntingan ringan, dan Layer W memeriksa silang dengan pencarian web langsung — keduanya tersedia di v1.0. L2 (pencocokan near-duplicate) ada di roadmap v1.1 dan L3 (pencocokan semantik dengan sentence embeddings) di v1.2; keduanya belum berjalan hari ini dan belum ada di repo publik. Jadi ringkasan jujurnya: setengah cascade sudah aktif, dan itu bagian yang menangani perubahan kata ringan.
- Bagaimana dengan back-translation sebagai teknik parafrase?
- Back-translation (Inggris → Spanyol → Inggris) termasuk tipe parafrase yang paling sulit — makna tetap sama tapi struktur baru. Jika masih ada urutan kata asli yang tersisa, kami bisa mendeteksi; jika sudah diubah total, saat ini belum terdeteksi. Ini target untuk lapisan semantik di v1.2.
- Apakah parafrase berat akan ditandai sebagai 'plagiarisme'?
- Hanya jika tingkat keyakinan cukup tinggi. Jika di bawah ambang, kami tampilkan bagian yang dicurigai dengan label 'low confidence match' dan menyerahkan penilaian ke reviewer. Kami tidak pernah secara sepihak menyatakan parafrase sebagai plagiarisme — kami laporkan kemungkinan dan alasannya.
- Bisakah saya melihat bagaimana Noplag memberi skor pada sebuah bagian?
- Bisa. Setiap kecocokan di laporan terhubung ke URL sumber dan menampilkan lapisan deteksi yang aktif. Anda bisa mereplikasi skor secara offline melalui engine open source — lihat /open-source-plagiarism-checker.
- Apakah Noplag bisa mendeteksi parafrase non-Inggris?
- Deteksi dikalibrasi untuk bahasa Inggris, Spanyol, Portugis, Polandia, dan Ukraina saat peluncuran, dengan bahasa lain menyusul. Bahasa lain akan diberi label 'low-resource — interpretasi perlu kehati-hatian ekstra.'
- Apakah detektor parafrase gratis?
- Ya di paket gratis — 2.500 kata per pemeriksaan, tanpa pendaftaran. Paket Pro dan Premium menaikkan batasnya; algoritma deteksi dasarnya sama di semua paket.
Temukan plagiarisme parafrase — gratis, hingga 2.500 kata.
Saat ini kami hanya dapat mendeteksi pengubahan kata ringan dan secara terbuka menyatakan bahwa deteksi parafrase menyeluruh belum tersedia sampai lapisan semantik dirilis. Jalankan pemeriksaan pada teks Anda sendiri dan lihat temuan mesin kami.
Temukan plagiarisme hasil parafrase