Parafrazēšanas detektors — atklāj maskētu kopēšanu
Parafrazēšanas detektors atrod tekstu, kas pārfrāzēts, lai slēptu tā izcelsmi. Noplag šobrīd atklāj viegli pārveidotu tekstu: ja piecu vārdu secības paliek nemainītas, tās tiek atpazītas, tāpēc sinonīmu aizvietošana un neliela vārdu kārtības maiņa tiek konstatēta ar winnowing pirkstu nospiedumiem un pārbaudīta ar tīmekļa meklēšanu. Rūpīga teikumu pa teikumam pārveidošana ir cita problēma, un to mēs vēl neatklājam — šim nolūkam būs pieejama gandrīz identisku tekstu meklēšana (v1.1) un semantiskā atbilstība (v1.2), kas tiks ieviestas pēc publicētas novērtēšanas.
Mēs detektējam. Mēs nepalīdzam izvairīties.
Humanizer ir rīks, kas pārveido AI vai cilvēka rakstītu tekstu, lai apietu detektorus. Mēs varētu tādu izveidot. Mēs to nedarām. Šī produkta mērķis ir atklāt nepietiekami norādītu kopēšanu, nevis palīdzēt to slēpt. Ja detektēšanai jābūt noderīgai, tad detektoru izstrādātāji un humanizer veidotāji nevar būt viens un tas pats pakalpojumu sniedzējs. Mēs esam izvēlējušies savu pusi.
Ja ziņojumā pieminam humanizer, tas ir, lai informētu, ka tādi pastāv un varētu būt izmantoti pirms pārbaudāmā teksta — nevis lai tos piedāvātu.
Četri slāņi. Divi jau pieejami, divi vēl izstrādē.
Pārbaudes process sašaurinās no precīzas atbilstības līdz semantiskai līdzībai un pēc tam salīdzina ar atvērtajiem tīmekļa resursiem. Divi šie slāņi ir pieejami v1.0; abi, kas paredzēti īstas pārfrāzēšanas noteikšanai, vēl tiek izstrādāti, un mēs to norādām atklāti.
Winnowing pirkstu nospiedumi — pieejams
Precīzas apakšvirknes sakritības. Nelielas sinonīmu nomaiņas un minimāla vārdu secības maiņa, ja piecu vārdu posmi paliek nemainīti.
Jebkāda pārkārtošana vai pārfrāzēšana.
MinHash LSH — v1.1 plānots
Noteiks teikumu pārkārtošanu un vārdu līmeņa pārvietošanu. Pašlaik netiek noteikts.
Patiesi sinonīmi un semantiski pārveidoti teksti, ko paredzēts noteikt ar L3.
Teikumu iegultnes — v1.2 plānots
Noteiks sinonīmu aizvietošanu un semantisku pārfrāzēšanu. Pašlaik netiek noteikts.
Pārveidojumi, kas ir tik tālu no oriģināla, ka nav saglabājies statistisks signāls.
Tiešsaistes tīmekļa pārbaude — pieejama
Avoti, kas parādījušies pēc korpusa momentuzņēmuma.
Maksas vai neindeksēts saturs.
Ko šobrīd atklājam — pēc pārfrāzēšanas pakāpes.
Šī ir v1.0 uzvedība, nevis prognoze. Nelielas izmaiņas tekstā joprojām atstāj atpazīstamus fragmentus; pilnīga pārrakstīšana tos izslēdz, un nekādas pirkstu nospiedumu metodes tos neatgūst. Precīzu robežu aprakstījām rakstā par tiešas kopēšanas atklāšanas godīgajiem ierobežojumiem: /blog/the-honest-limits-of-verbatim-detection.
Sinonīmu aizvietošana un neliela vārdu secības maiņa. Pietiekami daudz oriģinālā teksta saglabājas, lai pirkstu nospiedumi sakristu.
Kaķis sēdēja uz paklāja.
Felis sēdēja uz paklāja.
Pārveidots teikums, mainīti darbības vārdi. Atklāj tikai, ja saglabājas neskarts fragments. Gandrīz identisku atbilstību noteikšana (v1.1) paredzēta šim līmenim.
Kaķis sēdēja uz paklāja.
Uz paklāja bija apmeties kaķis.
Pilnībā pārveidots saturs, jauna struktūra un vārdu krājums. Šobrīd rezultāts ir nulle; semantiskā atbilstība (v1.2) paredzēta šim līmenim.
Kaķis sēdēja uz paklāja.
Mazs zīdītājs bija novietojies uz auduma virsmas.
Desmit jautājumi par pārfrāzēšanas noteikšanu.
Pārsvarā par to, kur noteikšana nedarbojas. Skaidri norādām ierobežojumus; tas ir svarīgi tiem, kas plāno rīkoties, balstoties uz rezultātu.
- Kāda ir atšķirība starp pārfrāzēšanas un plaģiāta noteikšanu?
- Plaģiāts ir plašāks jēdziens — teksta kopēšana bez atsauces. Pārfrāzēšanas noteikšana ir konkrēts uzdevums: atklāt plaģiātu, kad teksts ir pārrakstīts, lai slēptu izcelsmi. Noplag to dara vienā atskaitē; pārfrāzēšanas process tiek ieslēgts, ja L1 precīzās sakritības slānis nestrādā.
- Kāpēc grūti atklāt stipri pārfrāzētu tekstu?
- Noteikšana balstās uz statistiskiem signāliem — kopīgām vārdu sekvencēm, vēlāk arī struktūras un nozīmes līdzībām. Nelielas izmaiņas šīs sekvences saglabā, tāpēc tās tiek atklātas. Ja tekstu pārraksta pa teikumam, kopīgās sekvences pazūd: rūpīgi pārfrāzēts fragments uz pirkstu nospiedumu dzinēja (kāds ir v1.0) rāda nulli. Tā ir metodes īpašība, nevis kļūda, un tāpēc gandrīz identisko (v1.1) un semantisko (v1.2) sakritību noteikšana ir atsevišķi slāņi, nevis regulējams parametrs. Plašāk par to rakstījām blogā par verbatīmas noteikšanas ierobežojumiem: /blog/the-honest-limits-of-verbatim-detection.
- Vai Noplag piedāvā rīku AI teksta humanizēšanai?
- Nē. Mēs nepiedāvājam humanizētāju. Humanizētāja uzdevums ir apiet noteikšanu — tas ir pretrunā ar mūsu mērķi. Mēs esam par godīgumu; mēs atklājam, nevis palīdzam slēpt. Skatiet iepriekš norādīto pozīciju.
- Kā tas salīdzināms ar Quillbot pārfrāzēšanas rīku?
- Quillbot pārraksta tekstu, lai apietu noteikšanu. Mēs atklājam tekstu, kas pārrakstīts, lai izvairītos no noteikšanas. Mēs esam pretējās šīs problēmas pusēs. Ja Quillbot rezultāts nonāk pārbaudē, atskaitē parādīsies norāde 'iespējama pārfrāzēšanas rīka izmantošana', ja redzam atbilstošu parakstu.
- Kas ir 'četru slāņu kaskāde' un cik no tās darbojas?
- Četras noteikšanas kārtas, katra mazāk burtiska nekā iepriekšējā. L1 atlase atrod precīzas un viegli rediģētas sakritības, Layer W pārbauda ar tiešsaistes meklēšanu — abi darbojas v1.0. L2 (gandrīz identisko sakritību noteikšana) ir v1.1 plānā, L3 (semantiskā noteikšana ar teikumu iegremdējumiem) — v1.2; neviens no tiem šobrīd nav aktīvs un nav publiskajā repozitorijā. Tātad godīgs kopsavilkums: puse kaskādes darbojas, un tā ir daļa, kas nosedz vieglu pārfrāzēšanu.
- Kā ar atpakaļtulkošanu kā pārfrāzēšanas paņēmienu?
- Atpakaļtulkošana (angļu → spāņu → angļu) ir viena no grūtāk atklājamām pārfrāzēšanas formām — semantiski līdzīga, bet strukturāli jauna. Ja saglabājas oriģināla vārdu secības, mēs to atklājam; ja teksts pilnībā pārrakstīts, šobrīd to neatklājam. Tas ir v1.2 semantiskā slāņa mērķis.
- Vai jūs atzīmēsiet stipru pārfrāzēšanu kā 'plaģiātu'?
- Tikai, ja pārliecība ir pietiekami augsta. Ja tā ir zem sliekšņa, aizdomīgo fragmentu parādām ar norādi 'zema pārliecība', un lēmumu pieņem pārskatītājs. Mēs nekad vienpusēji neatzīstam pārfrāzētu tekstu par plaģiātu — ziņojam par iespējamību un pamatojumu.
- Vai varu redzēt, kā Noplag novērtēja fragmentu?
- Jā. Katrs sakritības avots atskaitē ir sasaistīts ar avota URL un norāda, kurš noteikšanas slānis nostrādāja. Rezultātu var atkārtot lokāli ar atvērtā pirmkoda dzinēju — skatiet /open-source-plagiarism-checker.
- Vai Noplag darbojas ar nepārfrāzētu tekstu citās valodās?
- Noteikšana sākotnēji pielāgota angļu, spāņu, portugāļu, poļu un ukraiņu valodām; vēlāk tiks pievienotas citas. Pārējām valodām rezultāti tiek atzīmēti kā 'maz resursu — interpretēt īpaši piesardzīgi.'
- Vai pārfrāzēšanas noteicējs ir bez maksas?
- Jā, bezmaksas līmenī — līdz 2 500 vārdiem pārbaudē, bez reģistrācijas. Pro un Premium līmeņos limits ir lielāks; noteikšanas algoritms visos līmeņos ir vienāds.
Atrodi pārfrāzētu plaģiātu — bez maksas, līdz 2 500 vārdiem.
Šobrīd konstatējam vieglu pārfrāzēšanu un atklāti norādām, ka pilnīgu pārrakstīšanu nevaram noteikt, kamēr nav ieviesti semantiskie slāņi. Pārbaudiet savu tekstu un skatiet, ko dzinējs faktiski atrada.
Atrodiet pārfrāzētu plaģiātu