Parafrasdetektor — hitta dold kopiering
En parafrasdetektor hittar text som omformulerats för att dölja ursprunget. Noplag fångar idag den enklare typen: redigeringar där fem ord i följd är oförändrade ger fortfarande träff, så synonymbyten och mindre omkastningar hittas med winnowing-fingeravtryck och kontrolleras mot webben. Grundlig omskrivning på meningsnivå är ett annat problem och vi upptäcker det ännu inte — närmatchning (v1.1) och semantisk matchning (v1.2) löser det, och lanseras när de klarat publicerad utvärdering.
Vi upptäcker. Vi hjälper inte till att kringgå.
En humanizer är ett verktyg som skriver om AI- eller människoskriven text för att undvika upptäckt. Vi skulle kunna bygga ett. Vi gör det inte. Syftet med denna produkt är att synliggöra plagiering utan källa, inte att dölja den. Om det ska vara någon nytta med detektion kan inte samma leverantör bygga både detektorer och humanizers. Vi har valt vår sida.
När vi nämner humanizers i rapporten är det för att informera om att de finns och kan ha använts innan texten du kontrollerar — inte för att sälja en.
Fyra lager. Två klara, två på väg.
Kedjan är byggd för att gå från exakta träffar via nästan-dubbletter till semantisk likhet, och till sist kontroll mot öppna webben. Två av dessa lager ingår i v1.0; de två som hanterar verklig parafras är inte klara än, och vi säger hellre det än antyder något annat.
Winnowing-fingeravtryck — klart
Exakta delsträngsträffar. Enkla synonymbyten och mindre omkastningar som lämnar fem ord i följd orörda.
Allt som är omkastat eller omformulerat.
MinHash LSH — v1.1 på väg
Kommer att hitta omkastade meningar och omflyttade ord. Upptäcks inte idag.
Riktiga synonymer och semantiska omskrivningar, vilket L3 är till för.
Meningsembeddingar — v1.2 på väg
Kommer att hitta synonymbyten och semantisk parafrasering. Upptäcks inte idag.
Omskrivningar som är så långt från källan att ingen statistisk signal återstår.
Direktkontroll mot webben — tillgänglig
Källor tillagda efter korpusens ögonblicksbild.
Material bakom betalvägg eller ej indexerat innehåll.
Vad vi identifierar idag — beroende på graden av omformulering.
Detta är v1.0-beteende, inte en prognos. Lätt redigering lämnar fortfarande textavsnitt som kan matchas; grundlig omarbetning gör inte det, och ingen mängd fingeravtryck kan återskapa det. Vi har beskrivit exakt var gränsen går i vårt inlägg om de ärliga begränsningarna för ordagrann upptäckt: /blog/the-honest-limits-of-verbatim-detection.
Synonymbyten och mindre omkastningar. Tillräckligt mycket av originalformuleringen finns kvar för att fingeravtryck ska kunna matcha.
Katten satt på mattan.
Katten satt på mattan.
Meningsstruktur ändrad, verb utbytta. Upptäcks bara där ett oförändrat avsnitt finns kvar. Nästan-duplicerad matchning (v1.1) riktar sig mot denna nivå.
Katten satt på mattan.
På mattan hade katten slagit sig ner.
Fullständig semantisk omskrivning, ny struktur och ordförråd. Ger noll poäng idag; semantisk matchning (v1.2) riktar sig mot denna nivå.
Katten satt på mattan.
Ett litet däggdjur hade placerat sig på en tygyta.
Tio frågor om upptäckt av parafrasering.
Främst om var upptäckten brister. Vi är tydliga med begränsningarna; de som behöver veta är de som ska agera på ett resultat.
- Vad är skillnaden mellan att upptäcka parafrasering och att upptäcka plagiat?
- Plagiat är den bredare kategorin — att kopiera text utan korrekt källhänvisning. Parafraseringsdetektion är den specifika utmaningen att identifiera plagiat när texten har skrivits om för att dölja ursprunget. Noplag gör båda i samma rapport; parafraseringskedjan aktiveras när L1-lagret för exakta träffar inte ger utslag.
- Varför är det så svårt att upptäcka kraftig parafrasering?
- Upptäckten bygger på att hitta statistiska mönster — gemensamma ordsekvenser, och senare gemensam struktur och innebörd. Lätt redigering lämnar dessa sekvenser kvar och upptäcks därför. Om man skriver om en text mening för mening försvinner sekvenserna helt: en grundlig parafras ger noll träff i en fingeravtrycksmotor, vilket v1.0 är. Det är en egenskap hos metoden, inte ett fel, och därför är near-duplicate (v1.1) och semantisk (v1.2) matchning separata lager istället för en inställning. Vi har beskrivit detta i vår artikel om de ärliga begränsningarna för ordagrann upptäckt: /blog/the-honest-limits-of-verbatim-detection.
- Erbjuder Noplag ett verktyg för att humanisera AI-text?
- Nej. Vi levererar inte något humaniseringsverktyg. Syftet med ett sådant är att kringgå upptäckt — det går emot vårt uppdrag. Vi arbetar för integritet; vi upptäcker, vi hjälper inte till att dölja. Se vår ståndpunkt ovan.
- Hur står sig detta mot Quillbots parafraseringsverktyg?
- Quillbot skriver om text för att undvika upptäckt. Vi upptäcker text som skrivits om för att undvika upptäckt. Vi arbetar med motsatta sidor av samma problem. Om en Quillbot-text hamnar i din kontroll kommer rapporten att markera 'möjlig användning av parafraseringsverktyg' när vi ser mönstret.
- Vad är ett 'fyralagerskaskad', och hur mycket av den är aktiv?
- Fyra detektionspass, varje mindre bokstavlig än det förra. L1-sorteringen fångar exakta och lätt redigerade träffar, och Layer W kontrollerar mot webbsök — båda ingår i v1.0. L2 (near-duplicate matchning) finns på v1.1-planen och L3 (semantisk matchning via meningsinbäddning) på v1.2; ingen av dessa är igång idag och ingen finns i det publika repo:t än. Så den ärliga sammanfattningen är: halva kaskaden är aktiv, och det är den del som hanterar lätt omformulering.
- Hur är det med back-översättning som parafraseringsteknik?
- Back-översättning (engelska → spanska → engelska) är en av de svåraste parafraseringstyperna — semantiskt likvärdig men strukturellt ny. Där ursprungliga formuleringar finns kvar upptäcker vi det; där texten är helt omskriven upptäcks det inte idag. Det är ett mål för det semantiska lagret i v1.2.
- Kommer ni att markera kraftig parafrasering som 'plagiat'?
- Endast om tillräcklig säkerhet finns. Under tröskelvärdet visas den misstänkta passagen med 'träff med låg säkerhet' och granskaren får avgöra. Vi fastslår aldrig ensidigt att parafraserat material är plagiat — vi rapporterar en sannolikhet och motiveringen.
- Kan jag se hur Noplag har bedömt en passage?
- Ja. Varje träff i rapporten länkar till källans URL och visar vilket detektionslager som gav utslag. Du kan återskapa resultatet offline via den open source-baserade motorn — se /open-source-plagiarism-checker.
- Fungerar Noplag för parafrasering på andra språk än engelska?
- Upptäckten är kalibrerad för engelska, spanska, portugisiska, polska och ukrainska vid lansering, fler språk tillkommer. Andra språk ger resultat markerade 'lågresurs — tolka med extra försiktighet.'
- Är parafraseringsdetektorn gratis?
- Ja på gratisnivån — 2 500 ord per kontroll, ingen registrering. Pro- och Premium-nivåerna höjer gränsen; själva detektionsalgoritmen är densamma på alla nivåer.
Hitta parafraserat plagiat — gratis, upp till 2 500 ord.
Vi upptäcker lättare omformuleringar idag och är tydliga med att omfattande omskrivningar inte fångas förrän de semantiska lagren är på plats. Kör en kontroll på din egen text och se vad motorn faktiskt hittade.
Hitta parafraserat plagiat