ACADÉMICO700M+ obras académicas · Apache 2.0

Detector de plagio académico con reconocimiento de citas

Detección de plagio ajustada a la escritura académica — compara con más de 700 millones de obras científicas de OpenAlex, CORE, arXiv, PubMed Central y Crossref. Clasificación con reconocimiento de citas. Motor Apache 2.0 auditable por cualquier revisión TI institucional.

0 / 1,500 words
700M+ obras académicasClasificación por reconocimiento de citasApache 2.0 · auditable por instituciones
EL CORPUS ACADÉMICO

Cinco fuentes. Más de 700 millones de obras. Todas de acceso abierto o registradas con DOI.

Sin contenido de pago ni revistas bajo suscripción — solo índices de acceso abierto. Cobertura amplia para investigación posterior a Plan-S; más limitada para catálogos antiguos bajo pago.

01 · ÍNDICEmensual

OpenAlex

250M+ obras

Índice académico abierto — sustituye al antiguo Microsoft Academic Graph. Cubre artículos, ponencias, conjuntos de datos, libros en todas las áreas.

02 · ACCESO ABIERTOsemanal

CORE

290M+ artículos

El mayor agregador mundial de investigación de acceso abierto. Texto completo de 11,000+ repositorios. Fuerte presencia de investigación europea y del Reino Unido.

03 · PREPRINTdiario

arXiv

2,4M+ preprints

Física, matemáticas, informática, biología cuantitativa, estadística, economía. Permite comparar con la versión vista por su revisor en arXiv.

04 · BIOMEDICINAsemanal

PubMed Central

10M+ artículos

Archivo abierto de biomedicina y ciencias de la vida. Índice de texto completo y metadatos. Investigación depositada en NIH y flujos espejo de revistas.

Crossref · 150M+ obras registradas por DOI · para resolución canónica y grafo de citas
FLUJOS DE TRABAJO ACADÉMICOS

Tres flujos de trabajo. Un solo producto.

Ya sea que esté preparando un envío a revista, defendiendo un capítulo de tesis o cerrando una solicitud de subvención — el detector se adapta a la etapa, no al revés.

01

01 · Revisión previa a envio de revista

Revise el manuscrito con el universo de acceso abierto antes que su revista. iThenticate / Crossref Similarity Check lo revisarán otra vez al enviar — conviene ver lo que verá el editor, antes de enviar. El plan Pro tarifa plana permite iterar borradores sin agotar créditos por documento.

02

02 · Capítulo de tesis / disertación

Por capítulos o texto completo. Autocitas entre capítulos se marcan pero se clasifican aparte (legítimas en una tesis larga). La bibliografía se excluye automáticamente del puntaje. El historial de versiones compara el capítulo de enero con la revisión de mayo — permite ver los cambios, mejoras y lo nuevo.

03

03 · Solicitud de subvención / revisión de literatura

El texto utilizado en propuestas anteriores, escrito por usted, no debería marcarse como plagio. Una revisión de literatura correctamente citada tampoco. El modelo distingue el reciclaje académico legítimo (trabajo propio, con cita) del copiado accidental. El puntaje refleja solo lo problemático, no lo estructuralmente inevitable.

CLASIFICACIÓN CON RECONOCIMIENTO DE CITAS

Seis categorías. Cada intervalo hallado cae en una.

Un informe con 28% de similitud para una revisión de literatura muy citada no es igual a un 28% por parafraseo sin citar. La clasificación marca la diferencia.

01 · Cita literal (con referencia)

Comillas + cita parentética O nota al pie. Se considera esperado; excluido del puntaje. Se detectan automáticamente varios estilos (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Cita en bloque

Fragmento indentado de 40+ palabras con cita al final. Se considera esperado. Se detecta el patrón de sangría izquierda 0,5 pulgadas + cita; si falta sangría se marca como desviación de formato.

03 · Parafraseo (con referencia)

Correspondencia de forma de la frase con atribución en el párrafo. Se cuenta con peso reducido. Se acepta “Smith (2023) argumenta...” como atribución legítima previa a la paráfrasis.

04 · Conocimiento común

Expresiones presentes en 2.000+ fuentes independientes (“El agua hierve a 100°C”, definiciones técnicas estándar, fórmulas conocidas). Excluidas del cálculo. Umbral ajustable para campos con mayor densidad de terminología.

05 · Bibliografía

La lista de referencias se detecta por encabezado y formato. Se excluye completamente del puntaje. Las referencias NO deben ser originales — marcarlas sube el puntaje sin sentido.

06 · Parafraseo sin referencia

Coincidencia de frase sin cita, sin comillas ni formato de bloque. ESTA categoría determina el puntaje de similitud. Cuenta con peso total; los otros intervalos no.

EL INFORME ACADÉMICO

Clasificación por intervalo. URL de cada fuente. Auditabilidad total.

Cada coincidencia incluye DOI/URL de la fuente, categoría de clasificación, fecha del corpus y commit del motor. Defendible en revisión por pares, comité de integridad o auditoría TI.

INFORME · 4.217 palabras · 47 intervalos clasificadosLa novela modernista: una reevaluación · Capítulo 3
Titular · 8,2%Motor · v0.4.2
#INTERVALO HALLADO · FUENTECLASIFICACIÓN
12

El modernismo es menos un movimiento coherente que una constelación de rechazos — del realismo, del progreso, del yo unificado... (Eysteinsson, 1990, p.117).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
CITADO · LITERAL
18

El énfasis de Eliot en la impersonalidad replantea la lírica como artefacto construido y no como desahogo confesional.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARÁF. · CITADO
23

La novela surge de una visión burgués fundamental que tomó forma en el siglo XVIII.

openalex.org/W12345678 · Watt (1957) — coincidencia sin citar
SIN ATRIB.
31

La corriente de conciencia de Joyce debe mucho a la psicología de la duración interior de William James.

James, W. (1890). The Principles of Psychology, ch.IX (mencionado en la lista de citas)
PARÁF. · CITADO
34

La propia tesis doctoral previamente publicada por el autor, Capítulo 1.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · autocita, sin atribución en este párrafo
AUTOCITA
41

Todas las referencias — Eysteinsson, Eliot, Joyce, James, Watt y 32 más.

Sección de bibliografía, pp. 38–41
REFS · EXCLUIDAS
Titular 8,2% = peso de paráfrasis sin cita + autocita; intervalos citados + bibliografía excluidos.
  • 700M+obras académicas indexadas
  • 6estilos de cita detectados automáticamente
  • 5idiomas calibrados en el lanzamiento
  • 3%residual de sesgo ESL (documentado)
  • Apache2.0 · revisable por comité de ética
DEFENDIBLE EN REVISIÓN POR PARES

Tres aspectos que un verificador caja negra no supera en audiencia de facultad.

01 · PUNTAJE REPRODUCIBLE

Repita el análisis con el mismo commit

Cada informe marca X-Engine-Commit y fecha del corpus. Meses después, puede verificar el mismo manuscrito con la versión del motor que dio el puntaje original — misma entrada, mismo algoritmo, mismo resultado. Los verificadores cerrados pueden re-entrenar sin aviso y su resultado de enero no se reproduce en mayo.

La reproducibilidad es el mínimo exigible en integridad académica que tomamos como base.
02 · ALGORITMO AUDITABLE

Fuente Apache 2.0 en GitHub — llévelo a la reunión

Cuando llegue la detección de IA (próximamente, en la hoja de ruta v1.2) y el estudiante cuestione su resultado en comité, podrá citar el commit del motor, mostrar la línea de código de la decisión, y la documentación de calibración ESL. No una captura de correo del soporte de proveedor.

github.com/NoplagLabs/noplag-engine — público, indexado por Google Scholar.
03 · VEREDICTO SENSIBLE A ESL

Documentado por Liang et al. 2023; la mitigación está en la hoja de ruta

Stanford 2023 midió un 61,3% de FPR en ensayos TOEFL usando detectores ingenuos. Cuando se implemente la detección de AI de Noplag (próximamente, en la hoja de ruta v1.2), el resultado incluirá una banda ajustada para ESL si la firma léxica indica inglés no nativo. El error residual se documentará; no se afirmará que es cero. Las anulaciones quedan registradas con el commit del motor y el motivo.

/docs/developers/benchmarks — metodología y resultados de PAN-PC-11.
APTO PARA ADQUISICIÓN

Un motor Apache 2.0 que su TI puede revisar antes de firmar.

Las revisiones institucionales de software antiplagio atascan en lo mismo: a dónde va el documento tras enviar, cómo es el algoritmo, quién accede a los datos, cómo se aplica el derecho al borrado, y si se puede replicar la precisión. Los proveedores cerrados contestan eso por llamada comercial. Con Apache 2.0, TI puede clonar el repositorio, ejecutar el motor en un entorno cerrado, auditar flujo de datos, comprobar el borrado, y reproducir los F1 en su propio conjunto de prueba. No es por rebajar la auditoría — es por hacerla, de hecho, viable para TI. Por eso universidades que antes rechazaban más software de plagio están firmando con este.

Leer guía de adquisición
PREGUNTAS FRECUENTES

Las preguntas reales del profesorado.

¿Sustituye esto a iThenticate para revisiones previas a revistas?

Por lo general, no — si la revista exige iThenticate (Elsevier, Springer, Wiley, IEEE), lo revisarán de todas formas al enviar. Lo que reemplaza Noplag es la auto-revisión iterativa de borradores previa a ese envío. iThenticate a $125/documento se hace prohibitivo tras la 4ª revisión; tarifa plana Pro no. Vea la comparación completa en noplag.com/vs-ithenticate.

¿Y las tesis de ProQuest? ¿No las tienen?

Correcto — ese hueco existe. La base de tesis de ProQuest es cerrada y no entra en OpenAlex/CORE. Cubrimos los ~700M de obras abiertas, más amplio que ProQuest para investigación post-Plan-S (2018 en adelante); más estrecho para tesis antiguas de pago. Si necesita sobre todo comparar con doctorados de EE.UU., lo apropiado es iThenticate para ese fin.

¿Cómo maneja el motor estilos de cita fuera del top seis?

MLA, APA, Chicago / Turabian, Harvard, Vancouver e IEEE se detectan del formato de bibliografía. Para otros estilos (ACS, AMA, ASA, Bluebook, Oxford), el motor clasifica intervalos por comillas + patrones parentéticos cerca, pero la validación por estilo está prevista en la hoja de ruta v1.2. Quienes instalan en local pueden ajustar estilos extra vía alignment/.

¿Cuál es el falso positivo en revisiones de literatura muy citadas?

Menor que lo esperado donde hay mucho parafraseo, porque el modelo excluye intervalos citados del puntaje. Se mide ~3,4% falso positivo en el subconjunto PAN-PC-11 académico (donde la mayoría son citas legítimas). Competidores cerrados que no clasifican citados reportan 12–18% sobre el mismo corpus.

¿Puedo excluir mis propias publicaciones previas?

En Pro, añada una lista blanca de autocitación (su ORCID, DOIs previos, URL de repositorio institucional). Coincidencias con estos documentos marcan como AUTOCITA y no suben el puntaje. Útil cuando financia proyectos sobre obra publicada propia; reciclar con cita es aceptado, no plagio.

¿Cómo es la cobertura multilingüe realmente?

La detección está calibrada para inglés, español, portugués, polaco y ucraniano en el lanzamiento; se añadirán más idiomas progresivamente. La calidad de detección se evalúa con PAN-PC-11; la evaluación por idioma está en la hoja de ruta. El rendimiento es más sólido en los idiomas europeos con mayor historial de validación; los idiomas nuevos se incorporan a medida que se completa su calibración.

¿Qué implica “Apache 2.0” para la adquisición institucional?

Su equipo de TI / DPO / IRB puede clonar github.com/NoplagLabs/noplag-engine, ejecutar el motor en un entorno aislado, auditar el flujo de datos, verificar que el derecho de supresión funciona de extremo a extremo y reproducir nuestros resultados publicados usando su propio corpus de prueba. Sin firmar nada, sin NDA, sin depender de nuestro marketing. Para instituciones cuyo proceso de adquisición requiere este nivel de revisión, esto lo habilita.

¿Detectará IA texto de Claude-3 o Gemini, o solo GPT?

La detección de AI estará disponible próximamente; está en la hoja de ruta v1.2, no incluida en el lanzamiento inicial. El enfoque es Binoculars (Hans et al. 2024), que es independiente del modelo: no entrena por LLM, compara la perplejidad de un modelo de referencia pequeño con el texto de prueba, lo que permite generalizar. Las cifras de precisión se publicarán cuando la función supere la evaluación, no antes, usando contenido de LLM mixto (frente a ~70% en Claude-3 para detectores entrenados en GPT). El artículo metodológico documenta los modos de fallo; no los ocultamos.

¿Y si mi director disputa un marcador?

Cada intervalo marcado incluye DOI fuente, fecha del corpus, commit del motor y motivo de clasificación. Corrija en ese commit y el resultado se reproduce igual. Lleve el informe a la reunión; las rutas de cita son navegables. No hay modo 'confíe en el puntaje', porque eso es propio de caja negra.

¿Cómo es la instalación en instituciones médicas con HIPAA?

Apache 2.0 + Docker — funciona sin salir de su red. Combínelo con PostgreSQL + Redis en su sistema; no sale tráfico de la VPC. Útil para borradores clínicos, estudios de pacientes o investigación protegida antes de publicar. Clientes empresariales reciben el corpus como paquete indexable.

Revise un capítulo en más de 700M publicaciones académicas.

Pegue capítulo de tesis, propuesta de beca o borrador de manuscrito. El informe reconoce lo esperado, lo que requiere cita y lo suyo. Gratis hasta 2.500 palabras. Apache 2.0 si su comité necesita revisar el algoritmo.

Detector de plagio académico con reconocimiento de citas