INVESTIGACIÓNPreenvío · Reconoce autocitas · Residencia en la UE · Auditable por comité de ética

Detector de plagio para investigadores pre-publicación

Revisión previa al envío contra más de 700 millones de trabajos académicos. Mis carpetas registra sus propias publicaciones previas para que la autocita legítima no infle el resultado. Punto de residencia en la UE disponible para investigación sensible previa a publicación. Motor Apache 2.0 — auditable por comité de ética.

700M+ trabajos académicosLista blanca de autocitasResidencia en la UE · Auditable
EN CUALQUIER ETAPA DEL PROCESO

Cuatro roles de investigación. Un solo flujo de autocontrol.

PHD / DOCTORADO

Preenvío de capítulos de tesis

Itere por capítulos. Rastree autocitas entre versiones.

  • Chequeo por capítulo + historial de versiones
  • Lista blanca de autocitas (su ORCID + DOIs)
  • Bibliografía excluida automáticamente
POST-DOC

Manuscrito antes del envío a revista

iThenticate revisa al enviar; nosotros antes.

  • Índice académico abierto de 700M+ publicaciones
  • Clasificación de citas (citadas vs parafraseadas sin cita)
  • Pro tarifa plana · iteraciones sin coste por crédito
ESCRITOR DE SUBVENCIONES

Revisión bibliográfica + validación de propuesta

Se espera reutilización de su texto de propuestas anteriores — señaleselo.

  • Reconoce sus propias publicaciones y subvenciones previas
  • Lista blanca de coautoría (trabajos previos de colaboradores)
  • Exportar informe clasificado a PDF para colaboradores
IP DE LABORATORIO

Control de calidad pre-publicación para todo el laboratorio

Detecte problemas en todos los envíos del laboratorio en una sola cola.

  • Carpeta por proyecto + por postdoc
  • Residencia en la UE para datos primarios clínicos/sensibles
  • Motor Apache 2.0 — justificable ante comité de ética
FLUJO DE PREENVÍO

Tres pasos antes de enviar el manuscrito a la revista.

Úselo repetidas veces. Detecte intervalos autocitados para que no inflen su puntaje en iThenticate / Crossref al enviar. Pronto, veredictos de detección de IA — podrá verlos antes de que el revisor 2 lo cuestione.

01

01 · Borrador + lista blanca

Suba el borrador del capítulo o manuscrito. Agregue su ORCID + lista de DOIs (la lista blanca) — sus publicaciones previas se etiquetan como SELF-CITE, no como plagio. Incluya DOIs de coautores si colaboró; el motor reconoce la reutilización legítima.

02

02 · Ejecute la cascada

L1 winnowing → web en vivo hoy; L2 MinHash (v1.1) y L3 vector embeddings (v1.2) próximamente. Detecta copias textuales y casi textuales; la detección de parafraseo estará disponible con L2 y L3. La clasificación de citas separa el material citado del parafraseo sin citar. Multilingüe, con calibración de la detección para inglés, español, portugués, polaco y ucraniano en el lanzamiento; más idiomas en desarrollo. Mediana de 47 segundos por manuscrito.

03

03 · Revise + itere

El informe marca intervalos por categoría: SELF-CITE (suyos, esperado), CITED (citados correctamente, esperado), CITED-PARA (parafraseo citado, peso bajo), UNCITED-PARA (requiere atención), y pronto AI-LIKELY (ajustado para ESL). Reproducible — versión del motor + instantánea del corpus en cada informe.

GESTIÓN DE AUTOCITAS

Seis casos de reciclaje académico legítimo — ninguno debe inflar su puntaje.

Verificadores opacos marcan cualquier coincidencia textual como plagio. El reciclaje de texto propio es común. Así lo clasifica el motor.

01 · SU PROPIO TRABAJO PREVIO

Lista blanca con ORCID + DOIs. Sus trabajos publicados previos se etiquetan SELF-CITE, no plagio. Frecuente en revisiones (“como argumenté en Chen 2023…”) y propuestas de subvención reutilizando resultados previos.

02 · TRABAJO EN COAUTORÍA

Agregue ORCIDs de colaboradores a la lista blanca. Trabajos coautorados se marcan como CO-CITE. Útil para manuscritos derivados de un artículo coescrito — la sección de métodos puede compartirse legítimamente.

03 · TEXTO HEREDADO EN LABORATORIO

Carpeta PI: métodos estándar, protocolos, declaraciones éticas replicadas en publicaciones del laboratorio. Se marca LAB-CITE y se excluye del puntaje. El texto aprobado por comité de ética no requiere rehacerse en cada artículo.

04 · PREIMPRESOS EN EMBARGO

Su propio preimpreso arXiv/bioRxiv del manuscrito que envía ahora. El clasificador reconoce la evolución preimpreso→versión revista y etiqueta como PREPRINT-SELF. No suma al puntaje. Revistas que prohíben preimpresos pueden configurar tratamiento más estricto.

05 · CITAS RETRACTADAS

Integración Crossref Retraction Watch marca intervalos que citan artículos retractados. No modifica su puntaje — pero conviene saberlo antes del envío. Resuelve el problema “cité un artículo retractado el mes pasado” antes que el revisor 2.

06 · IRB / SENSIBLE

Punto de residencia en la UE (api.eu.noplag.com) mantiene el manuscrito dentro de infraestructura europea. Puede alojar el motor en su red interna para casos HIPAA / GDPR / datos de pacientes. Apache 2.0 + Docker; nada sale de su VPC.

MIS CARPETAS · VISTA DE LABORATORIO

Organizado por proyecto. Auditoría por fecha.

Agrupe sus manuscritos por proyecto, año de laboratorio o ciclo de subvención. Reprocese borradores con la misma versión del motor — los informes son reproducibles meses después.

MIS CARPETAS · Laboratorio Dr. Hirano · CompBio24 manuscritos · 6 proyectos
RESIDENCIA EN UENueva carpeta
CARPETADOCSÚLTIMA ACTIVIDADREGIÓN
Proyecto: cohorte PD-L18 manuscritosborrador v3 revisado · hace 2hUE
Proyecto: revisión bioseguridad sintética5 manuscritoslisto para envío · ayerUE
Subvención: Renovación NIH R01 año 33 manuscritosrevisión bibliográfica v2 revisada · hace 2 díasUE
Herencia de laboratorio: métodos + ética4 docs · compartidoslista blanca laboratorio actualizada · hace 1 semanaUE
Preimpresos: arXiv pendiente2 manuscritosPREPRINT-SELF etiquetado · hace 1 semanaUE
Archivados (2022–2024)12 trabajosconjunto de referencia de autocitasUE
Todas las carpetas en UE · cifrado en reposo · versión auditable en cada informereproducibilidad: motor v0.4.2 activo
700M+trabajos académicos indexados
5idiomas de detección al lanzamiento, ampliando
UEpunto de residencia disponible
Apache2.0 · auditable
Crossref+ integración Retraction Watch
PROTECCIÓN DE DATOS

Tres cosas que un verificador debe garantizar para investigación sensible pre-publicación.

01 · RESIDENCIA EN UE

Manuscritos nunca salen de la infraestructura de la UE

Pro+ asignado en api.eu.noplag.com. Alojado en centros de datos Hetzner dentro de la UE (Falkenstein + Helsinki). Envío, huellas y reporte permanecen en la UE. Cumple con RGPD por defecto; DPA disponible en solicitud.

Útil para colaboraciones con socios europeos bajo Horizon Europe.
02 · AUTOALOJADO

Ejecute el motor en su propia institución

Apache 2.0 + Docker compose. Toda la detección se realiza en su infraestructura. Use su propio Postgres + Redis; corpus enviado como índice. Sin tráfico hacia afuera. La opción adecuada para datos de ensayos clínicos, casos de pacientes o investigación primaria sensible.

Compatible con clústeres Slurm y autenticación institucional existente (SAML, LDAP, OIDC).
03 · DERECHO AL OLVIDO

Borre cada huella que guardamos suya

Un click en Ajustes. En 24h, se borra toda huella, informe, entrada de lista blanca y metadato de su cuenta. Cumple con RGPD artículo 17. Los autoalojados tienen acceso total; los usuarios en nube disponen de API de eliminación documentada.

Log de borrado auditable queda guardado para controles.
AUDITABLE POR COMITÉ DE ÉTICA

Un motor Apache 2.0 que realmente puede auditar su comité.

Las revisiones institucionales suelen preguntar: dónde va el manuscrito tras enviarse, cómo funciona el algoritmo, si los datos sensibles se transmiten, cómo es el proceso de borrado y si se puede reproducir la precisión publicada. Con proveedores cerrados, esas respuestas llegan en llamada de ventas. Con Apache 2.0, su comité puede clonar el repo, ejecutar el motor en un entorno seguro, auditar el flujo de datos, comprobar el borrado y validar la precisión F1 en su propio set. No se trata de una revisión más barata — es una revisión posible de completar. Por eso, oficinas que antes se negaban están firmando este suministro.

Lea la guía de auditoría
PREGUNTAS ÉTICAS, RESPUESTAS
Q1¿Adónde va el manuscrito? — Postgres UE aislada por inquilino si usa punto de residencia en UE. Texto original borrado tras 30 días salvo retención habilitada.
Q2¿Se entrena el motor con manuscritos enviados? — No. Los textos enviados nunca se usan para entrenar modelos. Está claro en el DPA.
Q3¿Manejo de datos sensibles/pacientes? — Puede alojar el motor completamente dentro de su red. Sin tráfico externo. Despliegue compatible con HIPAA.
Q4¿Revisión del algoritmo? — Apache 2.0 en github.com/NoplagLabs/noplag-engine. Código legible, auditable y reproducible.
Q5¿Acceso multiinstitucional? — Acceso basado en roles por inquilino. Log de auditoría de cada lectura. O bien autoaloje para que los datos nunca salgan de su institución.
Q6¿Derecho al olvido? — Un click en Ajustes. 24h para completar. Cumple RGPD Art. 17. Log de auditoría conservado.
FAQ

Las preguntas reales de una oficina de investigación.

¿Por qué cambia mi puntaje de similitud al agregar mi ORCID + lista de DOIs?
Porque el motor reclasifica retroactivamente cada intervalo de coincidencia con artículos de su lista como SELF-CITE en vez de UNCITED-PARA. Las coincidencias no desaparecen — sólo se etiquetan distinto. SELF-CITE pesa casi cero en el puntaje final. Ejemplo: si su capítulo cita dos veces su propio preimpreso y una vez un artículo de coautor, tres intervalos pasan de “contados” a “reciclaje académico esperado”.
¿El motor entrena con manuscritos enviados?
No. El texto se convierte en huellas (sólo hashes — firma no reversible) y almacenado en su base de datos aislada. El texto original se borra tras 30 días, salvo retención. El detector de IA —próximamente— se preentrena en corpus públicos; no usamos manuscritos de clientes para esto. Está claro en el DPA.
¿Y mi preimpreso en arXiv / bioRxiv?
Si incluye el DOI de preimpreso en su lista, las coincidencias se marcan PREPRINT-SELF y no suman. El motor reconoce que evolución preimpreso→revista es esperada. Revistas que prohíben preimpresos (algunas aún) pueden tener lista más estricta — pero la mayoría (Nature, Cell, NEJM, PLOS) aceptan preimpresos, y esa autoetiqueta sigue esa política.
¿Cómo tratará el detector de IA a coautores ESL?
La detección de AI estará disponible pronto — en la hoja de ruta de v1.2. Cuando se lance, usará calibración por idioma y un veredicto ajustado para ESL. Si la firma léxica indica inglés no nativo (frecuente en colaboraciones multinacionales), el veredicto será ESL ADJ con un error residual documentado, no una afirmación de cero. El artículo de Liang et al. 2023 midió un 61,3% de FPR en ensayos TOEFL para detectores ingenuos; publicamos nuestra metodología de mitigación en /docs/developers/benchmarks. Los coautores ESL no serán marcados injustamente.
¿Puedo usar el motor en un clúster Slurm para revisión por lotes?
Sí — Apache 2.0 + Docker. Ejecuta el contenedor del motor en los nodos de cómputo de tu clúster; ingiere desde tu sistema de archivos compartido; genera informes en JSON donde tu pipeline los lea. Útil para revisar en lote la producción anual de un laboratorio frente a la última instantánea del corpus. Ejemplo de script Slurm sbatch en github.com/NoplagLabs/noplag-engine.
¿Y manuscritos con datos clínicos/pacientes?
Aloje internamente, en su VPC. Nada sale de su red. El motor no necesita acceso a internet para corpus indexado (el chequeo vía web en vivo es opcional). Despliegue compatible con HIPAA si la infraestructura es la adecuada; lo gestiona su IT como cualquier otro servicio interno.
¿En qué se diferencia de iThenticate al enviar?
iThenticate revisa al momento de enviar: lo ve su editor y usted no puede iterar. Noplag es el autocontrol previo. La cascada es comparable para contenido de acceso abierto (más amplio post-Plan-S); más reducido en contenido académico con licencia donde iThenticate tiene acuerdos. El manejo de autocitas es la función que la mayoría requiere y que iThenticate no aborda bien.
¿Se integra con mi gestor de referencias (Zotero / Mendeley / EndNote)?
La lista blanca acepta BibTeX, RIS y API ORCID directa. Suba su biblioteca exportada o pegue el ORCID y la lista se llena con sus DOIs. Sincronización en tiempo real para Mendeley + EndNote está en la v1.2, por ahora use la vía exportar.
¿Qué cobertura multilingüe hay para publicaciones no inglesas?
La detección está calibrada para inglés, español, portugués, polaco y ucraniano en el lanzamiento; más idiomas en desarrollo. Mejor rendimiento en lenguas europeas (historial largo de calibración). La calidad de la detección se evalúa con PAN-PC-11; la evaluación por idioma está en la hoja de ruta. Especialmente útil en contextos académicos europeos y sudamericanos.
¿Qué si citan un artículo retractado después de enviar?
La integración Crossref Retraction Watch lo marca en cada re-chequeo. Si ya envió, deberá notificar al editor (algunas revistas lo exigen). No afecta el puntaje pero lo sabrá antes que el revisor 2.

Ejecute un capítulo por la cascada. Vea el desglose de autocitas.

Suba un borrador de manuscrito, capítulo de tesis o revisión bibliográfica. Agregue su ORCID. Vea qué intervalos son SELF-CITE, CITED y UNCITED-PARA (AI-LIKELY en breve). Gratis hasta 2.500 palabras. Residencia en la UE en Pro+ para material sensible pre-publicación.

Detector de plagio para investigadores pre-publicación