WEB150M+ páginas · compatible con canonical

Detector de plagio de contenido duplicado en línea

Detecte contenido duplicado en la web pública, en sus propias carpetas y en la biblioteca de su equipo. Compatible con canonical: diferencia entre sindicación legítima y copias extraídas. Gratis hasta 2.500 palabras; escaneo por carpetas en Pro.

0 / 1,500 words
Web + Common Crawl indexadoDetección de duplicado parcial + contenido giradoEscaneo de biblioteca a nivel de carpeta
TIPOS DE DUPLICADO

Cuatro tipos de duplicado. Tratamiento diferente, solución diferente.

La mayoría de los “detectores de duplicados” solo detectan coincidencias exactas. Clasificamos cada coincidencia en una de cuatro categorías, así sabrá qué ignorar (cita legítima), qué canonizar (sindicación) y qué reescribir (copiado o girado).

01 · EXACTO

Coincidencia palabra por palabra

Cadenas idénticas de 30+ caracteres. Incluye bloques de texto copiados, artículos sindicalizados republicados íntegros, páginas extraídas.

Solución: canonizar, reescribir o aceptar (si es su pieza sindicada).
02 · DUP-PARCIAL

Levemente reformulado

Forma de la frase conservada, sinónimos intercambiados o adjetivos desordenados. El típico resultado “giro”. Detecta lo que Copyscape omite a propósito.

Solución: reescritura completa — el argumento debe ser suyo.
03 · GIRADO

Paráfrasis agresiva

Paráfrasis a nivel de frase con cláusulas reordenadas, tiempos verbales cambiados, relleno añadido. Común en herramientas de reescritura por IA y agencias de contenido.

Solución: verifique la intención. ¿Es paráfrasis propia del autor o copia no declarada?
04 · PLANTILLA

Recurrente entre páginas

El mismo aviso legal, biografía de autor o descripción de producto repetida en cientos de sus páginas — el verdadero problema de duplicado para Google.

Solución: extraiga a una plantilla compartida; evite que Google lo indexe 800 veces.
QUÉ CONSIDERA GOOGLE DUPLICADO

No es solo “copiar y pegar de otro sitio”.

Las reglas reales de Google (de Search Central): tres patrones activan el trato de contenido duplicado, y la mayoría son sobre sus páginas, no sobre competidores que copian.

01

Copias entre dominios sin canonical

El mismo artículo en varios sitios sin un rel=canonical apuntando al original. Incluye sindicación distribuida incorrectamente, competidores que copian sin declarar, y duplicación accidental entre sitios cuando un autor publica dos veces.

02

El mismo contenido bajo varias URLs en su propio sitio

/producto/foo y /producto/foo?utm_source=email y /producto/foo/ con barra. Navegación facetada (filtros que producen páginas idénticas), versiones para imprimir sin canonical, versiones móvil/escritorio separadas. Google los agrupa, elige uno y descarta el resto.

03

Plantilla presentada como contenido

Una categoría de tienda online con la misma descripción de categoría en 1.200 SKUs. Una página de ubicaciones con “Nuestro equipo tiene 20 años de experiencia” repetido en 47 páginas. Duplicado de poco valor — la Helpful Content Update lo marca intenso.

CASOS DE USO SEO

Seis equipos ejecutan este chequeo cada semana.

La misma herramienta, seis flujos distintos — desde la revisión de un bloguero antes de publicar, hasta la QA en agencia sobre contenido tercerizado.

Blog antes de publicar

Ejecute el borrador contra la web pública antes de publicar. Detecta reutilización accidental de frases de sus antiguos posts (autocanibalización), artículos de competidores vistos investigando, y errores de reescritura por IA.

Detección de scraping de competidores

Pegue su artículo y vea quién más lo publica. Útil para documentación DMCA: cada coincidencia muestra el URL fuente, los intervalos coincidentes, y una captura con fecha que puede guardar como prueba.

Higiene de biblioteca de contenido

Escaneo a nivel carpeta disponible en Pro. Arrastre toda la biblioteca de su equipo; la herramienta marca duplicados entre documentos — mismo párrafo en tres piezas, contenido que debería ir a plantilla.

Auditoría de sindicación

Publicó un artículo en Medium, LinkedIn y Substack. ¿Todos apuntan rel=canonical a su URL de origen? La herramienta revisa cada uno, valida el canonical y señala cuáles republicaciones filtran autoridad SEO.

QA de escritor externo

La entrega de su redactor freelance en una ventana. Pase el chequeo antes de pagar. Captura el habitual patrón scrape-then-spin, el giro por IA y citas sin referencia.

Procedencia en contenido por IA

Asistentes de IA extraen texto de páginas web reales durante la búsqueda de contexto. La herramienta muestra esos pasajes reutilizados para que decida: citar, reescribir o eliminar. Reducirá riesgo en Helpful-Content-Update.

ESCANEO DE DUPLICADOS CARPETA

Arrastre su biblioteca. Vea qué coincide con qué.

Función Pro. Elija una carpeta de artículos publicados; el motor genera una matriz de similitud entre cada par. Ordenable por solapamiento y clic directo a intervalos coincidentes.

CARPETA / blog-2026-q16 artículos · matriz de similitud por pares
3 coincidencias > 10%Exportar matriz
ARTÍCULOA1A2A3A4A5A6
A1 — Cinco modelos de precios SaaS·4%3%38%6%2%
A2 — Cómo escribir precios SaaS4%·5%12%7%3%
A3 — Guía de precios orientada a producto3%5%·8%6%4%
A4 — Playbook de precios SaaS38%12%8%·9%5%
A5 — Cómo elegir su precio SaaS6%7%6%9%·4%
A6 — Precios SaaS para fundadores2%3%4%5%4%·
Haga clic en cualquier celda para ver intervalos que se solapan entre artículos
  • 150M+páginas web indexadas
  • 30dfrecuencia de actualización del corpus
  • 94%tasa de detección canonical
  • 4niveles de clasificación del duplicado
  • 2014indexación Common Crawl
VS HERRAMIENTAS BÁSICAS DE DUPLICADO

Tres cosas que los chequeadores de navegador y suites SEO no detectan.

HERRAMIENTAS TIPO COPYSCAPE

Solo igual exacta (Copyscape estándar). Una frase reformulada es “única” — y el contenido girado pasa limpio. Útil para scrapes de portapapeles; inútil para QA de contenido.

Noplag: clasificación en 4 niveles (Exacto / Parcial / Girado / Plantilla) con indicios de intención — accionable, no solo un indicador binario.

SUITES SEO

Incluya herramienta de unicidad de contenido en su paquete por $99–499/mes. Solo emparejamiento de ngramas superficiales, sin Common Crawl, sin escaneo entre carpetas.

Noplag: versión gratuita independiente (2.500 palabras). Pro ($23/mes) agrega matriz por carpetas y todo el índice web de 150M+ — sin amarrarlo a un bundle SEO de $400.

CHEQUEADORES GRATIS ONLINE

Caja negra. No muestra QUÉ fuente coincide, solo un número de similitud. Suele limitarse a 1.000 palabras. La mayoría no refresca su índice — analizan contra web de 2021.

Noplag: cada coincidencia muestra URL fuente + canonical + intervalos + fecha de snapshot. Apache 2.0 — puede leer el algoritmo de coincidencia usted mismo.

DETECCIÓN COMPATIBLE CON CANONICAL

Un artículo republicado con rel=canonical no es “contenido duplicado”. Lo tratamos así.

Cuando un artículo aparece en varias URLs, la pregunta SEO no es “¿son idénticos?” — es “¿todos declaran el mismo canonical?” Si su post invitado en Medium usa rel=canonical hacia su URL original, Google los agrupa, atribuye el ranking al origen y trata el resto como sindicación legítima. Si no, usted compite con su propio contenido republicado. La herramienta revisa cada coincidencia, analiza su <link rel="canonical"> y asigna la etiqueta a cada resultado: ORIGEN, SIND-OK, SIND-FUGA o COPIADO.

Ver la lógica canonical
FAQ

Preguntas que hace un responsable editorial antes de integrarlo.

¿Qué cobertura web tiene frente a Copyscape o SEMrush?

150M+ páginas indexadas de Common Crawl + dominios SEO de tráfico alto, refrescado cada 30 días. Más amplio que el índice exacto de Copyscape (~120M, centrado en plagio de plantilla), más limitado que el rastreo completo de Google pero con cobertura documentada y frecuencia publicada. Pro añade su carpeta propia como corpus privado.

¿Cómo funciona exactamente la detección canonical?

Para cada coincidencia, el motor descarga el URL fuente (cacheado o vivo), analiza el <head> y extrae rel=canonical. Se etiqueta como ORIGEN (canonical apunta a sí mismo), SIND-OK (canonical a otra página suya), FUGA (falta canonical/en otra parte), o COPIADO (sin canonical y no es de distribución). Se visualiza junto a cada resultado para que su score sea honesto.

¿Detecta contenido generado por IA reutilizado de otras fuentes?

Sí — los asistentes de escritura por IA extraen texto real de la web, y esos pasajes aparecen como duplicado parcial o girado. Se muestran junto al URL fuente para que decida: citar, reescribir o eliminar. La detección de contenido IA (otra señal) es distinta — está en desarrollo, no disponible aún — y aquí solo se analiza duplicado.

¿Cuál es el documento más grande que puedo escanear?

2.500 palabras en Free, 50.000 en Premium, 250.000+ en Enterprise (sin límite en autohospedaje). En Pro, una carpeta admite hasta 2.000 documentos; la matriz por pares se calcula en menos de 5 minutos para ese tamaño.

¿Encontrará competidores que hayan copiado mi contenido?

Si el duplicado está en el índice web (en un sitio público y rastreable), sí — la URL aparece en la lista con snapshot y fecha. La captura vale como prueba DMCA: con fecha, hash de contenido e intervalos resaltados. No se autogenera la DMCA (es decisión legal), pero se le da el documento.

¿Puedo excluir mi propia red de sindicación del escaneo?

Pro — permita listar los dominios que controla (medium.com/@usted, linkedin.com/in/usted, substack.com/p/usted). Coincidencias en esos dominios marcan como SIND-OK y no suman al score. El score es “duplicación inesperada”, no “toda duplicación”.

¿Cómo analiza una carpeta de 500 artículos el escaneo por pares?

La búsqueda es O(n log n) por par en práctica — fingerprints filtran los pares con hashes de 60 bits, el alineamiento solo se ejecuta en candidatos. 500 artículos → 124.750 pares en ~4 minutos con 4 núcleos. Se exporta la matriz como CSV para su pipeline.

¿El motor es realmente de código abierto?

Sí — github.com/NoplagLabs/noplag-engine, Apache 2.0. El chunker, el sistema de huellas, la recuperación en cascada, la alineación y la lógica de clasificación de duplicados están en el repositorio. La versión en la nube añade el corpus, Common Crawl y el espejo de Wikipedia; en la opción autogestionada, el corpus lo aporta el usuario. Verifica el algoritmo antes de confiar en el resultado.

¿Qué API permite integración en pipeline de contenido?

Endpoint REST en /v1/checks (SDKs para Python y Node). Envía un documento y recibe un informe de duplicidad de forma síncrona hasta 8 segundos; por encima de ese tiempo, la respuesta es vía webhook. Útil para comprobaciones CI antes de publicar: rechaza el merge si el porcentaje de duplicidad supera el umbral de tu equipo. Referencia completa en /docs/developers/api.

¿Y el contenido tras muros de pago o login?

Solo rastreamos lo público — Common Crawl, páginas listadas en sitemap, dominios permitidos por robots. Lo que está tras paywall (NYT, FT, revistas académicas privadas) no entra en el índice; no detectará coincidencias aunque su borrador repita una frase de esos sitios. Para papers, OpenAlex / CORE (corpus aparte) cubre lo open-access.

Compruebe un borrador. O su biblioteca entera.

El plan gratis cubre 2.500 palabras frente a más de 250M de páginas web. Pro ($23/mes) permite escaneos pares entre carpetas de su biblioteca. Apache 2.0, si prefiere gestionar el corpus en su propio servidor.

Detector de plagio de contenido duplicado gratis en línea