Detector de IA: señal, no veredicto
La detección de AI estará disponible pronto — está en nuestra hoja de ruta, pero aún no está activa. Cuando salga, todos los detectores de AI — incluido el nuestro — se equivocarán a veces. Noplag devolverá una puntuación de probabilidad calibrada, no un veredicto afirmativo/negativo, y publicará la tasa de falsos positivos en personas que no son nativas del inglés. Estamos desarrollando cobertura para ChatGPT, Claude, Gemini, GPT-5 y Llama. Lea qué significa realmente la puntuación antes de tomar cualquier acción — especialmente si la decisión afecta a un estudiante o una persona postulando a un trabajo. La detección es solo una señal entre varias. Nunca debería ser la única.
Firmas de detección para cada LLM principal.
Cada modelo deja una firma estadística distinta. Las seguimos por cada versión y publicamos la calibración por modelo, para que usted sepa qué refleja la puntuación para cada LLM.
ChatGPT
Familias gpt-4o, o1, o3. Seguimos el cambio de resultados entre versiones; la calibración por modelo se actualiza en los 30 días posteriores a cada lanzamiento. El informe cita la familia del modelo que más se ajusta a la señal.
Claude
Capas Sonnet, Opus, Haiku en 3.x y 4.x. La señal varía según el modo (pensamiento vs rápido); la calibración para cada modo se indica en cada informe.
Gemini
1.5 Pro, 2.0 Flash, 2.5 Pro. La señal multilingüe es más débil en textos que no son en inglés; el informe lo muestra como 'confianza baja por pocos datos' en vez de ocultarlo.
GPT-5
Lanzamiento de agosto 2025 de OpenAI. Firma comportamental diferente a gpt-4o; recalibramos usando los textos de referencia de la tarjeta del modelo dentro de los 30 días del lanzamiento.
Llama
Familias 3, 3.1, 3.3. Las variantes autohospedadas son más difíciles — el ajuste fino cambia la firma. El informe dice 'probablemente generado por LLM, familia Llama', en lugar de precisar la versión.
Todo detector de AI marca exceso a no nativos del inglés. Esto hacemos al respecto.
Liang y otros (Stanford, 2023) midieron una tasa de falsos positivos del 61% en ensayos TOEFL — seis veces más que para nativos. En todos los detectores. El nuestro también, antes del ajuste.
El estudio de Stanford
Liang y otros (2023) testearon cada detector de AI comercial en ensayos TOEFL de hablantes no nativos de inglés. El detector base marcó 61% como generado por AI — seis veces más que en nativos. Misma tarea, mismos textos.
Qué recalibramos
Retrainamos el clasificador quitando rasgos de estilo ESL — longitud uniforme de frases, vocabulario más sencillo, menos modismos ya no pesan como señal de AI. Solo características independientes del estilo. Predecimos por estructura, no por pulido.
Tasa de error residual
Después de la corrección: un intervalo de confianza documentado por idioma, en lugar de un solo valor principal. Las tablas por idioma se publican cuando la función supera la evaluación, tal como exigiría una auditoría institucional.
Cuándo desestimar
Si evalúa a alguien ESL y la puntuación cae en el rango 20–80%, úselo solo como orientación. Expresamente aparece 'baja confianza — interpretar con cautela' en el informe, para que el usuario sepa cuándo no debe tomar acción.
Qué seguimos sin captar
Escritura híbrida — redactada por LLM y pulida por nativo — es más difícil que ambos casos puros. El informe muestra 'señal mixta, probablemente híbrido' en vez de adivinar; parte del error residual está aquí.
Dónde medimos
Conjuntos públicos de ensayos TOEFL, entregas académicas panhispánicas y textos multilingües evaluados según el MCER. Los mismos datos utilizados por Liang et al., más 8 nuevos corpus recopilados entre 2024 y 2026. Las referencias se publican junto con la metodología cuando la función esté disponible.
Es una probabilidad, no un veredicto.
La puntuación es una probabilidad entre 0% y 100%. Más de 80%: alta confianza de que es AI. Menos de 20%: alta confianza de humano. El rango 20–80% es donde hay que tratarlo como una señal más, no como prueba. Use la detección para empezar una conversación, nunca para cerrarla.
Alta confianza en que el texto fue escrito por una persona. La tasa de falsos positivos para este rango se publica por idioma cuando la función supera la evaluación.
El modelo no está seguro. Tome la puntuación como un dato más — muestras recientes, borradores previos, trabajo en clase. No tome acción solo con este rango.
Alta confianza de texto producido por un modelo de lenguaje. Tampoco es veredicto. Combine con contexto (prompts, historial de navegación, defensa oral) antes de cualquier decisión.
- 5Familias de LLM previstas para el lanzamiento
- 61%Tasa de falsos positivos ESL, Stanford '23
- 30dFrecuencia de reentrenamiento prevista tras cada versión del modelo
- v1.2Fecha objetivo de lanzamiento para la detección de AI
- 2024comienza I+D de detección
Estamos del lado de la integridad. No desarrollamos herramientas para evadir la detección.
Un humanizer es una herramienta para evadir la detección AI — reescribe el texto LLM para bajar la puntuación de detección. Podemos desarrollar uno. No lo hacemos. Todo el propósito de este producto es exponer el uso de AI, no ayudar a ocultarlo. Para que la detección sea útil, quienes ejecutan detectores y quienes construyen humanizers no pueden ser el mismo proveedor. Hemos tomado postura. Cuando aquí hablamos de humanizers, es para decir que existen y pueden haberse usado en los textos que analiza — no para venderle uno.
Lea la postura completaCómo nos comparamos con GPTZero, Originality.ai y Winston.
Enfocado en educación, sin capa antiplagio, calibración opaca. Solo detección de AI; si necesita plagio y AI, requiere dos herramientas.
Detección + plagio + motor open source. Datos de calibración por modelo publicados. Mismo informe, mismo proveedor, auditoría de extremo a extremo.
Marketing de '97% exactitud'. No se publica la tasa de falsos positivos. Calibración solo en inglés. Código cerrado — no puede auditar la puntuación.
Reconocemos el sesgo hacia ESL (citamos a Liang 2023 por nombre). Calibración multilingüe. Motor open source; la metodología se publica junto con la función.
Fuerte en detección de ChatGPT. Señal más débil en Claude y Gemini. Caro al escalar; precios divididos por límite de 10k palabras/mes.
Cubre todas las familias principales de modelos con el mismo nivel de calibración. Tarifas fijas hasta Pro. Opción self-host para requerimientos de cumplimiento.
Doce preguntas, respuestas directas.
Si no sabemos la respuesta, se dice. Actualizamos la lista cuando cambian las calibraciones.
- ¿La detección de AI es precisa?
- Respuesta directa: ningún detector es fiable con textos de menos de ~200 palabras, y todos presentan tasas de falsos positivos que varían según el estilo de escritura, el idioma y el LLM que generó el texto. Noplag se compromete a publicar sus datos de calibración para que sepas qué significa 'preciso' en tu caso específico; se publican junto con la función.
- ¿Noplag marcará mi escritura en inglés no nativo como AI?
- Podría — y somos transparentes con ello. Liang et al. (Stanford 2023) mostró que todo detector de AI comercial marca exceso en escritores ESL. Nuestras protecciones limitan el falso positivo en patrones ESL conocidos, y publicamos el error residual. Si la señal es incierta, el informe lo dice.
- ¿Qué modelos AI detectará Noplag?
- En el lanzamiento, detectaremos ChatGPT (gpt-4o, o1, o3), Claude (Sonnet / Opus / Haiku, 3.x y 4.x), Gemini (1.5 / 2.0 / 2.5), GPT-5 y Llama 3.x. La detección estará disponible pronto; la calidad varía según modelo, y el informe indica qué firma refleja la puntuación.
- ¿En qué se diferencia de GPTZero u Originality.ai?
- Ofrecemos detección de IA junto con verificación de plagio, y distribuimos el motor como open source. GPTZero solo detecta IA. Originality.ai es closed-source y no publica datos sobre sesgo hacia hablantes no nativos. Consulta /vs-gptzero y /vs-originality-ai para comparativas detalladas.
- ¿Los estudiantes pueden evadir el detector con humanizer?
- Sí — existen humanizers, y hay que ser honestos con eso. Reescribir mucho después de usar LLM baja la señal de detección. No vendemos humanizers (es contrario a nuestra misión). Considere detección AI como insumo, nunca como veredicto.
- ¿Qué es un 'falso positivo' aquí?
- Texto escrito por una persona evaluado como generado por AI. Mediremos y publicaremos la tasa por idioma y por grupo de estilo de escritura. Ningún detector tiene tasa cero; tratar una puntuación alta como prueba en vez de como señal a investigar es el uso incorrecto que esta página busca evitar.
- ¿Ofrecen 'detección 99% segura'?
- No. Quien afirme más de ~85% de precisión sostenida entre estilos de escritura, idiomas y LLMs está tergiversando lo que permiten las matemáticas. Publicamos el intervalo de confianza real por idioma cuando la función supera la evaluación. No vendemos certeza.
- ¿La detección de AI es gratuita?
- La detección AI estará disponible pronto. Al lanzarse, será gratis en el plan gratuito — mismo límite de 2,500 palabras que el antiplagio. Los planes pagos amplían el límite; nunca será un extra de pago aparte.
- ¿Qué tan actualizada es la cobertura de modelos?
- Recalibramos la detección para nuevos LLMs en 30 días. Si un modelo aún no está calibrado, el informe dirá 'probablemente LLM, modelo desconocido' en vez de adivinar familia.
- ¿Detectan AI en varios idiomas?
- Inglés, español, francés, alemán y portugués tienen calibración validada — inglés es la señal más fuerte. Otros idiomas devuelven resultado con advertencia 'recurso bajo — interpretar con extra cautela.' El informe indica qué nivel de calibración aplica al texto que ingresó.
- ¿Puedo integrar la detección AI vía API?
- Pronto. Está en desarrollo; cuando la lancemos, /v1/checks devolverá puntuaciones de plagio y AI. Vea /plagiarism-checker-api y /docs/api.
- ¿Qué hago si no estoy de acuerdo con el resultado?
- Avísenos. Registramos las correcciones, recalibramos tras cada versión de modelo y publicamos los cambios de comportamiento entre versiones. La detección no es perfecta; preferimos saber cuándo falla a fingir que no falla.
Detección AI — próximamente, gratuita hasta 2,500 palabras.
Se publicarán datos de calibración, tasas de falsos positivos y firmas por modelo. Consulte qué hay detrás de la puntuación antes de decidir.
Notifíqueme cuando esté disponible