Detector de IA: um sinal, não um veredito
A detecção de IA chega em breve — está no nosso roadmap, ainda não está ao vivo. Quando lançar, todo detector de IA — inclusive o nosso — vai errar às vezes. O Noplag retorna uma pontuação de probabilidade calibrada, não um sim/não, e publica o índice de falso-positivo em escritores não nativos de inglês. Estamos desenvolvendo cobertura para ChatGPT, Claude, Gemini, GPT-5 e Llama. Leia o que a pontuação realmente significa antes de agir — principalmente se estiver decidindo sobre um estudante ou candidato a emprego. Detecção é só um dos sinais. Nunca deve ser o único.
Assinaturas de detecção para todos os grandes LLMs.
Cada modelo deixa uma assinatura estatística diferente. Rastrearmos por versão e publicamos calibração, por modelo, para que você saiba o que a pontuação reflete do LLM que gerou o texto.
ChatGPT
Famílias gpt-4o, o1, o3. Acompanhamos a variação ao longo das versões; calibração por modelo retreinada em até 30 dias por lançamento. O relatório cita a família do modelo que mais se encaixa no sinal detectado.
Claude
Tiers Sonnet, Opus, Haiku nas linhas 3.x e 4.x. O sinal de detecção varia conforme o modo (raciocínio vs. rápido); calibração especificada por modo em cada relatório.
Gemini
1.5 Pro, 2.0 Flash, 2.5 Pro. O sinal em textos não ingleses é mais fraco; o relatório mostra isso como 'confiança baixa em recursos', não oculta.
GPT-5
Lançamento da OpenAI de agosto de 2025. Assinatura comportamental difere de gpt-4o; recalibramos com saídas-referência da model card em até 30 dias do lançamento.
Llama
Famílias 3, 3.1, 3.3. Variantes self-hosted são mais difíceis — o fine-tuning altera a assinatura. O relatório aponta 'provável LLM, família Llama' em vez de versão específica.
Todo detector de IA marca demais autores não nativos de inglês. Eis o que fazemos sobre isso.
Liang et al. (Stanford, 2023) mediram taxa de falso-positivo em TOEFL de 61% — seis vezes a taxa de nativos. Todo detector. Inclusive o nosso, antes da correção.
O estudo de Stanford
Liang et al. (2023) testaram todos os detectores comerciais de IA sobre redações TOEFL de autores não nativos de inglês. O detector padrão marcou 61% como IA — seis vezes a taxa de nativos. Mesmos textos, mesma tarefa.
O que recalibramos
Recalibramos o classificador sem sinais estilísticos de ESL — comprimento uniforme, vocabulário mais simples, pouco uso de expressões não contam como IA. Só sinais neutros de estilo. Previsão pela estrutura, não pelo acabamento.
Erro residual
Após a correção: intervalo de confiança documentado por idioma, em vez de um único número principal. As tabelas por idioma são publicadas quando o recurso conclui a avaliação — exatamente o que uma auditoria institucional exigiria.
Quando desconsiderar
Se avaliar um texto de autor ESL e a pontuação cair no intervalo de 20–80%, trate só como sugestão. No relatório, mostramos 'baixa confiança — interpretar com cautela' para que o usuário veja quando não agir.
O que ainda escapa
Texto híbrido — rascunho por LLM, polido por nativo — é mais difícil que só IA ou só humano. O relatório mostra 'sinal misto, provável híbrido' em vez de arriscar; parte do erro residual está aqui.
Onde medimos
Conjuntos públicos de redações TOEFL, submissões acadêmicas pan-hispânicas e textos multilíngues avaliados pelo CEFR. Mesmos dados usados por Liang et al., mais 8 novos corpora coletados entre 2024-2026. As referências são publicadas junto com a metodologia quando o recurso for lançado.
Uma probabilidade, não um veredito.
A pontuação é uma probabilidade de 0% a 100%. Acima de 80%: alta confiança em IA. Abaixo de 20%: alta confiança em humano. No intervalo 20–80% trate como só um dos sinais — não como prova. Use a detecção para iniciar conversa, nunca para encerrar.
Alta confiança de que o texto foi escrito por um humano. A taxa de falso positivo para essa faixa será publicada por idioma quando o recurso concluir a avaliação.
O modelo não tem confiança. Considere a pontuação como um dado entre outros — exemplos recentes, rascunhos prévios, texto em sala. Não decida só por este intervalo.
Alta confiança de geração por LLM. Ainda não é sentença. Junte com contexto (prompts, histórico de navegação, defesa oral) antes de qualquer decisão.
- 5Famílias de LLMs previstas para o lançamento
- 61%Taxa de falso-positivo em ESL, Stanford '23
- 30dPeriodicidade planejada de re-treinamento após cada versão do modelo
- v1.2Previsão de lançamento para detecção de AI
- 2024início do R&D em detecção
Estamos do lado da integridade. Não lançamos ferramenta para driblar detecção.
‘Humanizer’ é uma ferramenta para driblar detecção de IA — reescreve o texto gerado para baixar a pontuação. Poderíamos construir uma. Não fazemos. O propósito aqui é mostrar uso de IA, não esconder. Para valer, quem cria detector e quem faz humanizer não pode ser o mesmo fornecedor. Escolhemos o nosso lado. Quando mencionamos humanizers aqui, é para avisar que existem e podem atuar antes do texto chegar — não para vender nenhum.
Leia a posição completaComo nos comparamos a GPTZero, Originality.ai e Winston.
Foco educacional, sem camada de plágio, calibração opaca. Só detecção de IA; se precisa de plágio no mesmo relatório, são duas ferramentas.
Detecção + plágio + mecanismo open source. Dados de calibração por modelo publicados. Mesmo relatório, mesmo fornecedor, auditável de ponta a ponta.
Marketing de '97% de acerto'. Não publica falso-positivo. Calibração só em inglês. Código fechado — sem auditoria possível.
Transparência sobre viés em ESL (citamos Liang 2023 nominalmente). Calibração multilíngue. Engine open source; a metodologia é publicada junto com o recurso.
Forte para ChatGPT. Sinal mais fraco para Claude e Gemini. Caro em volume; preço trava acima de 10 mil palavras/mês.
Cobre todas grandes famílias com o mesmo rigor. Planos fixos até o Pro. Opção de self-host para compliance.
Doze perguntas, respostas honestas.
Se não soubermos a resposta, dizemos. Atualizamos ao mudar a calibração.
- A detecção de IA é precisa?
- Resposta direta: nenhum detector é confiável para textos com menos de ~200 palavras, e todos apresentam taxas de falso positivo que variam conforme o estilo de escrita, idioma e LLM utilizado. A Noplag se compromete a publicar seus dados de calibração para que você saiba o que 'preciso' significa no seu caso; esses dados são publicados junto com o recurso.
- O Noplag pode marcar minha redação não-nativa como IA?
- Pode sim — e somos transparentes quanto a isso. Liang et al. (Stanford 2023) mostraram que todo detector comercial marca ESL em excesso. As proteções limitam falso-positivo em padrões conhecidos de ESL, e publicamos o erro residual. Se o sinal for incerto, o relatório diz.
- Quais modelos de IA o Noplag detectará?
- Na estreia, suporte para ChatGPT (gpt-4o, o1, o3), Claude (Sonnet / Opus / Haiku, 3.x e 4.x), Gemini (1.5 / 2.0 / 2.5), GPT-5 e Llama 3.x. Detecção chega em breve; qualidade depende do modelo, e o relatório diz qual assinatura foi reconhecida.
- Como isso difere do GPTZero ou do Originality.ai?
- Oferecemos detecção de IA junto com verificação de plágio e disponibilizamos o mecanismo como open source. O GPTZero faz apenas detecção. O Originality.ai é fechado e não divulga dados de viés em ESL. Veja /vs-gptzero e /vs-originality-ai para comparações detalhadas.
- Estudantes conseguem burlar o detector com humanizer?
- Sim — humanizers existem, e isso não muda. Reescrita pesada reduz o sinal de detecção. Não lançamos humanizer (é contra nosso objetivo). Trate detecção de IA só como um insumo, nunca como sentença.
- O que é 'falso-positivo' aqui?
- Texto escrito por humanos classificado como gerado por AI. Vamos medir e publicar a taxa por idioma e agrupamento de estilo de escrita. Nenhum detector tem taxa zero — tratar uma pontuação alta como prova, e não como um sinal a ser investigado, é o uso inadequado que esta página busca desencorajar.
- Vocês garantem '99% de precisão'?
- Não. Quem afirma mais de ~85% de precisão sustentada entre estilos de escrita, idiomas e LLMs está distorcendo o que é matematicamente possível. Publicamos o intervalo real de confiança por idioma quando o recurso concluir a avaliação. Não vendemos certeza.
- A detecção de IA será gratuita?
- A detecção de IA chega em breve. Quando lançar, será gratuita no plano free — mesmo limite de 2.500 palavras do verificador de plágio. Os planos pagos aumentam o limite; detecção de IA nunca ficará atrás de add-on separado.
- Quão atual é a cobertura dos modelos?
- Retreinamos com LLMs novos em até 30 dias. Se um modelo não for coberto, o relatório aponta 'provável LLM, modelo desconhecido' e não supõe família.
- Detectam IA em outros idiomas?
- Inglês, espanhol, francês, alemão e português têm calibração validada — o inglês é o mais forte. Outros idiomas retornam resultado marcado como 'baixo recurso — interpretar com máxima cautela'. O relatório explica a calibração aplicada.
- Posso integrar detecção de IA via API?
- Em breve. Detecção de IA está no roadmap; quando lançar, o endpoint /v1/checks retorna resultado de plágio e IA. Veja /plagiarism-checker-api e /docs/api.
- O que faço se discordar da pontuação?
- Fale conosco. Registramos correções, retreinamos a cada novo modelo, e publicamos desvios de comportamento. A detecção não é perfeita; preferimos ouvir onde errou do que fingir acerto.
Detecção de IA — em breve, grátis até 2.500 palavras.
Calibração, falso-positivo e assinaturas por modelo serão publicados. Saiba o que há por trás do resultado antes de agir.
Avisar quando lançar