Detector de plágio para pesquisadores pré-submissão
Verificações pré-submissão de manuscritos contra 700M+ trabalhos acadêmicos. Meus Locais acompanha suas próprias publicações anteriores para que autocitações legítimas não aumentem a pontuação. Endpoint com residência na UE disponível para pesquisas sensíveis antes da publicação. Motor Apache 2.0 — auditável pelo comitê de ética institucional.
Quatro funções de pesquisa. Um fluxo de autoavaliação.
Pré-submissão de capítulo de dissertação
Itere entre capítulos. Acompanhe autocitações entre versões.
- Verificação por capítulo + histórico de versões
- Lista branca de autocitação (seu ORCID + DOIs)
- Bibliografia excluída automaticamente
Manuscrito antes da submissão ao periódico
iThenticate roda na submissão; rodamos antes.
- Índice acadêmico open-access de 700M+ trabalhos
- Classificação de citações (citadas x paráfrase não citada)
- Pro com tarifa fixa · itere sem custo por crédito
Revisão de literatura + checagem de propostas
Reaproveitar trechos de propostas anteriores é esperado — sinalize isso.
- Reconhece suas publicações e projetos anteriores
- Lista branca de coautores (trabalho anterior de colaborador)
- Exporta relatório de classificação em PDF para colaboradores
QA pré-publicação para todo o laboratório
Detecte problemas nas submissões do laboratório numa fila só.
- Pasta por projeto + por pós-doc
- Residência na UE para dados clínicos/sensíveis
- Motor Apache 2.0 — defensável perante o comitê de ética
Três etapas antes de o manuscrito entrar no sistema do periódico.
Rode de modo iterativo. Detecte intervalos autocitados para que não inflacionem sua pontuação iThenticate / Crossref na submissão. Detecção de IA chegando em breve, para que você possa pré-visualizar antes que o revisor 2 levante a questão.
01 · Esboce e crie lista branca
Envie o rascunho do capítulo/manuscrito. Adicione seu ORCID + lista de DOIs (lista branca) — seus próprios trabalhos publicados são marcados como SELF-CITE, não plágio. Inclui DOIs de coautores se houver colaboração; o motor reconhece reutilização legítima.
02 · Execute a cascata
L1 winnowing → web ao vivo atualmente, com L2 MinHash (v1.1) e L3 embeddings vetoriais (v1.2) previstos para as próximas versões. Identifica cópias literais e quase literais; a detecção de paráfrases estará disponível com L2 e L3. A classificação de citações separa trechos citados de paráfrases não citadas. Multilíngue, com calibração para detecção em inglês, espanhol, português, polonês e ucraniano no lançamento, e mais idiomas em breve. Mediana de 47 segundos por manuscrito.
03 · Revise e itere
O relatório classifica intervalos por categoria: SELF-CITE (seus, esperados), CITED (citados com atribuição, esperados), CITED-PARA (paráfrase citada, peso baixo), UNCITED-PARA (exige atenção) e AI-LIKELY (com faixa ajustada para ESL) em breve. Reprodutível — commit do motor + snapshot do corpus em cada relatório.
Seis categorias de reutilização acadêmica legítima — nenhuma deve aumentar sua pontuação.
Ferramentas caixa-preta tratam todo texto coincidente como plágio. Pesquisadores reutilizam texto de modo legítimo com frequência. Veja como o classificador faz isso.
01 · SEU PRÓPRIO TRABALHO ANTERIOR
Lista branca ORCID + DOI. Seus artigos já publicados são marcados como SELF-CITE caso coincidam — não plágio. Comum em revisões de literatura (“como argumentei em Chen 2023…”) e projetos que expandem seu trabalho anterior.
02 · TRABALHO COAUTORADO
Inclua ORCIDs de colaboradores na lista branca. Artigos coautorados são marcados como CO-CITE. Útil para manuscritos desenvolvidos a partir de artigo em coautoria — métodos padrão podem ser legítimos.
03 · TEXTO DE HERANÇA DE LAB
Corpus compartilhado por pasta PI: métodos padronizados, protocolos, declarações éticas comuns a publicações do lab. Marcado como LAB-CITE e fora da pontuação. Boilerplate aprovado pelo comitê não precisa ser reescrito sempre.
04 · PRÉ-PRINTS EM EMBARGO
Pré-print arXiv / bioRxiv do manuscrito submetido. O classificador reconhece evolução para versão de artigo e marca como PREPRINT-SELF. Não conta na pontuação. Periódico que rejeita pré-print pode configurar regras mais rígidas.
05 · CITAÇÕES RETRATADAS
Integração Crossref Retraction Watch marca qualquer intervalo que cite artigo retratado. Não altera a pontuação — mas é importante saber antes da submissão. Pega o “citei artigo retratado mês passado” antes que o revisor 2 note.
06 · IRB / SENSÍVEL
Endpoint com residência na UE (api.eu.noplag.com) mantém o manuscrito em infraestrutura da UE. Motor pode ser totalizado em sua rede para HIPAA / GDPR / dados de paciente. Apache 2.0 + Docker; nada trafega fora do seu VPC.
Organizado por projeto. Registro por data.
Agrupe manuscritos por projeto, ano do lab ou ciclo de financiamento. Re-execute contra o mesmo commit do motor — resultados reprodutíveis meses depois.
Três requisitos de pesquisa sensível para o verificador.
Manuscritos nunca saem da infraestrutura UE
Pro+ provisionado em api.eu.noplag.com. Hospedado em data centers da UE Hetzner (Falkenstein + Helsinki). Submissão, repositório de impressões digitais e relatório ficam na UE. Compatível com GDPR por padrão; DPA sob demanda.
Execute o motor na sua própria instituição
Apache 2.0 + Docker compose. Pipeline completo pode ser executado em sua infraestrutura. Use seu próprio Postgres + Redis; corpus é enviado como bundle indexável para Enterprise. Nenhum tráfego sai do seu VPC. Responde a dados de ensaios clínicos, estudos de caso de pacientes, pesquisas sensíveis.
Exclua toda impressão digital que mantemos de você
Um clique em Configurações. Em até 24h, toda impressão digital, relatório, entrada de lista branca e metadados de sua conta é apagada. Compatível com GDPR Artigo 17. Autogestores têm acesso direto ao banco de dados; usuários da nuvem têm endpoint de exclusão documentado.
Um motor Apache 2.0 que o comitê realmente pode revisar antes de aprovar.
Revisões institucionais de software acadêmico normalmente travam nas mesmas questões: para onde vai o manuscrito, como funciona o algoritmo de comparação, dados de paciente/sensíveis têm tráfego externo, qual caminho para apagar, a precisão publicada é reproduzível. Fornecedores proprietários respondem em chamada de vendas. Com Apache 2.0, o comitê pode clonar o repositório, rodar o motor em sandbox, auditar fluxos de dados, validar o direito ao apagamento, e checar pontuações F1 publicadas em seu próprio conjunto de testes. Não propomos menos revisão — propomos revisão que realmente pode ser feita. Por isso escritórios de dados acadêmicos que recusavam outros fornecedores estão assinando este.
Leia o guia de revisão do comitêPerguntas que o escritório de pesquisa realmente faz.
- Por que minha pontuação muda quando adiciono meu ORCID + DOIs?
- Porque o motor reclassifica todo intervalo coincidente com trabalho na lista branca como SELF-CITE, não UNCITED-PARA. As coincidências não somem — são marcadas diferente. SELF-CITE tem peso quase zero na pontuação. Exemplo: capítulo da sua tese cita seu próprio pré-print duas vezes e um artigo de coautor: mudam três intervalos de “contado” para “reciclagem acadêmica esperada”.
- O motor treina com manuscritos enviados?
- Não. O texto submetido é fingerprinted (só hashes não reversíveis) e fica isolado por tenant. O texto em si apaga após 30 dias salvo retenção. Detector de IA via Binoculars — chegando em breve — será pré-treinado em corpora públicos; não usamos manuscritos do cliente. Explicitado no DPA.
- E meu pré-print no arXiv / bioRxiv?
- Se listar o DOI do pré-print na lista branca, coincide como PREPRINT-SELF e não soma na pontuação. O motor reconhece a evolução para versão de periódico como esperada. Periódicos que rejeitam pré-print podem configurar regras mais rígidas — mas a maioria aceita (Nature, Cell, NEJM, PLOS) e a marcação condiz com suas políticas.
- Como o detector de IA deve lidar com coautores ESL?
- A detecção de AI estará disponível em breve — prevista para a v1.2. Quando lançada, usará calibração por idioma com veredito ajustado para ESL. Se a assinatura lexical indicar inglês não nativo (comum em colaborações multinacionais), o veredito será ESL ADJ com erro residual documentado, em vez de afirmar zero erro. O artigo de Liang et al. 2023 mediu 61,3% de FPR em redações TOEFL para detectores ingênuos; publicamos nossa metodologia de mitigação em /docs/developers/benchmarks. Coautores ESL não são sinalizados de forma injusta.
- Posso rodar o motor em cluster Slurm para checagem em lote?
- Sim — Apache 2.0 + Docker. Execute o container do engine nos nós de computação do seu cluster; ingira a partir do seu sistema de arquivos compartilhado; emita relatórios em JSON para onde seu pipeline consome. Útil para verificar em lote a produção de um ano de laboratório contra o snapshot mais recente do corpus. Exemplo de script Slurm sbatch em github.com/NoplagLabs/noplag-engine.
- E manuscritos com dados clínicos/de paciente?
- Autohospede em seu VPC. Nenhum tráfego externo. O motor não precisa de internet para checks no corpus — mas perde a camada live-web (opcional). Compatível com HIPAA se a infra for configurada; sua TI administra como serviço interno.
- O que isto difere do iThenticate na submissão?
- iThenticate roda só na submissão e o editor vê o resultado — você não pode iterar. Noplag é o seu auto-check antes disso. A cascata é comparável para conteúdo open-access (até mais ampla, pós-Plan-S); mais limitada para conteúdo pago/assinatura para o qual iThenticate tem licença. Autocitação é o que a maioria precisa e o iThenticate não resolve bem.
- Integra com gerenciador de referências (Zotero / Mendeley / EndNote)?
- Ingestão da lista branca aceita BibTeX, RIS e ORCID API. Exporte sua biblioteca do Zotero ou cole seu ORCID; em segundos sua lista branca recebe todos DOIs. Sincronização em tempo real com Mendeley e EndNote está no roadmap v1.2; no momento só por exportação.
- Como é a cobertura para pesquisas em idioma não inglês?
- A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas em breve. Melhor desempenho em idiomas europeus (histórico longo de calibração). A qualidade da detecção é avaliada no PAN-PC-11; a avaliação por idioma está no roadmap. Útil especialmente para contextos acadêmicos europeus e sul-americanos.
- O que acontece se artigo citado for retratado após submissão?
- A integração Crossref Retraction Watch marca a cada nova verificação do manuscrito. Se já submeteu, deve avisar o editor (alguns periódicos exigem manejo explícito de retratação pós-submissão). Não altera pontuação, mas evita surpresas do revisor 2.
Rode um capítulo na cascata. Veja a classificação das autocitações.
Envie o rascunho de um manuscrito, capítulo de dissertação ou revisão de literatura para projeto. Adicione seu ORCID. Veja quais intervalos são SELF-CITE, CITED e UNCITED-PARA, com AI-LIKELY em breve. Gratuito até 2.500 palavras. Pro+ com residência UE para material sensível antes da publicação.