PESQUISAPré-submissão · Reconhecimento de autocitação · Residência na UE · Auditável pelo comitê de ética

Detector de plágio para pesquisadores pré-submissão

Verificações pré-submissão de manuscritos contra 700M+ trabalhos acadêmicos. Meus Locais acompanha suas próprias publicações anteriores para que autocitações legítimas não aumentem a pontuação. Endpoint com residência na UE disponível para pesquisas sensíveis antes da publicação. Motor Apache 2.0 — auditável pelo comitê de ética institucional.

700M+ trabalhos acadêmicosLista branca de autocitaçãoResidência na UE · Auditável pelo comitê de ética
ONDE VOCÊ ESTIVER NO PROCESSO

Quatro funções de pesquisa. Um fluxo de autoavaliação.

PHD / DOUTORADO

Pré-submissão de capítulo de dissertação

Itere entre capítulos. Acompanhe autocitações entre versões.

  • Verificação por capítulo + histórico de versões
  • Lista branca de autocitação (seu ORCID + DOIs)
  • Bibliografia excluída automaticamente
PÓS-DOC

Manuscrito antes da submissão ao periódico

iThenticate roda na submissão; rodamos antes.

  • Índice acadêmico open-access de 700M+ trabalhos
  • Classificação de citações (citadas x paráfrase não citada)
  • Pro com tarifa fixa · itere sem custo por crédito
ELABORADOR DE PROJETO

Revisão de literatura + checagem de propostas

Reaproveitar trechos de propostas anteriores é esperado — sinalize isso.

  • Reconhece suas publicações e projetos anteriores
  • Lista branca de coautores (trabalho anterior de colaborador)
  • Exporta relatório de classificação em PDF para colaboradores
PESQUISADOR PRINCIPAL DE LABORATÓRIO

QA pré-publicação para todo o laboratório

Detecte problemas nas submissões do laboratório numa fila só.

  • Pasta por projeto + por pós-doc
  • Residência na UE para dados clínicos/sensíveis
  • Motor Apache 2.0 — defensável perante o comitê de ética
FLUXO PRÉ-SUBMISSÃO

Três etapas antes de o manuscrito entrar no sistema do periódico.

Rode de modo iterativo. Detecte intervalos autocitados para que não inflacionem sua pontuação iThenticate / Crossref na submissão. Detecção de IA chegando em breve, para que você possa pré-visualizar antes que o revisor 2 levante a questão.

01

01 · Esboce e crie lista branca

Envie o rascunho do capítulo/manuscrito. Adicione seu ORCID + lista de DOIs (lista branca) — seus próprios trabalhos publicados são marcados como SELF-CITE, não plágio. Inclui DOIs de coautores se houver colaboração; o motor reconhece reutilização legítima.

02

02 · Execute a cascata

L1 winnowing → web ao vivo atualmente, com L2 MinHash (v1.1) e L3 embeddings vetoriais (v1.2) previstos para as próximas versões. Identifica cópias literais e quase literais; a detecção de paráfrases estará disponível com L2 e L3. A classificação de citações separa trechos citados de paráfrases não citadas. Multilíngue, com calibração para detecção em inglês, espanhol, português, polonês e ucraniano no lançamento, e mais idiomas em breve. Mediana de 47 segundos por manuscrito.

03

03 · Revise e itere

O relatório classifica intervalos por categoria: SELF-CITE (seus, esperados), CITED (citados com atribuição, esperados), CITED-PARA (paráfrase citada, peso baixo), UNCITED-PARA (exige atenção) e AI-LIKELY (com faixa ajustada para ESL) em breve. Reprodutível — commit do motor + snapshot do corpus em cada relatório.

TRATAMENTO DE AUTOCITAÇÃO

Seis categorias de reutilização acadêmica legítima — nenhuma deve aumentar sua pontuação.

Ferramentas caixa-preta tratam todo texto coincidente como plágio. Pesquisadores reutilizam texto de modo legítimo com frequência. Veja como o classificador faz isso.

01 · SEU PRÓPRIO TRABALHO ANTERIOR

Lista branca ORCID + DOI. Seus artigos já publicados são marcados como SELF-CITE caso coincidam — não plágio. Comum em revisões de literatura (“como argumentei em Chen 2023…”) e projetos que expandem seu trabalho anterior.

02 · TRABALHO COAUTORADO

Inclua ORCIDs de colaboradores na lista branca. Artigos coautorados são marcados como CO-CITE. Útil para manuscritos desenvolvidos a partir de artigo em coautoria — métodos padrão podem ser legítimos.

03 · TEXTO DE HERANÇA DE LAB

Corpus compartilhado por pasta PI: métodos padronizados, protocolos, declarações éticas comuns a publicações do lab. Marcado como LAB-CITE e fora da pontuação. Boilerplate aprovado pelo comitê não precisa ser reescrito sempre.

04 · PRÉ-PRINTS EM EMBARGO

Pré-print arXiv / bioRxiv do manuscrito submetido. O classificador reconhece evolução para versão de artigo e marca como PREPRINT-SELF. Não conta na pontuação. Periódico que rejeita pré-print pode configurar regras mais rígidas.

05 · CITAÇÕES RETRATADAS

Integração Crossref Retraction Watch marca qualquer intervalo que cite artigo retratado. Não altera a pontuação — mas é importante saber antes da submissão. Pega o “citei artigo retratado mês passado” antes que o revisor 2 note.

06 · IRB / SENSÍVEL

Endpoint com residência na UE (api.eu.noplag.com) mantém o manuscrito em infraestrutura da UE. Motor pode ser totalizado em sua rede para HIPAA / GDPR / dados de paciente. Apache 2.0 + Docker; nada trafega fora do seu VPC.

MINHAS PASTAS · VISÃO DO LAB

Organizado por projeto. Registro por data.

Agrupe manuscritos por projeto, ano do lab ou ciclo de financiamento. Re-execute contra o mesmo commit do motor — resultados reprodutíveis meses depois.

MINHAS PASTAS · Dr. Hirano lab · CompBio24 manuscritos · 6 projetos
RESIDÊNCIA UENova pasta
PASTADOCSATIVIDADE MAIS RECENTEREGIÃO
Projeto: coorte expressão PD-L18 manuscritosrascunho v3 verificado · 2h atrásUE
Projeto: revisão de segurança sintética5 manuscritospronto para submissão · ontemUE
Projeto: renovação NIH R01 Y33 manuscritosrevisão de literatura v2 · 2d atrásUE
Herança do lab: métodos + ética4 docs · compartilhadoslista branca do lab atualizada · 1s atrásUE
Pré-prints: arXiv pendentes2 manuscritosPREPRINT-SELF marcado · 1s atrásUE
Arquivados (2022–2024)12 artigosconjunto de referência de autocitaçãoUE
Todas as pastas com residência na UE · criptografadas · commit do motor auditável em cada relatórioreprodutibilidade: motor v0.4.2 ativo
700M+trabalhos acadêmicos indexados
5idiomas com detecção no lançamento, expandindo
UEendpoint de residência disponível
Apache2.0 · auditável pelo comitê de ética
Crossref+ integração Retraction Watch
PROTEÇÃO DE DADOS

Três requisitos de pesquisa sensível para o verificador.

01 · RESIDÊNCIA UE

Manuscritos nunca saem da infraestrutura UE

Pro+ provisionado em api.eu.noplag.com. Hospedado em data centers da UE Hetzner (Falkenstein + Helsinki). Submissão, repositório de impressões digitais e relatório ficam na UE. Compatível com GDPR por padrão; DPA sob demanda.

Útil para colaborações UE-Horizon Europe.
02 · AUTOGESTÃO

Execute o motor na sua própria instituição

Apache 2.0 + Docker compose. Pipeline completo pode ser executado em sua infraestrutura. Use seu próprio Postgres + Redis; corpus é enviado como bundle indexável para Enterprise. Nenhum tráfego sai do seu VPC. Responde a dados de ensaios clínicos, estudos de caso de pacientes, pesquisas sensíveis.

Compatível com clusters Slurm e autenticação institucional existente (SAML, LDAP, OIDC).
03 · DIREITO AO APAGAMENTO

Exclua toda impressão digital que mantemos de você

Um clique em Configurações. Em até 24h, toda impressão digital, relatório, entrada de lista branca e metadados de sua conta é apagada. Compatível com GDPR Artigo 17. Autogestores têm acesso direto ao banco de dados; usuários da nuvem têm endpoint de exclusão documentado.

Log de exclusão auditável armazenado para compliance.
AUDITÁVEL PELO COMITÊ DE ÉTICA

Um motor Apache 2.0 que o comitê realmente pode revisar antes de aprovar.

Revisões institucionais de software acadêmico normalmente travam nas mesmas questões: para onde vai o manuscrito, como funciona o algoritmo de comparação, dados de paciente/sensíveis têm tráfego externo, qual caminho para apagar, a precisão publicada é reproduzível. Fornecedores proprietários respondem em chamada de vendas. Com Apache 2.0, o comitê pode clonar o repositório, rodar o motor em sandbox, auditar fluxos de dados, validar o direito ao apagamento, e checar pontuações F1 publicadas em seu próprio conjunto de testes. Não propomos menos revisão — propomos revisão que realmente pode ser feita. Por isso escritórios de dados acadêmicos que recusavam outros fornecedores estão assinando este.

Leia o guia de revisão do comitê
QUESTÕES DO COMITÊ, RESPONDIDAS
Q1Para onde vai o manuscrito? — Postgres isolado por tenant na UE se está no endpoint de residência. Texto original apagado após 30 dias, salvo se retenção ativada.
Q2Usa manuscritos submetidos para treinar? — Não. Manuscritos nunca alimentam os modelos de detecção. Explicado no DPA.
Q3Tratamento de dados sensíveis? — Motor pode ser totalizado em sua rede. Nenhum tráfego sai do VPC. Implantação compatível com HIPAA.
Q4Revisão do algoritmo? — Apache 2.0 em github.com/NoplagLabs/noplag-engine. Código legível, auditável e reprodutível.
Q5Acesso multi-institucional? — Controle por tenant/permissão. Logs de leitura. Ou autohospede e os dados não saem da instituição.
Q6Direito ao apagamento? — Um clique nas Configurações. 24h. Compatível com GDPR Art. 17. Log de auditoria mantido.
PERGUNTAS FREQUENTES

Perguntas que o escritório de pesquisa realmente faz.

Por que minha pontuação muda quando adiciono meu ORCID + DOIs?
Porque o motor reclassifica todo intervalo coincidente com trabalho na lista branca como SELF-CITE, não UNCITED-PARA. As coincidências não somem — são marcadas diferente. SELF-CITE tem peso quase zero na pontuação. Exemplo: capítulo da sua tese cita seu próprio pré-print duas vezes e um artigo de coautor: mudam três intervalos de “contado” para “reciclagem acadêmica esperada”.
O motor treina com manuscritos enviados?
Não. O texto submetido é fingerprinted (só hashes não reversíveis) e fica isolado por tenant. O texto em si apaga após 30 dias salvo retenção. Detector de IA via Binoculars — chegando em breve — será pré-treinado em corpora públicos; não usamos manuscritos do cliente. Explicitado no DPA.
E meu pré-print no arXiv / bioRxiv?
Se listar o DOI do pré-print na lista branca, coincide como PREPRINT-SELF e não soma na pontuação. O motor reconhece a evolução para versão de periódico como esperada. Periódicos que rejeitam pré-print podem configurar regras mais rígidas — mas a maioria aceita (Nature, Cell, NEJM, PLOS) e a marcação condiz com suas políticas.
Como o detector de IA deve lidar com coautores ESL?
A detecção de AI estará disponível em breve — prevista para a v1.2. Quando lançada, usará calibração por idioma com veredito ajustado para ESL. Se a assinatura lexical indicar inglês não nativo (comum em colaborações multinacionais), o veredito será ESL ADJ com erro residual documentado, em vez de afirmar zero erro. O artigo de Liang et al. 2023 mediu 61,3% de FPR em redações TOEFL para detectores ingênuos; publicamos nossa metodologia de mitigação em /docs/developers/benchmarks. Coautores ESL não são sinalizados de forma injusta.
Posso rodar o motor em cluster Slurm para checagem em lote?
Sim — Apache 2.0 + Docker. Execute o container do engine nos nós de computação do seu cluster; ingira a partir do seu sistema de arquivos compartilhado; emita relatórios em JSON para onde seu pipeline consome. Útil para verificar em lote a produção de um ano de laboratório contra o snapshot mais recente do corpus. Exemplo de script Slurm sbatch em github.com/NoplagLabs/noplag-engine.
E manuscritos com dados clínicos/de paciente?
Autohospede em seu VPC. Nenhum tráfego externo. O motor não precisa de internet para checks no corpus — mas perde a camada live-web (opcional). Compatível com HIPAA se a infra for configurada; sua TI administra como serviço interno.
O que isto difere do iThenticate na submissão?
iThenticate roda só na submissão e o editor vê o resultado — você não pode iterar. Noplag é o seu auto-check antes disso. A cascata é comparável para conteúdo open-access (até mais ampla, pós-Plan-S); mais limitada para conteúdo pago/assinatura para o qual iThenticate tem licença. Autocitação é o que a maioria precisa e o iThenticate não resolve bem.
Integra com gerenciador de referências (Zotero / Mendeley / EndNote)?
Ingestão da lista branca aceita BibTeX, RIS e ORCID API. Exporte sua biblioteca do Zotero ou cole seu ORCID; em segundos sua lista branca recebe todos DOIs. Sincronização em tempo real com Mendeley e EndNote está no roadmap v1.2; no momento só por exportação.
Como é a cobertura para pesquisas em idioma não inglês?
A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas em breve. Melhor desempenho em idiomas europeus (histórico longo de calibração). A qualidade da detecção é avaliada no PAN-PC-11; a avaliação por idioma está no roadmap. Útil especialmente para contextos acadêmicos europeus e sul-americanos.
O que acontece se artigo citado for retratado após submissão?
A integração Crossref Retraction Watch marca a cada nova verificação do manuscrito. Se já submeteu, deve avisar o editor (alguns periódicos exigem manejo explícito de retratação pós-submissão). Não altera pontuação, mas evita surpresas do revisor 2.

Rode um capítulo na cascata. Veja a classificação das autocitações.

Envie o rascunho de um manuscrito, capítulo de dissertação ou revisão de literatura para projeto. Adicione seu ORCID. Veja quais intervalos são SELF-CITE, CITED e UNCITED-PARA, com AI-LIKELY em breve. Gratuito até 2.500 palavras. Pro+ com residência UE para material sensível antes da publicação.

Detector de plágio para pesquisadores pré-submissão