Base de Conhecimento
Fase
Tipo
Tela
Academia
Navegar na documentação ▾
📘 Documentação Fase 4 — Consolidação 7 min de leitura

Fase 4 — Consolidação e Enriquecimento

Após a coleta nas bases automáticas e manuais, o conjunto bruto de documentos inevitavelmente contém sobreposições: o mesmo artigo retornado por Scopus e Web of Science, ou por duas expressões de busca distintas dentro da mesma base. A Consolidação resolve essa sobreposição de forma sistemática e auditável, produzindo uma base única e confiável — sem duplicatas — que será a entrada para a Triagem. O resultado é registrado no funil PRISMA como a transição de “registros identificados” para “registros após remoção de duplicatas”.


Deduplicação Automática (Smart Merge)

O Tykyra aplica uma deduplicação em quatro camadas sequenciais, cada uma atuando sobre os registros que escaparam das camadas anteriores:

  1. DOI idêntico: dois registros com o mesmo DOI são tratados como o mesmo documento — a camada mais precisa e de menor risco de falso positivo.
  2. Fingerprint de título e resumo: o sistema normaliza o texto (remove acentos e caracteres especiais) e compara o hash resultante — captura variações de codificação que deixariam o DOI inutilizável.
  3. Título e resumo diretos: comparação literal após normalização básica, para casos onde o DOI está ausente em ao menos um dos registros.
  4. Título e ano (fallback): usada quando o resumo está vazio nos dois registros — garante que documentos sem abstract preenchido não escapem da deduplicação.

Informação

Antes de comparar, o DOI é normalizado: os espaços nas pontas são removidos, as letras viram minúsculas e o prefixo de endereço web do provedor é retirado. Assim, o mesmo DOI escrito com ou sem o endereço completo do provedor é reconhecido como o mesmo documento. Essa normalização acontece uma única vez, no momento em que o documento é salvo no banco — não é recalculada a cada comparação.

Os prefixos removidos na normalização são: https://doi.org/, http://doi.org/, https://dx.doi.org/, http://dx.doi.org/ e doi:. Por exemplo, um DOI salvo como https://doi.org/10.1000/ABC e outro salvo como 10.1000/abc são reconhecidos como o mesmo documento.

O pesquisador configura os pesos do Smart Merge (Título/Resumo, Autores, Ano, Citações, Links) antes de executar. A deduplicação é totalmente automática — não há interface de revisão par a par — e o resultado é apresentado no funil de consolidação com as métricas de cada camada: quantos registros foram removidos por DOI, por fingerprint, por título+resumo e por título+ano, chegando ao total consolidado final.

O botão “Executar Consolidação” não roda se não houver documentos coletados, e a consolidação é bloqueada se a contagem de documentos ultrapassar o limite do plano (ver Planos e Perfis de Acesso).

Tela correspondente: Consolidação


Enriquecimento de Metadados (Colaborador)

Após a deduplicação, os registros consolidados podem ser enriquecidos com metadados adicionais via DOI: o Tykyra consulta fontes externas para complementar campos como autores, periódico, volume, páginas e palavras-chave quando esses dados estão ausentes ou incompletos no registro original. O progresso do enriquecimento é exibido em tempo real com um terminal de log.

O enriquecimento é opcional e está disponível para usuários com plano Colaborador. Ele não altera nem substitui campos já preenchidos — apenas preenche lacunas.


Análises Consolidadas e Visualizador da Coleção

Após consolidar, três abas ficam disponíveis para análise da base resultante:

  • Funil: gráfico do fluxo de deduplicação (total coletado → removidos por camada → consolidado final), exportável em PNG ou SVG.
  • Tabela: estatísticas por base e por expressão de busca (documentos, fontes ativas, lógicas únicas).
  • Análises: distribuição temporal por ano, Top 20 documentos mais citados, autores e periódicos mais frequentes.

Para uma inspeção mais profunda do conjunto antes da consolidação, o Tykyra oferece o Visualizador da Coleção (disponível para usuários Colaborador): uma janela separada que exibe os documentos brutos com filtros por base, expressão de busca e campo de busca (título, resumo, autores, DOI), além de uma análise de duplicatas com a matriz base×base (heatmap de sobreposição entre pares de bases) e um painel de leitura com destaque de registros duplicados.

Tela correspondente: Visualizador da Coleção


Contagem de duplicados para o relato PRISMA

O item 8 do checklist PRISMA 2020 exige que o relato da revisão informe quantos registros foram removidos por duplicidade. O funil da Consolidação apresenta os dois lados dessa conta: o detalhamento por camada (quantos registros saíram por DOI, por fingerprint, por título+resumo e por título+ano) e o total consolidado final — o card verde “Total Consolidado / Pronto para Triagem”, com o percentual em relação ao total coletado.

Um ponto importante para o relato: boa parte da deduplicação por DOI já acontece durante a Coleta (Fase 3) — quando uma busca reencontra um documento já salvo, o sistema vincula uma nova origem ao mesmo documento em vez de criar um registro duplicado. Por isso, ao chegar na Consolidação, parte da sobreposição entre bases já foi resolvida, e as camadas desta fase podem remover pouco ou nada adicional — o que é esperado, não um erro.

Como a deduplicação ocorre nas duas fases, o número honesto de duplicados removidos para o relato PRISMA é a diferença entre o total coletado e o total consolidado final, independentemente de em qual fase cada duplicata foi efetivamente eliminada:

Duplicados removidos (total) = total de registros coletados − total de documentos consolidados


Gate de Finalização

O botão “Finalizar e Ir para Critérios” segue as seguintes regras:

  • 0 documentos consolidados: desabilitado (é necessário ter ao menos um documento para avançar).
  • 1 documento: habilitado sem exigir que a consolidação tenha sido executada (com apenas um registro, a deduplicação é irrelevante).
  • 2 ou mais documentos: exige que a consolidação tenha sido executada ao menos uma vez.

O motivo da mensagem de desabilitação é exibido como tooltip no próprio botão.


Entradas, Processamento e Saídas

  • Entradas: documentos brutos coletados na Fase 3, organizados por base e expressão de busca.
  • Processamento: deduplicação automática em quatro camadas com métricas de funil por etapa; enriquecimento opcional de metadados via DOI (Colaborador); geração de análises de distribuição temporal, autores e periódicos.
  • Saídas: coleção consolidada e deduplicada, com funil PRISMA parcial registrado, pronta como base de trabalho para a Fase 5 (Triagem); status CONSOLIDACAO_REALIZADA gravado no projeto.

Decisões Metodológicas

DecisãoJustificativa
Deduplicação automática em quatro camadas sem revisão par a parGarantir que toda a deduplicação seja rastreável (métricas por camada no funil) e consistente, sem depender de julgamento manual para cada par de registros — reduz viés e tempo de execução em coleções grandes
DOI como primeira camada de deduplicaçãoO DOI é o identificador mais confiável na literatura científica; usá-lo primeiro minimiza falsos positivos nas camadas seguintes, que precisam de heurísticas de similaridade textual
Gate de finalização por contagem, não por execução obrigatóriaPermitir que pesquisadores com coleções muito pequenas (1 documento) avancem sem forçar uma etapa desnecessária, enquanto exige a execução para volumes onde a deduplicação é relevante
DOI normalizado (minúsculas, sem espaços nas pontas e sem prefixo de URL/protocolo) como chave de comparação e de armazenamentoEvita falsos negativos quando bases diferentes retornam o mesmo DOI em formatos distintos (com ou sem URL completa, maiúsculas/minúsculas)
Contagem de duplicados removidos para o relato PRISMA é a diferença bruta entre total coletado e total consolidado, não apenas o que a camada de Consolidação removeuAlinha ao item 8 do PRISMA 2020 mesmo quando parte da deduplicação já ocorreu na Coleta, evitando subestimar o total real de duplicatas eliminadas

Próximos Passos

Com a coleção consolidada e deduplicada, o pesquisador avança para a Fase 5 — Triagem, onde serão definidos os critérios de exclusão automática e, em seguida, realizada a triagem manual (com possibilidade de apoio de IA) documento a documento. Veja Fase 5 — Triagem.


Referências

O PRISMA 2020 exige que o relatório da revisão informe explicitamente o número de registros removidos por duplicata e o método utilizado (item 8). O funil de consolidação do Tykyra registra exatamente essas métricas por camada, facilitando o preenchimento desse item no relato final.