Capítulo 76 min de leitura·Manual Oficial · Versão 2026

Cross-model validation, investigating disagreements, and converging above 90% agreement.

7 · Validação e o Juiz de IA

Extração por si só não é confiança. A resposta de Sci-database para "como posso saber se meu banco de dados é preciso?" é validação de modelo cruzado: um modelo de IA independente extrai novamente uma amostra de seus artigos do zero, e a plataforma mostra exatamente onde os dois modelos concordam e discordam — campo por campo, registro por registro. Isto reflete a prática de extração dupla de revisões sistemáticas no estilo Cochrane, com modelos em vez de estudantes de pós-graduação.

Iniciando uma validação

Na guia Database, clique em Validate em qualquer tarefa concluída. A aba Validate é aberta com os controles de configuração:

Configuração de validação

  • Validation Sample — um controle deslizante de 1–100% (padrão 20%) dos artigos que produziram dados. Você não precisa validar tudo para saber sua precisão: uma amostra aleatória é como funciona a auditoria.
  • Modelo de validação — escolha o segundo leitor:
    • Gemini 3.1 Flash Lite (padrão) ou Gemini 3.1 Pro
    • GPT-4o-mini (OpenAI) — traga sua própria chave de API
    • Claude 3.5 Sonnet (Anthropic) — traga sua própria chave de API

Para modelos OpenAI/Anthropic, uma caixa de diálogo solicita sua chave de API e informa: "Esta chave será usada apenas para esta sessão de validação e não será armazenada."

  • Iniciar validação — custa 2 créditos por amostra de papel. O progresso é mostrado como "Validando i/N".

O modelo validador recebe o mesmo texto completo do artigo e o mesmo esquema, mas com instruções próprias ainda mais rígidas (analisar o documento completo, nunca confiar apenas no resumo; sem abreviações; especificidade máxima; precisão numérica exata; N/A quando ausente).

Lendo os resultados

Resultados da validação

O cabeçalho mostra a porcentagem geral de concordância em todos os campos validados, e cada artigo recebe seu próprio selo de concordância. Cheque verde = acordo total; triângulo vermelho = divergências encontradas. Um campo conta como discordância somente quando o validador retornou um valor não vazio diferente — se o validador não encontrou nada para um campo, isso é marcado como neutro (ℹ), não um conflito.

Expanda qualquer papel para ver a tabela Comparação de Registros:

Comparação campo por campo

Coluna Conteúdo
Field Seu campo de esquema
Original (Kateeb) O que a primeira extração encontrou
Status ✅ correspondência · ⚠️ incompatibilidade (linha destacada em vermelho) · ℹ️ validador não encontrou nada
Validado (modelo) O que o segundo modelo encontrou

Nada fica oculto e nada é corrigido automaticamente: cada linha vermelha é uma pergunta que a plataforma está fazendo para você.

O Juiz de IA: investigando divergências

Para qualquer artigo abaixo de 100% de concordância, clique em Investigar (2 créditos por discrepância). Uma terceira IA atua como um juiz especialista: ele relê o texto completo do artigo para cada campo disputado e deve retornar um dos dois valores candidatos, um valor para o qual pode apontar diretamente no texto, ou N/A — mais um raciocínio de uma ou duas frases.

O resultado aparece embutido como uma linha Resultado da Investigação com o valor final e o raciocínio do árbitro. A partir daí, o valor resolvido do árbitro torna-se a referência para aquele campo: a pontuação do acordo é recalculada em relação a ele.

Você pode baixar a comparação completa como Relatório — um CSV (validation_report_job_….csv) com colunas Título do papel, Índice de registro, Nome do campo, Valor original, Valor validado, Correspondência — pronto para anexar aos materiais suplementares de um manuscrito.

Fechando o ciclo: Melhorando o Esquema

A maioria das divergências não são falhas de modelo - são descrições de campo ambíguas ("eficiência" - de quê? inicial ou estabilizada? qual unidade?). Clique em Melhorar Esquema (5 créditos) e a IA analisa as discrepâncias investigadas e propõe melhores campos descrições (nomes e tipos nunca são tocados).

Cada sugestão mostra o raciocínio, a descrição antiga (vermelho) e uma descrição sugerida editável (verde); você Aceitar e editar ou Rejeitar por campo. As alterações aceitas chegam ao seu editor de esquema - salve o esquema e, em seguida, execute novamente a extração.

Convergindo para 90%+

Este é o ciclo de confiança em torno do qual a plataforma foi projetada:

  extract  →  validate (2nd model)  →  investigate (AI Judge)  →  improve schema  →  re-run
     ▲                                                                                │
     └────────────────────────────────────────────────────────────────────────────────┘

Uma trajetória típica ao longo das passagens: ~70% de concordância na primeira execução bruta (modelos discordam em unidades e campos ambíguos) → ~85% após refinar o esquema → 90%+, o limite de confiança da plataforma, ponto em que a discordância é confinada a decisões de julgamento genuinamente difíceis que você julgou pessoalmente. Seu banco de dados agora é algo que você pode defender na revisão por pares – com o relatório de validação para provar isso.


Próximo: Seu banco de dados e exportações →

Precisa de ajuda? Consulte o FAQ.
    7 · Validation & the AI Judge | Sci-database Documentation