Cross-model validation, investigating disagreements, and converging above 90% agreement.
7 · Validação e o Juiz de IA
Extração por si só não é confiança. A resposta de Sci-database para "como posso saber se meu banco de dados é preciso?" é validação de modelo cruzado: um modelo de IA independente extrai novamente uma amostra de seus artigos do zero, e a plataforma mostra exatamente onde os dois modelos concordam e discordam — campo por campo, registro por registro. Isto reflete a prática de extração dupla de revisões sistemáticas no estilo Cochrane, com modelos em vez de estudantes de pós-graduação.
Iniciando uma validação
Na guia Database, clique em Validate em qualquer tarefa concluída. A aba Validate é aberta com os controles de configuração:

- Validation Sample — um controle deslizante de 1–100% (padrão 20%) dos artigos que produziram dados. Você não precisa validar tudo para saber sua precisão: uma amostra aleatória é como funciona a auditoria.
- Modelo de validação — escolha o segundo leitor:
- Gemini 3.1 Flash Lite (padrão) ou Gemini 3.1 Pro
- GPT-4o-mini (OpenAI) — traga sua própria chave de API
- Claude 3.5 Sonnet (Anthropic) — traga sua própria chave de API
Para modelos OpenAI/Anthropic, uma caixa de diálogo solicita sua chave de API e informa: "Esta chave será usada apenas para esta sessão de validação e não será armazenada."
- Iniciar validação — custa 2 créditos por amostra de papel. O progresso é mostrado como "Validando i/N".
O modelo validador recebe o mesmo texto completo do artigo e o mesmo esquema, mas com instruções próprias ainda mais rígidas (analisar o documento completo, nunca confiar apenas no resumo; sem abreviações; especificidade máxima; precisão numérica exata; N/A quando ausente).
Lendo os resultados

O cabeçalho mostra a porcentagem geral de concordância em todos os campos validados, e cada artigo recebe seu próprio selo de concordância. Cheque verde = acordo total; triângulo vermelho = divergências encontradas. Um campo conta como discordância somente quando o validador retornou um valor não vazio diferente — se o validador não encontrou nada para um campo, isso é marcado como neutro (ℹ), não um conflito.
Expanda qualquer papel para ver a tabela Comparação de Registros:

| Coluna | Conteúdo |
|---|---|
| Field | Seu campo de esquema |
| Original (Kateeb) | O que a primeira extração encontrou |
| Status | ✅ correspondência · ⚠️ incompatibilidade (linha destacada em vermelho) · ℹ️ validador não encontrou nada |
| Validado (modelo) | O que o segundo modelo encontrou |
Nada fica oculto e nada é corrigido automaticamente: cada linha vermelha é uma pergunta que a plataforma está fazendo para você.
O Juiz de IA: investigando divergências
Para qualquer artigo abaixo de 100% de concordância, clique em Investigar (2 créditos por discrepância). Uma terceira IA atua como um juiz especialista: ele relê o texto completo do artigo para cada campo disputado e deve retornar um dos dois valores candidatos, um valor para o qual pode apontar diretamente no texto, ou N/A — mais um raciocínio de uma ou duas frases.
O resultado aparece embutido como uma linha Resultado da Investigação com o valor final e o raciocínio do árbitro. A partir daí, o valor resolvido do árbitro torna-se a referência para aquele campo: a pontuação do acordo é recalculada em relação a ele.
Você pode baixar a comparação completa como Relatório — um CSV (validation_report_job_….csv) com colunas Título do papel, Índice de registro, Nome do campo, Valor original, Valor validado, Correspondência — pronto para anexar aos materiais suplementares de um manuscrito.
Fechando o ciclo: Melhorando o Esquema
A maioria das divergências não são falhas de modelo - são descrições de campo ambíguas ("eficiência" - de quê? inicial ou estabilizada? qual unidade?). Clique em Melhorar Esquema (5 créditos) e a IA analisa as discrepâncias investigadas e propõe melhores campos descrições (nomes e tipos nunca são tocados).
Cada sugestão mostra o raciocínio, a descrição antiga (vermelho) e uma descrição sugerida editável (verde); você Aceitar e editar ou Rejeitar por campo. As alterações aceitas chegam ao seu editor de esquema - salve o esquema e, em seguida, execute novamente a extração.
Convergindo para 90%+
Este é o ciclo de confiança em torno do qual a plataforma foi projetada:
extract → validate (2nd model) → investigate (AI Judge) → improve schema → re-run
▲ │
└────────────────────────────────────────────────────────────────────────────────┘
Uma trajetória típica ao longo das passagens: ~70% de concordância na primeira execução bruta (modelos discordam em unidades e campos ambíguos) → ~85% após refinar o esquema → 90%+, o limite de confiança da plataforma, ponto em que a discordância é confinada a decisões de julgamento genuinamente difíceis que você julgou pessoalmente. Seu banco de dados agora é algo que você pode defender na revisão por pares – com o relatório de validação para provar isso.
Próximo: Seu banco de dados e exportações →