第 7 章6 分钟阅读·官方手册 · 2026 版本

Cross-model validation, investigating disagreements, and converging above 90% agreement.

7 · 验证与人工智能法官

仅仅提取并不是信任。 Sci-database 对*“我如何知道我的数据库是否准确?”* 的回答是跨模型验证:一个独立的 AI 模型从头开始重新提取您的论文样本,平台会向您准确显示两个模型一致和不一致的地方 — 逐个字段、逐条记录。这反映了Cochrane式系统评价的双重提取实践,用模型代替研究生。

开始验证

在 Database 选项卡中,在任何已完成的作业上单击 Validate。 Validate 选项卡将打开,其中包含设置控件:

验证设置

  • 验证样本 — 产生数据的论文的 1–100%(默认 20%)的滑块。您无需验证所有内容即可了解准确性:随机样本就是审计的工作方式。
  • 验证模型 — 选择第二个阅读器:
    • Gemini 3.1 Flash Lite(默认)或Gemini 3.1 Pro
    • GPT-4o-mini (OpenAI) — 自带 API 密钥
    • Claude 3.5 Sonnet (Anthropic) — 自带 API 密钥

对于 OpenAI/Anthropic 模型,会出现一个对话框,要求您提供 API 密钥并指出:“此密钥将仅用于此验证会话,不会被存储。”

  • 开始验证 — 每份样本论文花费 2 个学分。进度显示为*“正在验证 i/N”*。

验证器模型接收相同的完整论文文本和相同的模式,但有自己更严格的指令(分析完整文档,永远不要单独依赖摘要;没有缩写;最大特异性;精确的数值精度;N/A 不存在时)。

读取结果

验证结果

标题显示所有已验证字段的总体协议百分比,并且每篇论文都有自己的协议徽章。绿色勾号=完全同意;红色三角形 = 发现分歧。仅当验证器返回不同的非空值时,字段才算作不一致 - 如果验证器没有找到字段的任何内容,则标记为中性(ℹ),而不是冲突。

展开任意论文即可查看记录比较表:

逐场比较

栏 内容
Field 您的架构字段
原图(Kateeb) 第一次提取发现了什么
状态 ✅ 匹配 · ⚠️ 不匹配(行以红色突出显示) · ℹ️ 验证器未发现任何内容
已验证(模型) 第二个模型发现了什么

没有任何内容被隐藏,也没有任何内容被自动更正:每个红行都是平台向您提出的问题。

AI 法官:调查分歧

对于低于 100% 一致性的任何论文,请单击 调查(每个差异 2 学分)。第三个人工智能充当专家裁决者:它重新阅读每个有争议领域的完整论文文本,并且必须返回两个候选值之一(它可以直接在文本中指向的值)或N/A - 加上一到两句话的推理。

结果内联显示为 调查结果 行,其中包含最终值和仲裁者的推理。从那时起,仲裁器的解析值成为该字段的参考:根据它重新计算协议分数。

您可以将完整比较下载为 报告 — CSV (validation_report_job_….csv),其中包含论文标题、记录索引、字段名称、原始值、验证值、匹配 — 可以随时附加到手稿的补充材料中。

闭环:改进架构

大多数分歧不是模型失败 - 它们是模糊的字段描述(“效率” - 什么?初始或稳定?哪个单位?)。单击改进架构(5学分),人工智能会分析调查的差异并提出更好的字段描述(名称和类型从未触及)。

每个建议都显示推理、旧描述(红色)和可编辑的建议描述(绿色);您对每个字段接受并编辑或拒绝。接受的更改会出现在您的模式编辑器中 - 保存模式,然后重新运行提取。

收敛到90%+

这是平台设计的信任循环:

  extract  →  validate (2nd model)  →  investigate (AI Judge)  →  improve schema  →  re-run
     ▲                                                                                │
     └────────────────────────────────────────────────────────────────────────────────┘

通行证的典型轨迹:第一次原始运行时约 70% 的一致性(模型在单位和模糊字段上存在分歧)→ 细化架构后约 85% → 90%+,平台的信任阈值,此时分歧仅限于您个人裁定的真正硬性判断。现在,您可以在同行评审中为您的数据库辩护——并用验证报告来证明这一点。


下一个: 您的数据库和导出 →

需要帮助?请查看常见问题或故障排除指南。
    7 · Validation & the AI Judge | Sci-database Documentation