अध्याय 76 मिनट पढ़ने का समय·आधिकारिक मैनुअल · संस्करण 2026

Cross-model validation, investigating disagreements, and converging above 90% agreement.

7 · सत्यापन और एआई जज

अकेले निष्कर्षण पर भरोसा नहीं है। Sci-database का उत्तर "मुझे कैसे पता चलेगा कि मेरा डेटाबेस सटीक है?" क्रॉस-मॉडल सत्यापन है: एक स्वतंत्र एआई मॉडल स्क्रैच से आपके कागजात का एक नमूना फिर से निकालता है, और प्लेटफ़ॉर्म आपको दिखाता है कि दोनों मॉडल कहां सहमत और असहमत हैं - फ़ील्ड दर फ़ील्ड, रिकॉर्ड दर रिकॉर्ड। यह स्नातक छात्रों के बजाय मॉडल के साथ Cochrane-शैली व्यवस्थित समीक्षाओं के दोहरे-निष्कर्षण अभ्यास को प्रतिबिंबित करता है।

सत्यापन प्रारंभ करना

Database टैब में, किसी भी पूर्ण कार्य पर Validate पर क्लिक करें। Validate टैब सेटअप नियंत्रणों के साथ खुलता है:

सत्यापन सेटअप

  • सत्यापन नमूना - डेटा उत्पन्न करने वाले कागजात के 1-100% (डिफ़ॉल्ट 20%) से एक स्लाइडर। आपको अपनी सटीकता जानने के लिए हर चीज़ को सत्यापित करने की आवश्यकता नहीं है: एक यादृच्छिक नमूना यह बताता है कि ऑडिट कैसे काम करता है।
  • सत्यापन मॉडल — दूसरा पाठक चुनें:
    • मिथुन 3.1 फ्लैश लाइट (डिफ़ॉल्ट) या मिथुन 3.1 प्रो
    • जीपीटी-4ओ-मिनी (ओपनएआई) — अपनी स्वयं की एपीआई कुंजी लाएँ
    • क्लाउड 3.5 सॉनेट (एंथ्रोपिक) — अपनी स्वयं की एपीआई कुंजी लाएँ

ओपनएआई/एंथ्रोपिक मॉडल के लिए एक संवाद आपकी एपीआई कुंजी मांगता है और कहता है: "इस कुंजी का उपयोग केवल इस सत्यापन सत्र के लिए किया जाएगा और संग्रहीत नहीं किया जाएगा।"

  • मान्यीकरण प्रारंभ करें — लागत 2 क्रेडिट प्रति नमूना पेपर। प्रगति "सत्यापन i/N" के रूप में दिखाई देती है।

सत्यापनकर्ता मॉडल को समान पूर्ण पेपर टेक्स्ट और आपका समान स्कीमा प्राप्त होता है, लेकिन अपने स्वयं के और भी सख्त निर्देशों के साथ (पूर्ण दस्तावेज़ का विश्लेषण करें, कभी भी अकेले सार पर भरोसा न करें; कोई संक्षिप्तीकरण नहीं; अधिकतम विशिष्टता; सटीक संख्यात्मक सटीकता; अनुपस्थित होने पर N/A)।

परिणाम पढ़ना

सत्यापन परिणाम

हेडर सभी मान्य फ़ील्ड में समग्र अनुबंध प्रतिशत दिखाता है, और प्रत्येक पेपर को अपना स्वयं का अनुबंध बैज मिलता है। हरा चेक = पूर्ण सहमति; लाल त्रिकोण = असहमति पाई गई। एक फ़ील्ड को असहमति के रूप में तभी गिना जाता है जब सत्यापनकर्ता ने भिन्न गैर-रिक्त मान लौटाया हो - यदि सत्यापनकर्ता को किसी फ़ील्ड के लिए कुछ भी नहीं मिला, तो उसे तटस्थ (ℹ) के रूप में चिह्नित किया जाता है, संघर्ष के रूप में नहीं।

रिकॉर्ड तुलना तालिका देखने के लिए किसी भी पेपर का विस्तार करें:

फ़ील्ड-दर-फ़ील्ड तुलना

कॉलम सामग्री
फ़ील्ड आपका स्कीमा फ़ील्ड
मूल (Kateeb) पहला निष्कर्षण क्या मिला
स्थिति ✅ मिलान · ⚠️ बेमेल (पंक्ति लाल रंग में हाइलाइट की गई) · ℹ️ सत्यापनकर्ता को कुछ नहीं मिला
मान्य (मॉडल) दूसरा मॉडल क्या मिला

कुछ भी छिपा नहीं है और कुछ भी स्वतः-सुधारित नहीं है: प्रत्येक लाल पंक्ति एक प्रश्न है जो मंच आपसे पूछ रहा है।

एआई न्यायाधीश: असहमति की जांच

100% सहमति से नीचे के किसी भी पेपर के लिए, जांच (प्रति विसंगति 2 क्रेडिट) पर क्लिक करें। एक तीसरा एआई एक विशेषज्ञ निर्णायक के रूप में कार्य करता है: यह प्रत्येक विवादित क्षेत्र के लिए पूर्ण पेपर पाठ को दोबारा पढ़ता है और उसे दो उम्मीदवार मूल्यों में से एक को वापस करना होगा, एक मूल्य जो इसे सीधे पाठ में इंगित कर सकता है, या N/A - प्लस एक-से-दो वाक्य तर्क।

परिणाम अंतिम मान और मध्यस्थ के तर्क के साथ जांच परिणाम पंक्ति के रूप में इनलाइन दिखाई देता है। तब से, मध्यस्थ का हल किया गया मान उस क्षेत्र के लिए संदर्भ बन जाता है: समझौते का स्कोर इसके विरुद्ध पुनर्गणना किया जाता है।

आप पूर्ण तुलना को रिपोर्ट के रूप में डाउनलोड कर सकते हैं - एक CSV (validation_report_job_….csv) कॉलम के साथ पेपर शीर्षक, रिकॉर्ड इंडेक्स, फ़ील्ड नाम, मूल मूल्य, मान्य मूल्य, मिलान है - पांडुलिपि की पूरक सामग्री के साथ संलग्न करने के लिए तैयार है।

लूप बंद करना: स्कीमा में सुधार करें

अधिकांश असहमति मॉडल विफलताएं नहीं हैं - वे अस्पष्ट फ़ील्ड विवरण ("दक्षता" - किसकी? प्रारंभिक या स्थिर? कौन सी इकाई?) हैं। स्कीमा में सुधार (5 क्रेडिट) पर क्लिक करें और एआई जांच की गई विसंगतियों का विश्लेषण करता है और बेहतर क्षेत्र वर्णन का प्रस्ताव करता है (नाम और प्रकार कभी नहीं छुए जाते हैं)।

प्रत्येक सुझाव तर्क, पुराना विवरण (लाल) और एक संपादन योग्य सुझाया गया विवरण (हरा) दिखाता है; आप प्रति फ़ील्ड स्वीकार करें और संपादित करें या अस्वीकार करें। स्वीकृत परिवर्तन आपके स्कीमा संपादक में आते हैं - स्कीमा को सहेजें, फिर ** निष्कर्षण को फिर से चलाएँ**।

90%+ पर परिवर्तित हो रहा है

यह वह ट्रस्ट लूप है जिसके आधार पर प्लेटफ़ॉर्म डिज़ाइन किया गया है:

  extract  →  validate (2nd model)  →  investigate (AI Judge)  →  improve schema  →  re-run
     ▲                                                                                │
     └────────────────────────────────────────────────────────────────────────────────┘

पासों पर एक विशिष्ट प्रक्षेपवक्र: पहले कच्चे रन पर ~70% सहमति (मॉडल इकाइयों और अस्पष्ट क्षेत्रों पर असहमत हैं) → ~85% स्कीमा को परिष्कृत करने के बाद → 90%+, प्लेटफ़ॉर्म की विश्वास सीमा, जिस बिंदु पर असहमति वास्तव में कठिन निर्णय कॉल तक ही सीमित है जिसे आपने व्यक्तिगत रूप से निर्णय लिया है। आपका डेटाबेस अब कुछ ऐसा है जिसे आप सहकर्मी समीक्षा में बचाव कर सकते हैं - इसे साबित करने के लिए सत्यापन रिपोर्ट के साथ।


अगला: आपका डेटाबेस और निर्यात →

मदद चाहिए? अक्सर पूछे जाने वाले प्रश्न देखें।
    7 · Validation & the AI Judge | Sci-database Documentation