Cross-model validation, investigating disagreements, and converging above 90% agreement.
7 · सत्यापन और एआई जज
अकेले निष्कर्षण पर भरोसा नहीं है। Sci-database का उत्तर "मुझे कैसे पता चलेगा कि मेरा डेटाबेस सटीक है?" क्रॉस-मॉडल सत्यापन है: एक स्वतंत्र एआई मॉडल स्क्रैच से आपके कागजात का एक नमूना फिर से निकालता है, और प्लेटफ़ॉर्म आपको दिखाता है कि दोनों मॉडल कहां सहमत और असहमत हैं - फ़ील्ड दर फ़ील्ड, रिकॉर्ड दर रिकॉर्ड। यह स्नातक छात्रों के बजाय मॉडल के साथ Cochrane-शैली व्यवस्थित समीक्षाओं के दोहरे-निष्कर्षण अभ्यास को प्रतिबिंबित करता है।
सत्यापन प्रारंभ करना
Database टैब में, किसी भी पूर्ण कार्य पर Validate पर क्लिक करें। Validate टैब सेटअप नियंत्रणों के साथ खुलता है:

- सत्यापन नमूना - डेटा उत्पन्न करने वाले कागजात के 1-100% (डिफ़ॉल्ट 20%) से एक स्लाइडर। आपको अपनी सटीकता जानने के लिए हर चीज़ को सत्यापित करने की आवश्यकता नहीं है: एक यादृच्छिक नमूना यह बताता है कि ऑडिट कैसे काम करता है।
- सत्यापन मॉडल — दूसरा पाठक चुनें:
- मिथुन 3.1 फ्लैश लाइट (डिफ़ॉल्ट) या मिथुन 3.1 प्रो
- जीपीटी-4ओ-मिनी (ओपनएआई) — अपनी स्वयं की एपीआई कुंजी लाएँ
- क्लाउड 3.5 सॉनेट (एंथ्रोपिक) — अपनी स्वयं की एपीआई कुंजी लाएँ
ओपनएआई/एंथ्रोपिक मॉडल के लिए एक संवाद आपकी एपीआई कुंजी मांगता है और कहता है: "इस कुंजी का उपयोग केवल इस सत्यापन सत्र के लिए किया जाएगा और संग्रहीत नहीं किया जाएगा।"
- मान्यीकरण प्रारंभ करें — लागत 2 क्रेडिट प्रति नमूना पेपर। प्रगति "सत्यापन i/N" के रूप में दिखाई देती है।
सत्यापनकर्ता मॉडल को समान पूर्ण पेपर टेक्स्ट और आपका समान स्कीमा प्राप्त होता है, लेकिन अपने स्वयं के और भी सख्त निर्देशों के साथ (पूर्ण दस्तावेज़ का विश्लेषण करें, कभी भी अकेले सार पर भरोसा न करें; कोई संक्षिप्तीकरण नहीं; अधिकतम विशिष्टता; सटीक संख्यात्मक सटीकता; अनुपस्थित होने पर N/A)।
परिणाम पढ़ना

हेडर सभी मान्य फ़ील्ड में समग्र अनुबंध प्रतिशत दिखाता है, और प्रत्येक पेपर को अपना स्वयं का अनुबंध बैज मिलता है। हरा चेक = पूर्ण सहमति; लाल त्रिकोण = असहमति पाई गई। एक फ़ील्ड को असहमति के रूप में तभी गिना जाता है जब सत्यापनकर्ता ने भिन्न गैर-रिक्त मान लौटाया हो - यदि सत्यापनकर्ता को किसी फ़ील्ड के लिए कुछ भी नहीं मिला, तो उसे तटस्थ (ℹ) के रूप में चिह्नित किया जाता है, संघर्ष के रूप में नहीं।
रिकॉर्ड तुलना तालिका देखने के लिए किसी भी पेपर का विस्तार करें:

| कॉलम | सामग्री |
|---|---|
| फ़ील्ड | आपका स्कीमा फ़ील्ड |
| मूल (Kateeb) | पहला निष्कर्षण क्या मिला |
| स्थिति | ✅ मिलान · ⚠️ बेमेल (पंक्ति लाल रंग में हाइलाइट की गई) · ℹ️ सत्यापनकर्ता को कुछ नहीं मिला |
| मान्य (मॉडल) | दूसरा मॉडल क्या मिला |
कुछ भी छिपा नहीं है और कुछ भी स्वतः-सुधारित नहीं है: प्रत्येक लाल पंक्ति एक प्रश्न है जो मंच आपसे पूछ रहा है।
एआई न्यायाधीश: असहमति की जांच
100% सहमति से नीचे के किसी भी पेपर के लिए, जांच (प्रति विसंगति 2 क्रेडिट) पर क्लिक करें। एक तीसरा एआई एक विशेषज्ञ निर्णायक के रूप में कार्य करता है: यह प्रत्येक विवादित क्षेत्र के लिए पूर्ण पेपर पाठ को दोबारा पढ़ता है और उसे दो उम्मीदवार मूल्यों में से एक को वापस करना होगा, एक मूल्य जो इसे सीधे पाठ में इंगित कर सकता है, या N/A - प्लस एक-से-दो वाक्य तर्क।
परिणाम अंतिम मान और मध्यस्थ के तर्क के साथ जांच परिणाम पंक्ति के रूप में इनलाइन दिखाई देता है। तब से, मध्यस्थ का हल किया गया मान उस क्षेत्र के लिए संदर्भ बन जाता है: समझौते का स्कोर इसके विरुद्ध पुनर्गणना किया जाता है।
आप पूर्ण तुलना को रिपोर्ट के रूप में डाउनलोड कर सकते हैं - एक CSV (validation_report_job_….csv) कॉलम के साथ पेपर शीर्षक, रिकॉर्ड इंडेक्स, फ़ील्ड नाम, मूल मूल्य, मान्य मूल्य, मिलान है - पांडुलिपि की पूरक सामग्री के साथ संलग्न करने के लिए तैयार है।
लूप बंद करना: स्कीमा में सुधार करें
अधिकांश असहमति मॉडल विफलताएं नहीं हैं - वे अस्पष्ट फ़ील्ड विवरण ("दक्षता" - किसकी? प्रारंभिक या स्थिर? कौन सी इकाई?) हैं। स्कीमा में सुधार (5 क्रेडिट) पर क्लिक करें और एआई जांच की गई विसंगतियों का विश्लेषण करता है और बेहतर क्षेत्र वर्णन का प्रस्ताव करता है (नाम और प्रकार कभी नहीं छुए जाते हैं)।
प्रत्येक सुझाव तर्क, पुराना विवरण (लाल) और एक संपादन योग्य सुझाया गया विवरण (हरा) दिखाता है; आप प्रति फ़ील्ड स्वीकार करें और संपादित करें या अस्वीकार करें। स्वीकृत परिवर्तन आपके स्कीमा संपादक में आते हैं - स्कीमा को सहेजें, फिर ** निष्कर्षण को फिर से चलाएँ**।
90%+ पर परिवर्तित हो रहा है
यह वह ट्रस्ट लूप है जिसके आधार पर प्लेटफ़ॉर्म डिज़ाइन किया गया है:
extract → validate (2nd model) → investigate (AI Judge) → improve schema → re-run
▲ │
└────────────────────────────────────────────────────────────────────────────────┘
पासों पर एक विशिष्ट प्रक्षेपवक्र: पहले कच्चे रन पर ~70% सहमति (मॉडल इकाइयों और अस्पष्ट क्षेत्रों पर असहमत हैं) → ~85% स्कीमा को परिष्कृत करने के बाद → 90%+, प्लेटफ़ॉर्म की विश्वास सीमा, जिस बिंदु पर असहमति वास्तव में कठिन निर्णय कॉल तक ही सीमित है जिसे आपने व्यक्तिगत रूप से निर्णय लिया है। आपका डेटाबेस अब कुछ ऐसा है जिसे आप सहकर्मी समीक्षा में बचाव कर सकते हैं - इसे साबित करने के लिए सत्यापन रिपोर्ट के साथ।