Kapitel 64 Min. Lesezeit·Offizielles Handbuch · Version 2026

The Kateeb engine, multi-record extraction, zero-hallucination rules, and resume.

6 · Ausführen einer Extraktion

Mit überprüften Dateien in der Warteschlange und einem gespeicherten Schema sind Sie bereit für das Hauptereignis.

Starten eines Jobs

Klicken Sie auf der Registerkarte Dateien auf Process (N) Verified (oder Start 3-Pass AI Extraction im Floating Dock). Was passiert:

  1. 1 Credit pro Arbeit wird im Voraus berechnet.
  2. Es wird ein Auftrag erstellt, der Ihre Unterlagen und eine permanente Momentaufnahme Ihres Schemas enthält.
  3. Sie erhalten eine Bestätigungs-E-Mail („Sci-database Job Submitted“), der Toast ** „Job Submitted – N Papiere werden jetzt bearbeitet.“** erscheint und die App wechselt Sie automatisch zur Registerkarte Datenbank.

Auftrag übermittelt – Verarbeitung beginnt

Sie können den Browser schließen – die Verarbeitung wird auf dem Server fortgesetzt und die Ergebnisse werden Ihnen per E-Mail zugesandt.

Was passiert mit jedem Papier?

Die Papiere werden einzeln in der folgenden Reihenfolge verarbeitet:

  1. Das PDF wird heruntergeladen und sein Volltext extrahiert (bis zu ~950.000 Zeichen – ganze Arbeiten, nicht nur Abstracts).
  2. Die Kateeb-Engine liest den Text anhand Ihres Schemas unter strengen Anweisungen – den wichtigsten, wörtlich aus der Extraktionsaufforderung:
    • „Alle eindeutigen Datensätze finden, die dem Schema entsprechen“ – eine Arbeit kann mehrere Zeilen erzeugen (z. B. mehrere Materialien oder Studienarme).
    • „Wenn ein Papier für das Schema irrelevant ist, geben Sie ein leeres Array zurück“ – irrelevante Papiere ergeben nichts, kein Rauschen.
      • „Wenn der Wert für ein beliebiges Feld fehlt, nicht vorhanden ist oder Sie sich nicht zu 99 % sicher sind, MÜSSEN Sie die genaue Zeichenfolge „N/A“ zurückgeben. Verwenden Sie weder Null noch Schätzung.“*
    • „Für numerische Werte extrahieren Sie den genauen Wert aus dem Papier. Nicht runden.“
  3. Die extrahierten Datensätze und die Token-Nutzung werden im Job gespeichert.

Beobachten Sie den Fortschritt

Die Registerkarte Datenbank wird automatisch alle paar Sekunden aktualisiert, während ein Job ausgeführt wird. Jede Arbeit trägt ein Statusabzeichen:

Abzeichen Bedeutung
In der Warteschlange Warten, bis es an der Reihe ist
Verarbeitung (Spinner) Wird gerade gelesen
Abgeschlossen Extraktion abgeschlossen
Fehler Dieses Papier ist fehlgeschlagen (z. B. unlesbares/gescanntes PDF) – die Fehlermeldung wird auf dem Papier gespeichert

Status auf Jobebene: Verarbeitung → Abgeschlossen (alle Arbeiten erfolgreich), „X/Y abgeschlossen“ (teilweise erfolgreich – einige Arbeiten fehlgeschlagen) oder Fehler (keine erfolgreich).

Auftragsliste im Datenbank-Tab

Stoppen und fortfahren

  • Stop (⏹-Symbol in der Auftragszeile) hält den Arbeiter nach dem aktuellen Papier an: * „Auftrag gestoppt – Die Verarbeitung wird in Kürze angehalten.“* Bereits abgeschlossene Papiere behalten ihre Daten.
  • Fortsetzen (↻-Symbol) startet einen gestoppten oder teilweisen Job neu. Nur die unerledigten Arbeiten werden erneut in die Warteschlange gestellt und erneut aufgeladen (jeweils 1 Credit) – erledigte Arbeiten werden niemals erneut bearbeitet oder erneut berechnet.

Wenn der Job abgeschlossen ist

  • Sie erhalten eine E-Mail — "Sci-database Job Finished" — mit den Ergebnissen CSV im Anhang, sodass Ihre Datenbank in Ihrem Posteingang ist, noch bevor Sie zur App zurückkehren.
  • Die Karte „Nächster Schritt“ des Dashboards geht weiter zu „Erkunden Sie Ihre neue Datenbank“.

Ein Hinweis zum Maßstab: Ein einzelnes blockiertes Papier kann Ihren Job nicht blockieren – wenn ein Papierfehler auftritt, zeichnet der Mitarbeiter den Fehler auf und macht weiter, und der Job endet als Teilerfolg, den Sie unverändert fortsetzen oder exportieren können.


Weiter: Validierung und der KI-Richter →

Hilfe benötigt? Konsultieren Sie die FAQ oder die Fehlerbehebung.
    6 · Running an Extraction | Sci-database Documentation