Глава 64 мин чтения·Официальное руководство · Версия 2026

The Kateeb engine, multi-record extraction, zero-hallucination rules, and resume.

6 · Запуск извлечения

Имея проверенные файлы в очереди и сохраненную схему, вы готовы к главному событию.

Начало работы

На вкладке Файлы нажмите Процесс (N) проверен (или Начать трехпроходное извлечение AI в плавающем доке). Что происходит:

  1. 1 кредит за статью взимается авансом.
  2. Создается задание, содержащее ваши документы и постоянный снимок вашей схемы.
  3. Вы получаете электронное письмо с подтверждением ("Sci-database Задание отправлено"), появляется всплывающее сообщение ** «Задание отправлено — N документов сейчас обрабатываются». ** появляется, и приложение автоматически переключает вас на вкладку База данных.

Задание отправлено — начинается обработка

Вы можете закрыть браузер — обработка продолжится на сервере, а результаты будут отправлены вам по электронной почте.

Что происходит с каждой бумагой

Документы обрабатываются по одному в следующем порядке:

  1. Файл PDF загружается и извлекается его полный текст (до ~950 000 символов — целые статьи, а не только тезисы).
  2. Движок Kateeb читает текст по вашей схеме согласно строгим инструкциям — ключевым, дословно из подсказки по извлечению:
      • «Найти все отдельные записи, соответствующие схеме»* — в одном документе может быть несколько строк (например, несколько материалов или учебных групп).
    • "Если статья не имеет отношения к схеме, верните пустой массив" — нерелевантные статьи ничего не дают, кроме шума.
    • "Для любого поля, если значение отсутствует, отсутствует или вы не уверены на 99%, вы ДОЛЖНЫ вернуть точную строку 'N/A'. Не используйте значение null или предположение."
    • "Для числовых значений извлеките точное значение из бумаги. Не округляйте."
  3. Извлеченные записи и использование токенов сохраняются в задании.

Слежу за прогрессом

Вкладка База данных автоматически обновляется каждые несколько секунд во время выполнения задания. На каждой бумаге имеется значок статуса:

Значок Значение
В очереди Ожидает своей очереди
Обработка (спиннер) Читается прямо сейчас
Завершено Извлечение завершено
Ошибка Не удалось выполнить этот документ (например, нечитаемый/отсканированный PDF-файл) — сообщение об ошибке сохраняется на бумаге

Статусы уровня задания: Обработка → Завершено (все документы выполнены успешно), "X/Y завершено" (частичный успех — некоторые документы не выполнены) или Ошибка (ни одна не выполнена).

Список вакансий на вкладке «База данных»

Остановить и продолжить.

  • Stop (значок ⏹ в строке задания) останавливает работника после текущей бумаги: "Задание остановлено — обработка вскоре прекратится". Уже завершенные документы сохраняют свои данные.
  • Возобновить (значок ↻) перезапускает остановленное или частичное задание. Только незаконченные статьи переставляются в очередь и перезаряжаются (по 1 кредиту каждая) — завершенные работы никогда не обрабатываются повторно и не перезаряжаются.

Когда задание завершится

  • Вы получаете электронное письмо — "Sci-database Задание завершено" — с прикрепленными результатами CSV, поэтому ваша база данных находится в вашем почтовом ящике даже до того, как вы вернетесь в приложение.
  • Карточка «Следующий шаг» на информационной панели переходит к * «Изучите свою новую базу данных» *.

Примечание по масштабу: единственная застрявшая бумага не может заблокировать вашу работу — если в бумаге возникает ошибка, рабочий записывает ошибку и продолжает работу, а работа завершается как частичный успех, который вы можете возобновить или экспортировать как есть.


Далее: Проверка и ИИ-судья →

Нужна помощь? Проверьте FAQ или руководство.
    6 · Running an Extraction | Sci-database Documentation