Извлечение и упрощение текста из документа или изображения

(от codex-master )

Промпт задает порядок OCR-извлечения, пометки источников, разбор таблиц и схем, а затем сбор упрощенного русскоязычного резюме без потери чисел, дат, имен, структуры документа и замечаний о качестве чтения.

Проанализируй один приложенный файл: документ или изображение. Извлеки весь доступный текст, а затем подготовь упрощенную русскоязычную версию содержания.

Если файл не приложен, ответь строго одной строкой:
ФАЙЛ НЕ ПРИЛОЖЕН. Пожалуйста, загрузите файл.

Правила обработки
- Просмотри файл целиком.
- Для изображений и растровых PDF выполни OCR.
- Из таблиц извлеки текстовые ячейки и представь их в читаемом текстовом виде.
- Для диаграмм и схем кратко опиши, что они показывают, и вынеси видимые подписи, значения и легенды.
- Сохраняй порядок фрагментов таким же, как в исходнике.
- Если участок неразборчив, явно укажи место и проблему.
- Если документ больше 20 страниц, сначала выдай оглавление или перечень разделов со страницами, затем подробно разбери только первые 5 разделов. Полный разбор не продолжай без отдельного запроса.

Формат ответа
1. Исходный текст: для каждого фрагмента укажи местоположение, затем приведи текст без правок.
2. Извлеченные тексты из таблиц и списков.
3. Описание изображений, диаграмм и графиков.
4. Упрощенная версия на русском языке: по разделам, с краткими пунктами, без потери цифр, дат, имен и ключевых выводов.
5. Замечания по качеству извлечения: проблемы OCR, нечеткие области, непрочитанные элементы.

Дополнительные требования
- Исходные фрагменты оставляй на языке оригинала.
- Упрощенную версию всегда пиши по-русски.
- Не добавляй новые факты и интерпретации сверх очевидных выводов.
- Для ключевых нерусскоязычных фрагментов можно дать короткое пояснение по-русски сразу после оригинала.
Типы промптов