Группа исследователей из компании DeepSeek продемонстрировала принципиально новый подход к распознаванию текста с помощью своей модели DeepSeek-OCR. В отличие от традиционных OCR-систем, которые работают с текстовыми токенами, новая модель опирается на визуальные представления страниц. Этот подход кардинально меняет методы хранения и анализа информации.
Традиционные модели OCR обрабатывают текст, разбивая его на отдельные символы и токены, что требует значительных вычислительных ресурсов, особенно для длинных документов. DeepSeek предлагает альтернативу: преобразование текста в изображение и его последующее кодирование через уникальный DeepEncoder в компактные визуальные токены, что позволяет восстанавливать текст с минимальными затратами.
В ходе экспериментов модель продемонстрировала выдающиеся результаты. При сжатии в десять раз точность оставалась на уровне около 97%, а при двадцатикратном сжатии — около 60%. Это означает, что система может эффективно хранить длинные документы, сохраняя их смысл.
Архитектура DeepSeek-OCR основана на трехступенчатом подходе: локальное внимание для детализации, свёрточное сжатие в 16 раз и глобальное внимание для анализа структуры страницы. В дополнение, внедрён механизм забывания, который позволяет снижать разрешение старого контекста, сохраняя актуальность свежей информации.
Делегируйте рутинные задачи с BotHub! Для доступа не требуется VPN, а использование российской карты возможно. Получите 100 000 бесплатных токенов для первых задач и начните работу с нейросетями уже сегодня!