🚀 DeepSeek-OCR: новый подход к памяти в ИИ
DeepSeek показали, что OCR-модель может быть не только про чтение документов, но и про расширение «памяти» модели.
Идея простая и смелая: хранить контекст не в текстовых токенах, а в виде изображений страниц, а потом считывать нужный фрагмент через OCR.
Когда мы храним историю диалога как изображения, каждый визуальный патч покрывает больше информации, чем один текстовый токен. Модель работает с компактным визуальным представлением, а точные цитаты подтягивает только по запросу. Получается сохранять больше деталей, тратить меньше токенов и экономить на длинном контексте.
Что происходит внутри
- История упаковывается в страницы и разбивается на 2D-патчи
- Недавние страницы хранятся в высоком качестве
- Старые сжимаются сильнее, но не исчезают полностью
- OCR вызывается только когда нужно точное слово или строка
Это похоже на мягкое «угасание памяти» вместо жёсткого обрезания контекста. Таблицы, код, структура текста сохраняются как есть, что помогает модели не терять привязки.
Практический эффект
- тысячи текстовых токенов заменяются сотнями визуальных
- дешевле в обработке
- подходит для агентных систем, которые ведут длинные сессии и возвращаются к старым действиям или логам
- можно генерировать собственные обучающие данные, рендеря страницы и OCR-лейблы на лету
Метод не делает модель идеальной в запоминании, но позволяет гораздо дольше удерживать информацию и возвращаться к ней без внешних хранилищ и сложного RAG-контура.
Хранить текст как изображения и читать их по запросу может стать новой парадигмой долгой памяти в LLM. Особенно для агентов, которым нужно помнить путь, а не только последний шаг.
technologyreview.com/2025/10/29/1126932/deepseek-ocr-visual-compression
@data_analysis_ml