Ответсообщение недоступно
Ковырял тут задачу: как из 40 тысяч сообщений экспорта Telegram собрать что-то, из чего LLM сможет воспроизвести манеру речи человека. Наивный RAG по отдельным сообщениям не работает - теряется контекст диалога. В итоге сегментирую по временным разрывам, режу на диалоги по 5-8 сообщений с overlap, кластеризую, в Qdrant кладу центроид + примеры диалогов. Стало сильно лучше. Если кому интересны детали - расскажу, у меня из этого вырос продукт (memorychat.ru), но тут скорее про подход.