Ищу проект или подряд. Приоритет - полная загрузка, готов стартовать сразу.
Локация: Белград, часовой пояс CET. Оформление: сербское ИП, прямой B2B-договор без визы и EOR.
Senior AI Infrastructure & Backend Engineer, 9 лет.
Фокус: инференс и сервинг LLM, AI-инфраструктура, интеграция моделей в боевые процессы.
Что делал за последние 3 года:
- Self-hosted инференс LLM и VLM на 8 GPU-серверах. vLLM, SGLang, continuous batching, переиспользование KV-cache, бюджетирование VRAM под LoRA-адаптеры, автоматический провижининг GPU.
- Observability под LLM-трафик, а не под веб: TTFT, ITL, глубина очереди, насыщение памяти GPU.
- Нагрузка и стоимость: 12 млрд токенов и 4.5 млн запросов в неделю, 0.084 доллара за миллион токенов, примерно в 2.4 раза дешевле AWS On-Demand.
- Оркестрация: мультипровайдерный роутер с переключением при сбое прямо в запросе, версионирование промптов, гейты на золотых датасетах.
- Бэкенд: Python, FastAPI, PostgreSQL, RabbitMQ, Docker, Kubernetes.
Свой продукт в проде: Quest2Offer, AI-платформа для поиска работы. RAG на Qdrant, пайплайн агентов на очередях, 5 языков.
Условия: полная занятость либо part-time от 100 часов в месяц. Ставка от 45 евро в час. Английский рабочий, русский родной.
CV и детали в личку @pasterfild.