Ответсообщение недоступно
Сейчас сходил на первый в моей жизни собес на LLM инженера, стырил оттуда вопросы, надеюсь вам будет полезно из изучить:
LLM Engineer — HR-скрининг: вопросы
1. BERT — это encoder-decoder, encoder-only или decoder-only архитектура?
2. Какой формат весов безопаснее — .pth или .safetensors — и почему?
3. Какие общие преимущества у parameter-efficient fine-tuning (например, LoRA) перед полным файнтюнингом?
4. Что именно обучает LoRA?
5. Какие данные нужны, чтобы обучить модель через DPO?
6. Чем отличается tensor parallelism от pipeline parallelism, в двух словах?
7. LLM, хранящуюся в fp32, кастим в bf16. Как изменятся потребление памяти и скорость генерации?
8. Что такое KV-кеш и почему он потребляет память на инференсе?
9. Что даёт structured output?
10. Зачем в LLM нужна токенизация?
11. Что такое перплексия в контексте языковых моделей?
12. Какая операция превращает attention-скоры в вероятности?