Replymessage unavailable
singkatnya sih pake llama cpp kalau di cpu / single gpu, baru vllm/sglang kalo multi gpu + butuh macem2 fitur productionnya
Semuanya support openai compatible api kok, bisa langsung dipake lewat library openai, tapi ya mungkin ga semua endpoint diimplemen