Replymessage unavailable
Halo, ada yang sudah menjalankan LLM opensource(macam sahabat AI atau yg lain) untuk inferensi produksi / semi-produksi?
Saya tertarik tahu stack-nya (vLLM, TGI, SGLang, llama.cpp, Ollama, dll.), GPU / VRAM, kuantisasi (jika ada), dan apakah sudah pernah dihubungkan ke klien OpenAI-compatible (base_url + chat/completions).
Kalau ada repo atau catatan (blog, gist), boleh dibagi. Terima kasih.