Replymessage unavailable
Halo semua, izin bertanya beberapa hal terkait data preprocessing, ya. 🙏
Saya sedang mengerjakan sebuah proyek dan ada beberapa tantangan yang saya hadapi:
1. Menangani Fitur dengan Banyak Nilai Unik (High Cardinality): Saya punya fitur kategorikal yang nilainya sangat banyak, tapi beberapa nilai tersebut frekuensinya sangat kecil. Apakah praktik terbaik untuk menggabungkan nilai-nilai langka ini menjadi satu kategori, misalnya "Lainnya" (Other)? Adakah pertimbangan khusus kapan sebaiknya ini dilakukan dan kapan tidak?
2. Pemilihan Teknik Encoding: Kapan waktu yang tepat untuk menggunakan metode encoding yang berbeda?
* pandas.map()
* scikit-learn.OneHotEncoder
* scikit-learn.LabelEncoder
Apa kelebihan dan kekurangan masing-masing dalam konteks yang berbeda (misalnya untuk model linear vs. model berbasis pohon)?
3. Mengatasi Imbalance Data yang Ekstrem: Bagaimana strategi paling efektif untuk menangani dataset dengan ketidakseimbangan kelas yang sangat parah? Sebagai contoh, pada kasus deteksi penipuan (fraud detection), data saya terdiri dari 99% transaksi non-fraud dan hanya 1% transaksi fraud. Teknik apa yang lebih disarankan selain SMOTE atau Random Undersampling standar?