ChatCrawlersearch across public Telegram Open the app
P

Python Indonesia

сообщение · 2025-08-14 03:27 UTC
Q
Replymessage unavailable
Halo semua, izin bertanya beberapa hal terkait data preprocessing, ya. 🙏 Saya sedang mengerjakan sebuah proyek dan ada beberapa tantangan yang saya hadapi: 1. Menangani Fitur dengan Banyak Nilai Unik (High Cardinality): Saya punya fitur kategorikal yang nilainya sangat banyak, tapi beberapa nilai tersebut frekuensinya sangat kecil. Apakah praktik terbaik untuk menggabungkan nilai-nilai langka ini menjadi satu kategori, misalnya "Lainnya" (Other)? Adakah pertimbangan khusus kapan sebaiknya ini dilakukan dan kapan tidak? 2. Pemilihan Teknik Encoding: Kapan waktu yang tepat untuk menggunakan metode encoding yang berbeda? * pandas.map() * scikit-learn.OneHotEncoder * scikit-learn.LabelEncoder Apa kelebihan dan kekurangan masing-masing dalam konteks yang berbeda (misalnya untuk model linear vs. model berbasis pohon)? 3. Mengatasi Imbalance Data yang Ekstrem: Bagaimana strategi paling efektif untuk menangani dataset dengan ketidakseimbangan kelas yang sangat parah? Sebagai contoh, pada kasus deteksi penipuan (fraud detection), data saya terdiri dari 99% transaksi non-fraud dan hanya 1% transaksi fraud. Teknik apa yang lebih disarankan selain SMOTE atau Random Undersampling standar?

Вся лента · оригинал в Telegram

Open in Telegram Каталог площадок Искать в ChatCrawler

A snapshot of an open public feed from the search index ChatCrawler — “Google for public Telegram”; refreshed as the venue is crawled. Times are UTC.

Public content only, official Telegram API. About · FAQ · What we do not do · Remove a page · Catalog