Materi
Jaringan dengan banyak neuron bisa menghafal data latih, termasuk deraunya. Gejalanya overfitting: skor latih sangat tinggi, skor uji jauh lebih rendah. Karena itu keduanya selalu dibandingkan; skor latih saja tidak menunjukkan apa-apa tentang data baru.
Pengendali pertama adalah alpha, kekuatan regularisasi L2. User Guide scikit-learn menjelaskan bahwa alpha menambahkan penalti pada bobot yang besar ke dalam loss, sehingga membantu menghindari overfitting; nilai bawaannya 0,0001. Dive into Deep Learning §3.7 menyebut teknik yang sama weight decay. Alpha yang lebih besar membuat batas keputusan lebih halus; contoh "Varying regularization in Multi-layer Perceptron" di dokumentasi scikit-learn menggambarkannya. Terlalu besar juga keliru: model menjadi terlalu sederhana dan skor latih maupun ujinya turun.
Pengendali kedua adalah early stopping. Dengan early_stopping=True, MLPClassifier menyisihkan validation_fraction dari data latih (bawaan 10%) dan berhenti ketika skor validasi tidak membaik lebih dari tol selama n_iter_no_change epoch berturut-turut (bawaan 10). Hanya berlaku untuk solver sgd dan adam. Setelah fit, validation_scores_ berisi skor validasi setiap epoch, best_validation_score_ skor terbaiknya, dan n_iter_ banyak epoch yang benar-benar dijalankan. d2l §5.5 menyebut early stopping teknik regularisasi klasik yang juga menghemat waktu latih.