Mengolah Teks dengan Python
Unicode, regex, token, Counter, TF-IDF, dan Naive Bayes untuk ulasan dan pengaduan — dijalankan di browser.
Pelajaran pertama bisa dicoba tanpa akun. Selanjutnya pakai akun gratis agar progres, draft kode, dan sertifikatmu tersimpan.
Kelas mengolah teks Bahasa Indonesia dengan Python: menyamakan teks dengan normalisasi Unicode dan casefold, membersihkannya dengan re, memecahnya menjadi token, membuang kata henti, menghitung frekuensi kata dan n-gram, lalu mengubahnya menjadi vektor bag-of-words dan TF-IDF dengan scikit-learn untuk mencari dokumen mirip dan mengelompokkan pengaduan dengan MultinomialNB. Semua kode dijalankan di Python sungguhan (Pyodide) dan diperiksa dengan test assert.
5,0 ★ (Belum ada ulasan) · 16 pelajaran · 4 modul · ±229 menit

Bawa pulang keterampilannya
Yang akan kamu bisa setelah kelas ini
- Menyamakan teks dari sumber berbeda dengan normalisasi Unicode (NFC, NFKC) dan casefold.
- Membersihkan teks dengan re (URL, angka, tanda baca), memecahnya menjadi token, dan membuang kata henti.
- Menghitung frekuensi kata dan n-gram dengan collections.Counter, lalu menyusun bag-of-words dengan CountVectorizer.
- Memberi bobot TF-IDF, mengukur kemiripan kosinus, dan melatih pengklasifikasi teks MultinomialNB dengan scikit-learn.
Untuk siapa
Orang yang sudah menulis fungsi, list, dan dict di Python dan perlu mengolah teks ulasan, pengaduan, atau isian formulir.
Prasyarat
Python dari Nol, Regex untuk Mencari Teks
Alat yang perlu disiapkan
- Browser modern di komputer. Python (±12 MB) dimuat saat latihan pertama; modul 3 dan 4 memuat scikit-learn beserta numpy dan scipy (±21 MB) sekali, lalu tersimpan di cache.
Tempat berlatih
Coba, periksa, lalu lanjutkan.
52 latihan di 16 pelajaran. Jawaban diperiksa langsung di halaman materi; petunjuk dibuka bertahap.
Jalur belajar kelas ini
Kurikulum
4 modul · 16 pelajaran · ±229 menit
03Menghitung kata: frekuensi, n-gram, dan bag-of-words4 pelajaran
Urutan pelajaran tidak dikunci.
Sertifikat kelas
Selesaikan kelasnya, sertifikat ini atas namamu.
- Nama lengkapmu dan judul kelas tercetak di sertifikat.
- Kode dan QR yang bisa dicek siapa saja di kelasgratis.com/verifikasi.
- Sekali klik ke profil LinkedIn, atau unduh PNG dan PDF.
Bukti penyelesaian materi, bukan akreditasi atau sertifikasi kompetensi.
Pertanyaan yang sering muncul
Apakah kelas ini membahas stemming atau word embedding?
Tidak. Stemming Bahasa Indonesia dan word embedding membutuhkan pustaka atau model pralatih yang tidak tersedia di Python yang berjalan di browser. Kelas ini berhenti di bag-of-words, TF-IDF, kemiripan kosinus, dan MultinomialNB.
Dari mana daftar kata henti Bahasa Indonesia di kelas ini?
Daftarnya disusun sendiri untuk data latihan, karena Python dan scikit-learn tidak menyediakan daftar kata henti Bahasa Indonesia. Pelajaran Kata henti juga menunjukkan cara mencari calon kata henti dari data sendiri.
Apakah pola regex dijelaskan dari awal?
Tidak. Kelas ini memakai pola regex untuk membuang URL, angka, dan tanda baca, sedangkan cara menyusun polanya diajarkan di kelas Regex untuk Mencari Teks. Satu perbedaan yang dibahas di sini adalah arti \w di Python yang mencakup huruf Unicode.
Dari pengalaman belajar
Ulasan peserta
Apa yang membantu, dan apa yang masih bisa diperbaiki?
Ulasan berasal dari akun yang telah menyelesaikan setidaknya satu pelajaran. Bintang 1–3 ditinjau admin sebelum terbit; bintang 4–5 langsung terbit. Sebelum ada ulasan terbit, kelas menggunakan nilai awal admin 5,0. Setelahnya, rating mengikuti rata-rata ulasan yang sudah terbit.
Pengalamanmu bisa membantu peserta berikutnya.
Belum ada ulasan yang terbit untuk kelas ini.
Bagikan pengalaman belajarmu
Masuk dan selesaikan satu pelajaran untuk menulis ulasan. Masuk ke akun →
Setelah kelas ini
Jalur yang memuat kelas ini
Revisi materi terakhir: 27 Sep 2026. Laporan kesalahan bisa dikirim dari setiap halaman pelajaran.