Lompat ke konten utama
Masuk
CodingPythonMenengah

Mengolah Teks dengan Python

Unicode, regex, token, Counter, TF-IDF, dan Naive Bayes untuk ulasan dan pengaduan — dijalankan di browser.

Pelajaran pertama bisa dicoba tanpa akun. Selanjutnya pakai akun gratis agar progres, draft kode, dan sertifikatmu tersimpan.

Kelas mengolah teks Bahasa Indonesia dengan Python: menyamakan teks dengan normalisasi Unicode dan casefold, membersihkannya dengan re, memecahnya menjadi token, membuang kata henti, menghitung frekuensi kata dan n-gram, lalu mengubahnya menjadi vektor bag-of-words dan TF-IDF dengan scikit-learn untuk mencari dokumen mirip dan mengelompokkan pengaduan dengan MultinomialNB. Semua kode dijalankan di Python sungguhan (Pyodide) dan diperiksa dengan test assert.

5,0 ★ (Belum ada ulasan) · 16 pelajaran · 4 modul · ±229 menit

Bagikan kelas

Bawa pulang keterampilannya

Yang akan kamu bisa setelah kelas ini

  • Menyamakan teks dari sumber berbeda dengan normalisasi Unicode (NFC, NFKC) dan casefold.
  • Membersihkan teks dengan re (URL, angka, tanda baca), memecahnya menjadi token, dan membuang kata henti.
  • Menghitung frekuensi kata dan n-gram dengan collections.Counter, lalu menyusun bag-of-words dengan CountVectorizer.
  • Memberi bobot TF-IDF, mengukur kemiripan kosinus, dan melatih pengklasifikasi teks MultinomialNB dengan scikit-learn.

Untuk siapa

Orang yang sudah menulis fungsi, list, dan dict di Python dan perlu mengolah teks ulasan, pengaduan, atau isian formulir.

Prasyarat

Python dari Nol, Regex untuk Mencari Teks

Alat yang perlu disiapkan

  • Browser modern di komputer. Python (±12 MB) dimuat saat latihan pertama; modul 3 dan 4 memuat scikit-learn beserta numpy dan scipy (±21 MB) sekali, lalu tersimpan di cache.

Tempat berlatih

Coba, periksa, lalu lanjutkan.

52 latihan di 16 pelajaran. Jawaban diperiksa langsung di halaman materi; petunjuk dibuka bertahap.

editor Pythonjawaban angkapilihan jawaban

Jalur belajar kelas ini

Kurikulum

4 modul · 16 pelajaran · ±229 menit

Urutan pelajaran tidak dikunci.

Sertifikat kelas

Selesaikan kelasnya, sertifikat ini atas namamu.

  • Nama lengkapmu dan judul kelas tercetak di sertifikat.
  • Kode dan QR yang bisa dicek siapa saja di kelasgratis.com/verifikasi.
  • Sekali klik ke profil LinkedIn, atau unduh PNG dan PDF.
Mulai belajar

Bukti penyelesaian materi, bukan akreditasi atau sertifikasi kompetensi.

Pertanyaan yang sering muncul

Apakah kelas ini membahas stemming atau word embedding?

Tidak. Stemming Bahasa Indonesia dan word embedding membutuhkan pustaka atau model pralatih yang tidak tersedia di Python yang berjalan di browser. Kelas ini berhenti di bag-of-words, TF-IDF, kemiripan kosinus, dan MultinomialNB.

Dari mana daftar kata henti Bahasa Indonesia di kelas ini?

Daftarnya disusun sendiri untuk data latihan, karena Python dan scikit-learn tidak menyediakan daftar kata henti Bahasa Indonesia. Pelajaran Kata henti juga menunjukkan cara mencari calon kata henti dari data sendiri.

Apakah pola regex dijelaskan dari awal?

Tidak. Kelas ini memakai pola regex untuk membuang URL, angka, dan tanda baca, sedangkan cara menyusun polanya diajarkan di kelas Regex untuk Mencari Teks. Satu perbedaan yang dibahas di sini adalah arti \w di Python yang mencakup huruf Unicode.

Dari pengalaman belajar

Ulasan peserta

Apa yang membantu, dan apa yang masih bisa diperbaiki?

5,0Belum ada ulasan terbit

Ulasan berasal dari akun yang telah menyelesaikan setidaknya satu pelajaran. Bintang 1–3 ditinjau admin sebelum terbit; bintang 4–5 langsung terbit. Sebelum ada ulasan terbit, kelas menggunakan nilai awal admin 5,0. Setelahnya, rating mengikuti rata-rata ulasan yang sudah terbit.

Pengalamanmu bisa membantu peserta berikutnya.

Belum ada ulasan yang terbit untuk kelas ini.

Bagikan pengalaman belajarmu

Masuk dan selesaikan satu pelajaran untuk menulis ulasan. Masuk ke akun →

Setelah kelas ini

Revisi materi terakhir: 27 Sep 2026. Laporan kesalahan bisa dikirim dari setiap halaman pelajaran.