Lompat ke konten utama
←

Mengolah Teks dengan Python

Pelajaran 9 dari 16

Menghitung kata: frekuensi, n-gram, dan bag-of-words

Frekuensi kata dengan collections.Counter

Setelah pelajaran ini kamu bisa menghitung dan mengurutkan frekuensi kata dengan Counter.

±13 menitDiperiksa 27 Sep 2026

Materi

collections.Counter adalah subkelas dict untuk menghitung objek yang dapat di-hash. Counter(daftar) menghasilkan pemetaan dari setiap unsur ke banyaknya kemunculan. Kata yang tidak ada bernilai 0, bukan KeyError, sehingga hitung["durian"] aman dibaca meski durian tidak pernah muncul.

from collections import Counter

token = ["murah", "cepat", "murah", "rapi", "cepat", "murah"]
hitung = Counter(token)
print(hitung["murah"])        # 3
print(hitung["mahal"])        # 0
print(hitung.most_common(2))  # [('murah', 3), ('cepat', 2)]

most_common(n) mengembalikan n pasangan (unsur, jumlah) dari yang terbanyak. Dokumentasi Python menyatakan unsur dengan jumlah sama diurutkan menurut urutan pertama kali ditemui, jadi hasilnya tetap sama setiap kali dijalankan untuk data yang sama. Tanpa argumen, most_common() mengembalikan semua pasangan.

Counter dapat digabung. Method update(iterable) menambahkan hitungan dari data baru ke Counter yang sudah ada, dan operator + menjumlahkan dua Counter sambil membuang hasil yang nol atau negatif. total() mengembalikan jumlah seluruh hitungan, yang dipakai untuk menghitung proporsi: pada contoh di atas, hitung["murah"] / hitung.total() bernilai 0,5.

Latihan

0/3 lulus

Jawaban diperiksa di server. Lulus berarti kamu memahami contohnya, bukan penilaian seluruh pekerjaanmu.

Latihan 2 dari 3

hitung = Counter(["enak", "murah", "enak", "enak", "murah", "mahal", "enak", "murah"]). Berapa persen token yang berupa kata murah, yaitu hitung["murah"] / hitung.total() dikali 100?

Catatanmu

Memuat catatan…

tersimpan otomatis, ikut tercetak · 0/4.000

Luluskan semua latihan dulu untuk menandai pelajaran ini selesai.

Lanjutkan ke