Materi
Token adalah satuan terkecil yang diproses model. Glosarium Anthropic menyebut token bisa berupa kata, potongan kata, karakter, atau bahkan byte. Halaman token Google menambahkan bahwa kata panjang dipecah menjadi beberapa token, dan seluruh masukan dan keluaran dihitung dalam token, termasuk gambar dan berkas. Batas panjang masukan dihitung dalam token, dan biaya pemakaian API sebagian ditentukan jumlah token masukan dan keluaran.
Dokumentasi memberi rasio kasar, dan keduanya dinyatakan untuk teks bahasa Inggris. Pada tanggal diperiksa, glosarium Anthropic menyatakan satu token kira-kira 3,5 karakter bahasa Inggris dan jumlahnya bisa berbeda menurut bahasa. Halaman token Google menyatakan satu token sekitar 4 karakter, dan 100 token setara sekitar 60 sampai 80 kata bahasa Inggris. Karena rasionya berbentuk rentang, perkiraan dari jumlah kata juga berupa rentang: batas atasnya dihitung dengan angka kata terkecil.
Contoh dengan data lain: laporan bahasa Inggris 1.800 kata. Dengan rasio Google, perkiraannya 1.800 ÷ 80 × 100 = 2.250 token sampai 1.800 ÷ 60 × 100 = 3.000 token.
| Yang diketahui | Rasio yang dinyatakan | Cara menghitung |
|---|---|---|
| Jumlah karakter (Anthropic) | ± 3,5 karakter per token | karakter ÷ 3,5 |
| Jumlah karakter (Google) | ± 4 karakter per token | karakter ÷ 4 |
| Jumlah kata (Google) | 100 token ± 60–80 kata | kata ÷ 80 × 100 sampai kata ÷ 60 × 100 |