Materi
Model multimodal menerima lebih dari teks: gambar, berkas PDF, audio, atau video, bergantung modelnya. Halaman token Google menyebut semua masukan itu juga diubah menjadi token, dan halaman Context windows Anthropic menyebut gambar dan dokumen ikut dihitung di jendela konteks. Jadi foto dan PDF memakan jatah yang sama dengan teks.
Dua panduan tentang susunan. Halaman Vision Anthropic menyebut model bekerja paling baik bila gambar datang sebelum teks, sama seperti dokumen panjang sebelum pertanyaan. Panduan Google meminta semua jenis masukan diperlakukan setara dan instruksi menyebut tiap masukan dengan jelas, misalnya "pada foto nota pertama".
Halaman Vision juga mendaftar batasnya. Model bisa berhalusinasi atau keliru saat membaca gambar berkualitas rendah, terputar, atau sangat kecil (di bawah 200 piksel). Hitungan benda di gambar hanya perkiraan, terutama bila bendanya banyak dan kecil. Model tidak bisa memastikan apakah sebuah gambar buatan AI, dan tidak dipakai untuk menamai orang di foto. Halaman itu meminta hasil pembacaan gambar diperiksa, terutama untuk keperluan penting.
| Tugas dengan foto | Perlu diperiksa ulang? |
|---|---|
| Menyalin teks dari foto surat yang tajam dan tegak | Ya, angka dan nama dicocokkan |
| Menghitung 300 baut kecil di foto rak | Ya: hitungan hanya perkiraan |