Lompat ke konten utama
←

AI Generatif untuk Kerja

Pelajaran 14 dari 16

Memeriksa hasil, multimodal, dan agen

Masukan multimodal: gambar dan berkas

Setelah pelajaran ini kamu bisa menjelaskan masukan multimodal, menyusun gambar dan teks sesuai panduan, dan menyebut batas pembacaan gambar yang perlu diverifikasi.

±13 menitDiperiksa 27 Sep 2026

Materi

Model multimodal menerima lebih dari teks: gambar, berkas PDF, audio, atau video, bergantung modelnya. Halaman token Google menyebut semua masukan itu juga diubah menjadi token, dan halaman Context windows Anthropic menyebut gambar dan dokumen ikut dihitung di jendela konteks. Jadi foto dan PDF memakan jatah yang sama dengan teks.

Dua panduan tentang susunan. Halaman Vision Anthropic menyebut model bekerja paling baik bila gambar datang sebelum teks, sama seperti dokumen panjang sebelum pertanyaan. Panduan Google meminta semua jenis masukan diperlakukan setara dan instruksi menyebut tiap masukan dengan jelas, misalnya "pada foto nota pertama".

Halaman Vision juga mendaftar batasnya. Model bisa berhalusinasi atau keliru saat membaca gambar berkualitas rendah, terputar, atau sangat kecil (di bawah 200 piksel). Hitungan benda di gambar hanya perkiraan, terutama bila bendanya banyak dan kecil. Model tidak bisa memastikan apakah sebuah gambar buatan AI, dan tidak dipakai untuk menamai orang di foto. Halaman itu meminta hasil pembacaan gambar diperiksa, terutama untuk keperluan penting.

Tugas dengan fotoPerlu diperiksa ulang?
Menyalin teks dari foto surat yang tajam dan tegakYa, angka dan nama dicocokkan
Menghitung 300 baut kecil di foto rakYa: hitungan hanya perkiraan

Latihan

0/3 lulus

Jawaban diperiksa di server. Lulus berarti kamu memahami contohnya, bukan penilaian seluruh pekerjaanmu.

Latihan 1 dari 3

Kamu ingin model membaca foto kuitansi lalu menjawab satu pertanyaan. Susunan mana yang sesuai dengan halaman Vision Anthropic?

Pilih satu jawaban

Latihan 2 dari 3

Tugas mana yang menurut bagian Limitations halaman Vision hasilnya hanya perkiraan?

Pilih satu jawaban

Latihan 3 dari 3

Atasan bertanya apakah foto produk pesaing di media sosial dibuat dengan AI. Menurut halaman Vision Anthropic, bolehkah kamu mengandalkan jawaban model?

Pilih satu jawaban

Catatanmu

Memuat catatan…

tersimpan otomatis, ikut tercetak · 0/4.000

Luluskan semua latihan dulu untuk menandai pelajaran ini selesai.

Lanjutkan ke