Blog Metlivi

“Ia Mengetahui Nama Saya” vs. “Ia Memahami Proyek Saya”: Cara Membedakannya

Jika obrolan AI menggunakan nama Anda, itu menunjukkan bahwa ia dapat mengakses atau mengingat detail pribadi. Hal itu sendiri tidak menunjukkan bahwa ia dapat menggunakan konteks proyek kreatif Anda secara akurat. Untuk menilai konteks yang berguna, berikan tugas proyek kecil dengan batasan yang jelas, lalu periksa apakah responsnya mempertahankan detail, menerapkan preferensi Anda, dan menangani koreksi pada langkah-langkah berikutnya. Evaluasilah apa yang dilakukannya, bukan apa yang dikatakannya ia pahami.

30 September 20267 min readMembaca, seni, dan budayaOleh Metlivi Editorial Team
Bagian 1

Mengapa mengingat nama adalah pengujian yang sempit

Nama adalah fakta yang ringkas: nama dapat disimpan, diulang, atau diambil dari konteks obrolan atau akun yang tersedia. Di ChatGPT, misalnya, memori dapat mencakup detail yang diberikan pengguna, sementara informasi obrolan masa lalu yang relevan juga dapat digunakan saat fitur terkait tersedia dan diaktifkan. Dokumentasi produk juga menyatakan bahwa memori tidak menyimpan setiap detail dan bahwa kontrol yang tersedia bervariasi berdasarkan paket, wilayah, platform, dan ruang kerja. Oleh karena itu, nama yang benar memberi tahu Anda bahwa detail tersebut tersedia untuk respons tersebut; ini tidak mengungkapkan seberapa banyak konteks di sekitarnya yang dapat diambil atau diterapkan oleh sistem. OpenAI Help Center, “Memory in ChatGPT”

Proyek kreatif adalah pengujian yang lebih kaya karena biasanya menggabungkan beberapa fakta dan preferensi: apa yang sedang dibuat, untuk siapa, apa yang telah diputuskan, apa yang masih terbuka, dan saran seperti apa yang diharapkan. Mengulang “Anda adalah Alex” menguji ingatan akan satu label. Meminta tiga ide yang sesuai dengan instruksi singkat (brief) proyek yang dinyatakan menguji apakah sistem dapat memilih dan menggunakan beberapa detail yang relevan secara bersamaan.

Perbedaan ini bersifat praktis, bukan penilaian tentang apakah suatu model memiliki pemahaman mirip manusia. Pertanyaan yang berguna adalah apakah ia dapat menerapkan konteks yang Anda berikan ke tugas berikutnya, dan apakah Anda dapat memverifikasi penerapan tersebut dalam hasilnya.

Bagian 2

Apa yang dianggap sebagai memahami proyek untuk suatu tugas

Untuk penggunaan sehari-hari, perlakukan “memahami proyek saya” sebagai singkatan untuk serangkaian kemampuan yang dapat diamati. Respons yang bermanfaat harus menjaga fakta-fakta yang telah ditetapkan tetap tepat, membedakan keputusan dari kemungkinan, mengikuti batasan yang penting bagi permintaan tersebut, dan bertanya atau menandai ketidakpastian ketika detail yang hilang akan mengubah jawabannya. Ini adalah standar tugas: Anda dapat memeriksa hasilnya dan memutuskan apakah itu memenuhinya.

Penelitian memberikan alasan untuk menguji setiap bagian daripada hanya mengandalkan kata-kata yang fasih. FollowBench, tolok ukur model bahasa tahun 2024, memisahkan batasan instruksi ke dalam kategori seperti konten, situasi, gaya, format, dan contoh. Pengujiannya menemukan bahwa kinerja menurun seiring bertambahnya batasan, dan bahwa beberapa kategori lebih sulit daripada yang lain. Tolok ukur tersebut mengevaluasi tugas-tugas yang terkontrol, bukan obrolan khusus Anda, tetapi ini mendukung kebiasaan yang berguna: periksa setiap persyaratan penting secara terpisah daripada memberikan kelulusan hanya karena responsnya terdengar masuk akal. Jiang et al., “FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models”

Tolok ukur pemahaman konteks terpisah menguji fitur linguistik di empat tugas dan sembilan kumpulan data. Para penulisnya melaporkan bahwa model padat (dense) pra-latih kesulitan dengan fitur kontekstual yang lebih bernuansa dibandingkan dengan model terdepan yang disesuaikan (fine-tuned) dalam evaluasi mereka. Hasil tersebut tidak memprediksi bagaimana asisten saat ini tertentu akan menangani proyek Anda, tetapi ini memperkuat pentingnya memeriksa makna dan hubungan, daripada hanya mencari kata-kata yang familiar. “Can Large Language Models Understand Context?”

Untuk sebuah proyek, hubungan-hubungan tersebut mungkin berupa: “posternya untuk acara pertukaran benih lingkungan”; “tanggal acara masih belum diputuskan”; “arah visualnya cerah dan bernuansa buatan tangan (handmade)”; dan “hindari bahasa yang terdengar seperti promosi penjualan.” Respons yang mengulang “pertukaran benih” tetapi mengarang tanggal atau mengabaikan nada bicaranya telah mengingat sebuah topik tanpa mengikuti brief dengan baik.

Bagian 3

Jalankan pemeriksaan proyek yang kecil dan dapat diamati

Pilihlah tugas berisiko rendah yang menyerupai pekerjaan yang sebenarnya Anda inginkan bantuannya. Berikan brief singkat pada obrolan, lalu minta satu hasil kerja (deliverable) yang konkret. Brief yang berguna mungkin berbunyi: “Saya membuat undangan satu halaman untuk acara pertukaran benih lingkungan. Tanggalnya belum ditentukan, jadi jangan cantumkan. Jaga agar nadanya tetap hangat dan sederhana. Saya ingin orang-orang membawa benih yang berlabel, tetapi kehadiran terbuka untuk semua orang.” Kemudian mintalah judul utama dan paragraf undangan singkat.

Sebelum membaca jawabannya, ubah brief tersebut menjadi daftar periksa sederhana. Dalam contoh ini, periksa apakah hasilnya:

menghindari mengarang tanggal;

menjaga undangan tetap terbuka untuk semua orang;

menyebutkan benih berlabel sebagai sesuatu yang harus dibawa;

menggunakan nada yang hangat dan sederhana; serta

menyediakan judul utama dan paragraf yang diminta.

Daftar periksa ini adalah alat bantu editorial, bukan tes ilmiah yang divalidasi. Nilainya terletak pada kemampuannya membuat kesalahan terlihat. Paragraf yang dipoles masih bisa melewatkan batasan, sementara respons yang sederhana mungkin mengikuti brief secara akurat.

Selanjutnya, mintalah langkah kedua yang bergantung pada langkah pertama: “Sekarang buat versi yang lebih pendek untuk tanda kecil, tetap tanpa tanggal, dan jaga undangan tetap terbuka untuk semua orang.” Periksa apakah batasan utama bertahan dari perubahan format tersebut. Kemudian koreksi kesalahan apa pun secara eksplisit—misalnya, “Harap hapus frasa ‘untuk tukang kebun berpengalaman’; pemula juga dipersilakan”—dan lihat apakah revisi berikutnya benar-benar menghapusnya tanpa memunculkan kembali pengecualian yang sama dalam bentuk lain.

Bagian 4

Beri nilai pada tindak lanjut, bukan bahasa yang percaya diri

Kartu penilaian praktis memiliki empat bagian:

Ingatan (Recall): Apakah respons menggunakan fakta proyek yang relevan dengan benar?

Pemilihan (Selection): Apakah ia menyertakan fakta yang penting untuk tugas spesifik ini, alih-alih membaca detail yang tidak terkait?

Penerapan (Application): Apakah ia mengikuti batasan konten, nada, dan format brief dalam hasil akhirnya?

Pembaruan (Update): Setelah Anda mengoreksi suatu detail, apakah versi berikutnya mencerminkan koreksi tersebut?

Carilah bukti konkret dalam hasil keluarannya: kata-kata yang mempertahankan tanggal yang belum diputuskan, frasa yang diminta yang muncul, atau koreksi yang tetap diperbaiki dalam revisi. Berikan bobot lebih sedikit pada pernyataan seperti “Saya ingat proyek Anda” atau “Saya mengerti persis apa yang Anda maksud.” Pernyataan-pernyataan tersebut tidak membuktikan bahwa hasil kerja berikutnya akan menggunakan brief secara akurat.

Jaga agar pengujian tetap sebanding dengan tugasnya. Satu jawaban yang berhasil adalah bukti tentang permintaan itu, bukan bukti kinerja yang konsisten di setiap percakapan di masa mendatang. Jika suatu proyek mencakup banyak obrolan, periksa apakah alat yang Anda gunakan mengaktifkan fitur memori atau konteks proyek, dan tinjau kontrol yang tersedia. Untuk ChatGPT, dokumentasinya membedakan memori yang disimpan dari informasi yang diambil dari riwayat obrolan; dokumentasi tersebut juga mencatat bahwa ringkasan memori dapat menghilangkan detail dan bahwa sumber konteks dapat ditinjau saat ditampilkan. Fitur dan kontrol dapat berubah, jadi periksalah pengaturan produk dan halaman bantuan saat ini untuk akun Anda. OpenAI Help Center, “Memory in ChatGPT”

Percakapan panjang membutuhkan perhatian khusus. Dalam eksperimen terkontrol yang dilaporkan dalam “Lost in the Middle,” para peneliti menemukan bahwa kemampuan model bahasa yang diuji untuk menggunakan informasi yang relevan dapat bervariasi berdasarkan posisinya dalam input yang panjang, dengan kinerja yang sering kali lebih kuat untuk informasi di dekat awal atau akhir daripada di tengah. Studi ini menguji model dan tugas tertentu; ini tidak membuktikan bahwa setiap asisten akan kehilangan detail proyek Anda. Namun, ini menyarankan alur kerja yang masuk akal: nyatakan kembali beberapa keputusan penting sebelum hasil kerja yang signifikan, terutama setelah percakapan yang panjang. Liu et al., “Lost in the Middle: How Language Models Use Long Contexts”

Bagian 5

Buat brief lebih mudah digunakan

Ketika sebuah respons meleset dari sasaran, diagnosis kesalahan tersebut sebelum memutuskan apa artinya. Apakah sistem memiliki akses ke informasi tersebut? Apakah detailnya terkubur dalam percakapan yang panjang? Apakah permintaan tersebut menggabungkan banyak persyaratan? Apakah preferensi terlalu luas untuk memandu pilihan tertentu? Kemungkinan-kemungkinan ini memerlukan perbaikan yang berbeda: nyatakan kembali keputusan, perpendek brief, pisahkan persyaratan menjadi poin-poin, atau berikan contoh konkret dari gaya yang Anda inginkan.

Catatan proyek yang ringkas dapat membuat pekerjaan berulang lebih mudah dievaluasi. Batasi pada detail yang stabil dan berguna: tujuan proyek, audiens, pilihan yang dikonfirmasi, pertanyaan terbuka, dan beberapa preferensi. Beri label detail yang tidak pasti sebagai tidak pasti dan tandai keputusan yang telah berubah. Saat memulai tugas yang penting, sertakan bagian yang relevan secara langsung dalam prompt Anda daripada berasumsi obrolan akan mengambil setiap detail masa lalu. Ini adalah saran alur kerja yang disimpulkan dari variabilitas memori yang terdokumentasi dan penelitian tentang penggunaan konteks; ini bukan jaminan hasil yang lebih baik.

Jika suatu sistem menyebutkan nama Anda dengan benar tetapi berulang kali melewatkan pilihan utama proyek, perlakukan hal itu sebagai pengamatan yang terpisah. Jika sistem membuat draf pertama yang kuat tetapi gagal membawa koreksi ke versi berikutnya, perhatikan juga hal itu. Asisten yang berguna masih dapat menghemat waktu ketika Anda memberikan konteks dan memeriksa hasilnya; pengujian Anda memberi tahu Anda bagian mana yang memerlukan perhatian Anda.

Bagian 6

Perbedaan praktisnya

“Ia mengetahui nama saya” berarti detail pribadi tersedia dan muncul dalam respons. “Ia memahami proyek saya” dinilai lebih bermanfaat dari kemampuannya membawa konteks yang relevan ke dalam tugas nyata: mempertahankan keputusan yang telah dikonfirmasi, mengikuti batasan yang diminta, menyesuaikan format, dan menggabungkan koreksi. Cobalah brief singkat, nilai hasil yang terlihat berdasarkan daftar periksa, dan ulangi pemeriksaan pada langkah berikutnya. Itu memberi Anda ukuran konkret dari tindak lanjut proyek tanpa tertukar antara detail yang familiar atau klaim percaya diri dengan penggunaan konteks yang andal.

Bacaan terkait

Lanjutkan topik ini