Blog Metlivi

Cara Mengukur Obrolan AI Singkat yang Bermanfaat Tanpa Mengoptimalkan Durasi Sesi

Percakapan AI yang singkat dapat dikatakan berhasil jika membantu seseorang menyelesaikan tugas kreatif kecil: memilih palet warna, menamai proyek akhir pekan, atau menemukan beberapa ide untuk kegiatan pribadi. Untuk mengevaluasi interaksi tersebut, tentukan apa yang diinginkan orang tersebut, lalu periksa apakah responsnya relevan, berguna, serta mudah diarahkan atau diakhiri. Waktu yang dihabiskan dan kunjungan berulang dapat menggambarkan penggunaan, tetapi data tersebut saja tidak dapat memberi tahu Anda apakah interaksi tersebut bermanfaat.

30 September 2026Waktu baca 6 menitMembaca, seni, dan budayaOleh Metlivi Editorial Team
Bagian 1

Mulailah dengan tugas yang ingin diselesaikan pengguna

Sebelum memilih metrik, tentukan satu tugas biasa dalam istilah yang dapat diamati. "Mendapatkan beberapa nama yang ceria untuk kebun herba di balkon" lebih mudah dinilai daripada "melakukan percakapan yang menarik." Yang pertama memberi penilai sesuatu yang konkret untuk dicari: apakah sistem menawarkan nama-nama yang sesuai dengan permintaan, dan bisakah orang tersebut memilih atau mengadaptasi salah satunya?

Hal ini mengikuti prinsip kegunaan (usability) yang lebih luas: menilai apakah pengguna tertentu mencapai tujuan tertentu secara efektif, efisien, dan dengan kepuasan dalam konteks tertentu. Definisi ISO memperlakukan aspek-aspek ini sebagai kualitas yang saling terkait tetapi berbeda, sehingga tidak ada satu ukuran pun—termasuk durasi—yang dapat mewakili semuanya. ISO 9241-11:2018, *Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*

Untuk permintaan kreatif, definisikan penyelesaian sebagai hasil yang bermanfaat daripada satu jawaban yang benar. Seseorang mungkin selesai dengan satu ide yang dipilih, daftar pilihan singkat, atau arahan yang lebih baik untuk percobaan berikutnya. Tuliskan terlebih dahulu apa yang dianggap cukup untuk tugas tersebut. Hal ini mencegah tim mendefinisikan ulang keberhasilan secara diam-diam sebagai "pengguna terus mengobrol."

Bagian 2

Beri nilai penyelesaian dan relevansi secara terpisah

Tinjauan praktis dapat dimulai dengan dua pertanyaan: apakah interaksi mencapai hasil yang diharapkan, dan apakah balasan asisten sesuai dengan permintaan? Pisahkan jawabannya. Sebuah respons bisa saja relevan namun tidak memberi pengguna pilihan yang dapat digunakan; seseorang juga dapat menyelesaikan tugas setelah mengabaikan balasan yang mengalihkan perhatian atau bersifat umum.

Penyelesaian tugas adalah ukuran yang umum dan sederhana, tetapi ini menyederhanakan hasil menjadi jawaban ya-atau-tidak dan tidak menjelaskan mengapa seseorang gagal atau seberapa baik tugas yang selesai tersebut dijalankan. Pasangkan ini dengan tinjauan singkat percakapan atau penilaian langsung dari pengguna. Nielsen Norman Group, “Success Rate: The Simplest Usability Metric”

Penelitian dialog mendukung pandangan yang lebih terperinci ini. Sebuah studi tentang dialog berorientasi tugas menganotasi relevansi, daya tarik, pemahaman, penyelesaian tugas, dan efisiensi baik pada tingkat giliran bicara maupun percakapan secara keseluruhan; studi tersebut menemukan bahwa penilaian keseluruhan tunggal dapat melewatkan pembeda yang berguna, dan kepuasan bervariasi di antara para penilai dan dialog. Temuan tersebut bukanlah formula penilaian universal, tetapi mereka menawarkan serangkaian dimensi berdasar untuk diadaptasikan ke dalam tugas kreatif. Siro, Aliannejadi, dan de Rijke, “Understanding User Satisfaction with Task-oriented Dialogue Systems”

Bagian 3

Perlakukan kualitas respons sebagai pertanyaan tingkat giliran bicara

Tinjau apakah setiap jawaban merespons permintaan terbaru dan menggunakan konteks yang relevan dari giliran bicara sebelumnya. Jika pengguna mengatakan "buat itu lebih santai," misalnya, balasan berikutnya yang bermanfaat harus mengubah saran sebagaimana mestinya. Hitung pengulangan yang seharusnya bisa dihindari, batasan yang terlewatkan, atau permintaan klarifikasi yang tidak membantu memajukan tugas.

Sebuah studi tentang asisten cerdas menemukan bahwa kepuasan berbeda-beda menurut skenario: penyelesaian tugas sangat penting dalam beberapa tugas, sementara upaya lebih penting dalam tugas lainnya. Studi ini juga melaporkan bahwa mempertahankan konteks percakapan sangat penting dan kepuasan tugas secara keseluruhan tidak dapat disederhanakan hanya menjadi kepuasan terhadap kueri individual. Implikasi praktisnya adalah memeriksa baik balasan tertentu maupun keseluruhan interaksi, sambil menafsirkan masing-masing terhadap konteks tugasnya. Microsoft Research, “Understanding User Satisfaction with Intelligent Assistants”

Untuk interaksi kreatif, tinjauan manusia secara singkat dapat melabeli balasan sebagai relevan, sebagian relevan, atau melenceng dari tugas, serta mencatat apakah asisten mengikuti koreksi. Label-label ini merupakan metode tinjauan yang diusulkan, bukan tolak ukur tervalidasi. Jika pengklasifikasi otomatis yang menyediakannya, periksa sampel secara manual: skor yang tampak rapi tetap dapat melewatkan saran yang secara teknis cocok dengan perintah tetapi tidak memberi pengguna apa pun yang bisa digunakan.

Bagian 4

Pastikan pengguna memegang kendali atas interaksi

Kendali pengguna terlihat pada momen-momen kecil: pengguna dapat mempersempit permintaan, meminta gaya lain, mengoreksi kesalahpahaman, atau berhenti setelah merasa cukup. Tinjau transkrip untuk melihat apakah sistem merespons arahan alih-alih terus mengejar alur percakapannya sendiri. Jika antarmuka menyediakan kendali untuk menghentikan, mengedit, membuat ulang, atau menghapus respons, uji apakah tindakan tersebut berfungsi seperti yang diharapkan pengguna.

Penelitian tentang agen percakapan telah menggambarkan otonomi dalam istilah yang mencakup kendali atas percakapan, pertanyaan, dan respons. Hal ini mendukung pertimbangan kendali sebagai kualitas yang perlu diperiksa, meskipun tidak menetapkan satu metrik produk universal untuk itu. Yang dan Aurisicchio, “Designing Conversational Agents: A Self-Determination Theory Approach”

Pertanyaan pengguna yang ringan dapat membuat aspek kendali ini terukur: "Apakah Anda bisa mengarahkan percakapan menuju hasil yang Anda inginkan?" Ajukan pertanyaan ini setelah interaksi, bersamaan dengan pertanyaan penyelesaian tugas. Buat opsi respons konsisten di seluruh sesi dan sediakan ruang untuk penjelasan singkat. Skor rendah adalah sinyal untuk memeriksa percakapan, bukan bukti dari penyebab tertentu.

Bagian 5

Akui akhir yang jelas sebagai hasil yang valid

Titik akhir yang baik adalah ketika orang tersebut telah mendapatkan apa yang mereka butuhkan dan dapat pergi tanpa perintah lanjutan dari sistem. Untuk contoh kebun herba, itu mungkin momen saat mereka memilih sebuah nama. Percakapan yang berakhir di sana bisa jadi lebih bermanfaat daripada percakapan yang diperpanjang oleh pertanyaan lanjutan yang bersifat umum. Ini adalah prinsip pengukuran yang disimpulkan dari tugas: jika tujuan telah tercapai, giliran bicara tambahan tidak secara otomatis memberikan nilai tambah.

Lacak apakah tugas tampak selesai dan apakah orang tersebut memilih untuk melanjutkan, tetapi tafsirkan peristiwa tersebut sesuai konteks. Giliran bicara lanjutan bisa mencerminkan rasa ingin tahu, koreksi yang diperlukan, atau jawaban yang tidak lengkap. Kepergian tanpa respons (silent exit) bisa berarti pengguna puas, teralihkan, atau kecewa. Durasi percakapan saja tidak dapat membedakan berbagai penjelasan ini; gunakan tinjauan sampel transkrip atau umpan balik singkat pengguna untuk menyelidikinya.

Bagian 6

Gunakan durasi sebagai konteks, bukan sebagai penentu akhir

Durasi dapat membantu menjawab pertanyaan operasional, seperti apakah alur tertentu secara rutin membutuhkan banyak giliran bicara. Ini tetap merupakan ukuran aktivitas waktu yang berlalu, bukan bukti langsung bahwa sebuah jawaban bermanfaat. Google Analytics, misalnya, mendefinisikan waktu keterlibatan sebagai durasi keterlibatan pengguna yang terkait dengan peristiwa; panduan pengembangnya juga memperingatkan bahwa memperpanjang sesi secara artifisial akan mendistorsi data perilaku. Ini adalah definisi analitik dan kehati-hatian penerapan, bukan ukuran kualitas untuk obrolan kreatif. Google Analytics, “Measurement Protocol reference” dan Google Analytics, “Measure sessions and user engagement”

Bandingkan waktu hanya di antara tugas-tugas yang serupa dan bersamaan dengan penyelesaian tugas, relevansi, kendali pengguna, dan titik akhir yang jelas. Durasi median yang lebih pendek mungkin mencerminkan jawaban yang lebih langsung, tetapi bisa juga mencerminkan pengguna yang menyerah. Durasi yang lebih lama mungkin berarti iterasi yang produktif—atau hambatan yang tidak perlu. Bukti pendukung harus datang dari hasil tugas dan apa yang dialami orang-orang, bukan dari waktu semata.

Bagian 7

Rutinitas evaluasi yang ringkas

Untuk studi skala kecil, berikan partisipan satu tugas kreatif yang dirumuskan dengan jelas, biarkan mereka menggunakan obrolan secara alami, dan catat apakah mereka mencapai hasil yang mereka tentukan. Tinjau sampel interaksi untuk melihat relevansi, kepatuhan konteks, serta kesempatan untuk mengarahkan atau berhenti. Setelah setiap tugas, tanyakan apakah mereka mendapatkan hasil yang bermanfaat dan merasa mampu mengarahkan percakapan. Catat durasi sebagai konteks, lalu periksa kasus-kasus di mana durasi dan kegunaan yang dilaporkan tidak sejalan.

Laporkan metrik-metrik tersebut secara terpisah, alih-alih menggabungkannya ke dalam satu skor "keterlibatan". Nyatakan tugasnya, bagaimana penyelesaian dinilai, siapa yang meninjau balasan, dan bagaimana umpan balik pengguna dikumpulkan. Jika sampelnya kecil atau definisi tugasnya subjektif, jelaskan temuan sebagai hal yang bersifat directional (memberi arah) daripada menggeneralisasikannya ke setiap pengguna atau permintaan kreatif.

Interaksi singkat menjadi penting ketika interaksi tersebut membawa orang dari permintaan spesifik ke hasil yang dapat mereka gunakan, sambil tetap memberi mereka kendali atas alur dan titik perhentiannya. Ukur hasil-hasil tersebut secara langsung. Biarkan durasi sesi membantu menjelaskan pengalaman, tetapi jangan biarkan itu menentukan keberhasilan.

Bacaan terkait

Lanjutkan topik ini