Metlivi Blog

Oturum Süresini Optimize Etmeden Faydalı ve Kısa Bir Yapay Zeka Sohbeti Nasıl Ölçülür?

Kısa bir yapay zeka sohbeti, bir kişinin küçük ve yaratıcı bir görevi tamamlamasına yardımcı olduğunda başarılı olabilir: bir renk paleti seçmek, bir hafta sonu projesine isim bulmak veya kişisel bir aktivite için birkaç fikir keşfetmek gibi. Bu etkileşimi değerlendirmek için öncelikle kişinin ne istediğini tanımlayın; ardından yanıtın ilgili, yararlı ve yönlendirmesi ya da sonlandırması kolay olup olmadığını kontrol edin. Harcanan zaman ve tekrar eden ziyaretler kullanımı açıklayabilir, ancak tek başlarına etkileşimin gerçekten faydalı olup olmadığını gösteremezler.

30 Eylül 20266 dk okumaOkuma, sanat ve kültürYazan: Metlivi Editorial Team
Bölüm 1

Kişinin gerçekleştirmek istediği görevle başlayın

Bir metrik seçmeden önce, gözlemlenebilir terimlerle sıradan bir görev belirleyin. "Balkondaki saksı bahçesi için birkaç neşeli isim bul", "ilgi çekici bir sohbet gerçekleştir" hedefine kıyasla çok daha kolay değerlendirilir. İlki, inceleyenlere bakacakları somut bir çerçeve sunar: Sistem talebe uygun isimler sundu mu ve kişi bunlardan birini seçip uyarlayabildi mi?

Bu durum, daha geniş kapsamlı bir kullanılabilirlik ilkesini takip eder: Belirli kullanıcıların belirli hedeflere belirli bir bağlamda etkili, verimli ve tatmin edici bir şekilde ulaşıp ulaşmadığını değerlendirin. ISO tanımı, bunları birbiriyle ilişkili ancak farklı nitelikler olarak ele alır; dolayısıyla süre de dahil olmak üzere hiçbir tekil ölçüm hepsinin yerini tutamaz. ISO 9241-11:2018, *Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*

Yaratıcı taleplerde görev tamamlamayı, tek bir doğru cevap yerine faydalı bir sonuç olarak tanımlayın. Bir kişi seçtiği tek bir fikirle, kısa bir listeyle veya başka bir deneme için daha iyi bir yön duygusuyla ayrılabilir. Görev için neyin yeterli sayılacağını önceden yazılı olarak belirleyin. Bu, ekiplerin başarıyı sessizce "kullanıcı sohbet etmeye devam etti" şeklinde yeniden tanımlamasının önüne geçer.

Bölüm 2

Tamamlanmayı ve ilgililiği ayrı ayrı puanlayın

Pratik bir inceleme iki soruyla başlayabilir: Etkileşim belirtilen sonuca ulaştı mı ve asistanın yanıtları taleple uyuştu mu? Yanıtları birbirinden ayrı tutun. Bir yanıt konuyla ilgili olabilir ancak kişiyi işe yarar bir seçenekten mahrum bırakabilir; aynı şekilde bir kişi, dikkat dağıtıcı veya jenerik bir yanıtı görmezden gelerek de görevi tamamlayabilir.

Görev tamamlama yaygın ve basit bir ölçümdür, ancak sonuçları yalnızca bir evet/hayır çıktısına indirger; birinin neden başarısız olduğunu veya tamamlanan bir görevin ne kadar iyi gittiğini açıklamaz. Bunu sohbetin kısa bir incelemesiyle veya doğrudan bir kullanıcı değerlendirmesiyle eşleştirin. Nielsen Norman Group, “Success Rate: The Simplest Usability Metric”

Diyalog araştırmaları da bu daha detaylı yaklaşımı desteklemektedir. Görev odaklı diyalog üzerine yapılan bir çalışma; ilgililik, ilgi çekicilik, anlama, görev tamamlama ve verimliliği hem tur hem de sohbet düzeyinde incelemiş; tek bir genel puanın faydalı ayrımları gözden kaçırabileceğini ve memnuniyetin değerlendiriciler ile diyaloglar arasında değişiklik gösterdiğini ortaya koymuştur. Bu bulgular evrensel bir puanlama formülü olmasa da yaratıcı bir göreve uyarlanabilecek sağlam temelli boyutlar sunar. Siro, Aliannejadi, and de Rijke, “Understanding User Satisfaction with Task-oriented Dialogue Systems”

Bölüm 3

Yanıt kalitesini tur düzeyinde bir soru olarak ele alın

Her bir yanıtın en son talebe cevap verip vermediğini ve önceki turlardaki ilgili bağlamı kullanıp kullanmadığını inceleyin. Örneğin kişi "bunları daha az resmi yap" diyorsa, bir sonraki faydalı yanıt önerileri bu doğrultuda değiştirmelidir. Önlenebilir tekrarları, gözden kaçan kısıtlamaları veya görevi ilerletmeye yardımcı olmayan açıklama taleplerini hesaba katın.

Akıllı asistanlar üzerine yapılan bir araştırma, memnuniyetin senaryoya göre değiştiğini ortaya koymuştur: Bazı görevlerde görev tamamlama kritik öneme sahipken, diğerlerinde harcanan çaba daha önemliydi. Çalışma ayrıca diyalog bağlamının korunmasının önemli olduğunu ve genel görev memnuniyetinin yalnızca tekil sorgulardan alınan memnuniyete indirgenemeyeceğini bildirdi. Bunun pratik sonucu, hem münferit yanıtları hem de etkileşimin tamamını incelerken her birini kendi görevi bağlamında yorumlamaktır. Microsoft Research, “Understanding User Satisfaction with Intelligent Assistants”

Yaratıcı bir etkileşimde, kısa bir insan incelemesi yanıtları ilgili, kısmen ilgili veya konu dışı olarak etiketleyebilir ve asistanın düzeltmeleri takip edip etmediğini not edebilir. Bu etiketler önerilen bir inceleme yöntemidir, doğrulanmış bir kıstas (benchmark) değildir. Bunları otomatik bir sınıflandırıcı sağlıyorsa, örnekleri manuel olarak kontrol edin: Kusursuz bir puan bile teknik olarak komutla eşleşen ancak kişiye kullanabileceği hiçbir şey sunmayan bir öneriyi gözden kaçırabilir.

Bölüm 4

Kişinin etkileşimi yönlendirebildiğini kontrol edin

Kullanıcı kontrolü küçük anlarda kendini gösterir: Kişi talebi daraltabilir, başka bir üslup isteyebilir, bir yanlış anlaşılmayı düzeltebilir veya yeterli sonuca ulaştıktan sonra durabilir. Dökümleri, sistemin sürekli kendi sohbet çizgisini sürdürmek yerine verilen yönlendirmelere yanıt verip vermediği açısından inceleyin. Arayüz durdurma, düzenleme, yeniden oluşturma veya yanıtı temizleme gibi kontroller sunuyorsa, bu eylemlerin insanların beklediği gibi çalıştığını test edin.

Diyalog tabanlı yapay zeka ajanları üzerine yapılan araştırmalar, özerkliği sohbet, sorular ve yanıtlar üzerindeki kontrolü kapsayan terimlerle açıklamıştır. Bu durum, kontrolü incelenmesi gereken bir nitelik olarak ele almayı destekler; ancak bunun için evrensel bir ürün metriği ortaya koymaz. Yang and Aurisicchio, “Designing Conversational Agents: A Self-Determination Theory Approach”

Kullanıcıya yöneltilecek pratik bir soru, kontrolü ölçülebilir hale getirebilir: "Sohbeti istediğiniz türden bir sonuca ulaştırabildiniz mi?" Bu soruyu etkileşimin hemen ardından, görev tamamlama sorusuyla birlikte sorun. Yanıt seçeneklerini tüm oturumlarda tutarlı tutun ve kısa bir açıklamaya izin verin. Düşük bir puan, sohbetin incelenmesi gerektiğine dair bir işarettir; belirli bir nedenin kesin kanıtı değildir.

Bölüm 5

Net bir sonlanmayı geçerli bir sonuç olarak kabul edin

İyi bir bitiş noktası, kişinin ihtiyacı olanı aldığı ve sistemden başka bir komut gelmeden ayrılabildiği andır. Saksı bahçesi örneğinde bu, bir isme karar verdikleri an olabilir. Orada sona eren bir sohbet, jenerik takip sorularıyla uzatılan bir sohbetten daha faydalı olabilir. Bu, görevden çıkarılan bir ölçüm ilkesidir: Hedef tamamlandıysa, fazladan turlar otomatik olarak değer katmaz.

Görevin tamamlanmış görünüp görünmediğini ve kişinin devam etmeyi seçip seçmediğini takip edin, ancak bu olayları bağlamı içinde yorumlayın. Bir takip turu merakı, gerekli bir düzeltmeyi veya eksik bir yanıtı yansıtabilir. Sessizce ayrılmak, kişinin memnun olduğu, dikkatinin dağıldığı veya hayal kırıklığına uğradığı anlamına gelebilir. Sohbet uzunluğu tek başına bu açıklamaları birbirinden ayıramaz; durumu araştırmak için örneklem üzerinden metin incelemeleri veya kısa kullanıcı geri bildirimleri kullanın.

Bölüm 6

Süreyi nihai karar olarak değil, bağlam olarak kullanın

Süre, belirli bir akışın rutin olarak çok fazla tur gerektirip gerektirmediği gibi operasyonel soruları yanıtlamaya yardımcı olabilir. Yine de bu sadece geçen aktivitenin bir ölçüsüdür; bir cevabın faydalı olduğuna dair doğrudan bir kanıt değildir. Örneğin Google Analytics, etkileşim süresini etkinliklerle ilişkili kullanıcı etkileşiminin süresi olarak tanımlar; geliştirici kılavuzu ayrıca oturumları yapay olarak uzatmanın davranış verilerini çarpıttığı konusunda uyarır. Bunlar analitik tanımları ve uygulama uyarılarıdır; yaratıcı sohbetler için bir kalite ölçütü değildir. Google Analytics, “Measurement Protocol reference” ve Google Analytics, “Measure sessions and user engagement”

Zamanı yalnızca benzer görevler arasında ve görev tamamlama, ilgililik, kullanıcı kontrolü ve net bir bitiş noktası ile birlikte karşılaştırın. Daha kısa bir medyan süre daha doğrudan bir yanıtı yansıtabileceği gibi, kullanıcıların pes ettiğini de gösterebilir. Daha uzun bir süre verimli bir yineleme anlamına gelebileceği gibi gereksiz sürtünmeleri de temsil edebilir. Destekleyici kanıtlar yalnızca saatten değil, görevin sonucundan ve insanların ne deneyimlediğinden gelmelidir.

Bölüm 7

Kompakt bir değerlendirme rutini

Küçük çaplı bir çalışma için katılımcılara net bir şekilde ifade edilmiş yaratıcı bir görev verin, sohbeti doğal bir şekilde kullanmalarını sağlayın ve belirledikleri sonuca ulaşıp ulaşmadıklarını kaydedin. Etkileşimlerden oluşan bir örneklemi ilgililik, bağlam takibi ve yönlendirme ya da durdurma fırsatları açısından inceleyin. Her görevden sonra, faydalı bir sonuç alıp almadıklarını ve sohbeti yönlendirebildiklerini hissedip hissetmediklerini sorun. Süreyi bağlam olarak kaydedin, ardından süre ile bildirilen faydanın uyuşmadığı durumları inceleyin.

Ölçümleri tek bir "etkileşim" (engagement) puanında toplamak yerine ayrı ayrı raporlayın. Görevi, tamamlanmanın nasıl değerlendirildiğini, yanıtları kimin incelediğini ve kullanıcı geri bildirimlerinin nasıl toplandığını belirtin. Örneklem küçükse veya görev tanımı öznel ise bulguları her kullanıcıya veya her yaratıcı talebe genelletmek yerine yön gösterici nitelikte tanımlayın.

Kısa bir etkileşim, kişiyi belirli bir talepten kullanabileceği bir sonuca ulaştırırken rotanın ve durma noktasının kontrolünü ona bıraktığında değer taşır. Bu sonuçları doğrudan ölçün. Oturum süresinin deneyimi açıklamaya yardımcı olmasına izin verin, ancak başarıyı tanımlamasına izin vermeyin.

İlgili okumalar

Bu konuyu keşfetmeye devam et