İnsan Gibi Konuşmanın Ötesinde: Yapay Zekâ Sohbet Tasarımı İçin Dört Daha İyi Hedef
Bir yapay zekâ sohbet etkileşimine yön veren tasarımcılar için "gerçek hissettirsin" hedefi, faydalı kararlara rehberlik etmek için fazla belirsizdir. Daha iyi bir hedef; birinin net bir yanıt almasına, bir fikri keşfetmesine, sistemin ne yaptığını anlamasına ve bundan sonra ne olacağını seçmesine yardımcı olmaktır. Antropomorfik (insansı) ipuçları üzerine yapılan araştırmalar, insan benzeri sinyallerin insanların bir yapay zekânın bilgilerinin ne kadar doğru olduğuna dair algısını değiştirebileceğini göstermektedir. Bu da açıklığı, yaratıcı denemeleri, güvenilir görev durumunu ve kullanıcı kontrolünü, insan kimliğini taklit etmekten çok daha faydalı tasarım hedefleri haline getirir.
Yapay zekâ sohbeti neden insan benzerliğinin ötesini hedeflemeli?
Bir konuşma, kullanıcıya sistem hakkında güvenilir bir fikir vermeden de akıcı gelebilir. 2.165 katılımcıyla yapılan bir deneyde araştırmacılar, sözde bir dil modelinin yalnızca metin mi yoksa metinle birlikte ses mi kullandığını ve kendisinden "ben" mi yoksa "sistem" olarak mı bahsettiğini değiştirerek test etti. Metne eklenen ses, katılımcıların antropomorfizm ve bilgi doğruluğu puanlarını artırdı; birinci tekil şahıs kullanımı ise bir bağlamda doğruluk puanlarını yükseltirken algılanan riski düşürdü. Bu bulgular çalışma ortamına özgüdür, ancak bir sistemi daha insansı gösteren bir ipucunun, onun verdiği bilgilerin değerlendirilmesini de etkileyebileceğini göstermektedir. Google Research, “Believing Anthropomorphism: Examining the Role of Anthropomorphic Cues on User Trust in Large Language Models”
İşte bu yüzden antropomorfik ipuçları ve etkileşim kalitesi ayrı ayrı denetlenmeyi hak eder. Bir antropomorfik ipucu denetimi, arayüzün yapay zekânın kimliği veya insani nitelikleri hakkında ne ima ettiğini sorgular. Bir yargı riski denetimi ise bir ipucunun, kullanıcıların çıktının doğruluğunu veya güvenilirliğini abartmasına yol açıp açmayacağını inceler. Aşağıdaki tasarım hedefleri farklı bir soruya odaklanır: Bir kişi bu etkileşim sırasında neyi anlayabilmeli, yapabilmeli ve neye karar verebilmelidir? Sistemin yeteneklerini veya görev durumunu belirsizleştirmediği sürece sıcak bir üslup bu hedeflerle bir arada var olabilir.
Microsoft'un Human-AI eXperience Toolkit'i (İnsan-Yapay Zekâ Deneyimi Araç Seti), rehberliğini bir yapay zekâ sisteminin ilk kullanımda, etkileşim sırasında, hatalı olduğunda ve zaman içinde nasıl davrandığına göre düzenler. Bu yapı sohbet tasarımı için oldukça faydalıdır; çünkü dikkati bir karakterin kişiliğinden, sistemi kullanan kişinin değişen ihtiyaçlarına kaydırır. Microsoft, “Guidelines for Human-AI Interaction”
Açıklığı konuşmanın görünür bir özelliği haline getirin
Açıklık, kusursuz derecede konuşma dili kullanan bir ses tonuyla değil, kullanıcının göreviyle başlar. Üç hafta sonu aktivitesi fikri isteyen birinin karşılaştırabileceği seçeneklere ihtiyacı vardır; bir metnin yeniden yazılmasını isteyen birinin ise üzerinde değişiklik yapabileceği bir taslağa ihtiyacı vardır. Arayüz, talep edilen işlem ile sunulan sonucun ayırt edilmesini kolaylaştırmalıdır. Yapay zekâ bir materyali öneriyor, özetliyor veya dönüştürüyorsa, bu katkıyı açıkça etiketleyin ve kullanıcının bunu değerlendirebilmesi için yeterli bağlamı koruyun.
Faydalı bir etkileşim, bu bilginin önem taşıdığı noktada yapay zekânın neyi yapıp neyi yapamayacağını da gösterebilir. Örneğin, bir sohbet asistanı bir plan önerebiliyor ancak rezervasyon yapamıyorsa, yanıt bu eylemi belirsiz bırakmamalıdır. Neyin hazır olduğunu, neyin hâlâ kullanıcıyı gerektirdiğini ve hangi ayrıntıların belirsizliğini koruduğunu belirtin. Bu, tek bir ifade kalıbının her üründe işe yarayacağı iddiasından ziyade, HAX'in etkileşim boyunca sergilenen uygun davranış vurgusundan çıkarılan bir tasarım önerisidir.
Basit bir açıklık testi, kısa bir etkileşimden sonra birine şunu sormaktır: Sistemden ne yapmasını istediniz? Sistem gerçekte ne yaptı? Sonucu kullanmadan önce neyi kontrol etmeniz veya neye karar vermeniz gerekir? Yanıtlar arayüzün hedeflenen anlamından uzaklaşıyorsa, daha fazla kişilik eklemeden önce ifadeleri, yapıyı veya sonraki adım ipuçlarını gözden geçirin.
Keşfi desteklemek için oyunu kullanın
Oyunsuluk (playfulness), insanlara bir aracı ve sunduğu olasılıkları keşfetme yolu sunar. ChatGPT hakkındaki 372 kullanıcı paylaşımını inceleyen bir çalışmada araştırmacılar; şakalaşmayı, sisteme meydan okumayı ve sınırlarını test etmeyi içeren oyun dolu etkileşimler tespit etti. Yazarlar, örneklemin ChatGPT kullanımının erken bir dönemine ait paylaşımları yansıttığını belirtmekle birlikte, bu etkileşimleri insanların yapay zekânın yeteneklerini ve failliğini keşfetme biçimi olarak tanımlamaktadır. Nikghalb ve Cheng, “Interrogating AI: Characterizing Emergent Playful Interactions with ChatGPT”
Tasarımcılar açısından bunun pratik sonucu, her asistanı bir komedyene dönüştürmek değildir. Asıl mesele, düşük riskli denemeleri kolaylaştırmaktır: farklı bir açı denemenin, alternatifleri karşılaştırmanın veya önceki sürümü kaybetmeden bir taslağı gözden geçirmenin yollarını sunun. "Bana üç beklenmedik tema ver" gibi kısa ve yaratıcı bir komut, kullanıcının hedefini gözden kaçırmadan keşif yapmaya davet edebilir. Oyun, kullanıcının katlanmak zorunda olduğu bir performans değil, erişilebilir bir mod olmalıdır.
Oyunsu insan-yapay zekâ içerik üretim araçları üzerine yapılan araştırmalar, oyunsuluğu yaratıcılıktan ayırırken oyunu yaratıcı tepkilerin olası bir kolaylaştırıcısı olarak tanımlar. Oyunsuluğu garanti edilebilecek bir sonuçtan ziyade desteklenmesi gereken bir deneyim olarak ele alırken, arayüzü, yapay zekâ davranışını ve diyaloğu tasarım fırsatları olarak tartışır. Liapis ve ark., “Designing for Playfulness in Human-AI Authoring Tools”
Görev durumunu sıralar boyunca okunabilir tutun
Bir sohbet arayüzü doğal hissettirebilir, ancak yine de yapılan işin takibini kaybedebilir. Görev durumu; kullanıcının mevcut hedefini, halihazırda alınmış kararları, hâlâ açık olan seçenekleri ve bir sonraki adımı içerir. Etkileşim çok adımlı hale geldiğinde, kısa bir özet sistemin mevcut anlayışını gösterebilir: "İki seçeneğiniz kaldı; kısa bir yürüyüşü tercih ediyorsunuz; henüz bir konum seçmedim." Bu durum, konuşma devam etmeden önce kullanıcıya durumu düzeltme şansı verir.
Etkileşim kalıbı görevin karmaşıklığına uygun olmalıdır. Ding ve Chan'in insan-yapay zekâ metin ortak üretimi hakkındaki makalesi; sabit kapsamlı kürasyonu, bağımsız yaratıcı görevleri ve karmaşık, birbirine bağımlı yaratıcı görevleri birbirinden ayırır. Bunları, sınırlı müdahaleden yinelemeli iş birliğine kadar farklı etkileşim kalıplarıyla eşleştirir. Buradan çıkarılacak faydalı tasarım sonucu şudur: Tek turluk bir yanıt sınırları belli bir özet için uygun olabilirken, gelişmekte olan yaratıcı bir görev, seçimleri ortaya koyan ve kişinin sonucu şekillendirmesine olanak tanıyan sıralardan fayda sağlar. Ding ve Chan, “Mapping the Design Space of Interactions in Human-AI Text Co-creation Tasks”
Pratik bir durum kontrolü için, konuşma boyunca örnek bir görevi baştan sona takip edin. Her sırada, kişinin neyin tamamlandığını, neyin henüz çözülmediğini ve yanlış bir varsayımın nasıl düzeltileceğini anlayıp anlayamadığını sorgulayın. Yanıt daha önceki birkaç sıranın hatırlanmasına dayanıyorsa, kısa bir özet veya kararların görünür bir listesini ekleyin. Sistem bir ayrıntıyı güvenilir şekilde koruyamıyorsa, sahip olmadığı bir sürekliliği ima etmek yerine bu sınırlılığı açıkça belirtin.
Kullanıcılara anlamlı bir kontrol verin
Kontrol, kişiye etkileşimi yönlendirmek veya revize etmek için kullanışlı bir yol sunmak anlamına gelir. Sohbette bu; birinin seçenekler arasından seçim yapmasına, oluşturulan bir taslağı düzenlemesine, bir kısıtlamayı değiştirmesine veya sistemden durup özetlemesini istemesine izin vermek kadar basit olabilir. Bu kontroller en çok kullanıcının önemsediği bir kararı etkilediğinde değerlidir; anlamlı hiçbir şeyi değiştirmeyen bir ayar menüsü, faillik sağlamadan karmaşıklık yaratır.
Grup tartışmalarındaki bir diyalog ajanını konu alan bir deney, ajanın az katkıda bulunan katılımcıları belirleme yeteneğine ilişkin beklentileri belirleme yöntemlerini karşılaştırdı. Doğruluk hakkındaki bilgileri, tespit yaklaşımı ile verilerin bir açıklamasını ve bir ayarlama kontrolünü test etti. Bu özel çalışmada açıklama, kullanıcıların algoritmayı anlamasına yardımcı oldu ve genel olarak en etkilisiydi; yalnızca bir ayarlama kontrolü vermek ise daha olumsuz algılanan bir tartışma deneyimine yol açtı. Bu sonuç, bir kontrolü yalnızca var olduğu için faydalı kabul etmeye karşı bir uyarı niteliğindedir: kontrolün neyi değiştirdiğini açıklayın ve doğuracağı sonucu anlaşılır kılın. Do ve ark., “Inform, Explain, or Control: Techniques to Adjust End-User Performance Expectations for a Conversational Agent Facilitating Group Chat Discussions”
Pratik bir tasarım sırası şöyledir: mevcut yorumu gösterin, az sayıda anlamlı bir sonraki eylem sunun ve düzeltmeyi kolaylaştırın. Örneğin, bir gezi planı oluşturduktan sonra sistem rotayı kısaltmayı, bir aktiviteyi değiştirmeyi veya taslağı korumayı isteyip istemediğini sorabilir. Her seçenek somut bir değişikliği belirtir. Bu örnek açıklama amaçlıdır; herhangi bir ürünün özelliğini değil, genel bir etkileşim kalıbını tanımlar.
Hedefleri bir inceleme kontrol listesine dönüştürün
Bir sohbet tasarımını değerlendirirken, sıradan bir görevi baştan sona inceleyin. İlk alışverişin sistemin rolünü açıkça belirtip belirtmediğini; bir kullanıcının öneri ile tamamlanmış bir eylemi ayırt edip edemediğini; keşif amaçlı bir turun oyuncu bir kişiliği zorlamadan denemeye davet edip etmediğini; ve konuşmanın kararları ile çözülmemiş adımları doğru gösterip göstermediğini kontrol edin. Ardından kişinin sistemi düzeltip düzeltemediğini ve mevcut her bir kontrolün etkisini anlayıp anlayamadığını denetleyin.
Son olarak, dili ve sunumu, insan kimliğini veya özel bir güvenilirliği ima edebilecek ipuçları açısından inceleyin. Birinci şahıs iddialarının, sesin, duygusal dilin veya insan benzeri bir avatarın, kullanıcının bir yanıt hakkındaki yargısını etkileyip etkileyemeyeceğini değerlendirin. Bu inceleme, etkileşimin anlaşılır ve faydalı olup olmadığını test etmenin yerini almaz, onu tamamlar. Bir sohbet tasarımının asıl güçlü ölçütü, etkileşimin bir insanla yapılan bir konuşma hissi vermesi değil; bir kişinin yapay zekânın katkısını ve bir sonraki seçeneği net bir şekilde görerek kendi görevini sürdürüp sürdüremediğidir.
