İnsansı bir ipucunu sisteme dair kanıtlardan ayırın
Antropomorfik tasarım muhakemeyi etkileyebilir; çünkü insansı bir isim, ses, avatar, birinci tekil şahıs cümlesi, hatırlanan bir ayrıntı, hızlı sıra alma düzeni veya ilişkisel bir ifade bir arayüzü süslemekten çok daha fazlasını yapar. Sistemin insani bir şekilde anladığı, istikrarlı niyetlere sahip olduğu, kesintisiz biçimde hatırladığı veya geniş ölçüde yetkin olduğu çıkarımını tetikleyebilir. Bu çıkarım da temel alınan kanıt değişmese bile kullanıcının neyi kabul ettiğini, doğruladığını, paylaştığını, devrettiğini veya onayladığını değiştirebilir. Bu bir olasılıktır, her kişi veya her etkileşim için geçerli bir kural değildir. Faydalı olan yaklaşım tüm kişiliği ortadan kaldırmak değildir. Asıl yapılması gereken dört unsuru birbirinden ayrı tutmaktır: arayüzün sunduğu ipucu, arayüze atfedilen yetenek veya niyet, bu atfın teşvik ettiği eylem ve eylemi yeniden kalibre edebilecek kontrol veya kanıt. Bu makale söz konusu zinciri incelemektedir; belirli bir cevabın olgusal olarak desteklenip desteklenmediğini kontrol etmek ise ayrı bir görev olmaya devam eder.
Etkilerini değerlendirmeden önce insansı ipuçlarının bir envanterini çıkarın
Gözlemlenebilir tasarım tercihleriyle başlayın. Karakter adını ve biyografisini, yüzünü veya vücudunu, sesini, birinci tekil şahıs zamirlerini, yazma duraklamalarını, sıra almayı, selamlaşmaları, özürleri, hatırlamaya ilişkin ifadeleri, proaktif mesajları, paylaşılan geçmişe yapılan göndermeleri ve tercih, endişe, niyet veya mevcudiyet ima eden ifadeleri kaydedin. Ayrıca hizmetin kendisinin nerede konuştuğuna da dikkat edin: pazarlama, ilk katılım (onboarding), sohbet, bildirimler, hafıza ayarları, ödeme istemleri ve hata durumları farklı sesler kullanabilir. Bir ipucu otomatik olarak yanıltıcı anlamına gelmez. Bir isim gezinmeyi kolaylaştırabilir, bir ses erişilebilirliği artırabilir ve konuşma diline özgü bir ifade etkileşim çabasını azaltabilir. Buradaki asıl mesele, ipucunun doğru bir sınırla eşleştirilip eşleştirilmediğidir. ‘Planımızı hatırlıyorum’ ifadesi; kayıtlı bir not, getirilen bir transkript, geçici bir bağlam penceresi veya üretilmiş bir ifade anlamına gelebilir; bu mekanizmalar birbirinden farklı beklentileri destekler. Dahili bir durumun var olduğu sonucuna varmadan, yalnızca neyin göründüğünü tanımlayın. Bu, hoş bir tarzın varsayılan olarak bir yetenek kanıtına dönüşmesini engeller.
Yetenek atfı ile niyet atfını birbirinden ayırın
İnsansı sunum en az iki farklı sıçramayı tetikleyebilir. Bir yetenek sıçraması; akıcılığı varsayılan bir anlayışa, ayrıntılı bir yanıtı geniş kapsamlı bir uzmanlığa veya tek bir maddenin hatırlanmasını eksiksiz ve kesintisiz bir hafızaya dönüştürür. Bir niyet sıçraması ise; bir özrü kişisel bir pişmanlığa, bir öneriyi bağımsız bir tercihe veya sıcak bir ifadeyi sistemin kendi hedefini oluşturduğuna dair bir kanıta dönüştürür. Her iki sonuca da yalnızca ifadelere bakılarak ulaşılamaz. Google PAIR, antropomorfik arayüzlerin ürünün yapabileceklerinin ötesinde beklentiler oluşturabileceğini belirtmekte ve algoritmik yapının ve sınırların açıklanmasını önermektedir. Microsoft Research de benzer şekilde duyguları, inançları, yaşam deneyimini, özgür iradeyi veya bir benliği ima eden dili, incelenmeye değer tasarım tercihleri olarak tanımlamaktadır. Bir kayıt çizelgesine dar ve gözlemlenebilir iddiayı yazın: ‘hayatımı biliyor’ yerine ‘arayüz kaydedilen etkinliği görüntüledi’ veya ‘sonuçla ilgilenmeyi amaçladı’ yerine ‘destekleyici bir cümle üretti’ deyin. Dar kapsamlı bir dil, özelliğin gerçekte ne yaptığını muhafaza eder.
Muhakeme kaymasını sadece bir puanda değil, eylemde arayın
Pratik etki, bir atıf bir eylemi değiştirdiğinde ortaya çıkar. Belirtilen dayanağı kontrol etmeden bir öneriyi kabul etmek, daha geniş hafıza veya kişi izinleri vermek, görev için gereksiz bilgileri paylaşmak, uygulamanın bir son teslim tarihi veya satın alma adımı seçmesine izin vermek, yanıt kendinden emin duyulduğu için bir hatayı gözden kaçırmak veya arayüz istikrarlı bir ilişki geçmişi ima ettikten sonra devam etmek bu duruma örnektir. Bu eylemlerin hiçbiri, seçime kesinlikle antropomorfizmin neden olduğunu kanıtlamaz; fiyat, kolaylık, geçmiş deneyim ve görev zorluğu da rol oynayabilir. CHI 2024 çalışması daha dar kapsamlı kanıtlar sunmaktadır: Kontrollü sözde-LLM ortamında, konuşma artı metin, antropomorfizmi ve algılanan doğruluğu artırmış; birinci tekil şahıs ifadeleri ise bir bağlamda doğruluk ve risk değerlendirmelerini değiştirmiştir. Bu sonucu her uygulama için geçerli sabit bir yüzdeye genellemeyin. Bunun yerine, kullanıcının eylemini, içerik düz bir sistem mesajı olarak sunulsaydı kullanacağı karar kuralıyla karşılaştırın.
Atfın sonuç doğurmaya başladığı anda kalibrasyon yapın
Kurulum sırasındaki tek bir feragatnameyi sonraki ipuçlarından ayırmak kolaydır. Kalibrasyonu ilgili kararın hemen yanına yerleştirin. Sohbet karakterini yapay zekâ olarak tanımlayın; mevcut özelliğin görevini, girdisini, hafıza kaynağını, sınırlarını ve bir insanın dahil olup olmadığını açıklayın; üretilen dili depolanan olgulardan ve yürütülen eylemlerden ayırt edin; hatırlanan bir ayrıntının ne zaman görüntülenebileceğini, düzenlenebileceğini veya kaldırılabileceğini gösterin; ve harici bir eylemden veya daha geniş bir izin vermeden önce onay isteyin. Sistem emin değilse veya görevi tamamlayamıyorsa, hataya daha fazla kişilik katmak yerine konuşma odaklı olmayan bir yedek seçenek sunun. Google PAIR, tek ve aşırı yüklenmiş bir tanıtım yerine, ürün değiştikçe aşamalı bir ilk katılım (onboarding) ve hatırlatıcılar önerir. Kalibrasyon simetrik de olmalıdır: bir izin talep ederken sevimli bir persona kullanıp, yalnızca hata açıklarken soğuk bir teknik etikete başvurmayın. Aynı kimlik ve yetenek sınırı sohbette, ayarlarda, bildirimlerde ve pazarlamada görünür kalmalıdır.
Kanıtı sabit tutarak bir negatif kontrol gerçekleştirin
Canlı bir hizmeti manipüle etmeye çalışmak yerine, kendi görüşünüz üzerinde sınırları belirlenmiş bir negatif kontrol uygulayın. Sonuç doğurabilecek tek bir istemi alın ve ortaya çıkan iddiayı düz bir nota kopyalayın. Avatarı kaldırın, ayar mevcutsa sesi kapatın, ‘bence’ veya ‘istiyorum’ ifadelerini ‘sistem şunu üretti’ ile değiştirin ve içeriğin özünü değiştirmeden animasyonu veya sosyal zamanlamayı gizleyin. Ardından kendinize sorun: Kabul etme, doğrulama, açıklama, devretme veya izin verme şeklim farklı olur muydu? Kanıt sabit kalırken eylem değişiyorsa, ipucunu kararla ilişkili olarak işaretleyin. İkinci bir kontrol ise yönü tersine çevirir: Samimi sunumu koruyun ancak iddiayı açıkça desteklenmeyen veya bilinmeyen bir ifadeyle değiştirin. Aynı sıcaklık iddianın ağırlığını yine de artırıyor mu? Kasıtlı olarak güvenli olmayan içerikler kullanmayın, gizli kontrolleri kurcalamayın veya başka bir kişiyi dahil etmeyin. Amaç, evrensel bir nedensellik yasasını kanıtlamak değil, geri döndürülebilir kişisel bir karardaki sunum etkisini ortaya çıkarmaktır.
Dört sütunlu bir kayıt tutun ve arayüz sonucunu test edin
Anlam taşıyan her an için dört sütun kaydedin: gözlemlenen ipucu; atfedilen yetenek veya niyet; teşvik edilen eylem; mevcut kalibrasyon kontrolü veya bağımsız kanıt. Negatif kontrol sonucunu ve uygulama sürümünü not olarak ekleyin. Ürün ekipleri, ses, avatar, birinci tekil şahıs dili, hafıza ifadeleri veya yanıt zamanlaması değişirken içeriğin özünün aynı kaldığı eşleştirilmiş senaryoları test edebilir. Yalnızca karakterin ne kadar sevimli göründüğünü değil; kabul etme, düzenleme, doğrulama, açıklama, devretme veya izni genişletme gibi davranışları ölçün. İpucusuz durumu da dahil edin; yetenek etiketlerinin, hafıza kontrollerinin, belirsizlik ifadelerinin, onay ekranlarının ve kolay geri almaların göreve uygun bir kararı yeniden tesis edip etmediğini kontrol edin. NIST'in kullanıcı güveni çalışması; kişiyi, sistemi, görevi ve bağlamı bir arada incelemeyi destekler. Kalibre edilmiş bir arayüz maksimum veya minimum güven talep etmez; kullanıcının bu çıktıya ve bu özelliğe yalnızca burada desteklenen kadar ağırlık vermesine yardımcı olur.
Sık sorulan sorular
Her samimi yapay zekâ personası aldatıcı mıdır?
Hayır. İnsansı ipuçları gezinmeyi veya erişilebilirliği iyileştirebilir. Endişe, sunumun arayüzün doğru bir şekilde sınırlandırmadığı yetenek veya niyet çıkarımlarını desteklediği an başlar.
Hatırlanan bir ayrıntı, kesintisiz bir anlayışın kanıtı mıdır?
Hayır. Kaydedilmiş bir nottan, transkript getirmeden, geçici bağlamdan veya başka bir mekanizmadan kaynaklanabilir. Belirtilen hafıza kaynağını ve kontrollerini inceleyin.
Bu, bir yapay zekâ cevabını doğrulamakla (fact-checking) aynı şey midir?
Hayır. Bilgi doğrulama, iddianın dayanağını test eder. Bu yöntem ise insansı sunumun aynı dayanağa verdiğiniz ağırlığı değiştirip değiştirmediğini test eder.
