Metlivi Blog

Yapay Zeka Grup Sahnelerini Koordine Etmek Neden Tek Karakterli Sohbetlerden Daha Zordur?

Tek karakterli bir sohbetin takip edilecek tek bir sesi ve tek bir konuşma akışı vardır. Çok karakterli bir yapay zeka sahnesi ise bir sonraki konuşmacının kim olacağına, her karakterin ne bildiğine, kimin sözlerinin gösterildiğine ve paylaşılan durumun nasıl değiştiğine de karar vermelidir. Bir grup sahnesini tutarlı kılmak için bunları ayrı koordinasyon görevleri olarak ele alın: bir konuşma kuralı belirleyin, bilgileri karaktere göre takip edin, her sırayı tutarlı bir şekilde etiketleyin ve önemli hikaye değişikliklerini açıkça kaydedin.

30 Eylül 20267 min readOkuma, sanat ve kültürYazan: Metlivi Editorial Team
Bölüm 1

Bir grup sahnesinin birden fazla diyalog görevi vardır

Bire bir diyalogda model, genellikle en son mesajı yanıtlanması gereken bir sonraki şey olarak ele alabilir. Bir grup sahnesinde ise bir karakter kullanıcıdan başka birine hitap edebilir, başka bir karakterin sorusunu yanıtlayabilir veya sahne akıp giderken sessiz kalabilir. Makul bir replik seçmek görevin yalnızca bir parçasıdır; sistem aynı zamanda konuşmacıyı seçmek ve kimin kime yanıt verdiğini korumak zorundadır.

Bu ayrım çok taraflı diyalog araştırmalarında da karşımıza çıkar. Çok taraflı hedef takibi üzerine yapılan bir çalışma, insanların hedefleri paylaştığını, birbirini yanıtladığını ve bir diğer katılımcının hedefleri hakkında bilgi sağladığını açıklar; bunlar iki taraflı diyaloglarda aynı şekilde gerçekleşmeyen etkileşimlerdir. Yazarlar ayrıca görevin, değerlendirdikleri dil modelleri için zorlayıcı kalmaya devam ettiğini bildirmektedir. Bu bulgu görev odaklı konuşmalarla ilgilidir, ancak katılımcı eklemenin yalnızca ses sayısını değil, sorunun yapısını neden değiştirdiğini gösterir. Multi-party Goal Tracking with LLMs

Bir sahneyi planlamanın faydalı bir yolu, her anda üç kararı birbirinden ayırmaktır: az önce ne oldu, kimin yanıt vermek için bir nedeni var ve hangi yanıt paylaşılan sahneyi ileriye taşır. Bir karakter yalnızca sıranın dolması gerektiği için konuşursa, sonuç genellikle bir yoklama gibi hissettirir. Bir karakterin her ana hakim olmasına izin verilirse, sahne fazladan isimler iliştirilmiş tek karakterli bir diyaloğa geri çökebilir.

Bölüm 2

Konuşma sırasının sahnenin takip edebileceği bir kurala ihtiyacı vardır

Her yaratıcı sahne için tek bir en iyi sıra düzeni yoktur. Sabit bir rotasyonun tahmin edilmesi kolaydır ve her karakterin katkıda bulunmak için düzenli bir şansa ihtiyacı olduğunda kullanışlıdır. Bağlamsal seçim daha duyarlı hissettirebilir: bir karakter, en son eylem veya soru kendilerine net bir neden verdiğinde konuşur. Kısıtlanmış bir dizi ise belirli bir yapıyı koruyabilir; örneğin diğerleri tepki vermeden önce bir karakterin bir plan önermesine izin vermek gibi.

Çok etmenli (multi-agent) grup sohbeti çatıları bu ayrımları açık hale getirir. Microsoft'un AutoGen belgeleri; model tarafından seçilen konuşmacıları, sırayla (round-robin) konuşma düzenini ve özelleştirilebilir seçim işlevlerini açıklar; seçicisi katılımcı adlarını, açıklamalarını ve konuşma geçmişini kullanabilir. Belgeler ayrıca aynı katılımcının art arda gelen sıralarda konuşmasını engelleyen varsayılan bir seçeneğe de dikkat çeker. Bunlar hikaye anlatımı kuralları değil, orkestrasyon seçimleridir ancak sahne tasarımı için pratik bir menü sunarlar. AutoGen Selector Group Chat

Yaratıcı bir sahne için, üretimden önce günlük dille küçük bir seçim kuralı tanımlayın. Örneğin: “İlk olarak doğrudan hitap edilen kişinin yanıt vermesine izin verin. Aksi takdirde yerleşik hedefi veya mevcut eylemi en alakalı olan karakteri seçin. Faydalı bir tepkisi olmayan herkesi atlayın. Bir eylemi tamamlamadığı sürece bir kişiye arka arkaya iki sıra vermekten kaçının.” Bu, kanıtlanmış bir garanti değil, önerilen bir tasarım kuralıdır. Değeri, sisteme rastgele bir rotasyona güvenmek yerine bir konuşmacı seçmesi için bir neden vermesidir.

Bölüm 3

Karakter bilgisi ayrı olarak takip edilmelidir

Paylaşılan bir sahne, her karakterin her gerçeği bilmesi gerektiği anlamına gelmez. Bir karakter bir not görmüş olabilir, diğeri yalnızca kısmi bir açıklama duymuş olabilir ve üçüncüsü henüz gelmemiş olabilir. Yazma süreci yalnızca tek bir farklılaştırılmamış konuşma geçmişi depoluyorsa, bir model sohbette bir yerde bahsedilen bir gerçeği kolayca tüm kadro için ortak bilgi olarak değerlendirebilir.

Sahne özetinin yanında basit bir bilgi defteri kullanın. Her önemli gerçek için, bunu kimin bildiğini ve nasıl öğrendiğini kaydedin. Kesinleşmemiş bilgileri doğrulanmış bilgilerden ayrı tutun: “Mira, zarfın Jo'ya hitaben yazıldığından şüpheleniyor” ifadesi “Mira zarfı okudu” ile eşdeğer değildir. Bir sıradan önce, önerilen konuşmacıyı bu deftere göre kontrol edin. Bilgiden yoksunlarsa sorabilir, gözlemleyebilir, tahminde bulunabilir veya bilgisiz kalabilirler; bunu bildikleri bir şey olarak ifade etmemelidirler.

Karakter odaklı hikaye devamı üzerine yapılan araştırmalar, persona tutarlılığını, karakter ilişkilerini ve mantıksal olay örgüsü ilerlemesini birbiriyle ilişkili zorluklar olarak tanımlar. Çalışma, hikaye bağlamına karakter ilişkisi bilgilerini ekler ve bunun hikaye devam doğruluğunu temel seviyelerine kıyasla artırdığını bildirir. Her yapay zeka sahnesinde bilgiyi takip etmek için evrensel tek bir yöntem belirlemez, ancak daha geniş bir tasarım ilkesini destekler: karakterler arası bağlam, dekoratif bir biyografi değil, sahne durumunun bir parçasıdır. Telling Stories through Multi-User Dialogue by Modeling Character Relations

Bölüm 4

Konuşmacı etiketleri anlamın bir parçasıdır

Diyaloğun yanındaki isimler biçimlendirme gibi görünebilir, ancak doğru atıf konuşma akışını korumaya yardımcı olur. Bir replik, onu kimin söylediğine bağlı olarak anlam değiştirir: ev sahibinin sorduğu bir soru yanıt davet edebilirken, bir ziyaretçinin sorduğu aynı soru belirsizlik veya meydan okuma sinyali verebilir. Etiketler kayarsa, okuyucular bir olayı kimin fark ettiğini, kimin söz verdiğini veya kimin kime yanıt verdiğini güvenilir bir şekilde anlayamaz.

Konuşmacı farkındalıklı çok taraflı diyalog sınıflandırması üzerine yapılan bir araştırma bu bağlantıyı açıkça ortaya koyar: kimin konuştuğunu bilmenin, sözün bağlam içindeki niyetini geri kazanmaya yardımcı olduğunu ve muhatap sayısı arttıkça etkileşimleri modellemenin zorlaştığını savunur. Araştırmacılar, konuşmacı davranışını yerel konuşma bağlamında temsil eden yöntemleri test eder. Bu, yaratıcı yazarlık değerlendirmesinden ziyade bir diyalog anlama araştırmasıdır, ancak kararlı bir konuşmacı etiketinin neden yapısal bir bilgi olduğunu pekiştirir. Who Is Speaking? Speaker-Aware Multiparty Dialogue Act Classification

Konuşmacı kimliğini mümkün olduğunca uzun süre yapılandırılmış veri olarak tutun, ardından görünür bir etiket olarak işleyin. Karakter başına tek bir standart isim kullanın ve atfı karıştırabilecekse takma ad, unvan ve ilk ad arasında gelişigüzel geçiş yapmayın. Anlatımı da diyalogdan ayrı tutun. Mira: “Onu kapının yanına bıraktım.” gibi bir satır, hem konuşmayı hem de iddiasını açıkça Mira'ya atar; kalabalık bir sahneye gömülü atıfsız bir satır ise belirsizliğe davetiye çıkarır.

Bölüm 5

Paylaşılan hikaye durumunun açık güncellemelere ihtiyacı vardır

Karakterler ne olduğunu hatırlayabilir, ancak sahnenin artık neyin doğru olduğuna dair derli toplu bir kayda da ihtiyacı vardır. Anlamlı bir andan sonra konum, kimin orada olduğu, hangi nesnenin hareket ettiği, hangi kararın alındığı ve neyin çözümsüz kaldığı gibi gerçekleri güncelleyin. Bunu, diyaloğun uzun bir yeniden anlatımı yerine gözlemlenebilir olayların bir dökümü olarak ele alın.

Bu önemlidir çünkü bir grup sahnesi, paylaşılan bir sekans üzerinde birden fazla bakış açısı içerir. Bir kişinin iddiası hatalı olabilir, diğeri bunu düzeltebilir ve üçüncüsü ikisini de duymadan harekete geçebilir. Sonucu söylenen repliklerden ayrı olarak kaydetmek, her iddiayı kesin bir gerçeğe dönüştürmekten kaçınmaya yardımcı olur. Yararlı bir girdi şöyle diyebilir: “Anahtar mutfak tezgahında; Jo onu oraya koydu. Mira onu görmedi.” Bu tek güncelleme, paylaşılan dünya durumunu ve bireysel bir bilgi sınırını kapsar.

Grup sohbeti orkestrasyon belgeleri, her sıradan önce konuşma geçmişinin katılımcılar arasında senkronize edilmesini ve diğerlerinin güncellenmiş bağlamı kullanabilmesi için her yanıtın yayınlanmasını tanımlar. Bu mühendislik modeli kurgu için yararlı bir analoji sunar: katılımcıların mevcut sahne kaydına erişmesi gerekir, ancak karakter bilgisinin yine de kendi sınırlarına ihtiyacı vardır. Microsoft Agent Framework: Group Chat Orchestration

Bölüm 6

Taslak oluşturmadan önce pratik bir koordinasyon adımı

Bir sahne oluşturmadan önce dört küçük not yazın: oyuncu kadrosu ve her kişinin anlık amacı; mevcut paylaşılan durum; herkes tarafından bilinmeyen gerçekler için bir bilgi defteri; ve bir sonraki konuşmacıyı seçme kuralı. Taslak oluşturma sırasında her sırayı bu notlara göre kontrol edin. Taslak oluşturduktan sonra konuşmacı etiketi hatalarını, dayanağı olmayan bilgileri, nedensiz tekrarlanan sıraları ve sahneye yapılıp hiç kaydedilmeyen değişiklikleri tarayın.

Örneğin, üç arkadaşın bir hafta sonu pazarında hangi rotadan gideceklerini seçtiğini varsayalım. Biri yakında kapanacak bir el sanatları tezgahını fark etmiştir; diğeri yemek kuyruklarını karşılaştırmaktadır; üçüncüsü ise henüz iki tabelayı da görmemiştir. İlk karakter kapanan tezgahtan bahsedebilir, ikincisi bunu kuyruğa göre tartabilir ve üçüncüsü neyi kaçırdığını sorabilir. Üçüncü kişi söylenmeden veya görmeden hemen tabeladan bahsederse, bilgi defteri devamlılık hatasını ortaya çıkarır. Bu örnekleyici bir senaryodur, raporlanmış bir deney değildir.

Temel ayrım koordinasyondur: tek karakterli yanıtlar temel olarak tek bir diyaloğu sürdürürken, grup sahneleri sıraları, kimlikleri, bilgileri ve paylaşılan olayları aynı anda uyumlu tutmalıdır. Bu sorumlulukları ayırmak, her karakteri her sırada konuşturmak veya herkese aynı bilgiyi vermek zorunda kalmadan canlı sahneler yaratmayı kolaylaştırır.

İlgili okumalar

Bu konuyu keşfetmeye devam et