更長的角色卡會讓聊天機器人角色更具一致性嗎?
單憑較長的角色卡,無法確保聊天機器人角色會顯得更加真實可信。當額外的細節為模型提供了可在場景中使用的相關、相容的指引時,這些細節才是有益的;重複的內容、不相關的事實或前後矛盾,反而會讓角色更難以維持一致的呈現。若要決定是否擴充角色卡,請在相同的場景中比較簡潔版與詳細版,然後分別檢視一致性、語氣以及令人信服的抉擇。
角色卡需要發揮什麼作用?
當一張角色卡有助於在對話中回答實際問題時,它就是有用的:這個角色想要什麼?他們傾向於如何說話?他們知道些什麼,而當事情不明確時他們會如何反應?能夠引導這些抉擇的細節,比起從未影響對話互動的瑣碎細節,具有更明確的功用。
試想「收藏古董鈕釦」與「收藏古董鈕釦,且在感到尷尬時會用身邊的物品來開啟話題」之間的差異。前者只是一個事實;後者則提示了一種可在場景中展現的行為。兩者都不是天生就有價值:如果該角色從未遇到相關的情境,這項事實可能完全無法改善互動。
可信度也不僅僅是記住資料設定中的事實。一個角色可能會提到正確的家鄉,但說話方式卻平淡無奇;或者保持著獨特的語氣,所作的抉擇卻與其陳述的優先事項互相衝突。應將事實的延續性、語氣以及行為視為彼此相關但各自獨立的特質。
研究能告訴我們什麼——又無法告訴我們什麼
2025 年的研究[《Principled Personas》](https://aclanthology.org/2025.emnlp-main.1364/)評估了專家角色提示詞在語言模型任務表現上的影響。該研究將對不相關角色屬性的穩健性(robustness)以及對角色屬性的忠實度(fidelity)列為評估目標,並指出不相關的細節可能會影響表現。這正是我們不應盲目假設「添加任何事實都無害」的原因。但該研究探討的是專家角色與任務表現;它並未比較簡短與冗長的虛構角色卡,也沒有確立出最佳的角色卡長度。
2026 年的論文[《Multi-dimensional Evaluation of Character-Authentic Dialogue Models Learned from Question-Answer Data》](https://aclanthology.org/2026.lrec-1.209/)從可重現性、多樣性、幻覺以及角色真實性等多個維度評估了角色對話方法。該論文指出了在不同訓練方法與對話品質之間的權衡取捨。這支持了從多個維度來評估角色塑造的觀點。但這並非一項針對提示卡長度的實驗,因此無法證明較長的角色卡能提升真實性。
綜合來看,這些研究資料提出了值得深思的問題——這些細節是否相關,以及你正在衡量哪種品質?它們並未提供通用的字數標準,也未證明某種特定的角色卡撰寫公式適用於所有模型或角色。
精簡角色卡範例
這是一個刻意保持簡短的虛構角色卡:
**瑪拉·維爾(Mara Vale)** 是一位耐心且觀察敏銳的鐘錶修理工,比起閒聊,她更喜歡務實的問題。她說話簡短精準,偶爾展現冷幽默。她希望維持已故導師的工作室繼續營運。當她不確定時,她會如實相告,並要求在提出維修建議前先檢查鐘錶。她精通鐘錶機械結構;除非顧客主動告知,否則她對顧客的過往一無所知。
這張卡涵蓋了身份角色、動機、語氣、應對模式以及知識邊界。這些元素都可以在場景中進行測試。此長度只是一個範例,並非建議的理想字數。如果某個場景暴露出了缺失的細節——例如瑪拉在遇到超出她技術範圍的維修時會如何反應——你可以添加具體的行為描述,而不是寫上一整段的人物生平傳記。
在審視每個句子時,一個實用的編輯問題是:「因為卡片中包含了這句話,角色在說話、認知或行為上應該產生什麼不同的表現?」如果沒有合理的答案,該細節可能只是裝飾性的。裝飾性事實仍然可以是你創作意圖的一部分,但不應將其誤認為角色行為會更具一致性的依據。
進行受控的 A/B 檢視
公正的比較應該改變的是角色卡本身,而不是它所處的情境條件。請使用以下簡單流程:
分別檢視五項角色特質
對兩個版本角色卡產生的每個回應,都使用相同的五個問題進行檢驗。
解讀檢視筆記
這些評分是編輯輔助工具,而不是經過驗證的科學量表。在可行的情況下,讓評審在不知道回應是由哪張卡片產生的情況下進行比較;這可以減少偏向自己花費更多時間撰寫之版本的傾向。為每個評分保留簡短的註記說明,使結果不僅僅是一個分數。
在添加更多內容前解讀比較結果
如果版本 B 在多個場景中改善了特定維度且沒有削弱其他維度,請保留那些合理帶來助益的細節。如果它僅改善了事實記憶卻使對話變得僵硬,請評估對這個角色而言,事實記憶還是自然的場景反應更為重要。如果兩個版本看起來差不多,添加的內容可能在這些場景中並未發揮作用;這並不能證明它在其他地方永遠無關緊要。
當結果好壞參半時,請檢查指令是否存在冗餘或衝突。例如,「始終保持簡潔」與「詳細描述每個想法」傳達了相互矛盾的風格訊號。同樣地,如果角色卡沒有明確說明哪些經驗會塑造當前的行為,豐富的背景歷史可能會難以應用。將衝突改寫為具體的優先順序,或刪除對角色塑造無益的細節。
如果角色在重要事實上出現疏漏,請讓該事實更容易被檢索定位,並清楚說明其邊界。如果語氣顯得平淡通用,請添加一種可觀察到的言語習慣,並在對話中進行測試。如果決策顯得前後不一致,請釐清角色的目標以及他們在面臨挑戰時的反應。每一次修改都應該針對具體指出的弱點;不加區別地添加背景生平只會讓人更難判斷究竟是什麼起到了作用。
何時應該擴充電色卡?
當反覆出現的場景暴露出了實質的缺口時,再進行擴充:例如角色的動機不明確、缺乏知識邊界,或者對經常出現的情況缺乏應對指引。添加的內容應保持足夠具體以便測試。接著重新運行相同的場景,檢查預期的特質是否有所改善,且沒有產生新的矛盾或降低反應靈活度。
在引用的研究中,沒有任何證據支持存在一個通用的「可靠角色卡長度」。當一張簡潔的角色卡能夠持續穩定地引導你在意的場景時,它就已經足夠了。而當一張較長的角色卡所包含的額外細節能夠改變相關抉擇時,它就會很有用。請根據角色在穩定範例中的實際表現來評判結果,而不是根據設定資料中的字數多寡。
這種比較有助於在特定條件下評估角色卡;它無法證明該角色卡在每次對話、不同模型或各種設定中都會表現得完全相同。人類編輯仍應判斷這種呈現方式是否符合角色定位以及預期的體驗。
