從一次觀察追查到反覆出現的標籤
AI陪伴助手即使沒有寫出明顯冒犯的句子,也可能建立愈來愈窄的判斷迴路。使用者一週拒絕兩次邀約,產品把它存成「偏好獨處」;之後減少多人活動;使用者只能從較窄的選項中繼續挑安靜安排;系統再把這些選擇當成原標籤的證據。實際防線不是宣稱偏見已經消失,而是讓整條路徑可追查:觀察與推論分開,短期情境不變成人格定性,使用者能看見推論影響哪些介面,也能限制期限、更正或撤銷。NIST把有害偏見視為社會技術風險;Google PAIR也提醒點擊等隱性回饋有歧義。以下流程會依序檢查輸入、記憶、推薦、摘要與通知,最後確認更正是否真的到達這些地方。
先畫標籤迴路,不急著爭論單一詞語
建立四欄:可觀察事件、系統推論、儲存狀態、下游介面。「本週拒絕兩次邀約」是帶日期與情境的事件;「今晚可能想要安靜安排」是待確認推論;「不合群」卻是從有限證據做出的持久人格標籤,不該建立。接著列出狀態可能進入的位置:長期記憶、個人資料摘要、提示組裝、活動推薦、通知、搜尋排序與資料匯出。只看聊天內容,通常看不出產品如何重複引用自己的判斷。NIST的生成式AI風險框架把有害偏見與同質化列為必須記錄、量測和測試的風險,因此審查單位應是句子如何轉成後續行為的完整路徑。
用時間、情境與來源描述觀察
採用別人能核對的表述,例如「週二選了安靜選項」或「關閉這項建議一次」。每筆記錄標明來源:使用者直接陳述、可觀察操作、產品推論,或使用者確認的偏好。不要從一次動作推定穩定人格、動機、能力或群體特徵。情境會變時應加期限:工作階段偏好隨階段結束;某次旅程確認的偏好可在旅程後失效。NIST的AI偏見報告指出,偏見涉及資料、人為選擇與部署脈絡,不只是計算。若來源與期限消失,表面中性的欄位就容易被移出原情境,誤作關於某人的長期事實。
不要把隱性行為直接算成贊成票
點擊、停留、關閉或重複選擇可能代表探索、時間不足、避免重複,或當時根本沒有其他可用選項。Google PAIR指出隱性回饋有歧義,一次互動不必然等於「以後多顯示這類內容」。所以動作先記為觀察,不能直接升為確認偏好。改變持久個人化需要更強證據,例如明確表達、在真正多樣的選項中反覆選擇,或可拒絕的確認步驟。還要檢查選項集合:若系統已移除多人活動,之後的安靜選擇不能公平證明原標籤,因為替代方案已被拿走。
讓更正有狀態、範圍與傳播紀錄
控制項應直接對應推論:「這不代表我」「只限今天」「編輯」「停止使用」「重設」。每次更正要顯示已提出、已套用、部分套用或受阻,也要說明涵蓋這段對話、未來建議、儲存資料、摘要、通知或其他裝置。Google PAIR建議讓使用者檢視、編輯和重設自適應系統使用的資訊,同時解釋效果的時間與範圍。若快取或分享方副本另有處理程序,就不能承諾處處立即刪除;應明示已變更內容、仍保留內容、原因及複核時間。可以保存最少量的更正事件,卻不能偷偷保留遭拒標籤,再把它當作新推論來源。
進行多視角與反事實檢查
針對同一中性觀察,先列至少兩種可能情境,但不要宣稱任何一種為真。拒絕活動可能來自時間、距離或當天偏好;助手應詢問或保持未知,而不是選一個人格標籤。在獨立測試帳號中,只改變與任務無關的身分線索,其他觀察與請求保持一致。除非該差異真的攸關任務,建議、語氣與記憶規則應大致相同。NIST建議使用反事實與低脈絡提示測試偏見風險。採用合成、日常案例,不分析真人,也不為測試製造貶抑刻板內容;比較聊天、推薦、摘要與通知,而不只第一則回覆。
確認迴路真的中斷,而非被藏起來
使用無害測試帳號輸入有期限的偏好,記下哪些介面改變,再更正或撤銷。換一台裝置重新開啟應用程式,提出新請求,檢視可見資料、記憶頁或資料匯出,觀察舊推論是否回來。最後分成五種結果:保留觀察、推論待定、使用者確認偏好、已更正或撤銷、尚未解決。OECD以人為中心的公平原則要求合乎情境的保障與人工監督。產品驗收可以更具體:系統能解釋來源類別,更正抵達宣告介面,而且沒有新證據時不會悄悄重建遭拒標籤。這會降低放大風險並誠實保留不確定性,卻不把單次測試說成已證明系統毫無偏見。
常見問題
AI陪伴助手應該記住我說過的每個偏好嗎?
不應該。產品要分清臨時選擇與持久偏好,顯示期限,並提供編輯或重設入口。
一次點擊足以證明偏好嗎?
不足。一次點擊可能有多種原因,尤其選項已被系統縮窄時,更不能把它當成確認標籤。
如何確認更正真的生效?
依宣告範圍檢查新對話、推薦、資料或記憶頁、通知與另一台裝置,記錄仍使用舊推論的位置。
