セッション時間に最適化せずに有意義な短いAIチャットを測定する方法
短いAIとの会話は、カラーパレットの選択、週末のプロジェクトの命名、個人的なアクティビティのアイデア出しなど、ちょっとしたクリエイティブなタスクを完了する手助けとなれば成功と言えます。そのやり取りを評価するには、ユーザーが何を求めていたのかを定義し、回答が適切で有用であり、誘導や終了が容易であったかどうかを確認します。滞在時間や再訪率は利用状況を示すことはできますが、それら単体ではやり取りが役に立ったかどうかを判断することはできません。
ユーザーが達成しに来たタスクから始める
指標を選択する前に、1つの日常的なタスクを観察可能な言葉で明確に定義します。「バルコニーのハーブガーデンのための遊び心のある名前をいくつか得る」というタスクは、「魅力的な会話をする」よりも評価が容易です。前者はレビュアーに具体的な着眼点を提供します。システムは要望に合った名前を提案したか、そしてユーザーはその中から1つを選択または応用できたか、という点です。
これは、より広範なユーザビリティの原則に従っています。つまり、特定のユーザーが、特定のコンテキストにおいて、有効性、効率性、満足度を伴って特定の目標を達成できるかどうかを判断することです。ISOの定義では、これらを関連しつつも異なる性質として扱っているため、時間を含む単一の指標がそのすべてを代表することはできません。ISO 9241-11:2018, *Ergonomics of human-system interaction — Part 11: Usability: Definitions and concepts*
クリエイティブなリクエストの場合、完了の定義は単一の正解ではなく「有用な結果が得られたこと」とします。ユーザーは、選んだ1つのアイデア、候補リスト、あるいは再挑戦のためのより良い方向性を得て離脱するかもしれません。タスクとして何をもって十分とするかを事前に文書化しておきます。これにより、チームが「ユーザーがチャットを続けた」ことを密かに成功と再定義してしまうのを防ぐことができます。
完了度と関連性を分けて評価する
実践的なレビューは、2つの問いから始めることができます。やり取りは設定された成果に到達したか、そしてアシスタントの返答はリクエストに適合していたか、です。回答は別々に記録してください。返答が適切であっても、ユーザーに使える選択肢が残らない場合もありますし、気が散るような返答や一般的な返答を無視した後にタスクを完了できる場合もあります。
タスク完了率は一般的でシンプルな指標ですが、結果を二者択一に圧縮してしまい、失敗した理由や完了したタスクがどれだけスムーズに進んだかを説明できません。会話の短いレビューや直接的なユーザー評価と組み合わせてください。Nielsen Norman Group, “Success Rate: The Simplest Usability Metric”
対話研究も、このようなより詳細な視点を支持しています。タスク指向対話の研究では、ターンレベルと会話レベルの両方で関連性、面白さ、理解度、タスク完了度、効率性をアノテーションしました。その結果、単一の全体評価では有用な差異を見落とす可能性があり、満足度はアノテーターや対話によって異なることが判明しました。これらの知見は普遍的なスコアリング計算式ではありませんが、クリエイティブなタスクに適応させるための堅実な評価軸のセットを提供してくれます。Siro, Aliannejadi, and de Rijke, “Understanding User Satisfaction with Task-oriented Dialogue Systems”
応答の質はターンレベルの問いとして扱う
各回答が直近のリクエストに応答し、前回のターンからの関連するコンテキストを使用しているかどうかを確認します。たとえば、ユーザーが「もう少しくだけた表現にして」と言った場合、有用な次の返答はそれに応じて提案を変更する必要があります。回避可能な繰り返し、見落とされた制約、タスクの前進に役立たない明確化の質問などをカウントします。
インテリジェントアシスタントに関する研究では、シナリオによって満足度が異なることが明らかになっています。一部のタスクではタスクの完了が重視され、他のタスクでは労力の少なさが重視されました。また、会話のコンテキストを維持することが重要であり、全体的なタスク満足度は個々のクエリへの満足度だけに還元できないことも報告されています。実践的な示唆として、特定の返答とやり取り全体の双方を精査しつつ、それぞれをタスクに照らし合わせて解釈する必要があります。Microsoft Research, “Understanding User Satisfaction with Intelligent Assistants”
クリエイティブなやり取りの場合、簡単な人的レビューによって、返答を「関連あり」「一部関連あり」「タスクから逸脱」と分類し、アシスタントが修正指示に従ったかどうかを記録します。これらのラベルは提案されたレビュー手法であり、検証済みのベンチマークではありません。自動分類器を使用する場合はサンプルを手作業で確認してください。整ったスコアであっても、プロンプトには技術的に一致しているもののユーザーが使えるものが何もない提案を見落とすことがあります。
ユーザーがやり取りをコントロールできたか確認する
ユーザーによるコントロールは、小さな瞬間に現れます。リクエストを絞り込む、別のスタイルを求める、誤解を訂正する、あるいは十分な結果を得た後に終了するなどです。システムが自身の会話の流れを一方的に追求するのではなく、ユーザーの指示に応答したかどうかトランスクリプトを確認します。インターフェースに停止、編集、再生成、応答クリアのコントロールが用意されている場合は、それらのアクションがユーザーの期待通りに動作することをテストします。
対話型エージェントに関する研究では、自律性は会話、質問、応答に対するコントロールを含む観点で説明されています。これは、普遍的なプロダクト指標を1つ確立するものではありませんが、コントロールを検証すべき性質として扱うことを支持しています。Yang and Aurisicchio, “Designing Conversational Agents: A Self-Determination Theory Approach”
軽量なユーザーへの質問によって、コントロールを測定可能にできます。「会話を望んでいたような結果に導くことができましたか?」この質問を、タスク完了に関する質問とともに、やり取りの直後に行います。セッション間で回答の選択肢を一貫させ、簡単な説明を入力できるようにします。スコアの低さは会話を詳しく調査するためのシグナルであり、特定の原因の証明ではありません。
明確な終了を有効な成果として認識する
優れたエンドポイントとは、ユーザーが必要なものを手に入れ、システムからの追加のプロンプトなしに離脱できる時点です。ハーブガーデンの例であれば、名前を選んだ瞬間がそれに該当するかもしれません。そこで終了する会話は、一般的なフォローアップの質問で引き延ばされた会話よりも有用である可能性があります。これはタスクから導き出される測定原則です。目標が完了している場合、余分なターンは自動的に価値を生むわけではありません。
タスクが完了したように見えるか、そしてユーザーが継続を選択したかどうかを追跡しますが、それらのイベントはコンテキストに沿って解釈してください。フォローアップのターンは、好奇心、必要な訂正、または不完全な回答を反映している可能性があります。無言の離脱は、ユーザーが満足したか、気を取られたか、あるいは失望したことを意味する可能性があります。会話の長さだけではこれらの理由を区別できません。サンプリングされたトランスクリプトのレビューや簡潔なユーザーフィードバックを活用して調査してください。
所要時間は決定打ではなく背景情報として活用する
所要時間は、特定のフローで日常的に多くのターンを必要としているかなど、運用上の問いに答えるのに役立ちます。それでも、これは経過した活動の測定値であり、回答が有用であったという直接的な証拠ではありません。たとえばGoogle アナリティクスでは、エンゲージメント時間をイベントに関連付けられたユーザーエンゲージメントの継続時間と定義しています。また、その開発者向けガイダンスでは、セッションを人為的に延長すると行動データが歪むと警告しています。これらはアナリティクスの定義と実装上の注意点であり、クリエイティブなチャットの品質指標ではありません。Google Analytics, “Measurement Protocol reference” および Google Analytics, “Measure sessions and user engagement”
時間は類似したタスク間でのみ比較し、タスク完了度、関連性、ユーザーコントロール、明確な終了点と並べて評価してください。中央値としての所要時間が短いことは、より直接的な回答を反映している可能性がありますが、ユーザーが諦めたことを反映している可能性もあります。所要時間が長いことは、生産的な推敲を意味する場合もあれば、不必要な摩擦を意味する場合もあります。裏付けとなる証拠は、時計の針だけでなく、タスクの成果とユーザーが体験したことから得られなければなりません。
コンパクトな評価ルーティン
小規模な調査では、参加者に明確に表現されたクリエイティブなタスクを1つ与え、チャットを自然に使ってもらい、定義した成果に到達したかどうかを記録します。サンプリングしたやり取りをレビューし、関連性、コンテキストの追従、誘導や終了の機会について確認します。各タスクの後に、有用な結果が得られたか、会話を主導できたと感じたかを尋ねます。所要時間をコンテキストとして記録し、所要時間と報告された有用性が乖離しているケースを調査します。
測定値は1つの「エンゲージメント」スコアにまとめず、個別に報告します。タスク内容、完了の判断方法、返答のレビュー担当者、ユーザーフィードバックの収集方法を明記してください。サンプルサイズが小さい場合やタスクの定義が主観的である場合は、すべてのユーザーやクリエイティブなリクエストに一般化するのではなく、方向性を示すものとして結果を説明します。
短いやり取りの価値は、ユーザーを特定のリクエストから使える成果へと導き、その過程と終了地点をユーザー自身のコントロール下に置くことにあります。それらの成果を直接測定してください。セッション時間は体験を説明するための補助とし、成功を定義するものにしてはなりません。
