固定されたゲームシナリオは、数行の生成対話によってより面白く感じられるか?
答えは「イエス」です——生成機能によって局所的なバリエーションが加わり、かつ事前に執筆されたビートが次に起こる展開を引き続きコントロールしているなら。目的、ターニングポイント、結果は固定したままにしておき、キャラクターの口調や気づいた細部など、明確な制限内で少数の対話スロットを変化させます。次に、同じシーンとプレイヤーの選択肢を用いた完全スクリプト版とそのバージョンを比較します。プレイヤーが新鮮または反応が良いと表現する対話を探すと同時に、どちらのバージョンがキャラクター、イベント、またはゲームの状態についてより多くの混乱を生み出していないかを確認します。
ハイブリッドアプローチが変えようとしているもの
ハイブリッドナラティブでは、主要なイベントを直接的な作家の管理下に置き、それらのイベント周辺の厳選されたセリフに生成機能を使用します。例えば、シーンは常に店主が店じまいをするところから始まり、同じプレイヤーの選択肢を提示し、同じ手がかりで終わるとします。生成されたセリフは、店主が天気にどう言及するかやプレイヤーへの挨拶を変えるかもしれませんが、新しい手がかりを捏造したり、選択肢を変えたり、過去の出来事が異なって起こったことを示唆したりしてはなりません。
対話はストーリーの状態を変えることなく変化を感じさせることができるため、その境界線は重要です。インタラクティブナラティブの研究では、ストーリーレット(storylets)を、現在のゲーム状態に応じて利用可能かどうかが決まる個別の物語モジュールとして説明しています。別のインタラクティブナラティブシステムでは、高レベルのストーリーディレクションと自律的なキャラクター行動を組み合わせ、プレイヤーの行動によって矛盾が生じた場合にストーリーラインを適応させました。これらの例は有用な設計原則を支持しています。それは、作成されたイベントと現在の状態を構造的制約として扱い、それらと矛盾し得ない場所にのみバリエーションを許可することです。(Sketching a Map of the Storylets Design Space; Mixing Story and Simulation in Interactive Narrative)
繰り返しが目立つものの、影響が少ないスロットを選ぶ
まずは、訪問や周回プレイごとに繰り返され、かつ必須情報を含まない対話を特定することから始めます。挨拶、プレイヤーの直前の行動に対する簡単なリアクション、あるいはシーンに雰囲気を出すセリフなどが候補になります。真相の暴露、約束、指示、またはアイテムの所有権に関する発言は、最初のスロットとしては不適切です。その意味が変わると、プロットやプレイヤーの世界に対する理解が乱れる可能性があります。
スロットごとに、バリエーションを書いたり生成したりする前にその役割を書き留めます。誰が話しているのか、そのキャラクターは何を知っているのか、直前に何が起こったのか、適合する感情の範囲、そしてどの事実を変更してはならないかを記録します。明確な長さの制限を設定し、新しいクエスト、アイテム、人間関係、過去の出来事などの禁止される追加要素を定義します。セリフを置き換えてもシーンのプレイ可能な結果やプレイヤーが引き継ぐべき事実が変わらなければ、そのスロットは適切に制約されています。
これは設計上の推奨事項であり、生成されたすべてのセリフが新鮮に感じられると主張するものではありません。わずかな変化に気づかないプレイヤーもいれば、うまく作られたセリフであっても、注意深くペース調整されたシーンの邪魔になると感じるプレイヤーもいるかもしれません。テストでは、そのバリエーションがこの特定のゲームや対象読者に役立つかどうかを判断する必要があります。
スクリプトのみのバージョンと公平に比較できるようにする
プレイ可能な同じ短いセクションの2つのバージョンを構築します。コントロール(対照)バージョンでは、候補となる各スロットに既存の作成済みセリフを使用します。ハイブリッドバージョンでは、同じ作成されたビートを維持し、それらのスロットにのみ生成された対話を代入します。シーンの順序、選択肢、報酬、キャラクターの外見、およびプレイの指示は同一に保ちます。それらの要素が異なると、プレイヤーが対話のバリエーションに反応したのか、それとも他の変更に反応したのかを見分けるのが難しくなります。
プレイヤーを募集する前に、何を明らかにしたいかを決定します。実践的な問いは、「制約された対話によって、何が起こったかの理解を損なうことなく、このシーンがより応答性が高い、または繰り返し感が少ないと感じられるか?」というものです。同等のプレイヤーを対象とし、同じタスクを与えます。参加者が両方のバージョンをプレイする場合、最初のプレイでシーンを学習してしまう可能性があることを考慮してください。異なるグループがそれぞれのバージョンをプレイする場合、グループ間の違いが比較に影響を与える可能性があります。どちらの設定を選択するにしても、その限界を認識しておいてください。
ゲームユーザーリサーチのガイダンスでは、リサーチの目的に基づいて方法を選択し、有益な場合は観察、アンケート、インタビューを組み合わせることを推奨しています。観察はプレイヤーが何をするかを示し、アンケートは評価の比較を容易にし、インタビューは行動の説明に役立ちますが、それぞれの手法には限界があります。このテストでは、「面白かったですか?」というような単一の漠然とした質問に頼るのではなく、プレイ行動を記録し、プレイ後の簡単な評価やインタビューを収集してください。(Choose the Right Playtest Method)
創造的なバリエーションと状態の一貫性を分けて追跡する
生き生きとしたセリフによって継続性の問題が隠れてしまわないよう、2つの別々のスコアカードを使用します。1つ目は、バリエーションが知覚可能で有用だったかどうかを測定します。プレイ後、プレイヤーに対話が繰り返されていると感じたか、キャラクターの反応が状況に応じたものに見えたか、印象に残ったセリフはあったかを尋ねます。数値スコアだけでなく、具体的な瞬間を尋ねてください。プレイ中は、プレイヤーがセリフの前で一時停止したり、読み返したり、コメントしたりしたかを記録しますが、注目していることが必ずしも楽しんでいることを意味するとは決めつけないでください。
2つ目のスコアカードは一貫性をチェックします。生成された各セリフを、キャラクターの正体と知識、場所、以前の行動、現在の目的、およびシーンの前の段階で確立された事実といった、状態に関する事実の短いリストと比較します。矛盾、根拠のない新しい主張、プレイヤーが何が起きたのか確信が持てていないように見える瞬間をログに記録します。また、プレイヤーにシーンの重要なイベントと次の目的を要約するように依頼します。食い違いがあれば理解の問題を示している可能性がありますが、小規模なプレイテストだけではなぜそれが生じたのかを特定できない場合もあります。
状態の追跡には特別な配慮が必要です。「ダンジョンズ&ドラゴンズ」を対話タスクとして位置づけたある研究では、次のターンの生成と対話履歴からのゲーム状態の予測を、関連しつつも別個の課題として扱いました。そのデータセットには部分的な状態のアノテーションが含まれており、著者らは生成された対話と状態予測の両方を評価しました。その研究は特定のハイブリッド設計が機能することを立証するものではありませんが、物語のバリエーションと状態の正確性を個別に測定すべき理由を裏付けています。(Dungeons and Dragons as a Dialog Challenge for Artificial Intelligence)
結果は生成AIに対する評価ではなく、設計上の判断として読み取る
同じ指標で各バージョンを比較します。プレイヤーは対話のバリエーションに気づいたでしょうか? 特定の反応がより適切である、あるいは繰り返し感が少ないと評価したでしょうか? 同じシーンの事実と目的を理解していたでしょうか? ハイブリッドバージョンは何らかの継続性のエラーを引き起こしましたか? 有用な結果が一様ではない場合もあります。プレイヤーは多様な挨拶を楽しむ一方で、生成された解説は追いにくいと感じるかもしれません。それは、挨拶のスロットを維持し、解説のスロットを削除または絞り込むことを示唆しています。
プレイヤーが目にした実際のセリフを、彼らのコメントや状態チェックのメモと併せて確認します。平均値は1つの深刻な矛盾を隠してしまう可能性があり、一方で印象的なエピソードは稀な出来事を誇張してしまうことがあります。セリフが必須の事実を破っている場合は、楽しさの結果を解釈する前に修正すべき欠陥として扱ってください。プレイヤーがバリエーションに気づかない場合は、生成の適用範囲をシナリオ全体に広げる前に、スロットが短すぎるか、あるいは微妙すぎるかを確認してください。
静的、言い換え、ハイブリッド、完全生成の対話を比較したあるロールプレイングゲームの研究では、64人の参加者による行動ログとゲーム後のアンケートが使用されました。報告された結果は、生成エージェンシーのレベルが相互作用やエンゲージメントを形成し得ることを示唆していますが、それらの知見はそのゲームと研究に固有のものです。他のタイトルへの予測にはなりません。小規模なデザイン実験における実践的な教訓は、意図したプレイの文脈の中で対話アプローチを直接比較することです。(Quest of Aivengarde: Comparative Study of Player Experience Across LLM Dialogue Systems)
両方のチェックに合格したスロットのみを拡張する
ハイブリッドバージョンによって、プレイヤーが気づき評価するセリフが得られ、同時にシーンの理解や状態の事実が維持されている場合は、リスクの低いスロットの2つ目の小さなセットを試してみてください。固定されたビートは固定したままにし、比較を再度実行します。スロットが知覚可能なバリエーションをほとんど追加しない場合や、繰り返し混乱を招く場合は、作家による対話に戻すか、その境界制限を厳しくします。
慎重に選ばれた少数の生成セリフは、繰り返される瞬間がまったく同じであると感じさせにくくすることができますが、それがゲームをより面白くするかどうかはプレイヤーにとっての経験的な問いです。ストーリーの重要なイベントを維持し、局所的な目的が明確な対話のみを変化させ、管理されたプレイテストを行って、創造的な見返りと継続性のコストの両方を判断してください。
