Больше чем человекоподобие: четыре более эффективные цели для проектирования ИИ-чатов
Для дизайнеров, проектирующих взаимодействие с ИИ-чатом, установка «сделайте так, чтобы это казалось живым» слишком размыта, чтобы принимать полезные решения. Гораздо более полезная задача — помочь человеку получить понятный ответ, исследовать идею, разобраться в том, что сделала система, и выбрать следующий шаг. Исследования антропоморфных сигналов показывают, что человекоподобные черты могут влиять на то, насколько точной люди считают информацию от ИИ. Поэтому ясность, творческая свобода, надежное отображение состояния задачи и пользовательский контроль становятся более ценными ориентирами в дизайне, чем подражание человеку.
Почему ИИ-чату стоит стремиться к чему-то большему, чем внешняя человечность?
Диалог может звучать гладко и естественно, но при этом не давать пользователю достоверного представления о работе системы. В эксперименте с участием 2165 респондентов исследователи варьировали формат псевдоязыковой модели (только текст или речь с текстом) и то, как она себя называла («я» или «система»). Сочетание речи и текста повысило оценки антропоморфизма и точности информации со стороны участников; использование первого лица повысило оценки точности и снизило воспринимаемый риск в одном из контекстов. Эти выводы привязаны к конкретным условиям исследования, но они наглядно показывают: сигналы, делающие систему более «человечной», способны также влиять на оценку надежности ее информации. Google Research, «Believing Anthropomorphism: Examining the Role of Anthropomorphic Cues on User Trust in Large Language Models»
Именно поэтому антропоморфные сигналы и качество взаимодействия требуют раздельного аудита. Аудит антропоморфных сигналов проверяет, на какую идентичность или человеческие свойства ИИ намекает интерфейс. Аудит рисков субъективной оценки выявляет, не побуждает ли тот или иной сигнал пользователя переоценивать точность и надежность ответов. Представленные ниже цели проектирования отвечают на другой вопрос: что человек должен понимать, делать и решать в процессе диалога? Теплый, дружелюбный тон вполне совместим с этими целями — при условии, что он не скрывает реальные возможности системы и статус текущей задачи.
Руководство Microsoft Human-AI eXperience Toolkit структурирует рекомендации вокруг того, как система ИИ ведет себя при первом использовании, во время взаимодействия, в случае ошибки и с течением времени. Такая структура очень полезна для проектирования чатов, поскольку она смещает фокус с «личности» персонажа на меняющиеся потребности человека, использующего систему. Microsoft, «Guidelines for Human-AI Interaction»
Сделайте ясность видимым свойством диалога
Ясность берет начало в задаче пользователя, а не в идеально естественном тоне собеседника. Человеку, ищущему три идеи для отдыха на выходных, нужны варианты, которые легко сопоставить; тому, кто просит отредактировать текст, нужен черновик, удобный для доработки. Интерфейс должен четко разграничивать запрашиваемое действие и полученный результат. Если ИИ предлагает идею, делает саммари или перерабатывает материал, прямо обозначьте этот вклад и сохраните контекст, достаточный для самостоятельной оценки пользователем.
Продуманное взаимодействие также своевременно показывает, что ИИ умеет, а чего сделать не может — именно в тот момент, когда это действительно важно. Например, если чат-ассистент способен спланировать маршрут, но не может забронировать билеты, его ответ не должен порождать неопределенность. Укажите, что уже готово, где все еще требуется участие пользователя, а какие детали остаются под вопросом. Это практическая рекомендация, вытекающая из принципа HAX об уместном поведении на всех этапах взаимодействия, а не утверждение, что единый шаблон формулировок подойдет для любого продукта.
Простой способ проверить ясность — спросить пользователя после короткого диалога: о чем вы попросили систему? Что именно она сделала? Что вам нужно проверить или решить, прежде чем использовать полученный результат? Если ответы расходятся с логикой интерфейса, переработайте формулировки, структуру или подсказки к следующим шагам, прежде чем добавлять системе «характер».
Используйте игровой элемент для поддержки исследовательского интереса
Игровой формат дает людям возможность без напряжения осваивать инструмент и изучать его потенциал. В исследовании, охватившем 372 пользовательские публикации о ChatGPT, ученые выделили примеры игрового взаимодействия: шутки, попытки бросить системе вызов и проверку границ ее возможностей. Авторы описывают такие диалоги как способ исследовать возможности и субъектность ИИ, оговариваясь, что выборка отражает опыт раннего этапа использования ChatGPT. Nikghalb and Cheng, «Interrogating AI: Characterizing Emergent Playful Interactions with ChatGPT»
Для дизайнеров практический вывод заключается не в том, чтобы превратить каждого ассистента в комика. Главное — облегчить эксперименты с низкими ставками: предложить способы взглянуть на вопрос под другим углом, сравнить альтернативы или изменить черновик, не потеряв исходную версию. Короткая творческая подсказка вроде «Предложи три неожиданные темы» способна подстегнуть фантазию, не уводя в сторону от конечной цели пользователя. Игровой элемент должен быть доступным режимом, а не представлением, которое пользователь вынужден терпеть.
Исследования игровых инструментов для совместного творчества человека и ИИ разграничивают игривость и креативность, рассматривая игру как фактор, способный стимулировать творческие решения. В них интерфейс, поведение ИИ и ведение диалога анализируются как возможности для дизайна, а игровой компонент трактуется как поддерживаемый опыт, а не как гарантированный результат. Liapis et al., «Designing for Playfulness in Human-AI Authoring Tools»
Сохраняйте состояние задачи понятным на протяжении всего диалога
Интерфейс чата может восприниматься абсолютно естественно, но при этом легко терять нить работы. Состояние задачи включает текущую цель пользователя, уже принятые решения, остающиеся открытыми варианты и следующий шаг. Когда обмен репликами растягивается на несколько этапов, краткая сводка помогает показать текущее понимание системы: «Осталось два варианта; вы предпочитаете короткую прогулку; место пока не выбрано». Это дает человеку возможность скорректировать данные до того, как разговор пойдет дальше.
Паттерн взаимодействия должен соответствовать сложности задачи. В работе Дина и Чана о совместном создании текстов человеком и ИИ выделяются задачи с фиксированным объемом (кураторство), независимые творческие задачи и сложные взаимозависимые творческие процессы. Каждому типу соответствуют свои паттерны взаимодействия: от минимального вмешательства до итеративного сотрудничества. Важный практический вывод состоит в том, что ответ в одну реплику отлично подойдет для краткой сводки, тогда как развивающаяся творческая задача выигрывает от диалога, в котором на каждом шаге видны развилки, позволяющие человеку влиять на результат. Ding and Chan, «Mapping the Design Space of Interactions in Human-AI Text Co-creation Tasks»
Чтобы проверить прозрачность состояния на практике, проследите типичную задачу по всему диалогу. На каждой реплике задавайте вопрос: понимает ли человек, что уже сделано, что еще предстоит решить и как исправить ошибочное предположение? Если ответ требует помнить содержание нескольких предыдущих реплик, добавьте сжатый итог или наглядный список решений. Если система не способна надежно удерживать деталь в памяти, покажите это ограничение открыто, вместо того чтобы создавать ложную иллюзию преемственности.
Предоставьте пользователям реальный контроль
Контроль означает наличие у человека удобного способа направлять или корректировать взаимодействие. В чате это может быть возможность выбрать вариант из списка, отредактировать сгенерированный текст, изменить ограничение или попросить систему остановиться и сделать резюме. Подобные элементы управления ценны тогда, когда они влияют на важные для пользователя решения; набор настроек, не меняющий ничего существенного, лишь усложняет интерфейс, не давая реальной автономии.
В эксперименте с диалоговым агентом, модерирующим групповые дискуссии, сравнивались методы формирования ожиданий относительно его способности выявлять пассивных участников. Тестировались три варианта: информирование о точности, объяснение логики работы алгоритма и данных, а также элемент ручной регулировки. В этом конкретном исследовании объяснение помогло пользователям понять логику работы алгоритма и оказалось наиболее эффективным в целом; простое же добавление ползунка регулировки привело к ухудшению общего впечатления от дискуссии. Этот результат предостерегает от убеждения, будто функция контроля полезна сама по себе: объясняйте, на что она влияет, и делайте последствия изменений понятными. Do et al., «Inform, Explain, or Control: Techniques to Adjust End-User Performance Expectations for a Conversational Agent Facilitating Group Chat Discussions»
Оптимальная последовательность действий при проектировании: покажите текущую интерпретацию, предложите небольшое число осмысленных следующих шагов и обеспечьте простоту исправления. Например, составив план прогулки, система может спросить, сократить ли маршрут, заменить одно из занятий или оставить текущий вариант. Каждый пункт указывает на конкретное действие. Этот пример служит иллюстрацией: он описывает общий паттерн взаимодействия, а не функцию конкретного продукта.
Превратите цели в контрольный список для проверки
Оценивая дизайн чата, пройдите одну стандартную задачу от начала до конца. Проверьте, ясна ли роль системы с первой реплики; отличает ли пользователь предложение от уже выполненного действия; побуждает ли исследовательский шаг к экспериментам без навязывания нарочито игривого персонажа; и точно ли в разговоре отражены принятые решения и незавершенные шаги. Затем убедитесь, что человек может легко исправить ошибку системы и понимает, к чему приведет каждое доступное действие.
Наконец, проверьте формулировки и визуальную подачу на наличие сигналов, которые могут намекать на человеческую природу или особую непогрешимость. Подумайте, не искажают ли формулировки от первого лица, голос, эмоционально окрашенная лексика или похожий на человека аватар оценку ответов пользователем. Такая проверка дополняет, а не заменяет тестирование интерфейса на понятность и практическую пользу. Главный критерий качества дизайна чата — может ли человек решить свою задачу, четко понимая вклад ИИ и видя варианты следующего шага, а не то, насколько диалог похож на общение с живым собеседником.
