Blog Metlivi

Além de Soar Humano: Quatro Metas Melhores para o Design de Chat com IA

Para designers que moldam uma interação de chat com IA, “fazer parecer real” é vago demais para orientar decisões úteis. Uma tarefa melhor é ajudar o usuário a obter uma resposta clara, explorar uma ideia, entender o que o sistema fez e escolher o que acontece a seguir. Pesquisas sobre pistas antropomórficas sugerem que sinais semelhantes aos humanos podem alterar o quanto as pessoas acreditam na precisão das informações de uma IA. Isso torna a clareza, a exploração lúdica, o estado confiável da tarefa e o controle do usuário metas de design mais úteis do que a imitação de uma identidade humana.

30 de setembro de 20267 min de leituraLeitura, artes e culturaPor Metlivi Editorial Team
Seção 1

Por que o chat com IA deve mirar além da semelhança humana?

Uma conversa pode soar fluente sem dar ao usuário uma visão confiável do sistema. Em um experimento com 2.165 participantes, os pesquisadores variaram se um modelo de pseudo-linguagem utilizava apenas texto ou fala com texto, e se ele se referia a si mesmo como “eu” ou “o sistema”. Fala combinada com texto aumentou as avaliações dos participantes quanto ao antropomorfismo e à precisão da informação; a linguagem em primeira pessoa elevou as avaliações de precisão e reduziu o risco percebido em um contexto. Essas descobertas são específicas para a configuração do estudo, mas mostram que uma pista que faz o sistema parecer mais humano também pode afetar o julgamento sobre suas informações. Google Research, “Believing Anthropomorphism: Examining the Role of Anthropomorphic Cues on User Trust in Large Language Models”

É por isso que pistas antropomórficas e a qualidade da interação merecem auditorias separadas. Uma auditoria de pistas antropomórficas questiona o que a interface dá a entender sobre a identidade da IA ou suas qualidades humanas. Uma auditoria de risco de julgamento investiga se uma pista pode levar os usuários a superestimar a precisão ou a confiabilidade do que é gerado. As metas de design abaixo abordam uma questão diferente: o que uma pessoa deve ser capaz de entender, fazer e decidir durante a interação? Um tom acolhedor pode coexistir com esses objetivos, desde que não oculte as capacidades do sistema ou o estado da tarefa.

O Human-AI eXperience Toolkit da Microsoft organiza suas orientações em torno de como um sistema de IA se comporta no primeiro uso, durante a interação, quando comete erros e ao longo do tempo. Essa estrutura é útil para o design de chats porque desloca a atenção da personalidade de um personagem para as necessidades em constante mudança da pessoa que usa o sistema. Microsoft, “Guidelines for Human-AI Interaction”

Seção 2

Faça da clareza um elemento visível da conversa

A clareza começa com a tarefa do usuário, não com uma voz perfeitamente coloquial. Uma pessoa que pede três ideias de atividades para o fim de semana precisa de opções que possa comparar; quem pede uma reformulação de texto precisa de um rascunho que possa revisar. A interface deve tornar a ação solicitada e o resultado retornado fáceis de distinguir. Se a IA estiver sugerindo, resumindo ou transformando material, identifique essa contribuição com clareza e preserve contexto suficiente para que o usuário possa avaliá-la.

Uma interação útil também pode mostrar o que a IA pode e não pode fazer no momento exato em que essa informação importa. Por exemplo, se um assistente de chat pode sugerir um planejamento, mas não pode fazer uma reserva, a resposta não deve deixar a ação ambígua. Declare o que está pronto, o que ainda exige a ação do usuário e quais detalhes permanecem incertos. Esta é uma recomendação de design inferida a partir da ênfase do HAX em comportamentos adequados ao longo de uma interação, e não a afirmação de que um único padrão de redação funcione para todos os produtos.

Um teste de clareza simples é perguntar a alguém após uma breve conversa: O que você pediu para o sistema fazer? O que ele realmente fez? O que você precisaria verificar ou decidir antes de usar o resultado? Se as respostas divergirem da intenção da interface, revise o texto, a estrutura ou as indicações do próximo passo antes de adicionar mais personalidade.

Seção 3

Use a ludicidade para apoiar a exploração

A ludicidade oferece às pessoas uma maneira de explorar uma ferramenta e suas possibilidades. Em um estudo com 372 postagens geradas por usuários sobre o ChatGPT, os pesquisadores identificaram interações lúdicas que incluíam piadas, desafios ao sistema e testes de seus limites. Os autores descrevem essas interações como uma forma de as pessoas explorarem as capacidades e a agência da IA, observando que a amostra reflete postagens de um período inicial de uso do ChatGPT. Nikghalb e Cheng, “Interrogating AI: Characterizing Emergent Playful Interactions with ChatGPT”

Para os designers, a implicação prática não é transformar todo assistente em um comediante. É facilitar a experimentação de baixo risco: oferecer maneiras de tentar um ângulo diferente, comparar alternativas ou revisar um rascunho sem perder a versão anterior. Um comando criativo curto como “Dê-me três temas inesperados” pode convidar à exploração mantendo o objetivo do usuário em vista. A ludicidade deve ser um modo disponível, não uma encenação que o usuário é obrigado a suportar.

Pesquisas sobre ferramentas lúdicas de criação conjunta entre humanos e IA distinguem a ludicidade da criatividade, ao mesmo tempo em que descrevem o ato lúdico como um possível facilitador de respostas criativas. O estudo discute interface, comportamento da IA e diálogo como oportunidades de design, tratando a ludicidade como uma experiência a ser apoiada, e não como um resultado que possa ser garantido. Liapis et al., “Designing for Playfulness in Human-AI Authoring Tools”

Seção 4

Mantenha o estado da tarefa legível ao longo dos turnos

Uma interface de chat pode parecer natural e ainda assim se perder no andamento do trabalho. O estado da tarefa inclui o objetivo atual do usuário, decisões já tomadas, opções ainda em aberto e o próximo passo. Quando a conversa se torna uma sequência de várias etapas, uma recapitulação compacta pode mostrar a compreensão atual do sistema: “Você tem duas opções restantes; prefere uma caminhada curta; ainda não escolhi um local.” Isso dá ao usuário a chance de corrigir as informações antes que a conversa continue.

O padrão de interação deve se adequar à complexidade da tarefa. O artigo de Ding e Chan sobre cocriação de texto entre humanos e IA distingue a curadoria de escopo fixo, tarefas criativas independentes e tarefas criativas complexas e interdependentes. Ele mapeia essas categorias em diferentes padrões de interação, desde intervenções limitadas até colaborações iterativas. A inferência de design útil é que uma resposta de turno único pode servir a um resumo delimitado, enquanto uma tarefa criativa em desenvolvimento se beneficia de turnos que expõem escolhas e permitem que a pessoa molde o resultado. Ding e Chan, “Mapping the Design Space of Interactions in Human-AI Text Co-creation Tasks”

Para uma verificação prática do estado, acompanhe uma tarefa representativa ao longo da conversa. A cada turno, pergunte se a pessoa consegue identificar o que foi concluído, o que ainda está pendente e como corrigir uma suposição equivocada. Se a resposta depender de lembrar de vários turnos anteriores, adicione um resumo conciso ou uma lista visível de decisões. Se o sistema não puder preservar um detalhe de forma confiável, deixe essa limitação evidente em vez de sugerir uma continuidade que ele não possui.

Seção 5

Dê aos usuários um controle significativo

Controle significa dar à pessoa uma maneira prática de direcionar ou revisar a interação. No chat, isso pode ser tão direto quanto permitir escolher entre opções, editar um rascunho gerado, alterar um parâmetro ou pedir que o sistema pare e resuma. Esses controles são mais valiosos quando afetam uma decisão com a qual o usuário se importa; um menu de ajustes que não muda nada significativo apenas adiciona complexidade sem trazer agência.

Um experimento envolvendo um agente conversacional em discussões de grupo comparou maneiras de alinhar expectativas sobre sua capacidade de identificar participantes pouco participativos. Foram testadas informações sobre precisão, uma explicação da abordagem de detecção e dos dados utilizados, e um controle de ajuste. Nesse estudo em particular, a explicação ajudou os usuários a entenderem o algoritmo e foi a mais eficaz no geral; apenas fornecer um controle de ajuste gerou uma percepção mais negativa da experiência de discussão. O resultado serve de alerta contra considerar um controle útil apenas porque ele existe: explique o que ele altera e torne a consequência compreensível. Do et al., “Inform, Explain, or Control: Techniques to Adjust End-User Performance Expectations for a Conversational Agent Facilitating Group Chat Discussions”

Uma sequência prática de design é: mostrar a interpretação atual, oferecer um pequeno número de próximas ações significativas e facilitar a correção. Por exemplo, após gerar um roteiro de passeio, o sistema pode perguntar se deve encurtar a rota, trocar uma atividade ou manter o rascunho. Cada opção descreve uma mudança concreta. O exemplo é ilustrativo; ele descreve um padrão geral de interação, não uma funcionalidade de um produto específico.

Seção 6

Transforme as metas em uma lista de verificação para avaliação

Ao avaliar o design de um chat, examine uma tarefa comum do início ao fim. Verifique se o primeiro turno deixa o papel do sistema claro; se o usuário consegue distinguir uma sugestão de uma ação concluída; se um turno exploratório convida à experimentação sem impor uma persona artificialmente descontraída; e se a conversa exibe decisões e etapas não resolvidas com precisão. Em seguida, verifique se a pessoa consegue corrigir o sistema e compreender o efeito de cada controle disponível.

Por fim, revise a linguagem e a apresentação em busca de pistas que possam sugerir uma identidade humana ou uma confiabilidade irreal. Considere se declarações em primeira pessoa, voz, linguagem emocional ou um avatar com traços humanos poderiam influenciar o julgamento do usuário sobre uma resposta. Essa análise complementa, em vez de substituir, os testes para avaliar se a interação é compreensível e útil. O critério mais forte para o design de um chat é se a pessoa consegue realizar sua própria tarefa com clareza sobre a contribuição da IA e sobre a próxima escolha a ser feita — e não se a troca passa a ilusão de ser uma conversa com outro ser humano.

Leituras relacionadas

Continue explorando o tema