Oltre il sembrare umani: quattro obiettivi migliori per la progettazione delle chat IA
Per i designer che danno forma all'interazione di una chat IA, "farla sembrare reale" è troppo vago per guidare decisioni utili. Un compito migliore è aiutare qualcuno a ottenere una risposta chiara, esplorare un'idea, comprendere cosa ha fatto il sistema e scegliere cosa accadrà dopo. La ricerca sui segnali antropomorfi suggerisce che gli indizi di tipo umano possono modificare la percezione dell'accuratezza delle informazioni fornite dall'IA da parte delle persone. Ciò rende la chiarezza, il gioco creativo, uno stato affidabile delle attività e il controllo dell'utente obiettivi di progettazione più utili rispetto all'imitazione di un'identità umana.
Perché le chat IA dovrebbero puntare oltre la somiglianza umana?
Una conversazione può sembrare fluente senza dare all'utente un quadro affidabile del sistema. In un esperimento con 2.165 partecipanti, i ricercatori hanno variato la modalità con cui un modello di pseudo-linguaggio operava, alternando solo testo o sintesi vocale unita al testo, e verificando se si riferisse a se stesso come "io" o "il sistema". Voce più testo hanno aumentato le valutazioni dei partecipanti in termini di antropomorfismo e accuratezza delle informazioni; la formulazione in prima persona ha innalzato le valutazioni di accuratezza e abbassato il rischio percepito in un contesto. Questi risultati sono specifici della configurazione dello studio, ma dimostrano che un segnale che fa apparire un sistema più umano può influenzare anche i giudizi sulle sue informazioni. Google Research, "Believing Anthropomorphism: Examining the Role of Anthropomorphic Cues on User Trust in Large Language Models"
Ecco perché i segnali antropomorfi e la qualità dell'interazione meritano verifiche separate. Una revisione dei segnali antropomorfi si interroga su cosa l'interfaccia implichi riguardo all'identità o alle qualità umane dell'IA. Una revisione del rischio di valutazione si chiede se un segnale possa indurre gli utenti a sovrastimare l'accuratezza o l'affidabilità del suo output. Gli obiettivi di progettazione indicati di seguito affrontano una questione diversa: cosa dovrebbe essere in grado di comprendere, fare e decidere una persona durante lo scambio? Un tono caloroso può coesistere con questi obiettivi, a condizione che non oscuri le capacità del sistema o lo stato dell'attività.
Lo Human-AI eXperience Toolkit di Microsoft organizza le linee guida su come un sistema di IA si comporta al primo utilizzo, durante l'interazione, quando sbaglia e nel tempo. Questa struttura è utile per la progettazione della chat perché sposta l'attenzione dalla personalità di un personaggio alle mutevoli esigenze della persona che utilizza il sistema. Microsoft, "Guidelines for Human-AI Interaction"
Rendere la chiarezza una caratteristica visibile della conversazione
La chiarezza inizia con il compito dell'utente, non con una voce perfettamente colloquiale. Una persona che chiede tre idee per attività nel fine settimana ha bisogno di opzioni da poter confrontare; chi chiede una riscrittura ha bisogno di una bozza da poter correggere. L'interfaccia dovrebbe rendere l'azione richiesta e il risultato restituito facili da distinguere. Se l'IA suggerisce, riassume o trasforma il materiale, occorre etichettare quel contributo chiaramente e conservare un contesto sufficiente affinché l'utente possa valutarlo.
Un'interazione utile può anche mostrare cosa l'IA può e non può fare nel momento esatto in cui quell'informazione è rilevante. Ad esempio, se un assistente di chat può suggerire un piano ma non può effettuare una prenotazione, la risposta non dovrebbe lasciare l'azione ambigua. Specifica cosa è pronto, cosa richiede ancora l'intervento dell'utente e quali dettagli rimangono incerti. Questa è una raccomandazione di progettazione desunta dall'enfasi di HAX su un comportamento appropriato durante tutta l'interazione, piuttosto che l'affermazione che un singolo modello di formulazione funzioni in ogni prodotto.
Un semplice controllo di chiarezza consiste nel chiedere a qualcuno, dopo un breve scambio: Che cosa hai chiesto al sistema di fare? Che cosa ha effettivamente fatto? Cosa dovresti verificare o decidere prima di utilizzare il risultato? Se le risposte divergono dal significato previsto dall'interfaccia, revisiona la formulazione, la struttura o le indicazioni sui passaggi successivi prima di aggiungere ulteriore personalità.
Usare il gioco per supportare l'esplorazione
La giocosità offre alle persone un modo per esplorare uno strumento e le sue possibilità. In uno studio su 372 post generati dagli utenti su ChatGPT, i ricercatori hanno identificato scambi giocosi che includevano scherzi, sfide al sistema e test dei suoi limiti. Gli autori descrivono queste interazioni come un modo in cui le persone esplorano le capacità e l'azione dell'IA, pur notando che il campione riflette post risalenti a un primo periodo di utilizzo di ChatGPT. Nikghalb e Cheng, "Interrogating AI: Characterizing Emergent Playful Interactions with ChatGPT"
Per i designer, l'implicazione pratica non è trasformare ogni assistente in un comico. Si tratta di rendere facile la sperimentazione a basso rischio: offrire modi per provare una prospettiva diversa, confrontare alternative o revisionare una bozza senza perdere la versione precedente. Un breve prompt creativo come "Dammi tre temi inaspettati" può invitare all'esplorazione mantenendo in vista l'obiettivo dell'utente. Il gioco dovrebbe essere una modalità disponibile, non una performance che l'utente è costretto a sopportare.
La ricerca sugli strumenti di authoring giocosi uomo-IA distingue la giocosità dalla creatività, descrivendo il gioco come un possibile facilitatore di risposte creative. Vengono discusse interfaccia, comportamento dell'IA e dialogo come opportunità di design, trattando la giocosità come un'esperienza da supportare piuttosto che come un risultato garantibile. Liapis et al., "Designing for Playfulness in Human-AI Authoring Tools"
Mantenere leggibile lo stato dell'attività attraverso i vari turni
Un'interfaccia di chat può sembrare naturale e perdere comunque traccia del lavoro svolto. Lo stato dell'attività include l'obiettivo attuale dell'utente, le decisioni già prese, le opzioni ancora aperte e il passaggio successivo. Quando lo scambio diventa multi-fase, un riepilogo compatto può mostrare la comprensione attuale del sistema: "Ti restano due opzioni; preferisci una breve passeggiata; non ho ancora scelto un luogo". Questo dà all'utente la possibilità di correggere le informazioni prima che la conversazione continui.
Il modello di interazione dovrebbe adattarsi alla complessità del compito. Il saggio di Ding e Chan sulla co-creazione di testo uomo-IA distingue la curation a perimetro fisso, compiti creativi indipendenti e compiti creativi complessi e interdipendenti. Mappa questi elementi su diversi modelli di interazione, dall'intervento limitato alla collaborazione iterativa. L'utile deduzione progettuale è che una risposta in un unico passaggio può adattarsi a un riassunto circoscritto, mentre un compito creativo in evoluzione trae vantaggio da passaggi che mostrano le scelte e consentono alla persona di plasmare il risultato. Ding e Chan, "Mapping the Design Space of Interactions in Human-AI Text Co-creation Tasks"
Per un controllo pratico dello stato, traccia un'attività rappresentativa lungo la conversazione. A ogni passaggio, chiediti se la persona è in grado di capire cosa è stato completato, cosa rimane irrisolto e come correggere un presupposto errato. Se la risposta richiede di ricordare diversi passaggi precedenti, aggiungi un riepilogo conciso o un elenco visibile delle decisioni. Se il sistema non può preservare un dettaglio in modo affidabile, rendi evidente questo limite piuttosto che simulare una continuità inesistente.
Dare agli utenti un controllo significativo
Controllo significa dare alla persona un modo praticabile per guidare o modificare l'interazione. In una chat, ciò può essere semplice come consentire a qualcuno di scegliere tra più opzioni, modificare una bozza generata, cambiare un vincolo o chiedere al sistema di fermarsi e riassumere. Questi controlli sono più preziosi quando incidono su una decisione a cui l'utente tiene; un menu di regolazioni che non modifica nulla di rilevante aggiunge complessità senza offrire reale potere d'azione.
Un esperimento che ha coinvolto un agente conversazionale nelle discussioni di gruppo ha confrontato i modi per definire le aspettative sulla sua capacità di identificare i partecipanti che contribuivano poco. Ha testato informazioni sull'accuratezza, una spiegazione dell'approccio di rilevamento e dei dati, e un controllo di regolazione. In quello studio specifico, la spiegazione ha aiutato gli utenti a comprendere l'algoritmo ed è stata la più efficace nel complesso; la semplice presenza di un controllo di regolazione ha portato a una percezione più negativa dell'esperienza di discussione. Il risultato mette in guardia dal considerare un controllo utile solo perché esiste: spiega cosa cambia e rendi comprensibili le conseguenze. Do et al., "Inform, Explain, or Control: Techniques to Adjust End-User Performance Expectations for a Conversational Agent Facilitating Group Chat Discussions"
Una sequenza di progettazione pratica è: mostrare l'interpretazione corrente, offrire un numero limitato di azioni successive significative e rendere semplice la correzione. Ad esempio, dopo aver generato il piano per un'uscita, il sistema potrebbe chiedere se accorciare il percorso, sostituire un'attività o mantenere la bozza. Ogni opzione descrive un cambiamento concreto. L'esempio è illustrativo; descrive un modello di interazione generale, non una funzionalità di un prodotto specifico.
Trasformare gli obiettivi in una lista di controllo
Nel valutare la progettazione di una chat, esamina una normale attività dall'inizio alla fine. Verifica se il primo scambio chiarisce il ruolo del sistema; se un utente può distinguere un suggerimento da un'azione completata; se un turno esplorativo invita alla sperimentazione senza imporre un personaggio giocoso; e se la conversazione mostra con precisione le decisioni e i passaggi irrisolti. Controlla poi se la persona può correggere il sistema e comprendere l'effetto di ogni controllo disponibile.
Infine, riesamina il linguaggio e la presentazione alla ricerca di segnali che possano implicare un'identità umana o un'affidabilità speciale. Valuta se affermazioni in prima persona, voce, linguaggio emotivo o un avatar simile a un essere umano possano influenzare il giudizio di un utente su una risposta. Tale analisi completa, anziché sostituire, la verifica che l'interazione sia comprensibile e utile. Il metro di misura più solido per il design di una chat è se una persona possa portare avanti il proprio compito con una visione chiara del contributo dell'IA e della scelta successiva, non se lo scambio possa passare per una conversazione con una persona reale.
